Représentations temps-fréquence pour l'estimation multi-pitch dans les ensembles vocaux
Une étude montre que la STFT linéaire surpasse la HCQT pour détecter les pitchs dans les chants polyphoniques, à moindre coût.
arXiv cs.AI · cs.LG · cs.CL·Junyoung Koh, Hao-Wen Dong·2 octobre 2026
Lu et jugé par Fellow · impact léger
Étude technique de niche sur le choix de représentation temps-fréquence pour l'estimation multi-pitch vocale, portée limitée au domaine MIR.
Pourquoi ce titre est à nuancer
Le dek dit qu'une fenêtre plus courte est plus efficace, mais le corps précise qu'une fenêtre plus longue n'apporte pas d'amélioration, sans dire que la courte serait meilleure.

Image · Source originale
Les chercheurs réexaminent le choix classique de la représentation HCQT pour l'estimation multi-pitch dans les ensembles vocaux, où les harmoniques se chevauchent fortement. Ils montrent qu'une STFT linéaire, malgré sa résolution fréquentielle fixe, obtient de meilleurs résultats que la HCQT tout en réduisant significativement le coût d'extraction des features. L'analyse révèle qu'une fenêtre d'analyse plus courte est plus efficace pour suivre les pitchs vocaux variables dans le temps.