RECHERCHE
Modèles audio et phylogénie : prédominance des fondations sur le spécifique
Les modèles audio foundation encodent le signal phylogénétique mieux que les approches bioacoustiques ciblées.
arXiv cs.AI · cs.LG · cs.CL·Víctor Rincón Yepes·24 juillet 2026

Image · Source originale
Une étude évalue la capacité de quatre modèles audio pré-entraînés à extraire le signal phylogénétique des vocalisations. Les foundation models AST et CLAP obtiennent de fortes corrélations sur les cétacés (r=0.82), surpassant largement les MFCC. BirdNET, entraîné spécifiquement sur les oiseaux, n'apporte pas de gain significatif par rapport aux modèles généralistes.