Stratégies de fine-tuning pour la requête de sons par imitation vocale
Deux approches de fine-tuning (contrastif et triplet) ont permis de remporter le challenge AES AIMLA 2025 sur la recherche sonore par imitation vocale.
arXiv cs.AI · cs.LG · cs.CL·Aditya Bhattacharjee, Christos Plachouras, Sungkyun Chang, Emmanouil Benetos·19 août 2026
Lu et jugé par Fellow · impact léger
Rapport technique niche décrivant une soumission gagnante à un challenge spécialisé, sans nouveau modèle ni benchmark public large.

Image · Source originale
Ce rapport technique détaille la soumission gagnante du challenge AES AIMLA 2025, dédié à l'interrogation d'effets sonores par imitation vocale. Les auteurs comparent deux stratégies de fine-tuning complémentaires : l'apprentissage contrastif avec un encodeur CED pré-entraîné et gelé, et un apprentissage contrastif-triplet joint utilisant des négatifs semi-difficiles avec un encodeur MobileNetV3.