Votre prompt devrait faire plus : effets des instructions de retrieval dans les modèles d'embedding
Une étude finlandaise révèle que les modèles d'embedding peinent à suivre les instructions de retrieval en présence de distracteurs côté requête, et propose un fine-tuning ciblé pour y remédier.
arXiv cs.AI · cs.LG · cs.CL·Amanda Myntti, Jenna Kanerva, Veronika Laippala, Filip Ginter·7 octobre 2026
Lu et jugé par Fellow · impact notable
Étude empirique documentée sur une limitation réelle des modèles d'embedding (échec à suivre les instructions avec distracteurs côté requête) avec proposition de remédiation par fine-tuning, mais sans modèle ni code publié — résultat de recherche vérifiable, portée incrémentale.

Image · Source originale
Les modèles d'embedding promptés, largement utilisés pour le retrieval, peinent à suivre les instructions de manière fiable. Les auteurs étudient le mécanisme par lequel ces instructions affectent les représentations des requêtes dans les tâches de retrieval asymétrique. Ils montrent que les modèles échouent à suivre des instructions simples lorsque des distracteurs sont présents côté requête. Ils attribuent ce comportement au setup d'entraînement et d'évaluation, et démontrent qu'un fine-tuning avec distracteurs côté requête améliore substantiellement les performances, avec un impact minime sur les autres tâches.