ABSeeker : entraîner des agents de recherche long-horizon via une attribution de crédit rétropropagée depuis la réponse
Un nouveau framework transforme les récompenses binaires éparses en supervision dense étape par étape pour mieux entraîner les agents de recherche multi-étapes.
arXiv cs.AI · cs.LG · cs.CL·Yijun Lu, Rui Ye, Jiajun Wang, Yuwen Du·5 août 2026

Image · Source originale
Les auteurs proposent ABC (Answer-Backtracked Credit Assignment), une méthode qui remonte de la réponse finale vers les indices intermédiaires nécessaires pour la trouver, afin d'évaluer chaque étape de recherche individuellement. Ce signal dense alimente ABC-SFT et ABC-GRPO, deux variantes d'entraînement. Le modèle résultant, ABSeeker, basé sur Qwen3.5-4B avec seulement 8,5k exemples, atteint 37,3% sur BrowseComp et 39,1% sur BrowseComp-ZH.