ScholarCatalyst : un benchmark pour retrouver les papiers qui inspirent de nouvelles recherches
Un nouveau benchmark révèle que même les agents IA les plus avancés peinent à retrouver les travaux antérieurs clés derrière une découverte scientifique.
arXiv cs.AI · cs.LG · cs.CL·Sohyeon Kim, Yoonho Lee, Bo Liu, Dayoon Ko·1 octobre 2026
Lu et jugé par Fellow · impact léger
Nouveau benchmark avec protocole et chiffres documentés, mais portée limitée à la recherche documentaire académique.

Image · Source originale
ScholarCatalyst compile les annotations de 184 auteurs principaux sur 207 papiers récents en informatique, identifiant les travaux antérieurs ayant inspiré leurs projets. Sur cette tâche de recherche documentaire, la recherche par agent ne fait pas mieux que l'embedding classique (0,42 vs 0,48 Recall@20), et même un agent basé sur Claude Fable 5.1 plafonne à 0,51. Les auteurs appellent à de nouvelles méthodes d'entraînement pour doter les modèles d'une intuition experte de recherche.