Fisher-R1 : un agent LLM entraîné pour des tests d'hypothèses statistiquement fiables
Un nouveau benchmark révèle que les agents LLM commettent des erreurs d'inférence subtiles malgré des analyses correctement exécutées.
arXiv cs.AI · cs.LG · cs.CL·Jiacheng Miao, Jin Mu, Guanhua Chen, James Zou·7 août 2026

Image · Source originale
Les chercheurs présentent P-Bench, un benchmark de 425 tâches réalistes de test d'hypothèses en économie, biologie et médecine, conçu pour évaluer la validité statistique des p-values produites par des agents LLM. Ils introduisent aussi Fisher-R1, un agent open-weight entraîné par renforcement sur des tâches synthétiques avec récompense statistique vérifiée. Fisher-R1-14B surpasse GPT-5.4 et DeepSeek-V4-Pro, avec une amélioration relative moyenne de 21% en réussite au premier essai.