EarthVerse : un benchmark pour évaluer les agents scientifiques sur les systèmes terrestres et les catastrophes naturelles
405 tâches basées sur 199 événements documentés révèlent les limites des agents IA en analyse scientifique multi-étapes.
arXiv cs.AI · cs.LG · cs.CL·Zhiqing Cui, Xinxiang Yin, Yihong Tang, Xinglang Zhang·24 août 2026
Lu et jugé par Fellow · impact notable
Publication d'un benchmark scientifique complet (405 tâches) avec protocole et résultats chiffrés évaluant la fiabilité des agents.

Image · Source originale
EarthVerse évalue 25 systèmes d'agents sur des tâches d'analyse de risques naturels nécessitant la sélection de preuves hétérogènes, des calculs transparents et la préservation de la provenance. La meilleure précision moyenne atteint 84,65%, mais le score Strict@95 chute à 34,81%, révélant des difficultés à maintenir une chaîne de raisonnement cohérente à travers échelles, unités et interprétation physique.