SciExam for ENSO : un benchmark où des agents IA construisent des modèles climatiques
Des agents LLM doivent élaborer des modèles stochastiques de l'ENSO à partir de données réelles, sans réponse connue. Six systèmes sur douze dépassent le modèle publié de référence.
arXiv cs.AI · cs.LG · cs.CL·Yinling Zhang, Langchen Liu, Dongbin Xiu, Xueyan Zou·7 octobre 2026
Lu et jugé par Fellow · impact notable
Benchmark original évaluant la capacité d'agents LLM à construire des modèles scientifiques sans réponse connue, avec protocole rigoureux (évaluateurs cachés, contrôles anti-mémorisation) et résultat vérifiable : 6/12 systèmes dépassent le modèle publié de référence. Avance méthodologique réelle pou

Image · Source originale
Des chercheurs proposent SciExam for ENSO, un benchmark où des agents IA construisent des modèles climatiques de l'ENSO (El Niño-Southern Oscillation) à partir d'observations réelles, dans un budget de six heures. Les agents écrivent leurs propres diagnostics, qui sont ensuite gelés, puis développent un modèle en s'appuyant uniquement sur ces retours. Des évaluateurs cachés testent la reproduction des statistiques, la récupération de variables non observées et les prévisions sur des années tenues à l'écart. Sur douze systèmes testés, six produisent des modèles supérieurs au modèle publié, principalement grâce à une meilleure reconstruction et prévision. Les formes simplifiées des meilleurs modèles s'alignent chacune avec l'une des deux explications concurrentes de l'asymétrie chaude-froide de l'ENSO, un débat que la tâche ne mentionne pas. Des expériences contrôlées montrent que les scores ne résultent pas de la mémorisation des données historiques.