Estimation et validité des horizons temporels de l'IA : un regard statistique sur le graphique METR
Des chercheurs recalculent les horizons temporels à 50 % de METR avec des splines et la théorie de réponse à l'item, et montrent que la relation entre temps humain et difficulté pour l'IA n'est pas linéaire.
arXiv cs.AI · cs.LG · cs.CL·Drew T. Nguyen, William Fithian·8 octobre 2026
Lu et jugé par Fellow · impact notable
Réanalyse statistique vérifiable (228 tâches, 26 IA) de la métrique METR très citée, montrant une relation non linéaire qui change l'interprétation des courbes d'horizon temporel.

Image · Source originale
L'étude réestime l'horizon temporel à 50 % de METR sur 228 tâches et 26 IA, en utilisant des splines et l'item-response theory pour relâcher l'hypothèse de linéarité avec le logarithme du temps humain. La courbe obtenue est quasi plate entre 2 et 30 minutes, puis proche du linéaire : passer de 3 à 30 minutes est donc bien plus facile que de 30 minutes à 5 heures. Les auteurs proposent de meilleures estimations et des graphiques de diagnostic de la validité de construit.