TasteVal : évaluer le flair scientifique des IA face à des experts humains
Un nouveau benchmark mesure la capacité des modèles à concevoir des expériences et interpréter des résultats, comparée à celle de chercheurs humains.
arXiv cs.AI · cs.LG · cs.CL·Oliver Jaffe, Dane Sherburn·5 octobre 2026
Lu et jugé par Fellow · impact notable
Nouveau benchmark avec protocole détaillé, 24 experts humains, 20 modèles testés, montrant un doublement du multiplicateur d'efficacité tous les 3 mois.

Image · Source originale
TasteVal évalue le « goût expérimental » des modèles frontières à travers 8 tâches ouvertes représentatives de la R&D en IA, en isolant cette compétence de la capacité de codage via un agent Coder dédié. Sur 20 modèles testés entre 2023 et 2026, le meilleur, Opus 5.5, dépasse la baseline experte avec un multiplicateur d'efficacité de calcul de 2,3x, pour environ 1/30 du coût moyen des experts humains.