Scaling au moment de l'inférence dans les LLM de raisonnement : régimes, évaluation et reproductibilité
Une taxonomie systématique des méthodes de test-time scaling pour clarifier des comparaisons souvent biaisées par des protocoles hétérogènes.
arXiv cs.AI · cs.LG · cs.CL·Mohsen Hariri, Weicong Chen, Nahal Shahini, Vikash Singh·4 août 2026

Image · Source originale
Les auteurs distinguent trois régimes structurels de scaling à l'inférence — séquentiel, agrégation de candidats terminaux, recherche sur états partiels — et proposent un cadre d'évaluation unifié séparant performance système et diagnostics de banque de candidats. Ils formulent aussi des exigences de reproductibilité distinguant replay exact et reproductibilité distributionnelle.