CoBa : un routage à budget de calcul équilibré pour un test-time scaling plus économique
Une nouvelle politique de routage arbitre entre génération, vérification et arrêt pour réduire fortement le coût du raisonnement à l'inférence sans perte de précision.
arXiv cs.AI · cs.LG · cs.CL·Yan Zhou, Yue Ouyang, Kaiyang Zheng, Suncheng Xiang·7 août 2026

Image · Source originale
CoBa formule le raisonnement en test-time comme un problème d'allocation de calcul entre génération, vérification et arrêt. Sur MATH-500, AIME 2024/2025, AMC 2023 et du raisonnement symbolique procédural, CoBa-Routed-Strong atteint 85,13% de précision macro, équivalent statistiquement à un vote pondéré par auto-évaluation, tout en utilisant 49,1% de tokens pondérés en moins. Il égale aussi le best-of-16 à 0,01 point près avec 58,9% de tokens en moins.