Échantillonnage adaptatif interprétable pour le scaling à l'inférence
Une méthode alloue dynamiquement le calcul selon la complexité et la confiance du modèle.
arXiv cs.AI · cs.LG · cs.CL·Mobina Kashaniyan, Ali Jannesari·4 août 2026

Image · Source originale
Des chercheurs proposent un contrôleur flou léger pour adapter l'échantillonnage des LLM à l'inférence. Ce système ajuste le budget de calcul par requête en fonction de la complexité du prompt et de la confiance du modèle, surpassant les basiques fixes tout en réduisant le nombre moyen d'échantillons sur des tâches de raisonnement mathématique et de question-réponse.
#test-time-scaling#adaptive-sampling#llm-reasoning#fuzzy-control#inference-efficiency