Vers des LLM « natifs des compétences » : l'entropie des compétences pour évaluer et entraîner le raisonnement long
Un nouveau benchmark et une méthode RL mesurent et améliorent la capacité des LLM à basculer entre compétences dans des chaînes de raisonnement complexes.
arXiv cs.AI · cs.LG · cs.CL·Yinghui He, Ling Yang, Jiarui Liu, Yongjin Yang·5 août 2026

Image · Source originale
Les auteurs introduisent la « Skill Entropy », une mesure de la difficulté à passer d'une compétence à une autre dans une tâche multi-étapes. Ils proposent Skill²-Bench, un benchmark de 558 compétences sur 9 domaines, révélant un écart de performance sur les tâches à forte entropie. Un cadre RL exploitant ce signal améliore les scores sur Qwen3-4B et Qwen3-1.7B.