Fusion de modes de raisonnement : une étude systématique de l'entraînement des LLM en mathématiques
Une étude analyse les compromis entre mode « réflexion » et mode concis lors de l'entraînement conjoint de LLM sur des problèmes mathématiques.
arXiv cs.AI · cs.LG · cs.CL·Congfeng Cao, Pengyu Zhang, Jelke Bloem·10 août 2026

Image · Source originale
Les auteurs étudient le Thinking Mode Fusion (TMF), qui combine dans un même modèle un mode concis et un mode de raisonnement long. Ils montrent une interaction asymétrique : plus la supervision en mode concis augmente, plus la précision en mode raisonnement diminue. Le calendrier d'entraînement optimal dépend du ratio de données utilisé entre les deux modes. Code et données sont publiés via Fusion Bench.