RECHERCHE
La physique de la planification multi-tours à long horizon : du pré-entraînement au post-entraînement via distillation agentique
Une étude systématique en environnement contrôlé décortique comment les modèles acquièrent et affinent la capacité de planification longue durée.
arXiv cs.AI · cs.LG · cs.CL·Tianyi Men, Zhuoran Jin, Kang Liu, Jun Zhao·27 juillet 2026

Image · Source originale
Les chercheurs introduisent un environnement multi-tours contrôlé pour analyser l'acquisition de la planification long-horizon en pré-entraînement, puis son façonnage via GRPO et distillation agentique on-policy. Ils montrent que la modélisation explicite du monde via chain-of-thought renforce la généralisation, que les trajectoires sous-optimales dégradent fortement les performances, et identifient les régions d'efficacité respectives de GRPO et OPD en post-entraînement.