CalibForge : calibration adversariale de solveurs pour générer des tâches terminales apprenables
Un système autonome ajuste des tâches d'agents terminaux selon leur difficulté réelle pour un solveur donné, améliorant nettement les performances d'entraînement.
arXiv cs.AI · cs.LG · cs.CL·Fanzhe Meng, Guoxin Chen, Jiale Zhao, Shuang Sun·6 août 2026

Image · Source originale
CalibForge synthétise des tâches terminales calibrées via une calibration adversariale multi-solveurs ou contrastive, ciblant une zone d'apprentissage relative au solveur. 5 431 tâches ont été générées, et les modèles entraînés dessus atteignent jusqu'à 47,57% sur Terminal-Bench 2.0, avec des gains allant jusqu'à 30 points par rapport aux modèles de base sur plusieurs benchmarks.