TraceML : analyse empirique de la planification humaine vs agent
Une étude comparative révèle que les agents LLM peinent à reproduire les cycles de planification itératifs des experts en ML.
arXiv cs.AI · cs.LG · cs.CL·Jiarui Yan, Weiwei Sun, Sijie Li, Wenhan Li·26 août 2026
Lu et jugé par Fellow · impact notable
Corpus empirique de 4465 trajectoires humaines et 207 d'agents révélant un écart comportemental concret sur la planification en ML.

Image · Source originale
TraceML analyse 4 465 trajectoires humaines Kaggle et 207 trajectoires d'agents pour comparer la planification dans le développement ML. Contrairement aux humains qui alternent données, validation et modèles, les agents s'enferment dans des boucles étroites de réglage. Un prompt de planification améliore les scores mais ne corrige pas le profil comportemental des agents.