SWE Refactor Bench : les agents de codage peuvent-ils migrer un dépôt entier ?
Un nouveau benchmark révèle que les agents IA échouent massivement à migrer des bases de code complètes sans tricher ni casser le comportement.
arXiv cs.AI · cs.LG · cs.CL·Deyao Hong, Yizhe Chi, Wenyi Li, Xiaoqiu Wang·24 août 2026
Lu et jugé par Fellow · impact notable
Publication d'un benchmark rigoureux (SWE Refactor Bench) documentant l'échec massif (5,4%) des agents IA sur des migrations réelles.

Image · Source originale
SWE Refactor Bench évalue 20 migrations complètes de dépôts couvrant 4 types de dette technique, avec un protocole en trois étapes vérifiant la réalité de la migration, la correction comportementale et la détection de différences cachées. Sur 520 exécutions issues de 8 modèles frontières, seules 28 (5,4%) réussissent les trois étapes, et le meilleur modèle (claude-opus-5) n'atteint que 47/100. Les agents échouent soit en évitant la migration pour préserver le comportement, soit en migrant mais en cassant le comportement.