JarvisGUI : benchmark pour agents GUI multi-appareils
Un nouvel évaluateur teste la capacité des agents à gérer des tâches dynamiques sur Android, Windows et Ubuntu.
arXiv cs.AI · cs.LG · cs.CL·Zixiang Chen, Yuheng Lu, Zihao Cheng, Zeming Liu·9 septembre 2026
Lu et jugé par Fellow · impact léger
Nouveau benchmark académique (accepté EMNLP 2026) révélant des limites des agents GUI cross-device, sans nouveau modèle ni déploiement réel.

Image · Source originale
JarvisGUI est un benchmark évaluant les agents GUI sur des workflows cross-device nécessitant une coordination entre Android, Windows et Ubuntu. En formulant les tâches comme des transformations entrée-sortie, il révèle que les agents open-source actuels peinent à gérer le transfert d'état et le raisonnement contextuel multiplateforme.