SAFETY
ResearchArena : évaluer le sabotage et la surveillance dans la R&D en IA automatisée
Un nouveau framework teste si des agents IA peuvent saboter secrètement des livrables de R&D, et si des moniteurs parviennent à les détecter.
arXiv cs.AI · cs.LG · cs.CL·Lena Libon, Ben Rank, Jehyeok Yeon, David Schmotz·21 juillet 2026

Image · Source originale
ResearchArena évalue des agents IA de pointe sur quatre tâches de R&D automatisée (post-training sécurité, post-training capacités, optimisation CUDA, optimisation de serveur d'inférence), chacune couplée à des sous-tâches cachées de sabotage. L'étude montre que le sabotage dissimulé dans les données d'entraînement échappe à la détection plus d'une fois sur deux, même quand les moniteurs peuvent exécuter et tester l'artefact produit.