Mécanismes pour l'alignement et le contrôle d'agents IA
Un cadre de conception de mécanismes incitant les agents IA à l'honnêteté et l'obéissance malgré des préférences et capacités inconnues.
arXiv cs.AI · cs.LG · cs.CL·Dirk Bergemann, Andrew Koh, Stephen Morris·1 septembre 2026
Lu et jugé par Fellow · impact léger
Papier théorique en économie des mécanismes, sans implémentation ni validation empirique sur agents IA réels.

Image · Source originale
Les auteurs proposent un cadre de mechanism design pour des agents IA dont l'alignement et les capacités sont inconnus. Le modèle définit une structure d'imitation unilatérale et établit un principe de révélation via la monotonité cyclique imbriquée. Les applications couvrent le sandbagging, le trade-off alignement/interprétabilité et la supervision évolutive.