Sur la tractabilité computationnelle des bandits robustes
Un cas particulier des bandits robustes admet un apprenant en temps polynomial avec regret quasi-optimal, mais ses extensions sont NP-difficiles.
arXiv cs.AI · cs.LG · cs.CL·Vanessa Kosoy, Vinayak Pathak·6 octobre 2026
Lu et jugé par Fellow · impact léger
Résultat théorique circonscrit (cas particulier traitable, extensions NP-difficiles) sans application pratique démontrée.

Image · Source originale
L'article étudie l'apprentissage par bandits lorsque l'environnement ne correspond pas à la classe d'hypothèses de l'apprenant, un cadre récemment formalisé sous le nom de bandits robustes. Les auteurs identifient un cas particulier admettant un apprenant en temps polynomial avec regret en Õ(√T), mais montrent que plusieurs généralisations mineures de ce cas sont NP-difficiles. Ce travail s'inscrit dans une réflexion plus large sur la nécessité d'apprenants efficaces pour les problèmes d'apprentissage non réalisable, jugée centrale pour l'alignement de l'IA.
#bandits#théorie-apprentissage#complexité-computationnelle#alignement-ia