Un opérateur de Bellman unifié pour l'apprentissage par renforcement critique en sécurité
Des chercheurs proposent un opérateur de Bellman fusionnant performance et sécurité dans une fonction de valeur conjointe, avec preuve de convergence et quasi-absence de violations au test.
arXiv cs.AI · cs.LG · cs.CL·Nishanth Arun Rao, Royina Karegoudra Jayanth, Benjamin Eysenbach, Jaime Fernández Fisac·8 octobre 2026
Lu et jugé par Fellow · impact léger
Papier théorique avec preuve de convergence et tests en contrôle continu, mais préprint isolé, sans réplication ni adoption ; portée limitée à la communauté RL sûr.

Image · Source originale
Le papier introduit un opérateur de Bellman qui unifie objectifs de performance et de sécurité dans une fonction de valeur conjointe. Le TD learning associé converge dans un cadre d'approximation stochastique à deux échelles de temps, via une inclusion différentielle moyennée par occupation. La politique optimale maximise le retour en respectant la sécurité à tout instant. Les tests en contrôle continu avec approximation neuronale montrent une convergence stable et des violations quasi nulles.