Calibration de Bellman pour la pondération par importance marginalisée en apprentissage par renforcement hors ligne
Une méthode de post-traitement isotone corrige les biais des estimateurs de ratio d'occupation sans nécessiter de réoptimisation complète du modèle.
arXiv cs.AI · cs.LG · cs.CL·Lars van der Laan, Nathan Kallus·25 août 2026
Lu et jugé par Fellow · impact léger
Article académique proposant une méthode théorique de post-traitement pour corriger des biais d'estimation.

Image · Source originale
Les chercheurs proposent la calibration de Bellman isotone, une méthode de post-traitement unidimensionnelle et agnostique au modèle qui corrige l'échelle et la forme des estimations de ratio d'occupation en RL hors ligne. L'approche préserve l'information de classement de l'estimation initiale tout en réduisant les violations d'équilibre d'occupation, avec des garanties théoriques de calibration en échantillon fini et une inégalité oracle de type KL.