Bandits linéaires sous contraintes exactes de fenêtre glissante
Un nouveau cadre théorique pour l'apprentissage par bandits linéaires quand chaque bloc d'actions doit respecter une contrainte de faisabilité stricte.
arXiv cs.AI · cs.LG · cs.CL·Seyed Mohammad Hadi Hosseini, Yasin Abbasi-Yadkori, Sattar Vakili·6 octobre 2026
Lu et jugé par Fellow · impact léger
Résultat théorique avec garanties de regret et validation empirique, mais portée limitée à un cadre de bandits spécifique sans couverture externe.

Image · Source originale
Les chercheurs étudient les bandits linéaires sous contraintes de fenêtre glissante, où chaque séquence consécutive d'actions doit appartenir à un ensemble faisable. Ils introduisent des mesures de diamètre de transition et proposent des algorithmes à mises à jour rares offrant des garanties de regret, validés sur des benchmarks réels et synthétiques avec nettement moins de mises à jour de politique.
#bandits-linéaires#apprentissage-par-renforcement#théorie-de-l'apprentissage#contraintes-de-décision