Quand un bandit peut-il s'écarter de son ancrage ? Thompson sampling autorisé par e-process en environnement non stationnaire
Un nouveau cadre statistique encadre l'oubli adaptatif dans les algorithmes de bandit, avec des garanties formelles sur le moment où dévier du comportement optimiste.
arXiv cs.AI · cs.LG · cs.CL·Mayand Gulati, Kerong Wang, WeiChen Au·2 octobre 2026

Image · Source originale
Les auteurs proposent e-ATS, une variante du Thompson sampling qui utilise un e-process pour décider quand autoriser l'oubli de l'historique après un changement de distribution. Avant autorisation, l'algorithme suit exactement le comportement optimiste standard, avec une garantie de déviation bornée par un seuil choisi. Les résultats montrent des effets contrastés selon les suites d'évaluation testées.