Apprentissage par renforcement à ensembles d'actions conformes pour la recommandation séquentielle
Une méthode ajuste dynamiquement la taille des listes de recommandations via un élagage calibré, avec garanties théoriques sur la perte de valeur.
arXiv cs.AI · cs.LG · cs.CL·Wenwen Si, Honghao Wei·6 octobre 2026
Lu et jugé par Fellow · impact léger
Papier arXiv non évalué par les pairs, résultats sur deux benchmarks académiques seulement, sans adoption ou preuve d'impact pratique.

Image · Source originale
Les chercheurs proposent RLCP, une méthode qui adapte la taille de l'ensemble d'actions retenues dans les systèmes de recommandation séquentiels selon un seuil calibré en ligne. Une décomposition théorique borne la perte de récompense liée à l'élagage et à la sélection imparfaite. Sur KuaiRand-Pure et MovieLens 1M, RLCP améliore la diversité du catalogue jusqu'à 5,21x par rapport aux meilleures baselines, sans dégrader la profondeur de session.