RECHERCHE
DADiff : adaptation de politique par diffusion pour l'apprentissage par renforcement inter-domaines
Un nouveau cadre basé sur la diffusion estime l'écart de dynamique entre domaines pour adapter des politiques de RL avec peu d'interactions cible.
arXiv cs.AI · cs.LG · cs.CL·Hanyang Chen, Anirudh Satheesh, Longchao Da, Hua Wei·17 juillet 2026

Image · Source originale
DADiff exploite les divergences entre trajectoires génératives source et cible pour estimer le décalage de dynamique et adapter une politique entraînée dans un domaine source à un domaine cible avec peu de données. Deux variantes sont proposées : modification de récompense et sélection de données. Une analyse théorique borne la différence de performance par la déviation des trajectoires génératives. Les expériences montrent une supériorité sur les approches existantes face à divers types de décalage.