RECHERCHE
Expliquabilité du RL par distillation de politique physique
Une méthode distille un agent TD3 opaque dans un arbre de décision interprétable pour un contrôle continu sûr.
arXiv cs.AI · cs.LG · cs.CL·Shaker Al-Tamari, Waled Kadour·27 juillet 2026

Image · Source originale
Cette étude propose un framework de distillation de politique pour rendre le Deep Reinforcement Learning (DRL) interprétable dans les systèmes à contrôle continu. Un agent TD3 performant sert de modèle enseignant à un arbre de décision substitut, utilisant des caractéristiques physiques et des rollouts bruités. Les simulations montrent que cette approche maintient la stabilité BIBO et des performances équivalentes à l'expert tout en offrant une explicabilité globale et locale.