Apprentissage par renforcement continu pour processus de Hawkes
Un nouvel algorithme, Hawkes-CT DDPG, permet le contrôle stochastique de processus non markoviens.
arXiv cs.AI · cs.LG · cs.CL·Tomasz R. Bielecki, Thibaut Mastrolia, Haoze Yan·19 août 2026
Lu et jugé par Fellow · impact léger
Papier théorique de recherche avec validation limitée à des comparaisons internes, sans benchmark indépendant ni application déployée.

Image · Source originale
Cette recherche propose une méthode de contrôle stochastique pour des équations différentielles pilotées par des processus de Hawkes multivariés non markoviens. Les auteurs développent une procédure de markovianisation et introduisent l'algorithme Hawkes-CT DDPG, une technique de policy gradient en temps continu qui ne nécessite pas la connaissance des coefficients du noyau. Les performances de cette approche model-free sont comparées aux méthodes d'apprentissage par renforcement discret.