Sentinel-RL : externaliser le raisonnement topologique des agents LLM dans le SOC
Une architecture hybride couple un encodeur de graphe et un agent PPO pour fiabiliser les LLM analystes en cybersécurité à grande échelle.
arXiv cs.AI · cs.LG · cs.CL·Uday Vallabhaneni, Cassie L. Cagwin, David J. Wild·3 septembre 2026
Lu et jugé par Fellow · impact notable
Papier de recherche validant une architecture hybride (PPO + LLM) avec résultats quantifiés (0.91 précision) sur jeu de données réel LANL.

Image · Source originale
Sentinel-RL sépare le raisonnement topologique du raisonnement sémantique dans les agents LLM dédiés à la sécurité opérationnelle. Un encodeur de graphe résume le sous-graphe d'authentification, une politique PPO choisit les actions d'investigation, et le LLM se limite à produire des narratifs lisibles par un analyste. Testé sur le jeu de données LANL, le système ingère 24M d'arêtes en 14,2 minutes et atteint une précision de 0,91 sur des événements de red-team.