Intégrité de trace pour les agents de données LLM : vers un raisonnement structuré auditable
Une bonne réponse ne garantit pas un calcul valide : ce papier propose un cadre pour auditer le raisonnement des agents LLM sur données structurées.
arXiv cs.AI · cs.LG · cs.CL·Srimonti Dutta, Akshata Kishore Moharir·26 août 2026
Lu et jugé par Fellow · impact léger
Papier de vision proposant un cadre conceptuel avec démonstration empirique limitée à un seul benchmark, sans validation indépendante large.

Image · Source originale
Les auteurs introduisent la notion de Trace Integrity, un critère évaluant si le calcul derrière une réponse d'agent LLM est explicite, exécutable et auditable, indépendamment de l'exactitude de la réponse finale. Ils proposent le CAIT Rate pour mesurer les réponses correctes issues de traces invalides. Sur BIRD Mini-Dev, les taux de trace valide (39-43%) et de CAIT (45-59%) montrent que précision, validité de trace et échec silencieux sont des signaux distincts.