GradCuit : inférence latente robuste et interprétable par gradient
Une méthode de raisonnement latent à l'exécution améliore la précision et la robustesse des LLM via une attribution de crédit directe.
arXiv cs.AI · cs.LG · cs.CL·Zhaoxin Yu, Qi Shen, Hengli Li, Zhaowei Zhang·3 août 2026

Image · Source originale
GradCuit optimise des états latents continus au sein d'une couche Transformer, gardant les poids du modèle figés. Ce mécanisme permet une attribution de gradient directe du raisonnement complet vers les latents, outperformant le chain-of-thought et les méthodes concurrentes sur plusieurs benchmarks.
#inference-time#gradient-flow#test-time-computing#llm-reasoning#optimization