Prefix Sliding : une méthode pour un test-time scaling plus efficace
Une technique qui tronque la mémoire des LLM pendant le raisonnement long, sans perte de performance, pour un scaling moins coûteux.
arXiv cs.AI · cs.LG · cs.CL·Niklas Muennighoff, Zhengyang Wang, Zeyi Chen, Weijia Shi·26 août 2026
Lu et jugé par Fellow · impact notable
Technique testée avec code disponible, réduisant la mémoire de 3x sans perte de performance.

Image · Source originale
Les chercheurs montrent que la plupart des tokens de raisonnement intermédiaires perdent leur importance au fil du raisonnement. Prefix Sliding ne conserve que le préfixe (instructions clés) et une fenêtre récente de tokens, plafonnant ainsi le besoin mémoire quel que soit la longueur du raisonnement. Sans entraînement, la méthode rend les modèles 3x plus rapides à performance égale ; avec entraînement par reinforcement learning, elle permet d'aller au-delà de 100 000 tokens de raisonnement.