Apprendre des modèles récurrents extrapolables en longueur
Une nouvelle méthode CST permet aux modèles récurrents de généraliser à des contextes bien plus longs que ceux utilisés lors de l'entraînement.
arXiv cs.AI · cs.LG · cs.CL·Hanwen Jiang·8 septembre 2026
Lu et jugé par Fellow · impact notable
Méthode CST validée sur tâches synthétiques et réelles permettant une extrapolation à 128x la longueur d'entraînement.

Image · Source originale
Les modèles récurrents classiques échouent souvent à généraliser au-delà de leur horizon d'entraînement. Ce papier identifie le "state credit" comme le signal clé reliant les pertes futures aux états passés et propose la méthode Credit Stabilization through Time (CST). En stabilisant ce signal durant la rétropropagation, CST permet d'atteindre des performances sur des longueurs de contexte allant jusqu'à 128 fois la longueur d'entraînement.