Appris, puis perdu : une contre-expérience mesurée sur un seul exemple en pré-entraînement
32 GPT-2 entraînés pour mesurer l'effet réel d'une seule ligne injectée dans un batch : appris en un coup, oublié en quelques centaines de pas.
arXiv cs.AI · cs.LG · cs.CL·Zachary Speck, Asa Shepard·19 août 2026
Lu et jugé par Fellow · impact notable
Résultat contre-intuitif étayé par 24 expériences de pré-entraînement complet montrant l'effacement d'un exemple appris.

Image · Source originale
Des chercheurs ont mené 24 fois une contre-expérience coûteuse : entraîner des paires de GPT-2 (124M paramètres) identiques sauf pour une ligne d'un batch, contenant un passage de 194 tokens. Le passage est bien appris après une seule exposition (gain de 0,039-0,044 nats de cross-entropy à 50 pas), mais cet effet disparaît à la fin de l'entraînement, sans différence détectable sur la perte finale ni sur la géométrie du paysage de perte.