TACO : un optimiseur ternaire pour réduire drastiquement la mémoire lors du fine-tuning des LLM
Un nouvel optimiseur réduit de 174× la mémoire d'état par rapport à AdamW8bit, rendant possible le fine-tuning complet de modèles 30-32B sur du matériel limité.
arXiv cs.AI · cs.LG · cs.CL·Jichao Jiang, Cristian McGee, El Houcine Bergou, Hanqin Cai·1 octobre 2026

Image · Source originale
TACO (Ternary Absolute-max Column-wise One-sparse optimizer) s'inspire de l'approche de Muon mais pousse plus loin la logique géométrique en sélectionnant le signe de l'entrée de plus grande magnitude par colonne. Il conserve les gradients de premier ordre tout en rendant l'état de l'optimiseur quasi négligeable : sur OPT-13B, la mémoire persistante passe de 27,7 Go à 0,16 Go et la mémoire de pic d'entraînement de 80,6 Go à 27,5 Go, avec une précision et un temps d'exécution comparables à AdamW. Cela permet le fine-tuning complet de modèles de 30-32B paramètres sur du matériel plus modeste.