RECHERCHE
Tokens, octets ou pixels : les frontières coût-utilité des encodages linguistiques
Une étude compare tokens, octets et pixels à contenu et capacité contrôlés, révélant qu'aucun encodage ne domine sur toutes les tâches.
arXiv cs.AI · cs.LG · cs.CL·Ingo Ziegler, Martin Krebs, Desmond Elliott·17 juillet 2026

Image · Source originale
Des chercheurs comparent trois modes d'encodage du texte (tokens, octets, pixels) via un goulot d'étranglement partagé, sur treize langues et cinq écritures. Résultat : les pixels préservent mieux la forme de surface, les octets favorisent l'alignement translingue, et les tokens sont plus efficaces pour la classification thématique. Le choix optimal dépend donc de la tâche, du mélange de langues et du budget de calcul, plutôt que d'une préférence fixe.