Graph Machine : meilleur pré-entraînement via les arêtes
Une nouvelle architecture à état $O(n)$ et routage dynamique sparse compense 75% des couches denses d'un Transformer.
arXiv cs.AI · cs.LG · cs.CL·Lintai Hou·2 septembre 2026
Lu et jugé par Fellow · impact léger
Étude préliminaire sur un seul petit modèle (0.6B), sans code ni comparaison indépendante à grande échelle.

Image · Source originale
Le Graph Machine (GM) utilise un routage dynamique sparse et des arêtes differentiables pour maintenir un état de taille $O(n)$. En remplaçant 75% des couches denses de Qwen3-0.6B par des couches GM, le modèle pré-entraîné sur 15,7B tokens maintient la perte avec une retrieval minimale, et l'améliore légèrement en augmentant celle-ci.