Apprendre à lire les tokens contextuels dans les Diffusion Transformers
Une méthode permet d'interroger en langage naturel les représentations internes des MM-DiT pour mieux comprendre ce qu'ils encodent pendant la génération d'image.
arXiv cs.AI · cs.LG · cs.CL·Omer Dahary, Etai Sella, Hadar Averbuch-Elor, Daniel Cohen-Or·5 octobre 2026

Image · Source originale
Des chercheurs entraînent un réseau léger qui traduit les tokens contextuels intermédiaires d'un Multimodal Diffusion Transformer dans l'espace d'un LLM gelé, permettant de questionner directement ces représentations cachées. L'analyse révèle que ces tokens encodent très tôt une sémantique globale de la scène, même avec un prompt vide. Les générations mieux « lisibles » sont aussi mieux notées par des évaluateurs humains, ce qui a conduit à une nouvelle technique d'entraînement, l'Alignement Contextuel.