Un bloc, plusieurs profondeurs : Vision Transformers récurrents avec experts programmés par la profondeur
reViT applique un unique bloc Transformer de façon récurrente et atteint la précision d'un encodeur vision pleine profondeur, avec environ 70 % de paramètres stockés en moins.
arXiv cs.AI · cs.LG · cs.CL·Adrian Bulat, Yassine Ouali, Georgios Tzimiropoulos·8 octobre 2026
Lu et jugé par Fellow · impact léger
Article arXiv à résultats chiffrés (ImageNet-1k, distillation DINOv2) mais méthode d'efficacité en paramètres, sans reproduction indépendante ni couverture externe ; portée de recherche limitée.

Image · Source originale
Les auteurs montrent qu'un seul bloc Transformer appliqué récurremment peut égaler un encodeur vision pleine profondeur à FLOPs d'inférence comparables, sans distillation de features intermédiaires. Le FFN de chaque profondeur est une combinaison convexe d'une petite banque d'experts partagés, pilotée par une coordonnée de profondeur normalisée. reViT-B/16 atteint la précision de DeiT III avec environ 70 % de paramètres en moins ; la version distillée depuis DINOv2 conserve presque toute sa précision en linear-probe. Un même checkpoint fonctionne à plusieurs profondeurs.
#vision-transformer#recurrent#MoE#distillation#efficacité