UEmb : Embeddings unifiés éparses et denses multimodaux
Un modèle decoder-only unifie les représentations éparses et denses pour le texte et le multimédia, performant sur MMEB-v2.
arXiv cs.AI · cs.LG · cs.CL·Tingyu Song, Mingxin Li, Yanzhao Zhang, Dingkun Long·3 août 2026

Image · Source originale
UEmbed est un modèle d'embedding multimodal de type decoder-only générant simultanément des vecteurs éparses et denses. Il partitionne le vocabulaire pour prédire les poids épars via des tokens apprenables lors d'un passage causal. Les modèles 2B, 4B et 9B atteignent des scores élevés sur les benchmarks MMEB-v2 et BEIR, validant leur efficacité pour le RAG et les agents.
#retrieval#multimodal#sparse-retrieval#embeddings#decoder-only