Toutes les news taguées avec ce sujet.
Le laboratoire chinois Moonshot AI met en ligne sur Hugging Face une nouvelle famille de modèles multimodaux légers à architecture MoE.
Un framework sans fine-tuning maintient une mémoire narrative pour produire des audiodescriptions fidèles à l'histoire, pensées pour les publics aveugles et malvoyants.
Un nouveau benchmark et dataset visent à forcer les Video LLMs à justifier leurs réponses par des segments spatio-temporels précis, pas juste du texte.
Le framework VRRL entraîne les modèles vision-langage à corriger leurs erreurs en s'appuyant réellement sur les entrées visuelles, même hors distribution.
Un nouveau benchmark teste la résistance de 18 modèles vision-langage aux corruptions visuelles sur des tâches de raisonnement OCR.