Toutes les news taguées avec ce sujet.
Moonshot AI publie un nouveau modèle multimodal sur Hugging Face.
Une méthode de self-distillation visuelle qui surpasse les OPSD existants sur Qwen-VL.
Un nouveau framework injecte des représentations 3D dans les modèles vision-langage à partir de simples vidéos RGB, sans capteur additionnel.
Moonshot AI publie un modèle léger de raisonnement visuel sur Hugging Face.
Une méthode d'entraînement simple améliore la détection de retouches générées par ChatGPT, Gemini ou Qwen-Image, avec une robustesse accrue hors distribution.
Un nouveau benchmark et une métrique VLM permettent de conditionner la similarité visuelle selon un aspect précis (forme, couleur, etc.).
Les modèles multimodaux les plus avancés s'effondrent face à des tâches nécessitant une perception visuelle itérative, loin derrière les humains.
Un nouveau benchmark exploite l'historique des versions arXiv pour entraîner des agents à éditer des figures scientifiques via instructions en langage naturel.
Une étude sur dix ans montre que les modèles multimodaux récents ont quasiment comblé leur écart de performance face aux scènes sociales complexes.
Une étude montre que pré-entraîner directement sur des documents visuels surpasse l'approche texte-only classique, sans passer par l'extraction de texte.
Moonshot AI présente un modèle VL compact pensant, accessible sur Hugging Face.
Un nouveau dataset évalue la capacité des modèles vision-langage à raisonner sur des incidents routiers réels, au-delà de la simple reconnaissance d'objets.