Toutes les news taguées avec ce sujet.
Un nouveau framework utilise un VLM pour générer des transitions vidéo ancrées visuellement, améliorant le captioning et la localisation d'événements.
161 tâches d'interprétation d'images scientifiques révèlent les limites des modèles vision-langage face aux workflows réels de biotech.
Un framework de diffusion pour la navigation aérienne VLN améliorant la mémoire et l'arrêt explicite.
Une nouvelle méthode de pré-entraînement pour MLLM remplace les entités textuelles par des objets visuels, améliorant l'efficacité des données de façon marquée.