Toutes les news taguées avec ce sujet.
Un nouveau modèle vision-langage de 3 milliards de paramètres, optimisé pour l'instruction et disponible en open-weights.
Une méthode RL exploitant les vues texte et image pour améliorer la cohérence des modèles de vision-language.
Un nouveau framework injecte des représentations 3D dans les modèles vision-langage à partir de simples vidéos RGB, sans capteur additionnel.
Moonshot AI publie un modèle léger de raisonnement visuel sur Hugging Face.
Une nouvelle architecture deep learning multimodal améliore l'identification précise de biomarqueurs via des capteurs nanopores.
Une méthode introduisant des tokens compacts pour guider précisément les DiTs selon des zones définies.
Un nouveau framework guide des agents de codage pour transformer des implémentations de référence en déploiements multi-GPU optimisés, avec des gains massifs de latence.
Un cadre utilisant des outils spécialisés et le reinforcement learning pour améliorer la vérification de réclamations scientifiques.
SceneBind permet une représentation omni-modale sémantique et spatiale pour la compréhension de scènes réalistes.
Un nouveau jeu de données combine vidéos et fils de commentaires TikTok pour étudier les prises de position politiques lors de l'élection américaine de 2024.
Thinking Machines Lab dévoile Inkling, un modèle MoE multimodal open Apache 2.0, accompagné d'une version légère Inkling-Small.
Un nouveau benchmark évalue la capacité des agents multimodaux à appeler des outils sur 500+ fonctions.
Une approche basée sur LoRA fusionne progressivement plusieurs modalités pour la reconnaissance d'actions en formation médicale.
Doorash utilise des jurys de LLM et de l'IA multimodale pour structurer les données de ses menus.
Une étude montre que pré-entraîner directement sur des documents visuels surpasse l'approche texte-only classique, sans passer par l'extraction de texte.
Moonshot AI présente un modèle VL compact pensant, accessible sur Hugging Face.
Un framework open-source qui transforme la génération vidéo en mécanisme de raisonnement séquentiel, alternatif au Chain-of-Thought textuel.
Un nouveau benchmark évalue les agents LLM sur des tâches réelles en conteneurs Docker, avec une stratégie en boucle fermée pour simuler des interactions humaines multi-tours.
Des chercheurs proposent MedPMC, un pipeline automatisé extrayant 11 millions de paires image-texte médicales depuis PubMed Central pour entraîner des foundation models.
Un modèle de fondation multimodal capable de raisonner sur des protéines, molécules et cristaux en préservant l'information structurelle native.
Des chercheurs proposent un cadre d'orchestration modulaire pour les modèles d'IA en oncologie, découplant la logique clinique des modèles sous-jacents.
Un nouveau framework résout les conflits de gradients entre modalités acoustique et sémantique qui dégradaient les modèles de parole full-duplex natifs.
Un nouveau modèle fondationnel 3D aligne langage et géométrie à différentes échelles d'abstraction, réduisant de moitié les FLOPs par rapport aux approches existantes.
Une nouvelle méthode structure la compression de tokens visuels comme un problème de maximisation submodulaire, filtrant le bruit textuel par entropie statistique.
Des chercheurs introduisent DramaSR-532K, un benchmark massif, et DramaSR-LRM, un système multimodal attribuant chaque réplique à son personnage.
Un projet open-source qui donne aux LLMs la capacité d'analyser des vidéos en temps réel, sans dépendre d'API multimodales natives.
Cerebras annonce le support de Gemma 4 sur son infrastructure, combinant sa vitesse d'inférence record avec les capacités multimodales du modèle de Google.
Une étude révèle qu'aucun des 18 grands modèles multimodaux testés n'est invariant à l'ordre de présentation des données, avec des taux d'inversion atteignant 50 %.
Le laboratoire français met à jour son moteur OCR, promettant une meilleure précision sur documents complexes et multilingues.
Des chercheurs proposent une méthode d'entraînement par RL pour doter les modèles multimodaux d'un raisonnement adaptatif alternant langage naturel et code.