Toutes les news taguées avec ce sujet.
Une méthode RL exploitant les vues texte et image pour améliorer la cohérence des modèles de vision-language.
Les modèles vision-langage sont sensibles à l'ordre des entrées. Une méthode d'adaptation corrige ce biais et améliore les performances.
Une méthode d'entraînement simple améliore la détection de retouches générées par ChatGPT, Gemini ou Qwen-Image, avec une robustesse accrue hors distribution.