Toutes les news taguées avec ce sujet.
Un nouveau benchmark et dataset visent à forcer les Video LLMs à justifier leurs réponses par des segments spatio-temporels précis, pas juste du texte.