MMDiff : Différentiation de modèles multimodaux
Un framework pour identifier et contrôler les features internes des MLLM via des sparse autoencoders.
arXiv cs.AI · cs.LG · cs.CL·Hunar Batra, Lachin Naghashyar, Ashkan Khakzar, Philip Torr·10 août 2026

Image · Source originale
MMDiff est un cadre d'analyse qui entraîne des sparse autoencoders (SAEs) pour identifier les features modifiées par l'entraînement multimodal. Il permet l'isolement de causales spécifiques, leur détection comparative et leur suppression ciblée. Testé sur LLaVA-MORE, PaliGemma 2 et InternVL3.5, il dégrade sélectivement des comportements comme l'OCR ou la sécurité sans impacter les performances VQA générales.