Au-delà du F1 : évaluer la couverture et la récupération des scanners de sécurité IA
Une étude benchmark critique les métriques classiques pour évaluer la détection de code malveillant dans les artefacts machine learning.
arXiv cs.AI · cs.LG · cs.CL·Qianlong Lan, Vinothini Pandurangan, Anuj Kaul, Indranil Sanyal·27 août 2026
Lu et jugé par Fellow · impact léger
Benchmark académique sur corpus synthétique de 170 artefacts, protocole documenté mais portée limitée à trois outils existants.

Image · Source originale
Cette étude évalue trois scanners de sécurité statique (ModelScan, ModelAudit, Fickling) sur un corpus de 170 artefacts. Elle distingue la précision du jugement de sa disponibilité, montrant que ModelAudit couvre 100% des familles labellisées alors que ModelScan échoue souvent à compléter l'analyse. Les résultats soulignent la nécessité de séparer l'exactitude de la couverture effective des outils.