Ce que le FID cache : détecter, classer et diagnostiquer les écarts en évaluation générative
Une étude montre les limites du FID et propose ZID, un nouveau cadre de diagnostic plus fin pour évaluer les modèles génératifs.
arXiv cs.AI · cs.LG · cs.CL·Hao Chen·25 août 2026
Lu et jugé par Fellow · impact léger
Nouvelle métrique de diagnostic proposée par un seul auteur, validée sur deux modèles, sans adoption ni évaluation indépendante à ce stade.

Image · Source originale
Les auteurs démontrent que le FID, basé sur deux moments statistiques, peut être trompé par des images non reconnaissables visuellement mais obtenant un score meilleur que des images réelles. Ils introduisent ZID, une méthode combinant six critères statistiques pour fournir un indice de classement, un test de significativité et un diagnostic directionnel (sous- ou sur-dispersion). ZID détecte des écarts que le FID manque ou inverse, validé sur DiT-XL/2 et SiT-XL/2.