Les pratiques de rédaction radiologique faussent l'évaluation des rapports générés par IA
Une étude montre que le style de rédaction des rapports de référence influence lourdement le classement des modèles d'IA en radiologie.
arXiv cs.AI · cs.LG · cs.CL·Daniel P. Jeong, Charles Q. Li, Hossein Hosseiny, Nitya M. Bhalla·16 septembre 2026
Lu et jugé par Fellow · impact notable
Publication d'un papier arXiv démontrant une fragilité méthodologique majeure dans l'évaluation de modèles médicaux, avec jeu de données publié.

Image · Source originale
Les auteurs démontrent que les métriques d'évaluation actuelles pour la génération de rapports radiologiques sont très sensibles aux variations stylistiques des rapports de référence, indépendamment de leur exactitude clinique. Ils introduisent une taxonomie des pratiques de rédaction et une méthode, ReRef, qui reformule les références selon ces axes tout en préservant l'interprétation clinique. Sur MIMIC-CXR avec RadCliQ-v1, ces reformulations suffisent à inverser le classement de plusieurs modèles, dont Libra et CheXOne. Un jeu de données, MIMIC-CXR-Ext-ReRef, est publié pour soutenir les recherches futures.