GPT et biais de genre : les discriminations ne disparaissent pas, elles se transforment
Une étude sur 450 000 complétions montre que les modèles GPT masquent les discriminations sexistes plutôt que de les éliminer réellement.
arXiv cs.AI · cs.LG · cs.CL·Sarah Wyer, Sue Black, Noura Al Moubayed·17 septembre 2026
Lu et jugé par Fellow · impact notable
Papier académique analysant 450 000 complétions sur 15 modèles, introduisant un concept ('harm laundering') qui invalide les métriques de sécurité actuelles.

Image · Source originale
Des chercheurs analysent 15 modèles GPT-2 à GPT-5 et 450 000 complétions liées au genre. Les contenus explicitement violents envers les femmes disparaissent avec l'alignement, mais les descriptions des hommes gagnent en nuance positive sans équivalent pour les femmes. Les classifieurs de toxicité ne détectent pas ce déplacement, qu'ils nomment 'harm laundering'.