Silence structurel : l'IA exclut les langues sous-représentées
Les infrastructures de l'IA pénalisent structurellement le bengali et autres langues minoritaires dès la conception.
arXiv cs.AI · cs.LG · cs.CL·Avijit Roy, Proma Roy·12 août 2026

Image · Source originale
Cette étude analyse comment les corpus d'entraînement, la tokenisation et l'architecture défavorisent les locuteurs de langues sous-représentées, comme le bengali, bien avant l'entraînement des modèles. Elle identifie quatre échecs interdépendants : un déficit de présence web, un déséquilibre massif de tokens, une pénalité de tokenisation et l'exclusion par la connectivité.