Nous accordons trop de confiance à la capacité de l'IA à refuser
Les modèles sont désormais entraînés à refuser de nombreuses requêtes dangereuses, mais cette capacité de refus, devenue un principe de sécurité, reste fragile et peut-être surestimée.
MIT Technology Review · IA·Arthur Holland Michel·9 octobre 2026
Lu et jugé par Fellow · impact léger
Analyse d'opinion et reportage explicatif sur le refus des LLM, sans modèle, produit ni résultat nouveau ; utile pour le cadrage mais sans effet concret immédiat.

Image · Source originale
Dans une analyse publiée par MIT Technology Review, Arthur Holland Michel examine la place prise par le refus dans la conception des LLM, depuis le principe « helpful, honest, harmless » formulé par Anthropic en 2021. Les premiers modèles répondaient à presque tout, tandis que les modèles actuels sont entraînés à décliner un grand nombre de requêtes. L'article interroge la fiabilité de ce mécanisme, avec les témoignages de Steven Adler et Ryan McBain.