IDiom : génération de régions protéiques intrinsèquement désordonnées via des autoencodeurs épars renforcés
Un modèle de langage protéique entraîné sur 54 millions d'IDR, combiné à une méthode RL-SAE, permet de concevoir des séquences désordonnées fonctionnelles de façon contrôlable.
arXiv cs.AI · cs.LG · cs.CL·Jason X. Liu, Sebastian Ibarraran, Frank Hu, Soojung Yang·1 octobre 2026

Image · Source originale
IDiom est un modèle de langage protéique autorégressif entraîné sur IDiom-DB, une base de 54 millions de régions protéiques intrinsèquement désordonnées issues d'AlphaFold. Les auteurs introduisent RL-SAE, une méthode de post-entraînement par renforcement utilisant des features d'autoencodeurs épars pour orienter la génération vers des fonctions ciblées. Sur huit tâches de conception, RL-SAE active en moyenne 90% des features visées contre 24% pour le steering classique, et améliore la localisation subcellulaire et l'activité transcriptionnelle prédites des séquences générées.