Entraînement efficace de modèles MoE par reconfiguration de couches
Une architecture MoE hétérogène réduit les coûts d'entraînement sans perte de performance.
arXiv cs.AI · cs.LG · cs.CL·Simeng Sun, Roger Waleffe·28 août 2026
Lu et jugé par Fellow · impact notable
Une étude académique validant une architecture MoE réduisant de 33,3% les coûts GPU sans perte de performance.

Image · Source originale
Les chercheurs proposent CE-MoE, une approche qui découple la profondeur de mélange de tokens et de canaux pour optimiser les communications. En concentrant la capacité d'expert dans quelques couches routées et en ajoutant des couches denses, le modèle réduit significativement les coûts GPU. À l'échelle 31,5B, CE-MoE économise 33,3% d'heures GPU tout en améliorant les scores downstream.