Toutes les news taguées avec ce sujet.
Un transformer entraîné sur des données ATLAS retrouve masses et résonances du Modèle Standard sans connaissance physique préalable explicite.
Une étude théorique décortique le rôle des skip connections et de la normalisation dans la préservation du rang des gradients au fil des couches.
Des chercheurs modélisent l'apprentissage des circuits de raisonnement inductif via une variété invariante de faible dimension, rendant leur dynamique interprétable.
Une étude théorique explique pourquoi les modèles utilisent inégalement les fréquences RoPE et lie ce phénomène à la structure multi-échelle du langage naturel.
Hugging Face intègre un backend transformers natif dans vLLM, permettant d'atteindre des vitesses d'inférence optimales sans surcoût de conversion.
Des chercheurs montrent qu'une pénalité de norme simple peut accélérer le grokking jusqu'à 6x en contraignant les représentations cachées sur une hypersphère.
Allen AI analyse en détail les différences de prédiction entre architectures hybrides et transformers classiques au niveau du token.
NVIDIA et Hugging Face présentent NeMo AutoModel, une solution pour optimiser et accélérer le fine-tuning de modèles Transformers à grande échelle.
Des chercheurs montrent que l'optimiseur Muown opère sur une géométrie riemannienne et proposent AngularMuown, une version améliorée avec un multiplicateur angulaire explicite.
Une nouvelle approche architecturale réduit progressivement la largeur des MLP en profondeur et améliore la perplexité sans coût supplémentaire.