Toutes les news taguées avec ce sujet.
Anima Anandkumar explique pourquoi l'IA pour les systèmes physiques nécessite des approches distinctes des LLM.
Une étude révèle que le taux d'apprentissage effectif (ELR) unifie les dynamiques de perte à travers diverses configurations.
Une étude inédite montre que la taille des modèles doit varier selon les étapes de critique, de génération et de révision.
Le CEO de Z.ai explique pourquoi le nombre de paramètres ne suffit plus et présente GLM 5.3.
Un billet technique distingue l'optimalité théorique du compute (à la Chinchilla) des contraintes réelles d'un cluster de calcul.