Toutes les news taguées avec ce sujet.
Une étude montre que la distillation on-policy peut atteindre des performances quasi-optimales avec une seule donnée d'entraînement.
Réduire les coûts d'évaluation via batching ou quantisation peut altérer les conclusions sur les biais et la performance des modèles.
Une architecture MoE hétérogène réduit les coûts d'entraînement sans perte de performance.
Une nouvelle borne mathématique définit l'erreur minimale atteignable par le fine-tuning LoRA en fonction du rang.
Un modèle LLM apprend à sélectionner le niveau de raisonnement nécessaire par problème, réduisant le coût de calcul de 41%.
Cette méthode réduit l'espace de recherche des splits via des centroïdes informés par les données.
Un nouveau modèle de raisonnement combine apprentissage in-context et mémoire récurrente, battant le record d'efficacité coût/précision sur ARC-AGI-1.
Moonshot AI propose une nouvelle méthode d'attention optimisée pour réduire la complexité computationnelle.