Toutes les news taguées avec ce sujet.
Une étude compare recettes de modèles et corpus de données de 2019 à 2025 pour isoler la source réelle des gains de performance en pré-entraînement.
Deux campagnes préenregistrées montrent que les LLM utilisés comme juges produisent des classements incohérents, même sur des requêtes strictement identiques.
Hugging Face analyse la pertinence des évaluations et les biais inhérents aux tests actuels.
Réduire les coûts d'évaluation via batching ou quantisation peut altérer les conclusions sur les biais et la performance des modèles.
L'analyse comparative montre des pertes de performances significatives avec musl, en particulier sur les opérations de chaînes de caractères.
Les casse-têtes révèlent les forces et faiblesses cognitives des modèles par rapport à l'humain.
L'interaction entre LLM multi-agents peut réduire la diversité des solutions et nuire aux performances sous budget contraint.
Le nouveau modèle GLM-5.3 de Zhipu AI a été évalué par Artificial Analysis, qui publie ses scores sur une batterie de benchmarks standards.
Un nouveau framework évalue les propriétés des tokenizers et leur impact réel sur les performances des modèles.
Un modèle 1B paramètres basé sur l'architecture HRM, entraîné uniquement sur des données permises.