Toutes les news taguées avec ce sujet.
Le modèle d'Anthropic devance ses concurrents sur l'agrégateur de benchmarks Artificial Analysis, référence pour comparer les LLM.
Le classement officiel du benchmark ARC-AGI est désormais accessible pour mesurer le raisonnement.
Le classement WebDev Arena révèle la domination des modèles chinois dans le coding IA, avec un seul modèle occidental dans le top 5.
Hugging Face introduit un classement dédié à l'évaluation des systèmes de reconnaissance vocale automatique sur des données audio du monde réel.