Toutes les news taguées avec ce sujet.
Le modèle d'Anthropic devance ses concurrents sur l'agrégateur de benchmarks Artificial Analysis, référence pour comparer les LLM.
Tests de performance du modèle Qwen 3.6 35B MoE (3B actifs) exécuté localement sur carte graphique NVIDIA RTX 3090.
Le classement officiel du benchmark ARC-AGI est désormais accessible pour mesurer le raisonnement.
Un développeur teste l'idée d'utiliser un jeu textuel multi-utilisateurs (MUD) comme benchmark pour évaluer les capacités des LLM.
Un nouveau benchmark et corpus d'instruction en cinghalais-anglais pour corriger le biais occidental de l'alignement des valeurs des LLM.
Un nouveau benchmark évalue neuf algorithmes de détection de staypoints et révèle leur fragilité face au bruit réel.
Un nouveau cadre et benchmark pour mesurer la complétude factuelle des générations longues via des méta-rubriques à deux niveaux.
Fireworks AI publie une évaluation montrant que Kimi K3 se hisse au niveau de Fable, avec des résultats combinés inédits.
Un test informel confronte plusieurs LLM sur un exercice de génération d'image façon crayons de couleur, la Joconde comme sujet.
Un outil en ligne permet d'évaluer, selon les specs de sa machine, quels modèles d'IA locaux sont exécutables sans souci.
Le laboratoire français Pleias met en ligne GoldenSwag, une nouvelle collection destinée à l'évaluation des modèles de langage.
763 tâches ancrées dans la littérature évaluent les LLM sur quatre rôles de conception d'ingénierie physique, révélant des performances très inégales selon les étapes.
Un nouveau benchmark et une métrique VLM permettent de conditionner la similarité visuelle selon un aspect précis (forme, couleur, etc.).
Une étude typologique montre comment la formulation linguistique d'une croyance influence la capacité des LLM à suivre le contexte ou leurs connaissances préalables.
Une méthode qui transforme les évaluations par rubrique en diagnostic précis des capacités faibles d'un modèle, pour générer des données de fine-tuning ciblées.
Les modèles multimodaux les plus avancés s'effondrent face à des tâches nécessitant une perception visuelle itérative, loin derrière les humains.
Un leaderboard open source mesure la rapidité des différentes méthodes de fine-tuning LoRA sur des tâches standardisées.
Le laboratoire chinois Moonshot AI dévoile Kimi K3, qui revendique le titre de premier modèle open-weight de classe 3T, avec des tarifs inédits pour un modèle chinois.
Un billet compare deux modèles sur un problème d'optimisation NP-difficile pour évaluer l'apport d'une fonctionnalité de guidage par objectif.
Simon Willison teste Kimi K3 avec son benchmark maison — dessiner un pélican à vélo en SVG — et en tire des enseignements sur l'évaluation des LLM.
Un nouveau benchmark exploite l'historique des versions arXiv pour entraîner des agents à éditer des figures scientifiques via instructions en langage naturel.
Une étude compare des agents de sécurité IA à budget de calcul fixe, révélant des dynamiques très différentes entre attaque et défense.
Le modèle embedding de NVIDIA domine le benchmark RTEB, boostant les capacités de retrieval pour les agents IA.
Une étude compare trois méthodes d'optimisation d'agents et montre que la plupart des gains ne se maintiennent pas dans un cadre d'apprentissage continu.
Un billet Hugging Face interroge la portée réelle des gains apportés par les modèles récents face aux approches établies.
Un nouveau protocole d'évaluation isole les LLM de toute donnée post-événement pour mesurer une vraie capacité de prévision, pas du simple rappel.
Hugging Face dévoile Real World VoiceEQ, un nouveau benchmark pour évaluer la qualité humaine des modèles de voix.
Un contexte non pertinent, même du charabia, peut faire basculer les réponses de LLM sur certains exemples sans que la précision globale ne bouge.
Un benchmark pour le cold-start avec un nouveau dataset contrôlé et privé.
Un nouveau cadre, E3, apprend aux agents LLM à estimer l'effort nécessaire avant d'agir, réduisant drastiquement coûts et sur-lecture inutile de code.