Toutes les news taguées avec ce sujet.
Un essai explore comment les erreurs des LLM sur des tâches simples révèlent des usages où leur imperfection reste exploitable.
Un tutoriel examine le passage des agents LLM du prototype académique à la production, avec études de cas en pharma et finance.
Le laboratoire français Pleias met en ligne GoldenSwag, une nouvelle collection destinée à l'évaluation des modèles de langage.
763 tâches ancrées dans la littérature évaluent les LLM sur quatre rôles de conception d'ingénierie physique, révélant des performances très inégales selon les étapes.
Une méthode qui transforme les évaluations par rubrique en diagnostic précis des capacités faibles d'un modèle, pour générer des données de fine-tuning ciblées.
Les modèles multimodaux les plus avancés s'effondrent face à des tâches nécessitant une perception visuelle itérative, loin derrière les humains.
Une étude sur HotpotQA montre qu'un tiers des documents jugés inutiles par les métriques RAG classiques s'avèrent en réalité déterminants pour les agents de recherche.
Une analyse rétrospective de neuf systèmes en endoscopie GI révèle l'écart entre performance sur benchmark et fiabilité clinique réelle.
Une étude compare des agents de sécurité IA à budget de calcul fixe, révélant des dynamiques très différentes entre attaque et défense.
Une étude montre que les estimations probabilistes des LLM violent souvent les règles de base de la théorie des probabilités.
Un contexte non pertinent, même du charabia, peut faire basculer les réponses de LLM sur certains exemples sans que la précision globale ne bouge.
Une étude méthodologique teste si les petits LLM de code exploitent réellement le contenu des erreurs pour se corriger, via des placebos contrôlés.
Une étude montre que la température d'échantillonnage influence la transmission des idéologies dans les systèmes RAG.
Un nouveau benchmark évalue la capacité des LLM à produire et vérifier des preuves de niveau universitaire à doctoral, au-delà des olympiades.
Une étude sur dix ans montre que les modèles multimodaux récents ont quasiment comblé leur écart de performance face aux scènes sociales complexes.
NVIDIA détaille les défis méthodologiques liés à l'évaluation rigoureuse des foundation models robotiques en conditions réelles.
La précision et la perplexité ne suffisent pas à évaluer la quantization : une nouvelle métrique comportementale révèle des divergences invisibles.
Un nouveau benchmark évalue les agents LLM sur des tâches réelles en conteneurs Docker, avec une stratégie en boucle fermée pour simuler des interactions humaines multi-tours.
Une analyse approfondie des benchmarks LLM appliqués au coding agentique, de leur variance et de leurs limites méthodologiques.
Une analyse d'OpenAI pointe des défauts dans SWE-Bench Pro, benchmark de référence pour évaluer les capacités de codage des modèles IA.
Un nouveau benchmark multidimensionnel pour mesurer si les modèles vocaux conversationnels se comportent vraiment comme des interlocuteurs humains.
Un essai argue que créer un benchmark ciblé transforme des données dormantes en signal utile, donnant à un domaine un objectif mesurable à optimiser.
Un chercheur teste TabFM de Google sur des données réelles et remet en question les performances annoncées par rapport aux baselines classiques.
Un thread Hacker News interroge la communauté sur l'existence de benchmarks fiables pour évaluer la sécurité des grands modèles de langage.
Une étude révèle que des agents LLM adaptent stratégiquement leur discours public selon le contexte social, même sans instruction explicite en ce sens.
Une audit de GSO, SWE-Perf et SWE-fficiency révèle des fragilités majeures : instabilité des runtimes, règles de scoring biaisées et saturation des tâches.
Un nouveau benchmark évalue les agents IA non plus sur des bugs isolés, mais sur des tâches d'ingénierie logicielle complexes, à la hauteur d'un senior.
Cursor publie CursorBench 3.1, son propre cadre d'évaluation pour mesurer les capacités des modèles sur des tâches de programmation réelles.
Une étude à grande échelle révèle que les LLM génèrent des idées de recherche concentrées sur des patterns étroits, loin de la diversité humaine.
Un outil open-source permettant d'analyser et classifier les traces d'exécution d'agents IA à l'aide de classifieurs multi-têtes légers.