Toutes les news taguées avec ce sujet.
L'incohérence des prévisions probabilistes des LLM mesurée par le profit des Dutch Books.
Un benchmark évalue la capacité des modèles à suivre l'impact des modifications de plugins dans des systèmes dynamiques complexes.
Analyse mécaniste de l'évaluation automatique par LLM pour identifier les couches responsables de la notation.
Un nouveau cadre d'évaluation exploite les traces d'exécution pour améliorer le benchmarking d'agents logiciels.
Réduire les coûts d'évaluation via batching ou quantisation peut altérer les conclusions sur les biais et la performance des modèles.
Une étude contrôlée évalue 13 modèles Qwen et GPT pour déterminer l'influence de la taille sur l'apprentissage d'ontologies.
Deux métriques basées sur des représentations SSL évaluent la qualité du forçage temporel sans annotation manuelle.
Une étude benchmark critique les métriques classiques pour évaluer la détection de code malveillant dans les artefacts machine learning.
DeepMind teste un protocole d'évaluation en double aveugle pour réduire les biais lors des benchmarks de modèles.
Hugging Face analyse l'impact de l'optimisation sur les benchmarks de reconnaissance automatique de la parole.
Un framework RL avec checklist alignée pour améliorer la qualité factuelle et l'accessibilité des interprétations de rapports médicaux.
NVIDIA lance SkillEvaluator, un outil pour mesurer l'efficacité des compétences des agents IA et réduire les étapes inutiles.
Un benchmark basé sur l'Olympiade Internationale de Linguistique pour tester la capacité des modèles à déduire des règles.
SecIT Bench évalue les performances des agents IA dans les workflows informatiques et de cybersécurité.
Un nouveau framework évalue les propriétés des tokenizers et leur impact réel sur les performances des modèles.
L'ingénierie prompt et le modèle Kimi K3 dépassent les capacités natives de Claude Code.
Anthropic publie une méthode pour évaluer la robustesse des raisonnements conceptuels face à la distillation.
DeepSeek dévoile Harness, un environnement pour le développement et l'évaluation d'agents LLM.
Une méthode de diagnostic intervient dans l'espace des logits pour forcer les modèles hors de leur voie nominale et évaluer leur résilience.
Une étude mappe 21 outils open-source sur la taxonomie MIT des risques, révélant un déséquilibre au profit des contrôles techniques.
Une nouvelle ressource dédiée à l'évaluation et à la validation de modèles.
Un framework sans référence utilise des LLM comme juges pour évaluer la consistance et la complexité des benchmarks d'agents.
Une étude sur 2 190 vidéos contrôlées révèle que les VLM comme Gemini échouent massivement dès que le nombre et la fréquence d'événements augmentent.