Toutes les news taguées avec ce sujet.
Un nouveau benchmark teste les LLM sur des données physiologiques longitudinales réelles issues de 200 utilisateurs et 500 jours de mesures.
Un nouveau benchmark révèle qu'un tiers des correctifs validés par les tests fonctionnels ignorent les contraintes de revue de code réelles.
Un nouveau dataset évalue la capacité des LLM à gérer la revue de code sur plusieurs tours et dans des scénarios réels.
GB/T-Bench teste la capacité des LLM à détecter des erreurs structurelles et normatives dans des standards nationaux chinois, un exercice jusqu'ici réservé aux experts humains.
Une méthode anytime-valid accélère l'évaluation d'agents LLM dans les jeux à information imparfaite.