Toutes les news taguées avec ce sujet.
Une étude montre que le feedback utilisateur améliore réellement les révisions de modèles, mais que les juges LLM échouent à le reconnaître.
Un nouveau benchmark révèle que les agents IA échouent massivement à migrer des bases de code complètes sans tricher ni casser le comportement.
Un chercheur propose de mesurer la régularité des réponses des LLM plutôt que leur performance moyenne, jugée saturée sur les benchmarks actuels.