Évaluer la qualité des benchmarks pour agents conversationnels
Un framework sans référence utilise des LLM comme juges pour évaluer la consistance et la complexité des benchmarks d'agents.
arXiv cs.AI · cs.LG · cs.CL·Noam Koren, Roy Bar-Haim, Abigail Goldsteen·6 août 2026

Image · Source originale
Cette étude propose un cadre d'évaluation sans référence utilisant des LLM pour juger la qualité des benchmarks d'agents conversationnels. Il évalue la consistance, la complexité et la couverture, validant la méthode par comparaison avec des annotations humaines et des benchmarks dégradés.