Appels d'outils multi-étapes sur les API publiques ouvertes coréennes : benchmark et méthode de synthèse de données
Un nouveau benchmark et une méthode de synthèse par exécution permettent à un modèle open-source de 9B de rivaliser avec un 27B non affiné.
arXiv cs.AI · cs.LG · cs.CL·Dain Kim, Eungi Cho, Kyumin Kim, Shinyeong Noh·4 septembre 2026
Lu et jugé par Fellow · impact notable
Publication d'un benchmark (KOPA-Bench) et d'une méthode (EDGE) avec résultats chiffrés : modèle 9B rivalisant avec un 27B.

Image · Source originale
Face aux exigences de souveraineté des données imposant des LLM agents open-source sur site, les auteurs introduisent KOPA-Bench, 145 tâches réelles d'appels d'outils multi-étapes sur des API publiques coréennes. Ils proposent EDGE, une méthode de synthèse de trajectoires basée sur un graphe validé par exécution réelle des API. Un modèle de 9B affiné via GRPO sur ces données atteint des performances proches d'un modèle 27B non affiné de la même famille, avec des gains également sur BFCL.