Bottling : les agents LLM peuvent-ils transformer leurs capacités en artefacts économiques et scalables ?
Un nouveau benchmark, BOTTLED, teste si des agents LLM peuvent convertir des compétences générales en solutions spécialisées à moindre coût.
arXiv cs.AI · cs.LG · cs.CL·Ankit Sonthalia, Haritz Puerto, Alexander Rubinstein, Martin Gubri·6 octobre 2026
Lu et jugé par Fellow · impact notable
Nouveau benchmark avec résultats chiffrés sur 10 modèles montrant une limite réelle des agents LLM en distillation de tâches.

Image · Source originale
Les auteurs introduisent BOTTLED, un benchmark évaluant la capacité des agents LLM à traiter des workloads entiers sous contraintes de temps, compute et budget API, en choisissant leur propre approche (modèle distillé, programme réutilisable, etc.). Sur dix modèles et trois tâches, la performance zero-shot ne prédit pas fiablement la capacité de « bottling » : 48 des 60 runs sous-performent par rapport au zero-shot du même modèle. Malgré cela, le bottling permet des économies substantielles, par exemple 82% du F1 zero-shot conservé pour un coût environ 657 fois inférieur sur une tâche de classification.