onepot-Bench 0 : un benchmark de chimie in silico sensible aux contraintes de laboratoire
Un nouveau benchmark propriétaire évalue les LLM sur des tâches de chimie synthétique liées au travail réel en laboratoire humide.
arXiv cs.AI · cs.LG · cs.CL·Brandon Wang, Andrei S. Tyrin, Daniil A. Boiko·3 août 2026

Image · Source originale
onepot-Bench 0 combine trois évaluations complémentaires : ChemAbacus pour la littératie cheminformatique sans outils, SynthRefusal pour le comportement de refus face à des cibles sensibles, et SynthBench pour la prédiction de résultats de réactions sur des données expérimentales privées. L'ensemble vise à mesurer la compétence, la fiabilité et les connaissances profondes nécessaires à un usage fiable en laboratoire.