BrickBench : évaluer la conception d'assemblages LEGO par des agents
Un nouveau benchmark teste la capacité des agents à concevoir, à partir d'un texte, des sets LEGO réellement constructibles. Les meilleurs agents restent en deçà des designs humains.
arXiv cs.AI · cs.LG · cs.CL·Peter Kulits, Yiqing Xu, R. Kenny Jones, Cordelia Schmid·8 octobre 2026
Lu et jugé par Fellow · impact léger
Benchmark de niche avec environnement BrickAgent publié (Stanford/Inria), mais portée limitée à la conception LEGO et sans évaluation indépendante ni couverture externe à ce stade.

Image · Source originale
BrickBench est un benchmark de conception de sets LEGO pilotée par texte, où un agent doit sélectionner des pièces dans une bibliothèque discrète et respecter des contraintes locales et globales. Trois configurations, variant par l'échelle et la disponibilité des pièces, mesurent validité, alignement et design. Les agents de pointe satisfont l'essentiel des exigences physiques et sémantiques vérifiables, mais restent inférieurs aux créations humaines. Le benchmark et l'environnement BrickAgent sont publiés.