VeriFine : une vérification évolutive pour l'auto-amélioration en raisonnement incarné
Un framework où politique, curriculum et juge co-évoluent pour permettre l'auto-amélioration continue d'agents en robotique et conduite autonome.
arXiv cs.AI · cs.LG · cs.CL·Zewei Zhou, Rachel Luo, Yulong Cao, Chaowei Xiao·6 octobre 2026
Lu et jugé par Fellow · impact léger
Framework de recherche avec résultats sur tâches de conduite/navigation, mais sans benchmark indépendant ni comparaison chiffrée claire.

Image · Source originale
VeriFine propose un agent harness où un juge basé sur des rubriques diagnostique les échecs récurrents pour construire un curriculum adaptatif et optimiser la politique. Lorsque la progression stagne, une boucle d'amélioration du juge sollicite l'humain sur des cas ambigus pour recalibrer les critères d'évaluation. Testé sur des tâches de conduite et de navigation robotique, le système montre une auto-amélioration continue de la politique et du juge.