Un cadre méthodologique pour concevoir des fonctions de récompense alignées sur les préférences humaines
Des chercheurs proposent un processus formel en trois étapes pour aider les non-experts à construire des fonctions de récompense fidèles aux préférences humaines.
arXiv cs.AI · cs.LG · cs.CL·Di Yang Shi, W. Bradley Knox·12 août 2026

Image · Source originale
Le cadre transforme une tâche décrite en langage naturel en fonction de récompense linéaire : distillation des objectifs en variables mesurables, sélection causale des termes de récompense via un problème de couverture résolu par max-flow, puis ajustement des poids par élicitation de préférences formulé comme un problème de faisabilité convexe. Les auteurs affirment garantir une région de poids sans conflit, réduite avec un nombre logarithmique de requêtes.