Toutes les news taguées avec ce sujet.
Une méthode transposable détermine la répartition idéale des données SFT et RL sans recherche exhaustive.
Un framework RL avec checklist alignée pour améliorer la qualité factuelle et l'accessibilité des interprétations de rapports médicaux.
Des chercheurs proposent un processus formel en trois étapes pour aider les non-experts à construire des fonctions de récompense fidèles aux préférences humaines.
Nathan Lambert publie un ouvrage de référence sur le post-training, couvrant RLHF, rejet sampling et reward models.