Manuel RLHF : aligner et post-trainer les LLM
Nathan Lambert publie un ouvrage de référence sur le post-training, couvrant RLHF, rejet sampling et reward models.
Interconnects (Lambert)·Nathan Lambert·10 août 2026

Image · Source originale
Nathan Lambert publie son ouvrage chez Manning, intitulé Reinforcement Learning from Human Feedback. Ce livre documente les méthodes de post-training et d'alignement des LLM, expliquant les techniques fondamentales comme le rejection sampling et les outcome reward models. L'auteur vise à clarifier les intuitions et l'histoire de ces processus techniques pour combler un manque de ressources pédagogiques.