💬 观点Nathan Lambert
5 useful things you'll learn in my new post-training — Nathan Lambert 新书发布,提炼 RLHF 与后训练的核心直觉、历史
Nathan Lambert 新书发布,提炼 RLHF 与后训练的核心直觉、历史与系统设计。
2026-08-10原文
本文为要点摘要,完整细节以原文为准。
- 书中约 25% 篇幅讲解 RL 算法直觉,从策略梯度到 PPO、GRPO、GSPO 等,帮助读者判断新算法是“真有用”还是“假把式”。对开发者而言,理解这些直觉能更有效地调试和设计 RL 训练系统。
- 现代 RL 本质是系统问题,需平衡数据 off-policy 程度、训练-推理不一致和吞吐量,异步 RL 架构(learner 与 actor 分离)仍是主流。开发者应关注系统层面的权衡,而非仅算法本身。
- 书中梳理了后训练的三段历史(~2018 前、2019-2022、2023 后),并专门用一章拆解“蒸馏”的多种工业标准做法,澄清其在政策讨论中被过度简化的形象。开发者可借此理解数据工业中的常见实践,避免概念混淆。
原文:5 useful things you'll learn in my new post-training textbook (shipping now!) · 作者 Nathan Lambert