Nathan Lambert的后训练教材出版了。封面印着《Reinforcement Learning from Human Feedback: Aligning and Post-training LLMs》,翻开目录却是GSPO、CISPO、在策略蒸馏——这些方法都是RLHF这个说法流行之后才出现的。作者自己也承认,书名起得有点旧。

这个错位比新书上市本身更值得琢磨。技术迭代的速度,已经追上了给技术起名字的速度。

书是什么,适合谁读

纸质书由Manning出版,8月19日前有折扣码,美国现货,英国10月上架,需要单独付费。全文在线版免费,配12小时课程(幻灯片加YouTube视频)、代码库、练习题、模型输出对比。

这本书面向已经写过代码、想认真做后训练的人,不算入门书。已经在做RLHF项目的工程师,可以直接把免费在线版当工具书查;还没做过相关项目、只有计算机本科背景的人,建议先看免费课程判断方向,再决定要不要买纸质书。

书起初只是一个网站,Lambert想把拒绝采样、结果奖励模型、角色训练这些当时几乎没有教材讲清楚的方法记下来。2024年他买下域名时,这些话题已经很热,但讲透的资料仍然很少。

书名旧,内容讲了什么

书名旧了,内容没旧 书名定格在 RLHF ChatGPT前后的术语框架 出版流程锁定于早期方案 内容更新到 GSPO / CISPO 最后一刻补上在策略蒸馏 覆盖小米、DeepSeek新方案

全书约四分之一篇幅讲强化学习,但不是把PPO、GRPO、GSPO、CISPO列成一张清单。重点是从策略梯度定理讲起,到PPO的裁剪目标在正负优势下怎么拆成六个区间。这套直觉是用来识别"新算法是真突破还是换个名字"的工具,没有哪个新算法一出来就能被证明正确。

再往下是系统层面。现在的RL问题大多是系统问题:数据有多离策略、训练和推理的不匹配、吞吐量,三者互相牵制。异步RL把生成rollout的actor和更新梯度的learner分成两组GPU,这套架构已经用了好几年,agentic任务只是在这套基础设施上继续叠。

其余几个章节可以摆成一张表:

内容讲什么对谁有用
后训练三阶段史2018年前起源、2019-2022语言模型试验、2023年后被ChatGPT放大想搞清楚领域怎么走到今天的人
蒸馏多教师在策略蒸馏,覆盖小米MiMo-V2-Flash、DeepSeek V4用到的方案要评估蒸馏是否可落地的团队
过度优化与角色训练为什么RL能泛化而SFT容易遗忘,模型性格怎么被塑造又怎么塑造过头做对齐和评测的研究者

蒸馏那章处理得比较克制。用一个模型的输出训练另一个模型,经常被描述成地缘政治工具,作者的态度是与其争论概念,不如把技术边界讲清楚。

稀缺的从来不是公式

研究落地窗口:3-9个月 论文发布 工程复现/训练 3-9个月 进入前沿模型 过去大厂可以对新论文视而不见,那时窗口以年计

Lambert给创业者的判断是:一篇论文从发表到进入前沿模型,现在只要3到9个月。这是他自己的经验判断,不是全行业统计,但方向站得住——以前大厂可以对新研究视而不见,窗口按年算;现在窗口缩到季度级。

对创业团队来说,这意味着押注一个新算法方向前,先问自己一个问题:如果6个月后被验证是死胡同,团队能不能承受。押错方向,代价不是浪费预算,是错过整个窗口期。

孔子说"必也正名乎",名不正则言不顺。这本书恰好反过来:名没跟上,内容没掉队。书名叫RLHF,是这个行业命名滞后的缩影——技术跑得比词汇快,等一个说法印上封面,内容早该更新了。

这本书真正想训练的,是读者对研究的判断力,一眼看出哪个新名词是旧方法换皮,哪个是真的往前走了一步。公式可以现学,眼力练不出来就只能靠交学费。