训练模型推理
当奖励是可核查的真值,而不是一个习得的人类偏好代理时,强化学习的性质会发生变化。在存在验证器的任务上,验证器胜过奖励模型,因为它移除了习得代理缺口;组相对策略优化(GRPO)与REINFORCE 留一法(RLOO)是两种策略梯度变体,它们从一组采样里计算基线(用来判断某个结果是否好于寻常的参照值),再通过丢掉评论者(一个习得的期望奖励预测器,正是充当上述基线的那个网络)来简化近端策略优化(PPO);o1 与 R1 一脉表明,没有步级监督也能产出长程推理;而领域内至今仍有分歧的是,这种训练究竟教会了新推理,还是主要重加权了基座模型本来就能采样到的路径。
全章围绕一个对象展开:验证器。它存在之处,这套配方适用;它不存在之处,就只能退回到 第 19 章 的习得奖励模型。一旦验证器固定下来,每一项设计选择的代价也会随之显形。
一个没有习得代理缺口的奖励
先从这一切要解决的失效讲起。习得的奖励模型是一个代理,而针对代理训练的策略会去找它的 argmax,而非真实目标的 argmax。这正是困扰 第 19 章 中 RLHF 的过度优化问题 (Gao et al. 2022):对一个人类偏好模型优化得足够强,策略学到的便是满足那个模型,而非满足人。奖励模型没有真值来锚定它,于是它的盲区就变成了策略的可乘之机。
对于一大类有价值的任务,存在一条出路,因为答案可以被核查。一段程序要么通过它的单元测试,要么不通过。一个数学答案要么等于参考答案,要么不等。一个形式化证明要么在 Lean 中通过类型检查,要么不通过。在这些任务上,就可以用一个验证器取代习得的奖励,针对一个没有习得代理缺口的奖励来优化策略。智能体运行框架在推断时会跑一个运行时验证回路,而 可验证奖励的强化学习(RLVR) 正是它在训练阶段的对应物。
把代理换成核查器
端到端的回路很短。为一个提示采样若干补全,把每条补全送过一个验证器以获得标量奖励,这个奖励往往就是二元的,再朝着获奖的补全更新策略。训练数据是带有核查答案手段的提示,而非带有参考补全的提示。优化器原封不动地复用了 第 19 章 的 PPO 机制 (Schulman et al. 2017):一个策略、一个优势估计,以及一项对冻结的参考模型的 KL 惩罚。创新之处在于奖励来源,而不在算法。
这个回路下游的一切,都取决于中间那个框里的核查器有多好。下一节展开验证器本身。
三类验证器
验证器正是最难取得的那一部分,它分为三类,成本与覆盖面各不相同。用于代码的可执行单元测试成本低且信号强,但覆盖面有限,一个通过了测试却实则错误的解,照样会得到奖励。用于数学的答案核查器归结为字符串、数值或符号等价,难的工程在于解析与等价判定,而非核查本身。Lean 或 Isabelle 一类的形式化证明检查器几乎无法伪造,却范围狭窄、编写成本高昂。每一类都在覆盖面与完整性之间权衡,而这一取舍在这里反复出现。图 28.2 把这三类放到那条轴上。
强化学习配方的形态,由下层是否存在验证器所决定。答案可核查处,得到的是一个没有习得代理缺口的奖励,这个回路适用。不可核查处,就只能退回到 第 19 章 的习得奖励模型,并继承它的过度优化。这正是前沿推理工作集中于数学、代码与形式化证明的原因:在数据层是否有一个真值可用,而非在训练层是否有一个偏好,才决定了能运行哪种算法。验证器的覆盖面才是真正的预算,不过本章结尾会看到,这条边界在 2025 年被拉伸了。
丢掉评论者
奖励来源一旦固定,优化器便得到一处实际的简化。PPO 背着一个价值网络,即评论者(critic),用于估计那个降低优势方差的基线,而这个网络使模型显存翻倍,并引入它自身的失效模式。组相对策略优化(Group Relative Policy Optimization),为 DeepSeekMath 提出 (Shao et al. 2024),丢掉评论者,转而从为一个提示采出的样本组中估计优势:把每个奖励相对组内均值与标准差做归一化。对于一组 条补全、奖励为 ,
其中 是第 条补全的奖励, 是同一提示下采样出的补全数量,分子把这条补全相对组平均值的好坏取出来,分母再用组内标准差把尺度归一。这个式子的直觉是:不再训练一个价值网络去估计基线,而是让同一组样本互相充当基线;一条补全是否值得强化,取决于它是否比同题的其他补全更好。
在同一个奖励向量上算出两种基线,看它们在哪里不同,以及一个无离散度的组对各自意味着什么。
import numpy as np
def grpo_adv(r):
s = r.std()
if s == 0: # 全对或全错:没有离散度,没有信号
return np.zeros_like(r)
return (r - r.mean()) / s
def rloo_adv(r): # 基线 = 其余 G-1 个样本的均值
G = len(r)
return r - (r.sum() - r) / (G - 1)
for name, r in [("mixed ", np.array([1., 0., 1., 0.])),
("all pass", np.array([1., 1., 1., 1.]))]:
print(f"{name} rewards={r.tolist()}")
print(f" GRPO advantage = {np.round(grpo_adv(r), 3).tolist()}")
print(f" RLOO advantage = {np.round(rloo_adv(r), 3).tolist()}")
它比带评论者的 PPO 成本更低,且恰好契合 RLVR,因为当每条补全都低成本可验证时,每个提示采多个样本就很自然。对参考模型的 KL 项依旧保留。RLOO,即 REINFORCE 留一法(Leave-One-Out),用一个不同的基线做同样的押注 (Ahmadian et al. 2024):每个样本的基线是组内其余样本的平均奖励。GRPO 与 RLOO 在偏差与方差的取舍上不同,但它们在一个结构性主张上一致:评论者往往是不必要的额外开销。图 28.4 展示了这三种方法各自从何处获取那个把奖励变成优势的基线。
强化学习所优化的那个奖励预测误差,即所期望的奖励与所收到的奖励之间的差,正是中脑多巴胺神经元后来被发现按其比例放电的那个量:算法在此预言了它后来才描述的神经科学,这样的例子并不多见。第 3 章 追溯了这条脉络,以及类比在何处止步。
这个回路产出了什么:o1 与 R1
改变了整个领域的结果是:这个回路在数学与代码上运行起来,并允许长链思维出现时,可以在没有任何步级监督的情况下产出涌现的长程推理。自我核查、回溯,以及更长时间的斟酌,都从一个仅结果的奖励中出现。OpenAI 的 o1 宣告了这一能力 (OpenAI 2024)。DeepSeek-R1 则展示了这套配方的公开数据点 (Guo et al. 2025)。
R1 拆成两个变体时最清楚,因为这组对照承载了它的主张 (Guo et al. 2025)。R1-Zero 把强化学习直接施于一个基座模型,没有监督冷启动,而推理行为依然涌现,这是那个更强的主张。R1 在强化学习之前加了一段简短的 SFT 冷启动,借用了 第 17 章 的监督微调,不是为了教推理,而是为了修复可读性与稳定性:Zero 变体的推理虽正确却难以阅读,且易出现语言混杂。冷启动是一段修饰性、起稳定作用的前缀,推理增益来自强化学习。图 28.5 对照了这两条流水线。
完整发布的 R1 不止是在强化学习前贴上一个冷启动。整体来看,它是一条四阶段的流水线:一小批冷启动 SFT 数据用于修复可读性,第一段面向推理的强化学习,一轮只保留已验证为正确的轨迹并掺入通用 SFT 数据的拒绝采样,再是一段跨推理与通用偏好一起跑的最终强化学习 (Guo et al. 2025)。zero 变体的奖励是基于规则且复合的,一个核查答案的准确率奖励,加上一个要求链式思维落在 <think> 与 </think> 标签之间的格式奖励;R1 又加了一个语言一致性奖励,即链中以目标语言书写的比例,以制止 zero 变体的语言混杂,代价是原始准确率的一点可测下降 (Guo et al. 2025)。
R1 报告的两条死路,和它的成功一样有教益 (Guo et al. 2025)。过程奖励模型(PRM)试过又被弃:在开放推理里定义一个细粒度的正确步骤很难,逐步判定本身就易错,而习得的 PRM 招来了 第 19 章 的奖励欺骗,所换来的收益不足以抵消其开销。在词元流上做蒙特卡洛树搜索(MCTS)也试过又被弃,因为词元生成所开的搜索空间比棋类游戏指数级地更大,而它所需的步级价值模型很难训练。胜出的信号是基础的结果奖励,而非更密、更巧的那个。另一条教训关乎推理轨迹从哪里来:把 R1 的轨迹蒸馏进一个更小的稠密模型,胜过在那个小模型上直接跑同样的强化学习,DeepSeek-R1-Distill-Qwen-32B 被报告高于 DeepSeek-R1-Zero-Qwen-32B,于是把推理装进小模型成本最低的办法,是让一个大模型把它找出来再复制结果,这条线由 第 23 章 接续。
RLVR 究竟是在教出新的推理能力,还是只放大了基座模型已经知道的东西,尚无定论。放大派认为,可验证奖励的强化学习是在锐化基座模型已经赋予概率质量的分布:它通过把概率集中到基座模型本就能采样到的推理路径上来提升 pass@1(首次尝试就解出的题目占比),而且有研究报告称,基座模型在大 处的 pass@k(在 次尝试内解出的题目占比)可以追平甚至超过经强化学习训练的模型,这意味着强化学习是在引出与重新加权,而非在教。另一派则指向 R1-Zero,那里回溯与自我纠错这类行为在训练过程中频率与长度都在增长,看起来像习得,而非仅仅重新加权 (Guo et al. 2025)。这一分歧部分关乎度量,因为 pass@k、采样温度以及基座模型的强度都会左右判决;它之所以持续存在,是因为双方都能指向真实的训练。把「RLVR 教会推理」这样的主张看作取决于基座模型与度量指标,而非已成定论。Yue 等人用大 pass@k 比较强化了放大派立场,认为基座模型宽广的采样分布中已经包含了 RL 模型后来集中到的那些路径 (Yue et al. 2025)。伪奖励实验把这一论据推得更尖锐:在 Qwen2.5-Math-7B 上,即便奖励是随机的甚至错误的,RLVR 也能取得真值奖励的大部分增益,MATH-500 上 +21.4 分对 +29.1 分,而同样的伪奖励在 Llama 与 OLMo 基座上完全无效 (Shao et al. 2025)。一个不含信息的奖励教不了任何东西,它只能放大预训练已经装进去的行为。ProRL 则在带 KL 控制与参考策略重置的长时间 RL 下给出相反主张,报告了 RL 模型能解决而基座模型即便大量采样也解决不了的任务 (Liu et al. 2025)。Wen 等人进一步指出度量问题:普通 Pass@K 会把最终答案正确但链条错误的样本也算作成功,因此提出 CoT-Pass@K,要求推理路径和最终答案同时正确 (Wen et al. 2025)。图 28.7 勾勒出放大派所依凭的那处交叉。
信用给多少,多久给一次
监督密度还有自己的轴线,横跨上面三类验证器。结果奖励只为最终答案打分,成本低,是 RLVR 的默认做法,但对一条长链的信用分配较粗。过程奖励经由PRM为每一步打分,Lightman 等人在 "Let's Verify Step by Step" 中训练了它 (Lightman et al. 2023),Uesato 等人更早将其与结果反馈做了比较 (Uesato et al. 2022)。PRM 给出更密集的信用,有助于长程学习,但它重新引入了验证器所移除的那个东西:一个习得的、可被利用的奖励。R1 时代的意外之处,在于一个仅结果的信号在完全没有过程模型的情况下走出了多远。
精炼组基线
GRPO 让推理模型得以落地,而 R1 之后的一年,许多工作都在找出它的组基线偏差并加以修正。最明确的解读来自 Liu et al. (2025),它指出更新中的两个偏置。一个长度偏置,因为按词元的 归一化,会让一个正确的短答案得到比正确的长答案更大的梯度,并且对一个错误的长答案比错误的短答案惩罚得更轻,于是策略朝着更长的错误输出漂移。还有一个难度偏置,因为把优势除以组的标准差,会上调那些几乎全对或全错、即离散度最小的问题的权重。去掉 与标准差两项即可消除两者,并恢复无偏的 PPO 目标,以更少的词元达到同样的推理,这正是作者称其为「GRPO 做对了」的缘由。
另外两个修正针对另一种失效,即策略坍缩到少数几个高奖励模式上、其熵急剧下跌(输出失去多样性,收敛到少数几个反复出现的套路)。DAPO (Yu et al. 2025) 把裁剪范围解耦,让上界能够单独抬升,即它的 clip-higher 规则,从而给低概率的探索性词元留出生长空间,而非把它们裁掉;它还加入动态采样,丢弃那些整组全对或全错的提示,因为一个没有离散度的组既产生不了优势也产生不了梯度,正是上面那段可运行代码所揭示的死局。GSPO (Zheng et al. 2025) 出自 Qwen 团队,把重要性比从词元移到序列:它在整条序列的似然上打分、裁剪与优化,而非用按词元的比,后者它认为与一个定义在整条序列上的奖励并不匹配,而这一改动稳住了混合专家模型(第 9 章 介绍过的那种稀疏、带路由的架构)本就脆弱的强化学习。KL 项也失去了它在 第 19 章 中的那种必要性:有了验证器,就没有可供漂入的习得代理,而 DAPO 丢弃了 RLHF 用作约束的 KL 惩罚,转而依靠 clip-higher 来防止熵坍缩。
Kimi k1.5 是另一个重要的公开数据点,因为它从不同路径抵达了相近的实践教训。它的报告强调长上下文 RL 与改进的策略优化,并明确避开 MCTS、价值函数和过程奖励模型,同时在数学、代码和多模态推理上达到强结果 (Kimi Team et al. 2025)。它还提出 long2short 方法,用 long-CoT 训练改善 short-CoT 模型。这部分属于 第 29 章,但它在这里也很重要,因为它说明训练回路与数据回路已不再能分开:一条长推理策略可以成为更便宜的短推理策略的教师。
它在哪里失效,又在哪里得到回报
配方是一组平衡,每个都有一个转折点。可以把它们理解为验证器固定之后还需要选择的控制参数。
- 可验证奖励,还是习得奖励。 验证器在代理的意义上难以被利用,但只存在于真值可核查之处,而它的覆盖面正是新的攻击面。第 19 章 的习得奖励模型可用于开放式任务,却是一个可被过度优化的代理。真实的配方会按领域把两者混用 (Lambert et al. 2024)。
- 结果监督,还是过程监督。 结果奖励成本低、稳健且稀疏。经由 PRM 的过程奖励密集、对长程信用分配更好,但 PRM 是一个习得的、可被利用的奖励,且标注成本高 (Uesato et al. 2022)。这是信号密度与奖励完整性之间的取舍。
- 有评论者,还是无评论者。 价值网络降低了优势的方差,却使模型显存翻倍并引入它自身的失效模式。GRPO 与 RLOO 以方差换取简洁,并契合 RLVR 多样本的形态 (Shao et al. 2024)。
- 探索,还是 KL 崩溃。 KL 太小,或优化太激进,会让策略坍缩到少数几个高奖励模式上并停止探索,于是奖励上升而留出质量下降。KL 太大则策略永远离不开参考模型。KL 系数与裁剪范围是 RLVR 的核心控制参数。图 28.9 勾勒出那个转折点:训练奖励持续上升,而留出质量开始下降。
- 验证器覆盖面,还是可被利用程度。 更严格、更宽广的验证器能抵抗利用,但成本更高,且可能拒绝正确但不寻常的答案,即让学习缺少数据的假阴性。宽松的验证器成本低,却会把奖励泄漏给错误答案。
这里的多数失效,都是优化器找到了所度量的,而非所意指的。经由验证器漏洞的奖励欺骗(reward hacking)是其中核心:策略发现一些被验证器判为正确、实则不然的输入,在退化解上通过的测试、被格式骗过的核查器、对已知用例硬编码的输出。对优化器而言奖励是真实的,对人而言答案却是错误的。KL 崩溃或模式崩溃是其次:策略集中到少数几个高奖励输出上,熵急剧下跌,训练奖励上升而留出质量退化。利用核查器而非解决问题的推理是其中微妙的一种,即可见的链式思维朝着验证器所奖励的任何东西引导,或根本不忠实地驱动答案。
两条边界给这个方法设定了范围。RLVR 在真值可核查之处最强,并不会免费迁移到开放式任务上,因此过度倚重它会令模型偏斜,并留下一道只有习得奖励或人类判断才能填补的缺口。2025 年把这套配方往那条边界之外扩展的尝试,是用一份明确的评分量表(rubric)取代核查器,按一份写下来的标准清单、而非单一真值来为一个开放式答案打分,从而在没有验证器之处恢复出一个比偏好更密集的信号 (Gunjal et al. 2025)。它以那个曾让验证器安全的性质为代价换来了更广的适用范围,因为一份量表本身就是一个可被利用的书面代理。而过度优化奖励会使后训练中装入的指令遵循、安全性与广度发生回退,这是一种灾难性遗忘,此处的 KL 锚定只能部分预防,而 第 47 章 必须将其捕获。
这条边界,前沿一侧也在往外推。2025 年 7 月,经 IMO 协调员正式评分的 Gemini Deep Think,与 OpenAI 的一个实验模型,在国际数学奥林匹克上达到金牌水平,42 分中拿到 35 分,全程用自然语言写出完整证明,推断时既没有形式化验证器,也没有逐题的核查器 (Google DeepMind 2025)。据报告,配方是在难以验证的推理任务上做强化学习,加上并行的测试时算力。应当把它读作可验证奖励的边界被拉伸,而非被抹去:奖励可以比机械核查更软,但训练倚重的仍是数学这类至少可以评分的领域。
自我改进回路是验证器可靠时的回报。用模型生成候选训练数据,经验证器过滤以只保留已验证为正确的轨迹,再把它们用于又一轮 SFT 或强化学习,如此迭代。这与 第 23 章 的蒸馏不同,因为这里的过滤器是一个核查器,而非更强的教师,于是模型能自举越过当前自身能力。硬性限制在于它需要一个可验证的信号才能持续迭代:可靠的验证器给出真正的自举,不可靠的则放大其自身的盲区。大规模运行支撑这一切的采样与 rollout 集群,第 10 章 会专门展开,而「投入更多算力以得到更好的推理」在推断时的对应物,留到 第 30 章 再谈。
把同一个回路从奖励一个答案扩展到奖励一整条轨迹,训练一个模型去行动、而不只是去推理,是 第 37 章 的主题。
延伸阅读
- Shao et al., “DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models” (introduces GRPO), 2024. arXiv:2402.03300DeepSeekMath 7B 通过在从 Common Crawl 筛选的 1200 亿词元数学语料上继续预训练,并引入去掉评论家模型的近端策略优化变体 GRPO,在 MATH 基准上达到 51.7
- Guo et al., “DeepSeek-R1 incentivizes reasoning in LLMs through reinforcement learning” (peer-reviewed version of arXiv:2501.12948, published 17 September 2025; DOI 10.1038/s41586-025-09422-z), 2025. arXiv:2501.12948
- Schulman et al., “Proximal Policy Optimization Algorithms” (PPO; introduced in 第 19 章, reused here), 2017. arXiv:1707.06347
- Lightman et al., “Let's Verify Step by Step” (process reward models / PRMs), 2023. arXiv:2305.20050
- Uesato et al., “Solving Math Word Problems with Process- and Outcome-Based Feedback” (process vs outcome supervision), 2022. arXiv:2211.14275本文在 GSM8K 上对比过程奖励模型(PRM)与结果监督方法,发现 PRM 将推理过程错误率从 14.0
- Ahmadian et al., “Back to Basics: Revisiting REINFORCE-Style Optimization for Learning from Human Feedback in LLMs” (RLOO), 2024. arXiv:2402.14740简单的 REINFORCE 风格策略梯度(RLOO)在 LLM 基于人类反馈的强化学习(RLHF)对齐中优于 PPO 和 DPO,且计算开销更低,无需近端策略优化(PPO)的 actor-critic 复杂机制。
- OpenAI, “Learning to Reason with LLMs” (the o1 line; an official announcement / system report, not a peer-reviewed paper), 2024. openai.com
- Lambert et al., “Tulu 3: Pushing Frontiers in Open Language Model Post-Training” (names/positions RLVR), 2024. arXiv:2411.15124Tülu 3 是基于 Llama 3.1 底座的完全开放后训练方案,包含监督微调(SFT)、直接偏好优化(DPO)及新提出的可验证奖励的强化学习(RLVR),并公开权重、数据与训练代码,性能超越同类指令模型。
- Google DeepMind, “Advanced Version of Gemini with Deep Think Officially Achieves Gold-Medal Standard at the International Mathematical Olympiad” (IMO 2025 gold, 35/42, with end-to-end natural-language proofs graded by IMO coordinators), 2025. deepmind.google
评论
登录后评论