AI 基建
0%
第三部分 · 后训练 · 第 21 章

可验证奖励与推理迁移

作者Changkun Ou
阅读时长约 6 分钟

前面几章把奖励当作偏好的习得代理。这适合开放式行为:有用性、品味、语气、拒绝校准,以及许多判断类任务。但有些领域自带另一种信号。代码解法能通过单元测试,或者通不过;数学答案与检查器对得上,或者对不上;验证器接纳一份证明,或者驳回它。在这些领域里,后训练可以针对结果本身训练,而不只是针对某个人对质量的估计。

这一区分,是本部分通向第四部分的衔接点。本章问的是哪一种奖励来源进入后训练回路;第 28 章 接着讨论怎样利用这种奖励训练推理行为。

一个不是评判者的奖励

习得奖励模型估计的是偏好:

rϕ(x,y)人类或 AI 对 y 在 x 下的判断.r_\phi(x,y) \approx \text{人类或 AI 对 } y \text{ 在 } x \text{ 下的判断}.

这里,可验证奖励则是一个谓词:

rver(x,y)=1[check(x,y)=pass].r_{\text{ver}}(x,y) = \mathbf{1}[\operatorname{check}(x,y)=\text{pass}].

其中 rverr_{\text{ver}} 在任务检查器通过时取 1,否则取 0。符号上只有一点差别,实践中却差很远。习得奖励会因为偏爱某种风格、漏掉事实错误、或者没见过回复分布里的某个区域而出错。验证器仍可能不完整、或者设定有误,但只要它本身可靠,就不在乎答案听起来有多自信。模型要么满足检查,要么不满足。

prompt 提示词 x sample 采样回答 y_1 ... y_n prompt->sample learned 习得奖励 偏好代理 sample->learned verifier 验证器 单元测试、答案检查、证明检查 sample->verifier pref 偏好训练 RLHF、DPO、过滤 learned->pref rlvr 可验证奖励强化学习 RLVR / 拒绝采样 verifier->rlvr eval 留出评测 人类与检查器 pref->eval rlvr->eval
图 21.1. 后训练中的两类奖励来源。习得奖励覆盖开放式行为,但只是代理信号;可验证奖励更窄,却给出直接的通过/失败监督。真实系统常把两者混用。

这也是为什么可验证领域成为推理后训练的试验场。推理数据最贵的地方,不只是轨迹本身,而是知道这条轨迹是否走到了正确终点。只要检查器存在,模型就可以生成许多候选,系统只保留通过者,训练再把概率质量推向模型本来偶尔就能产生的行为。

图 21.2. 选择器可靠时,更强选择压力会带来收益;选择器只是代理时,选择压力可能带来伤害。提高选择器可靠性,best-of-n 曲线能维持更久;降低可靠性,过度优化更早出现。理想化示意。

从选择到训练

第一步是选择。Cobbe 等人展示了这样一种做法:让模型采样许多数学推理解法,再用一个训练出的验证器从中挑选,可以显著提高数学文字题表现 (Cobbe et al. 2021)。机制并不复杂:只要模型有非零概率产生正确解,best-of-nn(采样 nn 个候选,留下最好的一个)就可能暴露这种潜在能力,前提是选择器能找出它。第 24 章 讨论的是这件事在推断时的版本。

第二步是把被选中的行为训练进模型。拒绝采样微调会在通过评分器或验证器的候选上做微调,第 23 章 把它当作数据飞轮来讨论。可验证奖励的强化学习(RLVR) 更进一步:采样同策略补全(由当前模型生成的回复,而非取自固定数据集),由检查器给奖励,再更新策略。DeepSeekMath 在这一场景下引入了 GRPO,一种更轻的策略梯度方法,第 28 章 会细讲 (Shao et al. 2024)。Tülu 3 提出了 RLVR 这个名字,并把它演示为一套开放后训练配方的组成部分,与 SFT 和 DPO 并列 (Lambert et al. 2024);DeepSeek-R1 随后让这套配方在前沿规模上变得可见:一个基座模型或有冷启动数据的模型生成推理轨迹,从答案检查器获得奖励,并在强化学习中形成更长的审慎行为 (Guo et al. 2025)。

被优化的信号可能非常稀疏:最终答案检查器只在长轨迹末端给出一个比特。如果模型从来碰不到正确答案,就没有梯度告诉它往哪里走;如果它偶尔能到达,奖励就能放大这些路径。这就是冷启动数据、课程设计和提示词分布为何重要。它们把策略放到离成功轨迹足够近的位置,让验证器有东西可选。

结果奖励与过程奖励

结果奖励只看最终答案。过程奖励给每一步打分。对一条轨迹 z1,,zTz_1, \ldots, z_T 和最终答案 yy,结果奖励可以写成

rout(x,z1:T,y)=1[check(x,y)=pass].r_{\text{out}}(x,z_{1:T},y) = \mathbf{1}[\operatorname{check}(x,y)=\text{pass}].

这里的结果奖励除了最终答案外,不看中间路径。过程奖励则更密:

rproc(x,z1:T,y)=t=1Tγt1rt(x,zt).r_{\text{proc}}(x,z_{1:T},y) = \sum_{t=1}^{T} \gamma^{t-1} r_t(x,z_{\le t}).

其中 rtr_t 给前缀步骤打分,γ\gamma 对较后的步骤分数打折。 Lightman 等人的 "Let's Verify Step by Step" 证明,在数学推理上,过程监督可以超过结果监督,并发布了大约 80 万步级标签的 PRM800K (Lightman et al. 2023)。吸引力很明显:模型不必等到最终答案才收到信号。代价也同样重要。步骤标签更难定义、更难采集,而且更容易把某种推理风格错当作正确性本身。习得的 PRM 仍然是奖励模型,因此也可能把可验证结果奖励本要规避的代理失效重新带回来。第 27 章 会更细地讨论这条边界。

实践规则是把真值来源和信号密度分开看。精确的最终检查器稀疏,但有根;习得的过程模型密集,但易错。强系统可能同时使用两者:用验证器锚定最终正确性,用过程模型引导搜索或分配信用,并用留出检查确保密集信号没有变成新的目标。

验证器买来了什么,又没有买来什么

验证器买来四件事。

  • 较少的奖励欺骗。 单元测试或精确答案检查器,比习得评判者更难被花言巧语讨好。它仍可能不完整,但不会被风格打动。
  • 更便宜的数据。 正确轨迹可以靠采样和过滤发现,而不必全由人写出。
  • 同策略改进。 模型在自己成功的样本上训练,而不是只模仿教师分布。
  • 训练与推断的桥。 同一个检查器可以训练策略,在推断时选择样本,也可以评估留出表现。

它没有买来普适性。许多重要任务不可核查。一段有帮助的法律解释、一篇有分寸的研究综述、一条产品支持回复,都没有唯一可执行的真值谓词。即便是代码,测试也可能太弱或泄漏;即便是数学,最终答案也可能对了,推理路径却错了。近期关于 CoT-Pass@K 的工作正指出这一点,这种更严格的指标还要求推理路径本身可靠:普通 pass@k(在 kk 次尝试内解出问题的比例)可能把最终答案正确但推理过程错误的样本也计为成功 (Wen et al. 2025)。

在可核查奖励与习得偏好奖励之间,如今多了第三种选择。基于评分准则的奖励(rubric-based rewards)把一个开放式判断拆成逐条标准的检查,每一条由模型对照成文准则打分,训练针对的则是汇总分数 (Gunjal et al. 2025)。这把 RLVR 式的训练延伸到了医学、法律、研究综述这类没有可执行检查器的领域;前沿实验室给这些领域的工作打分,用的也正是这套办法,OpenAI 的 HealthBench 就是一例。代价是打分者又变回了模型,每条标准都把检查器本已移除的代理风险重新带回来一部分。

因此,真实的后训练栈是混合的。有检查器时,使用可验证奖励;没有检查器时,使用习得奖励。边界必须明确,因为奖励变了,失效模式也会变。

争议所在

有人把可验证奖励说得仿佛只要把人类移出回路,就解决了对齐。它解决的其实是更窄的问题:怎样在结果可核查的任务上训练。一旦任务要求判断、品味、政策或降低伤害,系统仍会回到行为规格、评分准则、人工标签、AI 评判者,以及前面几章讨论的代理失效。

下层约束

可验证奖励的强度取决于提供检查的环境。数学里可能是答案等价检查;代码里可能是一组单元测试;智能体里可能是一次状态转移。这让本章向下连接 第 27 章第 52 章,也横向连接 第 31 章:大量采样只有在检查器可靠、且便宜到能按所需规模运行时,才真正有用。

  • Cobbe et al., “Training Verifiers to Solve Math Word Problems” (best-of-N reranking with a trained verifier), 2021. arXiv:2110.14168
    Training Verifiers 提出 GSM8K,并展示在数学文字题上采样多个解法再用验证器选择,能胜过只直接微调生成器。
  • Shao et al., “DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models” (introduces GRPO), 2024. arXiv:2402.03300
    DeepSeekMath 结合 1200 亿词元数学语料与 GRPO,后者是去掉评论家、在采样组内归一化奖励的 PPO 变体。
  • Guo et al., “DeepSeek-R1 incentivizes reasoning in LLMs through reinforcement learning” (peer-reviewed version of arXiv:2501.12948, published 17 September 2025; DOI 10.1038/s41586-025-09422-z), 2025. arXiv:2501.12948
    DeepSeek-R1 展示了大规模可验证奖励强化学习能引出长推理行为;R1-Zero 不用监督冷启动直接 RL,R1 则加入多阶段训练以改善可读性和稳定性。
  • Lightman et al., “Let's Verify Step by Step” (process reward models / PRMs), 2023. arXiv:2305.20050
    Let's Verify Step by Step 比较数学推理中的结果监督与过程监督,并发布约 80 万步级标签的 PRM800K。
  • Lambert et al., “Tulu 3: Pushing Frontiers in Open Language Model Post-Training” (open post-training recipe with RLVR), 2024. arXiv:2411.15124
    Tulu 3 是面向 Llama 3.1 底座的完全开放后训练配方,结合 SFT、DPO 与 RLVR,并公开数据、权重和训练代码。
  • Wen et al., “Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs” (introduces CoT-Pass@K for the RLVR capability-boundary debate), 2025. arXiv:2506.14245
    本文指出普通 Pass@K 可能把错误推理但答案正确的样本计为成功,并提出 CoT-Pass@K,要求推理路径与最终答案同时正确。
  • Gunjal et al., “Rubrics as Rewards: Reinforcement Learning Beyond Verifiable Domains” (rubric-based rewards extend RLVR-style training into non-verifiable domains), 2025. arXiv:2507.17746
    Rubrics as Rewards 把开放式判断拆成逐条清单式评分准则,由模型逐条打分并作为在线强化学习的奖励,在 HealthBench 与 GPQA-Diamond 上优于模型作为评判者的 Likert 基线。

评论

登录后评论