AI 基建
0%
第三部分 · 后训练 · 第 21 章

可验证奖励与推理迁移

作者Changkun Ou
阅读时长约 12 分钟

偏好模型可以预测人们倾向于哪个回答,却不能判断程序是否真的通过测试,或两个代数式是否等价。对于后一类任务,训练系统可以实际运行一项检查,再把结果变成奖励。这个变化去掉了一个学习型评判者,却没有消除规格错误。策略学会满足的是已经实现的检查,而这项检查可能比人们真正想完成的任务更窄。

决定性边界在于奖励来自哪里。可执行检查器运行一份已经实现的契约,学习型验证器则估计某种判断。选择与训练是信号的两种不同用途,正如结果奖励与过程奖励的差别在于反馈出现的时机。优化算法留到 第 28 章 讨论。本章先回答更基础的问题:训练即将优化的那个数,究竟来自事实、判断,还是代理指标?

检查器是已经实现的任务规格

xx 为任务,yy 为候选回答,q(x,y){0,1}q(x,y)\in\{0,1\} 表示人们真正希望采用的正确性标准。训练系统实际能运行的是检查器 CC。在最简单的二元情形下,

rver(x,y)=C(x,y){0,1}.r_{\mathrm{ver}}(x,y)=C(x,y)\in\{0,1\}.

这里,rverr_{\mathrm{ver}} 是可验证奖励,C(x,y)=1C(x,y)=1 表示检查器接受任务 xx 的候选回答 yy。RLVR 也可以使用分级的规则奖励,例如通过测试的比例,或单独计算的格式分数。二元接纳是最清楚的情形,却不是整个方法的定义。

学习型奖励模型遵循的是另一份契约:

rϕ(x,y)E[J(x,y)x,y].r_\phi(x,y)\approx \mathbb{E}[J(x,y)\mid x,y].

其中,J(x,y)J(x,y) 是人类或 AI 作出的判断,ϕ\phi 表示模型学到的参数,期望值则是模型对这项判断的预测。学习型模型可以推广到没有标签的样本,却也可能奖励看似自信的文风、漏掉事实错误,或在分布外失效。可执行检查器不会犯这些特定的评判错误,却仍然可能把错误的任务规格执行得一丝不差。

要把这一区别说清楚,可以相对于预期正确性 qq 考察可靠性与完备性:

C(x,y)=1q(x,y)=1q(x,y)=1C(x,y)=1.C(x,y)=1\Rightarrow q(x,y)=1 \qquad\text{且}\qquad q(x,y)=1\Rightarrow C(x,y)=1.

第一个蕴含式表示可靠性(soundness):检查器接受的回答都确实正确,因此没有假阳性。第二个表示完备性(completeness):真正正确的回答都会被接受,因此没有假阴性。形式化证明内核可以相对于公理和受信任的实现给出很强的可靠性论证。单元测试可以执行,却不是行为的完整规格。测试太弱时,错误程序也可能通过,因而相对于 qq 并不可靠;测试太脆弱时,正确实现也可能失败,因而不完备。只做精确字符串匹配也会漏掉表达形式不同但等价的答案。

检查器就是优化器实际看到的任务规格。如果生成的程序能够读取隐藏答案、修改测试框架、利用未定义行为,或把可见测试用例写死,那么通过检查并不能证明它满足了原本的任务。沙箱用于隔离候选程序,保护检查器不受它影响。隐藏测试、模糊测试、蜕变测试和人工审计都可以扩大覆盖范围,却都不能把不完整的规格变成真值。

检查方式 能够证明什么 常见缺口
规范化答案匹配 提取出的答案采用了可接受的等价形式 终点正确,论证过程仍可能错误
单元测试或性质测试 程序在已测试输入上的行为正确 未测试输入、副作用以及对测试框架的利用
形式化证明内核 提交的每一步推导都符合形式规则 形式化命题可能漏掉实际需求
环境状态检查 要求的状态变化确实发生 过程中还可能出现不安全或浪费资源的动作
学习型验证器 模型预测回答正确 校准、分布偏移与代理博弈

最后一行对应一个常见的术语混淆。论文常把学习得到的正确性模型称为验证器。例如,Cobbe 等人在 2021 年的 GSM8K 工作中训练模型为采样解答打分,再用这些分数重新排序 (Cobbe et al. 2021)。即使这个模型的训练标签来自可执行的答案检查,它所提供的奖励也并不等同于直接运行答案等价检查程序所得的奖励。

pair 任务 x + 候选回答 y source 奖励来源 pair->source learned 学习型评分器 估计判断或 正确性代理 source->learned 估计 checker 可执行检查器 执行已经实现的 任务契约 source->checker 执行 use 怎样使用 这个信号 learned->use checker->use select 选择一个回答 use->select filter 筛选 SFT 数据 use->filter update 更新同策略模型 use->update
图 21.1. 奖励来自哪里,与奖励怎样使用,是两项独立选择。学习型评分器或可执行检查器都可以用来挑选回答、筛选训练数据或更新策略。严格来说,只有可执行检查器这条路径提供可验证奖励。

先有覆盖率,选择才有意义

选择不是训练。假设策略独立生成一个样本时,回答正确的概率为 pp;系统在同一解码分布下抽取 nn 个样本。至少出现一个正确候选的概率为

P(至少一个正确)=1(1p)n.P(\text{至少一个正确})=1-(1-p)^n.

这里,PP 表示概率。这个式子描述单个提示的理想覆盖率,假设每次采样彼此独立,而且成功概率相同;它还假设一个完美选择器能在正确候选出现时把它找出来。选择器可以把覆盖率变成返回答案的正确率,却不能凭空创造覆盖率。如果策略几乎不给任何成功路径分配概率,那么在增大 nn 带来实际收益之前,采样成本可能已经高得难以承受。

使用学习型选择器后,结论会改变。Best-of-nn 返回的回答为

y=argmax1in  s(x,yi),yiπ(x).y^*=\underset{1\le i\le n}{\operatorname{argmax}}\;s(x,y_i), \qquad y_i\sim\pi(\cdot\mid x).

其中,s(x,yi)s(x,y_i) 是选择器为第 ii 个候选打出的分数,yiy_i 是这个候选,π\pi 是生成策略。更多样本会带来更多正确候选,却也会暴露更多可能被学习型分数高估的异常错误。Cobbe 等人直接观察到了这种现象:候选数增加到 400 时持续改善,超过后反而下降 (Cobbe et al. 2021)。因此,用不完美代理做 best-of-nn,不能保证单调改善。

图 21.2. 一个合成的选择器模型。理想核查器会持续受益于更多候选,代理选择器最终会找到得分高于真实解答的假阳性。滑块只是定性示意,并不是对验证器准确率的校准估计。

Pass@kk 衡量的是理想覆盖率,而不是单个选中回答的质量。若 nn 个样本中有 cc 个成功回答,当 knk\le n 时,常用的有限样本估计量为

pass@k^=1(nck)(nk).\widehat{\operatorname{pass@}k} =1-\frac{\binom{n-c}{k}}{\binom{n}{k}}.

这个估计量的含义是:从这些样本中抽取 kk 个,至少一个能够通过的概率是多少。它并不说明部署时的选择器能够找到那条通过的回答。比较 pass@kk 时,应同时报告采样温度、核采样阈值、最大回答长度、生成样本数和检查器。缺少这些条件,指标就没有描述一项可复现的实验。

通过核查的样本有三种用法

系统能为候选回答打分以后,可以保持模型不变、把通过的回答做成数据集,或直接更新当前策略。这三种算法的失效方式不同。

方法 改变了什么 样本来自哪里 主要局限
Best-of-nn 选择 模型不变 推断时正在部署的策略 每次请求都要支付生成与检查成本
拒绝采样微调 模型模仿通过检查的回答 生成器某个固定检查点产生的一批样本 会连同无关或偶然特征一起模仿
RLVR 用经过检查的采样结果更新当前策略 正在训练的模型产生的同策略回答 奖励稀疏、优化不稳定以及利用检查器漏洞

拒绝采样微调把通过的回答固定成普通监督数据集。数据收集结束后,相对于后续检查点,它们已经成为离策略数据。RLVR 即可验证奖励强化学习:它反复从当前策略采样、运行检查器、估计优势,再更新同一个策略。Tülu 3 为这种规则奖励阶段使用了 RLVR 这个名称,并把它放进开放的 SFT、DPO 与强化学习配方中 (Lambert et al. 2024)。不过,自动核查样本后再筛选或优化的做法早于这个名称。

DeepSeekMath 提出了组相对策略优化(GRPO)。它不再训练 PPO 的评论家,而是用同一提示下的多个回答估计基线 (Shao et al. 2024)。论文报告的 GRPO 实验使用了学习型奖励模型,因此 GRPO 是优化器,不是 RLVR 的同义词。随后,DeepSeek-R1-Zero 才把 GRPO 与基于规则的准确率和格式奖励结合,直接训练基座模型。完整的 DeepSeek-R1 流水线远不止这一步:它还包括冷启动 SFT、拒绝采样、第二轮 SFT,以及后来把推理规则奖励与学习得到的有用性和安全奖励结合起来的阶段 (Guo et al. 2025)。

下面的骨架只展示检查器进入组相对 RLVR 回路的位置。优化细节由 第 28 章 展开。

对每个任务 x:
    从当前策略采样 g 个回答 y_1, ..., y_g
    对每个回答计算 r_i = C_train(x, y_i)
    把 r_1, ..., r_g 转换成相对优势 A_1, ..., A_g
    更新策略,提高高优势回答的概率
    约束策略偏移,并记录诊断指标

这里,gg 是同一任务采样的回答数,CtrainC_{\mathrm{train}} 是训练检查器,rir_i 是第 ii 个回答的奖励,AiA_i 是相对于组基线的优势。若二元奖励相互独立,且单个样本的成功概率为 pp,组内同时出现通过与失败的概率为

P(组内结果混合)=1pg(1p)g.P(\text{组内结果混合})=1-p^g-(1-p)^g.

有信息量的组必须包含奖励差异。如果所有回答都失败,或所有回答都通过,只看组相对正确性时,优势全部为零。KL 惩罚、格式奖励等其他项仍可能产生更新,但正确性信号并没有区分组内样本。p=0.05p=0.05g=8g=8 时,只有约 34% 的组同时包含通过与失败。课程设计、提示筛选、更大的组以及冷启动数据,可以让训练进入更常出现混合结果的区间。不过,R1-Zero 也说明冷启动数据并不是普遍必要条件。

结果与过程是另一条轴线

结果奖励把反馈附在完整回答上,过程奖励则把反馈附在中间步骤上。反馈出现的时机本身并不能说明评分信号是可执行的,还是学习得到的。结果与过程是一条轴线,可执行与学习得到则是另一条轴线。

反馈时机 可执行或基于规则 学习得到
结果 基于规则的结果检查:答案等价、单元测试、最终环境状态 学习型结果奖励模型,预测整个回答是否成功
过程 形式化证明步骤检查器、编译器反馈或经过验证的中间状态 过程奖励模型(PRM),学习判断自然语言步骤

τ=(z1,,zT,y)\tau=(z_1,\ldots,z_T,y) 为一条推理轨迹。基于规则的结果检查器可能只使用最终答案:

Rout(x,τ)=C(x,y).R_{\mathrm{out}}(x,\tau)=C(x,y).

其中,ztz_t 是第 tt 个推理步骤,TT 是步骤数,yy 是最终答案,RoutR_{\mathrm{out}} 是结果奖励。成功轨迹中的每个词元可能一起得到强化,其中也包括绕路与错误;失败轨迹中有用的前缀则可能得不到任何正向信用。

学习型 PRM 则估计每一步的质量:

st=P^ϕ(St=1x,zt),Rproc=A(s1,,sT).s_t=\widehat{P}_\phi(S_t=1\mid x,z_{\le t}), \qquad R_{\mathrm{proc}}=A(s_1,\ldots,s_T).

这里,St=1S_t=1 表示第 tt 步被判断为正确,sts_t 是 PRM 估计的概率,ϕ\phi 表示学习得到的参数,ztz_{\le t} 是截至第 tt 步的轨迹前缀,AA 则是聚合规则。聚合方式可以取乘积、最小值、学习得到的价值,或其他塑形规则。过程监督不存在一种普适的折扣求和定义。

Lightman 等人为 MATH 训练了学习型结果奖励模型与过程奖励模型。在 best-of-nn 实验中,过程监督模型优于结果监督模型,PRM800K 则提供了约 80 万条人工步骤标签 (Lightman et al. 2024)。这是一个困难数学场景中的证据,并不是过程监督总能胜出的定理。自然语言步骤标签成本高,也带有主观判断。PRM 也重新带回了代理风险,而这正是可执行终点检查原本避开的问题。

两种来源可以结合使用。精确的终点检查器可以锚定任务是否成功,PRM 则可以引导搜索或提供更密集的信用分配,但两者的指标应分别记录。过程分数不能补偿失败的终点,除非这种取舍已经明确写入任务规格。

奖励带来的提升究竟证明了什么

规则奖励让推理训练更容易扩展到大规模,因为不再需要人为标注每条轨迹。DeepSeek-R1-Zero 在数学、代码及相关可验证任务上取得了显著进步,使用的是基于规则的最终答案与格式奖励,而不是神经网络结果奖励模型或过程奖励模型 (Guo et al. 2025)。但这项结果并没有回答三个更强的问题:

  1. 策略是否学会了基座模型原本无法生成的路径,还是只提高了原有罕见路径的概率?
  2. 推理本身得到改善,还是仅仅提高了到达被检查终点的概率?
  3. 这种增益能否迁移到奖励结构不同的提示?

现有证据同时支持不同解释。在伪奖励实验中,随机奖励甚至错误奖励也为 Qwen2.5-Math-7B 恢复了相当一部分 MATH-500 增益,而同样的信号在 Llama 与 OLMo 模型上往往不起作用 (Shao et al. 2026)。这并不表示正确奖励无关紧要,而是说明,仅凭基准分数上升,可能无法判断奖励究竟提供了什么信息;结论会依赖基座模型。

Pass@kk 的比较同样可能误导。最终答案可以正确,推理链却无效。CoT-Pass@kk 只在终点与另一套思维链验证器都接受时才把回答计为成功 (Wen et al. 2026)。它比只检查终点的 pass@kk 更严格,但路径验证器是学习得到的,也会出错,因此这个指标用一种新的测量误差换掉了原来的盲点。

应当把推理迁移分成三个层次来验证:同一训练任务族中的留出实例、相关任务族,以及真正不同的领域。第一层的证据不能证明第三层。如果系统面向通用任务,就应分别测量这三层表现。

建立并审计奖励契约

训练应当从检查器设计开始,而不是先选优化器。

  1. 写明预期契约。 明确什么算正确、接受哪些等价输出、禁止哪些副作用,以及时间或资源上限如何影响结果。
  2. 加固训练检查器。 规范化答案、隔离执行、将评分文件设为不可变,并用对抗候选测试检查器。对一组人工审计样本,记录假阳性与假阴性。
  3. 分开训练检查器与评测检查器。 评测时使用隐藏用例、不同的测试生成器,或更强的审计检查器。完全复用训练框架,只能测出策略学会这套框架的程度。
  4. 检查初始奖励分布。 按提示统计奖励率,并跟踪每个采样组的组内奖励方差。全失败组没有正向正确性样本,全通过组则没有相对正确性信号。
  5. 监控策略,而不只监控奖励。 记录回答长度、熵或多样性、格式错误率、执行失败,以及相对参考策略的偏移。轨迹更长、训练奖励更高,都不能证明推理变好了。
  6. 在奖励之外评测。 报告审计检查器下的留出通过率,人工抽查通过的轨迹,并测量域外质量、指令遵循与安全性。狭窄的推理增益可能与广泛回退同时发生。

评分准则奖励可以把同策略强化学习扩展到没有可执行真值谓词的任务。例如,Rubrics as Rewards 使用针对具体提示的标准与 LLM 评判者,在医学和科学基准上提供奖励 (Gunjal et al. 2025)。这是结构化的学习型反馈,严格来说并不是可验证奖励。评分准则让代理信号更便于审查,却不能消除评判模型的误判与博弈。

争议所在

RLVR 可以提高通过检查的成功概率。一次训练究竟扩大了模型的推理范围、强化了基座模型已有的行为,还是利用了优化器偏差,仍取决于任务、模型、训练配方与度量方式。不能只根据 pass@1 就断言能力范围已经扩大。

下层约束

验证器质量本身就是基础设施约束。数学任务需要稳健的等价检查,代码任务需要隔离执行与隐藏测试,形式化证明需要可信内核,智能体则需要环境状态断言。采样成本进一步把奖励契约连接到 第 31 章;路径级验证由 第 27 章 继续讨论,策略优化则由 第 28 章 展开。

  • Cobbe et al., “Training Verifiers to Solve Math Word Problems” (使用训练得到的验证器进行 best-of-N 重排), 2021. arXiv:2110.14168
    Training Verifiers 提出 GSM8K,并展示在数学文字题上采样多个解法再用验证器选择,能胜过只直接微调生成器。
  • Shao et al., “DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models” (用含 120B 过滤数学语料的混合数据继续训练 500B 词元,之后进行 SFT 与 GRPO), 2024. arXiv:2402.03300
    DeepSeekMath 结合 1200 亿词元数学语料与 GRPO,后者是去掉评论家、在采样组内归一化奖励的 PPO 变体。
  • Guo et al., “DeepSeek-R1 incentivizes reasoning in LLMs through reinforcement learning” (通过大规模 RL 实现推理,从纯 RL 中涌现), 2025. arXiv:2501.12948
    DeepSeek-R1 展示了大规模可验证奖励强化学习能引出长推理行为;R1-Zero 不用监督冷启动直接 RL,R1 则加入多阶段训练以改善可读性和稳定性。
  • Lightman et al., “Let's Verify Step by Step” (作为逐步验证的过程监督), 2023. arXiv:2305.20050
    《Let's Verify Step by Step》在固定生成器的 MATH Best-of-N 选择中比较结果监督与过程监督,并发布约 80 万条人工步骤标签的 PRM800K。
  • Lambert et al., “Tulu 3: Pushing Frontiers in Open Language Model Post-Training” (包含 RLVR 的开放后训练方案,并明确使用这一名称与定位), 2024. arXiv:2411.15124
    Tulu 3 是面向 Llama 3.1 底座的完全开放后训练配方,结合 SFT、DPO 与 RLVR,并公开数据、权重和训练代码。
  • Wen et al., “Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs” (为 RLVR 能力边界争论提出 CoT-Pass@K), 2026. arXiv:2506.14245
    本文指出普通 Pass@K 可能把错误推理但答案正确的样本计为成功,并提出 CoT-Pass@K,要求推理路径与最终答案同时正确。
  • Gunjal et al., “Rubrics as Rewards: Reinforcement Learning Beyond Verifiable Domains” (用评分细则奖励把 RLVR 式训练扩展到不可直接验证的领域), 2025. arXiv:2507.17746
    Rubrics as Rewards 把开放式判断拆成逐条清单式评分准则,由模型逐条打分并作为在线强化学习的奖励,在 HealthBench 与 GPQA-Diamond 上优于模型作为评判者的 Likert 基线。

评论

登录后评论