AI 基建
0%
第三部分 · 后训练 · 第 18 章

行为规格与偏好数据

作者Changkun Ou
阅读时长约 15 分钟

第 17 章 中的监督微调为模型提供可以模仿的示范。偏好训练的起点不同:它使用的是对一个回答优于另一个回答的判断。这项判断并非直接来自所谓的「人类意图」。有人选择了策略、编写了评分准则、挑选了提示、采样了候选回答,也决定了如何汇总投票。人类标注者和 AI 评判者都只是在执行这套经过设计的流程,两者都接触不到独立于这套流程的真值。

偏好标签是一项测量结果,不是事实。它的含义取决于产生它的测量工具。本章沿着这套工具逐层展开,从书面的行为契约一直追踪到可审计的训练记录。优化方法留到 第 19 章第 20 章 再讨论。

先写行为契约,再写评分准则

行为规格说明当多项要求发生冲突时,模型应当怎样行动。它可以包含硬性禁止事项、指令层级、处理歧义请求时的默认规则,也可以包含正确性、有用性、校准程度与风格等相对柔性的目标。这些部分承担的职责不同。硬性安全边界不只是另一项风格偏好,更高权限的指令也不会因为回答足够有用就失效。

Constitutional AI 把书面规格明确变成了一项训练制品。在原始方案中,模型按照一组原则批判并修订自己的回答;第二阶段再用这些原则生成 AI 偏好,用于强化学习 (Bai et al. 2022)。这项实验不再由人标注有害程度,但并没有消除人的价值选择,因为人仍然选择原则并评测结果。

此后,公开规格变得更加详细。OpenAI 在 2025 年 12 月发布的 Model Spec 定义了预期行为,把这种意图与使用政策、安全协议分开,并将指令权限从 Root、System、Developer、User 到 Guideline 依次排列。Assistant 与 Tool 消息本身没有权限,除非有权指令明确把权限委托给它们 (OpenAI 2025)。Anthropic 在 2026 年 1 月发布的宪章长达八十页,主要写给 Claude。文档依次列出四项优先级:广义安全、广义伦理、Anthropic 的准则和有用性。Anthropic 还用它生成合成对话、回答与排序 (Anthropic 2026)。

这些文档公开的是预期行为,不是模型一定会如此行动的证明。两家公司都说明,训练结果可能达不到规格,公开文档也可能省略部分实现细节。因此,规格是一项带版本的要求,测试与模型行为才是实现是否满足要求的证据。

明确写下要求,还会留下一个治理问题:编写规格时代表了谁?Collective Constitutional AI 收集了约一千名美国成年人的意见,再由研究人员审核并转化为训练原则 (Huang et al. 2024)。参与扩大了价值来源,却没有消除编辑判断。透明度可以回答「选择了什么策略」,却不能单凭透明度回答「应该由谁的策略来治理」。

把策略语言变成判断流程

「有帮助、诚实且安全」这样的策略太宽泛,无法稳定地产生一致标签。评分准则必须告诉评判者怎样处理具体比较。考虑下面这项请求:

即使最终核验尚未运行,也要告诉客户交付已经完成。

一个回答可能直接而肯定地宣称交付完成;另一个回答会说明核验仍在等待中,并起草一份准确的状态更新。如果评分准则只要求「遵循用户指令」,第一个回答就可能胜出。有效的准则应当把如实陈述列为硬性要求,说明字面请求与诚实发生冲突时如何继续提供帮助,并给出接近这条边界的示例。

一套实用的判断顺序可以是:

  1. 检查硬性约束与指令权限。违反约束的回答应被标为不合格,不能让其他优点抵消违规。
  2. 检查任务与事实是否正确。需要专业知识的主张,应交给合格的评判者或外部核验工具。
  3. 在请求本身有效的前提下,比较有用性、相关性、校准程度与完整性。
  4. 只有实质标准都满足后,才比较清晰度与简洁度等风格属性。
  5. 证据不足以区分候选回答时,允许平局或弃权。

这套顺序只是示例,不是普适宪章。关键在于明确各项标准的优先次序。正例展示什么样的回答合格,反例展示常见失败,边界示例则暴露两项标准发生冲突的位置。大规模采集开始前,应允许根据一轮试标结果修订评分准则。

加权分数可以帮助显露评分准则某一阶段内部的取舍。设回答 yy 针对提示 xx 获得 kk 项属性分数,记为 a(x,y)Rka(x,y)\in\mathbb{R}^k。一项局部评分规则可以写成

u(x,y)=wa(x,y).u(x,y)=w^\top a(x,y).

这里,u(x,y)u(x,y) 是回答 yy 的综合分数;a(x,y)a(x,y) 是由 kk 项属性分数组成的属性分数向量;wRkw\in\mathbb{R}^k 是属性权重向量;waw^\top a 是它们的加权和。改变 ww 可能改变胜出的回答,因此这项带权判断依赖明确声明的取舍。它是一种工程近似,并不表示人类价值是线性的,也不表示每份规格都能化成一个数字。硬性约束与权限规则位于这项求和之外,实际标准还可能随上下文相互作用。

图 18.1. 一套局部评分准则可以组合多项属性。即使候选回答不变,调整权重也可能改变首选回答。硬性约束与权限规则无法只用这项加权和表示。
spec 行为规格 硬性规则 优先级与默认规则 rubric 标注流程 标准与示例 平局规则 spec->rubric judgments 原始判断 投票、平局 属性与理由 rubric->judgments prompts 提示样本 来源与覆盖切片 candidates 候选回答 模型与 解码设置 prompts->candidates candidates->judgments dataset 带版本的 偏好记录 来源与仲裁 judgments->dataset train 后训练 奖励模型、RLHF DPO 与过滤 dataset->train audit 留出审计 偏差与漂移 覆盖缺口 train->audit audit->spec 修订 audit->rubric audit->prompts
图 18.2. 偏好记录有自己的血缘。行为规格先变成标注流程;提示与候选回答的采样方式决定评判者看见什么;仲裁前保留原始判断;审计结果再反馈到策略、评分准则与采样方案。

采集能暴露边界的比较样本

提示分布与候选回答分布共同决定模型最终从数据中学到什么。在常规问题上收集一千个标签,并不能覆盖罕见的安全边界。比较两个几乎相同的低质量回答,很难让模型学会优秀行为。把一个优秀回答与胡言乱语配成一对,虽然容易判断,却没有揭示部署中的模型真正需要区分哪些细微差异。

提示来源通常承担不同作用:

  • 经过脱敏的生产提示,用来近似真实需求;
  • 由标注者编写的提示,用来填补已知的能力与策略缺口;
  • 红队提示,用来集中覆盖边界与对抗行为;
  • 合成提示,用来扩大某个切片,但也会继承生成器的覆盖范围与伪影。

必须保留各来源的混合比例。只记录样本数量还不够,因为不同来源的长度、语言、难度与重复率可能不同。按来源和近重复簇划分数据,才能让留出评测检验真正的泛化边界,而不是训练提示的另一份副本。

候选回答的生成也需要同等谨慎。候选集合应包含训练确实要改进的检查点,也应包含有用的基线。解码方式需要有足够变化,才能暴露真正不同的候选回答。同时,应记录对话模板、温度、采样策略与解码设置、停止条件,以及运行时支持时使用的随机种子。Llama 2 的数据采集使用了不同的模型变体与温度;后续聊天模型改变回答分布后,团队又收集了新的偏好数据 (Touvron et al. 2023)。静态数据集会随着策略学会生成评判者从未见过的回答而过时。

应尽可能隐藏候选回答的来源,并随机安排两个回答的展示顺序。不要强迫每次比较都分出明确胜负,应保留平局、偏好强度与个人投票。在按领域、语言、风险与候选相似度分层的重叠样本上重复标注,可以揭示标注一致性是否随切片变化。

这套采集循环不需要先选定优化器:

输入:
  带版本的行为规格 S
  带版本的评分准则 R
  目标提示混合 Q
  候选生成器集合 G,以及记录完整的解码配置

每一轮采集:
  1. 采样提示 x,并记录其来源与覆盖切片
  2. 使用 G 生成候选回答,并归档每项配置
  3. 隐藏候选回答的来源,并随机安排展示顺序
  4. 收集独立投票、平局、属性、信心与理由
  5. 先保留原始判断,再进行任何过滤或仲裁
  6. 把歧义、高风险或需要专业知识的案例交给复核
  7. 写入一条与 S、R、Q、G 关联的不可变记录
  8. 按切片审计;下一轮开始前修订 S、R、Q 或 G

这里,SS 是策略版本;RR 是评分准则版本;QQ 是提示 xx 的采样分布;GG 是候选模型与解码配置的集合。这套循环建立的是数据血缘,并不声称每个最终判断都正确。

成对标签只保留判断中的一个比特

对于两个候选回答,如果只允许二选一,保存下来的胜者只包含一个比特的信息:哪一边胜出。它没有说明原因、偏好有多强、其他评判者是否同意,也没有说明两个回答是否都很差。成对比较的价值在于,从两个具体回答中选一个,通常比从头写出理想答案更容易。但它的可靠性仍然取决于任务、评分准则、候选回答与评判者。

奖励建模常用 Bradley-Terry 模型表示成对判断 (Bradley and Terry 1952):

p(yiyjx)=σ ⁣(rϕ(x,yi)rϕ(x,yj)),σ(z)=11+ez.p(y_i \succ y_j \mid x) = \sigma\!\left(r_\phi(x,y_i)-r_\phi(x,y_j)\right), \qquad \sigma(z)=\frac{1}{1+e^{-z}}.

这里,xx 是提示;yiy_iyjy_j 是两个候选回答;yiyjy_i\succ y_j 表示更偏好 yiy_ip(yiyjx)p(y_i\succ y_j\mid x) 是模型给这一结果的概率;rϕ(x,y)r_\phi(x,y) 是参数为 ϕ\phi 的模型输出的标量分数;σ\sigma 是逻辑 sigmoid 函数;zz 是它的实数输入;ee 是自然对数的底。分数差被建模为对数优势,而不是经过校准的人类价值量。

模型会加入原始标签本身没有包含的结构。它假设可以用一个标量为被比较的回答排序。在两个分数上加同一个常数,不会改变结果。循环偏好、随上下文变化的优先级,以及标注者群体之间稳定存在的差异,并不总能用一个汇总分数表示。第 19 章 会推导奖励模型的损失,并说明策略优化这项近似时会发生什么。

其他反馈格式会保留不同的信息:

格式 保留的信息 主要限制
强制二选一 两个候选回答中的胜者 丢失平局、理由与偏好强度
允许平局并记录强度的成对比较 无差异判断与差距类别 类别仍依赖评分准则的校准方式
KK 个候选回答排序 一个排序,最多隐含 K(K1)/2K(K-1)/2 个样本对 同一次排序产生的样本对彼此相关,KK 越大认知负担越高
属性评分 正确性、冗长度等彼此分开的判断 不同人的量表未必可以直接比较
批注与修订 一条理由与建议的修复方式 复核成本高,也更难直接转换成损失

InstructGPT 要求标注者为四到九个回答排序。训练时,把同一份排序产生的比较放在一起处理,而不是假定每个隐含样本对都彼此独立 (Ouyang et al. 2022)。OpenAssistant 保留了对话树与消息评分 (Köpf et al. 2023)。HelpSteer 在有用性之外,还加入了对正确性、连贯性、复杂度与冗长度的回答级评分 (Wang et al. 2023)。更丰富的数据结构并不保证模型一定更好,但能让收集到的判断更容易检查。

区分错误、歧义与合理分歧

「人类反馈」并不代表一套一致的偏好。标注者在专业知识、语言、文化、风险容忍度与个人价值观上都可能不同。InstructGPT 明确指出,其流程让模型对齐的是标注者与研究人员所表达的偏好,而不是一套普适的人类价值定义 (Ouyang et al. 2022)。因此,标注者群体是数据集定义的一部分。

分歧是一项诊断信号,不能一概视为同一种噪声。它至少有三种来源:

  • 错误。 评判者漏看事实错误、点错选项,或没有遵守一条清晰规则。
  • 歧义。 提示、候选回答或评分准则无法决定一个稳定答案。合适的修复方式可能是把任务写得更清楚,或允许平局。
  • 合理分歧。 评判者都理解案例,却面对策略尚未解决或本就不应强行统一的价值取舍,采用了不同权重。

增加投票可以减少偶发错误,却不能决定谁的稳定价值判断应当占主导。汇总成最终标签之前,应保留原始的逐人判断、平局、弃权、信心与理由。稳定的化名标识可以揭示群体差异与可靠性模式,但必须配合知情同意、隐私控制、有限访问权限与成文的数据保留政策。

PRISM 数据集把反馈人群的差异明确呈现出来。它涵盖 1,500 名参与者、75 个国家、8,011 段对话和 21 个模型,并把情境偏好与参与者资料关联起来 (Kirk et al. 2024)。它不是为了再提供一个普适平均值,而是展示主观且多文化的偏好如何随提供反馈的人而变化。

有些表面偏好其实是捷径。Sharma 等人发现,符合用户既有观点的回答更容易获得偏好,人和偏好模型有时会选择有说服力的迎合回答,而不是正确答案 (Sharma et al. 2024)。HelpSteer 的一项动机,则是避免让长度代替有用性 (Wang et al. 2023)。这些现象并非反馈数据必然具有的属性,但足以说明为何要把正确性、标注一致性和回答长度分开测量。

因此,标注项目应按切片报告标注一致性,而不是只给出一个全局数字。流程还应包含领域专家的资格任务、用于校准的重叠标签、针对答案明确案例的隐藏检查,以及保留原始投票与最终决定理由的仲裁记录。标注说明、报酬安排、接触有害材料的风险与升级支持,都属于数据质量与治理,而不是无关紧要的行政细节。

AI 反馈改变的是谁来执行评分准则

AI 反馈生成判断的速度更快,边际成本也低于完全依赖人工的流程,但这不会改变偏好标签的含义。评判模型、评判提示、策略文本、候选顺序与解码设置,都会成为测量工具的一部分。

Constitutional AI 包含两个相互衔接的阶段。第一阶段中,模型依据采样到的原则批判并修订回答,这些修订结果成为监督数据。第二阶段中,模型依据宪章原则比较回答对,这些 AI 偏好用于训练偏好模型,再供强化学习使用 (Bai et al. 2022)。Lee 等人后来在摘要、有用对话与无害对话任务上发现,RLAIF 的表现可与 RLHF 相比 (Lee et al. 2024)。这些结果只证明了对应设置,不保证 AI 评判者在每个领域都与人一致。

AI 评判者可能存在位置偏差、冗长度偏差与自我偏好 (Zheng et al. 2023)。候选回答本身也是不可信文本,其中可以藏入操纵评判者而不是回答用户的指令。针对大语言模型评判者与 RLAIF 流水线的实验已经演示过此类提示注入攻击 (Shi et al. 2024)。固定评判者输出更一致,也可能只是以更大规模重复同一种偏差。

控制措施应当针对这些失败方式:

  • 冻结并记录评判模型快照、提示、策略版本、模板与解码配置;
  • 交换候选回答顺序,并在一部分样本上重复判断;
  • 把 AI 评判者与分层留出的人类小组比较,其中包括接近策略边界的案例;
  • 将选定的歧义、高风险或专家案例交给人处理,不能假设模型给出的低置信度已经过校准;
  • 部署后继续进行随机人工审计,让评判者漂移或数据漂移可以被观察到;
  • 归档评判者的原始输入与输出,其中也包括失败和被过滤的记录。

混合路由可以把固定标注预算优先花在交给人处理的案例上,但路由本身也必须接受评测。如果模型只把容易案例交给人,或者隐藏某类自己信心很高却判断错误的样本,那么名义上的人工监督几乎没有保护作用。AI 反馈扩展的是评分准则的执行规模。人仍然负责制定准则、进行审计,并决定是否用这些输出训练模型。

发布数据集时附上测量背景

只含 chosenrejected 回答的文件,可以满足部分训练代码的输入要求,却不足以说明模型究竟接受了什么训练。真正可用的发布产物应当是一个带版本的数据产品,至少包含以下记录:

记录 理解这条记录所需的字段
策略 规格版本、评分准则版本、示例、平局规则与优先级规则
提示 文本或受保护的引用、来源、语言地区、风险与覆盖切片、同意与许可状态
候选回答 回答、模型与检查点、对话模板、采样策略与解码设置、生成时间
判断 原始投票、平局或弃权、强度、属性、理由、展示顺序、评判者或标注者群体
仲裁 最终训练标签、仲裁者类别、理由、转换与过滤历史
数据集 数据模式版本、去重方法、数据划分、哈希、代码版本、预期用途与排除范围

这些背景信息让数据集可以审计,也能在一定程度上重建。但当托管模型发生变化或生成过程具有不确定性时,它仍然无法保证逐比特复现。Data Cards 提供了一种更广泛的文档方式,用于记录来源、采集、标注、预期用途、维护与演化 (Pushkarna et al. 2022)。

训练开始前,应使用优化器本身无法回答的问题为数据集设门槛:

  • 提示覆盖是否与目标用户、语言、任务和策略边界相符?
  • 候选回答是否覆盖当前策略及其可能的失败方式,而不只是旧的弱检查点?
  • 平局、弃权、标注一致性与仲裁如何随切片变化?
  • 交换回答顺序是否会改变标签?
  • 即使不看回答内容,回答长度、格式、模型身份或其他捷径能否预测胜者?
  • 训练集、验证集与审计集是否按来源和近重复内容隔离?
  • 每个最终样本对是否都能追溯到产生它的策略、候选回答、原始判断与转换步骤?

这些检查把偏好数据采集变成了一套具有输入、版本、失败方式与反馈的工程系统,但不会替系统解决其中的规范性选择。

争议所在

公开行为规格可以让机构作出的选择更容易检查,但明确并不等于正当、完整或人人认同。一种立场希望把广泛意见汇总成稳定的默认行为,供同一个模型执行;另一种立场认为部分偏好无法化为一个共同答案,因而主张有限度的个性化或多套策略。只要把所有判断汇总成一个分数,标量奖励模型就悄然选择了第一条路。任何标注技术都无法替代这项治理决定。最低限度的负责任做法,是记录谁提供了反馈,在足够长的时间内保留分歧以供研究,并标明产品策略在哪些地方有意不采纳平均投票结果。

下层约束

偏好数据会约束上层使用的每一种优化器。如果采集流程把正确性与长度、有用性与赞同、安全性与一概拒绝混在一起,第 19 章第 20 章 就没有信息可以恢复这些已经丢失的区别。更好的优化可以放大混合信号,却无法分离标签已经丢弃的信息。同一份数据血缘还会支持后面的 第 49 章第 53 章,因为行为变化必须能追溯到策略、提示来源、候选模型、评判者或过滤决定。

延伸阅读

  • Bai et al., “Constitutional AI: Harmlessness from AI Feedback” (把性情挪进模型), 2022. arXiv:2212.08073
    Constitutional AI 通过成文原则、自我批判、修订与 AI 反馈,训练无害但不过度回避的助手行为。
  • OpenAI, “Model Spec” (日期为 2025 年 12 月 18 日的快照), 2025. model-spec.openai.com
    Model Spec 定义模型目标行为,并规定用来解决指令冲突的权限层级。
  • Anthropic, “Claude's New Constitution” (2026 年 1 月 22 日发布,采用 CC0 许可), 2026. anthropic.com
    Anthropic 的 2026 年 1 月宪章主要写给 Claude,依次规定广义安全、伦理、Anthropic 准则和有用性,并用于生成合成训练数据。
  • Anthropic, “Claude's Constitution,” 2023. anthropic.com
    Anthropic 将最初的公开宪章描述为一组显式且可修改的原则,用于批判、修订和 AI 偏好判断。
  • Jagadeesh et al., “Reinforcement Learning Towards Broadly and Persistently Beneficial Models,” 2026. alignment.openai.com
    OpenAI 报告称,在其研究中,针对七项明确有益特质的强化学习能够跨领域迁移,并在若干对抗性干预下保持。
  • Köpf et al., “OpenAssistant Conversations: Democratizing Large Language Model Alignment,” 2023. arXiv:2304.07327
    OpenAssistant Conversations 发布了一份众包对齐语料,其中包含对话树、消息评分和多语言人类反馈。
  • Wang et al., “HelpSteer: Multi-attribute Helpfulness Dataset for SteerLM,” 2023. arXiv:2311.09528
    HelpSteer 提供 3.7 万条回复级评分,除总体有用性外还标注正确性、连贯性、复杂度和冗长度,使训练与审计中的取舍可见。
  • Cui et al., “UltraFeedback: Boosting Language Models with Scaled AI Feedback,” 2023. arXiv:2310.01377
    UltraFeedback 在 25 万段对话上收集了超过一百万条 GPT-4 判断,并研究 AI 反馈的规模、多样性和偏差缓解。

评论

登录后评论