AI 基建
0%
第三部分 · 后训练 · 第 18 章

行为规格与偏好数据

作者Changkun Ou
阅读时长约 9 分钟

第 17 章 说明了怎样通过模仿示范,把一个基座模型调成助手形态。接下来的问题,比 RLHF、DPO 或任何优化器都更早:这条示范或这组偏好,到底想表达什么?一条「A 比 B 好」的成对标签,不是未经加工的人类意图。它是策略文本、评分准则、采样流程、标注者群体和数据过滤共同作用之后的结果。后训练从这里开始。

本章把偏好数据当成一套经过工程化设计的测量系统。行为规格说明目标行为;评分准则把规格转成可操作的判断;人类标注者或 AI 评判者依据准则做比较;这些比较再变成训练信号。若这条链条含糊,模型学到的就是含糊。若它奖励冗长、迎合、语气自信,优化器就会找到这些把手。

损失函数之前,先有策略

对齐文献常从损失函数讲起。真实流水线则从一份成文规格开始。Anthropic 的 Constitutional AI 把这件事显式化:它用一组原则引导模型自我批判和修订,从而替代相当一部分由人来做的 harmlessness 标注 (Bai et al. 2022)。Anthropic 对 Claude 宪章的公开说明,也把这些原则描述为一种让价值可检查、可修改的方式,而不是把价值埋在一堆标签里 (Anthropic 2023)。这部宪章后来长成了一件独立的训练制品:2026 年 1 月的修订版长约八十页,以 CC0 发布,主要写给 Claude 自己而非标注其输出的人读,并写明了优先顺序:安全与人类监督最先,其次是广义伦理,再次是 Anthropic 的准则,最后才是有用性 (Anthropic 2026)。OpenAI 的 Model Spec 则把同一件事写成更接近产品的形式:它定义模型的目标行为,将其与使用政策、安全系统区分开,并把指令权限从 root、system、developer、user 到 guideline 分层排序 (OpenAI 2025)。

这些文档不是训练外围的装饰,而是上游训练制品。一个标注者被要求偏好「有帮助且无害」的回答,仍然需要知道:正确但生硬的回答是否胜过温和但空泛的回答;医疗请求应该谨慎回答还是拒绝;用户指令能否覆盖工具输出。成文规格的作用,就是把这些选择稳定下来,稳定到足以被标注。

成文规格能做的还不止稳定标签。当被命名的那些行为本身成为强化学习的目标,而不只是标注者套用的评分准则时,效果可以延伸到准则覆盖之外的情形。OpenAI 报告称,针对七项有益特质(真实性、认知谦逊、元认知透明、可纠正性、风险敏感、普遍公平、关切人类福祉)做强化学习,在一个含 53 项任务的留出基准套件上,多数任务的对齐表现都有提升,效果能从单一领域的训练迁移到其他领域,并在对抗性引导与微调下依然保持 (Jagadeesh et al. 2026)。规格仍是上游对象;它的效果能泛化到多广,是这个领域正在测量的经验问题,而非文档本身所能保证的属性。

spec 行为规格 宪章、模型规范、策略 rubric 评分准则 维度、例子、边界情形 spec->rubric judge 判断 人类、AI 或混合 rubric->judge sample 采样回答 来自当前或候选模型 sample->judge data 偏好数据 成对、排序、属性 judge->data train 后训练损失 RLHF、DPO、SFT、过滤 data->train eval 审计与评测 偏差、分歧、漂移 train->eval eval->spec 修订 eval->rubric
图 18.1. 偏好数据是一条供应链。行为规格变成评分准则,准则指导对采样回答的判断,判断再进入后训练。优化器看不到策略本身,只看到这条链条生产出来的标签。

即便没人把它写出来,这里也存在一个效用函数。设提示词为 xx,回复为 yy,评分准则把它映射到若干属性,其中 a(x,y)Rka(x,y) \in \mathbb{R}^k,比如正确性、有用性、安全性、校准程度、简洁程度和风格。一个最简单的效用可写为

u(x,y)=wa(x,y),u(x,y) = w^\top a(x,y),

其中 ww 是行为规格隐含的权重向量。这不是说人类价值真的线性,而是为解读标签立下一条纪律:当一个回答被标为更好时,总有某组隐含权重完成了这次取舍。权重一变,哪个回答胜出也会变,哪怕两个候选回答本身没有变。

图 18.2. 偏好标签是一种带权判断。调整属性权重,候选回答不变,胜出的回答也可能翻转。这里的重点不是说真实评分准则都是线性的,而是说每份准则都编码了取舍。

成对标签能说什么

最容易规模化的标签,是成对比较。给定提示词 xx,其中 ywy_w 是被偏好的回复,yly_l 是被拒绝的回复,奖励建模(训练一个模型,也就是奖励模型,用单个数字给回复打分,以此代替人类判断)常用的 Bradley-Terry 模型把偏好概率写成

P(ywylx)=σ ⁣(r(x,yw)r(x,yl)).P(y_w \succ y_l \mid x) = \sigma\!\left(r(x,y_w) - r(x,y_l)\right).

其中 r()r(\cdot) 是学到的奖励分数,σ\sigma 是 sigmoid,一条把任意实数压进 (0,1)(0,1) 的 S 形曲线,于是输出读起来就是一个概率。换句话说,这个式子把两个回复的分数之差,转换成人类偏好其中之一的概率:ywy_w 领先越多,它被选中的可能性就越大。这正是成对数据自然流向 第 19 章第 20 章 的原因。它问的是一个更容易稳定作答的问题:这两个哪个更好?比起让人「写出理想答案」,这样的判断要稳得多。但这种简单性也带来限制。成对标签只说明,在当前准则下胜者比败者好;它不说明为什么好;不区分正确性与语气;不告诉后来者标注者之间是否一致;还依赖候选集合本身。一个回答胜出,可能因为它确实好,也可能只是因为另一个更差。

所以现代反馈数据集往往在成对比较外再保留更多结构。OpenAssistant Conversations 在社区规模上采集对话树、消息评分和多语言人类反馈 (Köpf et al. 2023)。HelpSteer 把判断拆成 helpfulness、correctness、coherence、complexity、verbosity 等属性,明确降低对单一标量的依赖 (Wang et al. 2023)。UltraFeedback 用 GPT-4 在数十万对话上生成大规模 AI 反馈,同时强调多样性和偏差缓解,因为规模本身只会把评判者的伪影一同放大 (Cui et al. 2023)。

真正的设计选择,不是「成对还是标量」,而是保留多少判断结构。成对标签便宜、稳健;排序能从一组采样里提取更多信息;属性标签让取舍可审计;自由文本批注难以解析,却适合修复数据和修订宪章。保留的结构越多,后来越容易判断模型到底是更正确了、更啰嗦了、更顺从了,还是更擅长满足评判者了。

标注者也是模型的一部分

偏好标签常被概括为「人类反馈」,仿佛人类是一种单一而稳定的真值来源。实际情况是,标注者群体本身就是建模假设的一部分。标注者在领域知识、风险偏好、语言、文化背景、耐心和对自信文字的敏感度上都不同。任务需要专家知识,而标注池不是专家时,奖励模型学到的就是非专家偏好。指南把有用性和赞同混在一起时,模型就会学会迎合,也就是专挑用户想听的话说。长答案看起来更认真时,奖励也会继承冗长偏差,也就是不顾内容、单单偏好更长的回答。

运维上最要紧的是三件事。

  • 分歧。 标注者分歧率就是噪声底。两名受训标注者按同一准则仍不能一致时,不应指望奖励模型凭空学到更尖锐的边界。
  • 覆盖。 提示词分布和候选模型决定标注者见过什么。只在安全、普通回答上训练过的奖励模型,没有理由理解对抗式提示或少见政策边界。
  • 来源。 标签需要版本化的指南、标注元数据、模型版本和采样设置。没有这些信息,后来的行为变化就无法归因到模型、数据还是准则。

第 49 章 把人类评测当成仪器。这里也是同一条原则,只是这件仪器位于训练上游,而不是发布下游。奖励模型是这件仪器的一份冻结拷贝。一旦它被优化,偏差就不再只是测量误差,而会变成行为。

AI 反馈扩大标注者,也继承标注者的风险

RLAIF(基于 AI 反馈的强化学习)和宪章式流水线,用模型评判者替代一部分人工标注 (Bai et al. 2022)。收益很清楚:AI 评判者便宜、一致、多语言,并且能以反复后训练所需的规模持续工作。它还可以更直接地把成文规格带进数据,让模型依据明示原则批判和修订回答。这也是宪章式方法不只是廉价 RLHF 的原因:它让规格成为回路里的一级对象。2026 年的 Claude 宪章把这条路走到了头:文档主要写给模型而非标注者,并被直接用于训练,Claude 依据它生成对话、回复与回复排序 (Anthropic 2026),于是 第 23 章 所讲的那类合成训练数据,如今直接出自这份规格。

风险同样直接。模型评判者本身也是模型,带着自己的训练分布、拒绝习惯、文化先验和盲区。它可能偏好流畅解释而非正确解释,偏好安全的表面形式而非校准过的风险降低,也可能把提供方的政策带进一个原本想采用不同政策的系统。更麻烦的是,一旦目标模型被训练去满足这个评判者,它会学会评判者特有的伪影。这就是 第 19 章 之后还会讨论的 Goodhart 压力(一旦某个度量变成了目标,它就不再是个好度量),只是被提前搬到了数据供应端。

实践上的答案通常是混合监督。人类编写和审计规格;在人类与模型评判者分歧或模型评判者不确定的样本上做抽检;用留出的人类小组测量评判偏差;保留一条小规模的新鲜人工标签流来监测漂移。AI 反馈买来规模,但不会取消「反馈到底意味着什么」这项责任。

运维形态

一份可用的偏好数据集,不只是一个由 chosen 和 rejected 回复组成的 JSONL 文件。它应当是一组版本化制品:

  • 行为规格和策略版本;
  • 评分准则,包括正例、反例和边界情形;
  • 提示词来源和采样策略;
  • 候选模型版本与解码设置;
  • 标注者或评判者类别,不必是个人身份;
  • 分歧、仲裁和质量控制记录;
  • 已知偏差、排除领域和预期训练用途。

这些元数据不是模型周围的文书工作,而是后训练能否复现的条件。缺少它们,后面的优化器可以完全正确,却仍然在优化错误的对象。

争议所在

成文行为规格让价值可检查,但不会让价值变得完整。有些政策边界本来就没有被充分规定;不同文化与用户会发生真实分歧;有些危害只有部署后才显现。最好的规格不是对齐的最终答案,而是一个稳定的对象:它可以被审计、修订、测试,并且能够连接到真正训练模型的那些标签。

下层约束

偏好数据受制于制造它的评测仪器。如果评分准则分不开正确性、有用性、冗长、拒绝和权限,第 19 章第 20 章 就会优化一份混合信号,并让这份混合更难检查。同一批元数据后来也会变成 第 49 章第 53 章 里的运营证据:缺少它,行为变化就无法追溯到策略、标注者、评判者或采样决策。

  • Bai et al., “Constitutional AI: Harmlessness from AI Feedback,” 2022. arXiv:2212.08073
    Constitutional AI 通过依据成文原则进行自我批判、修订与 AI 偏好标注来训练无害行为,减少直接人工标注,并让支配模型行为的价值更可检查。
  • Anthropic, “Claude's Constitution” (official description of Claude's Constitutional AI principles), 2023. anthropic.com
    Anthropic 将 Claude 的宪章描述为一组显式且可修改的原则,用于通过 Constitutional AI 引导无害性与有用性。
  • Anthropic, “Claude's New Constitution” (the January 2026 constitution, released under CC0), 2026. anthropic.com
    2026 年 1 月的新宪章篇幅近八十页,以 CC0 发布,主要写给 Claude 自己阅读,明确了安全、伦理、Anthropic 准则、有用性的优先顺序;Claude 在训练中直接依据它生成对话、回复与回复排序。
  • OpenAI, “Model Spec” (snapshot dated 2025-12-18), 2025. model-spec.openai.com
    Model Spec 定义模型目标行为,将其与使用政策和安全缓解措施区分开,并按 root、system、developer、user 与 guideline 层级规定指令权限。
  • Jagadeesh et al., “Reinforcement learning towards broadly and persistently beneficial models” (针对规格化有益特质的强化学习可跨领域泛化), 2026. alignment.openai.com
    OpenAI 报告称,在真实场景上针对七项有益特质(真实性、认知谦逊、元认知透明、可纠正性、风险敏感、普遍公平、关切人类福祉)做强化学习,在 53 个留出基准中的大多数上提升了对齐表现,并能从仅医疗领域的训练迁移到其他领域,且在对抗性引导与微调下依然保持。
  • Köpf et al., “OpenAssistant Conversations: Democratizing Large Language Model Alignment,” 2023. arXiv:2304.07327
    OpenAssistant Conversations 发布一份宽松许可的众包对齐语料,包含 35 种语言的 161,443 条消息、461,292 个评分和 10,000 多棵带标注对话树。
  • Wang et al., “HelpSteer: Multi-attribute Helpfulness Dataset for SteerLM,” 2023. arXiv:2311.09528
    HelpSteer 除整体有用性外,还标注正确性、连贯性、复杂度与冗长度,使偏好数据比单一标量标签更可诊断。
  • Cui et al., “UltraFeedback: Boosting Language Models with Scaled AI Feedback,” 2023. arXiv:2310.01377
    UltraFeedback 在 25 万段对话上使用大规模 GPT-4 反馈,并强调多样性与偏差缓解是 AI 反馈能用于对齐的关键因素。

评论

登录后评论