AI 基建
0%
第三部分 · 后训练 · 第 22 章

安全调优与指令层级

作者Changkun Ou
阅读时长约 11 分钟

安全调优必须先作出两个不同的判断,模型才能回答。第一项判断涉及输出策略:对于当前请求,哪些行为是允许的?第二项判断借助指令层级,在上下文里的要求彼此冲突时,确定哪些指令应当支配回答。混淆二者会造成两类常见失败。模型可能服从有害请求或拒绝无害请求,也可能服从攻击者控制的文本,而不听从调用它的应用。

训练可以改善这两项判断,却无法替模型建立安全边界。后训练改变的是模型行为,不是模型权限。运行时安全、授权、秘密信息处理和工具隔离,仍是彼此独立的系统责任。

两项判断,三类错误

输出策略要判断候选回答是否符合成文安全策略,同时尽可能保留策略允许的帮助。权限判断要先找出适用的指令,再解决它们之间的冲突。两项判断会相互影响,却不能彼此替代。

判断 期望行为 危险漏判 过度纠正
输出策略 给出策略允许范围内最有用的回答 不安全服从 拒绝无害请求,或无谓地删减细节
指令权限 遵循所有适用指令,只在冲突时让更高权限胜出 越狱或提示注入成功 忽略有效的低层级指令
运行时授权 只允许获批的动作和数据流 未经授权的副作用或信息泄露 阻止合法操作

越狱与提示注入彼此相关,却不是同一件事。越狱试图绕过模型习得的安全行为,不一定利用消息角色之间的冲突。直接提示注入把攻击者控制的文本放进用户请求,试图覆盖应用指令 (Perez and Ribeiro 2022)。间接提示注入则把这类文本藏在网页、文档、邮件或其他第三方内容里,随后再让它进入模型上下文 (Greshake et al. 2023)。表中前两行属于习得行为,第三行必须由模型之外的机制强制执行。

拒绝校准不是二元分类

早期安全方案常把任务写成意图分类:服从无害请求,拒绝恶意请求。这个框架适合边界清楚的情形,却难以处理双用途请求。同一个生物实验流程或软件漏洞问题,既可能服务防御与教学,也可能被用于滥用。安全回答可以是直接回答、删去操作细节的有限回答、要求澄清、只拒绝其中一部分,或转向安全内容。拒绝只是其中一种动作,并不等同于安全本身。

两个比率分别刻画边界两侧。令 DHD_H 表示留出的有害请求集,DBD_B 表示留出的无害请求集。定义

UCR=1DH(xi,yi)DH1[V(xi,yi)=1],\operatorname{UCR} =\frac{1}{|D_H|}\sum_{(x_i,y_i)\in D_H}\mathbf{1}[V(x_i,y_i)=1],

其中,UCR 是不安全服从率,xix_i 是第 ii 个请求,yiy_i 是模型回答;V(xi,yi)=1V(x_i,y_i)=1 表示该回答违反安全策略,DH|D_H| 是有害测试请求数,1[]\mathbf{1}[\cdot] 是指示函数。对于无害请求,定义

BRR=1DB(xi,yi)DB1[F(xi,yi)=1],\operatorname{BRR} =\frac{1}{|D_B|}\sum_{(x_i,y_i)\in D_B}\mathbf{1}[F(x_i,y_i)=1],

其中,BRR 是无害拒绝率;F(xi,yi)=1F(x_i,y_i)=1 表示回答拒绝或隐去了策略允许提供的帮助,DB|D_B| 是无害测试请求数。如果 BRR 高到让产品无法使用,那么 UCR 再低也不能算成功。

平均值可能掩盖真正要紧的失败。应当按策略类别、语言、编码方式、对话长度和工具路径分别报告这两个比率,还要报告不安全输出的严重程度与可操作性。一段短回答即使没有出现拒绝措辞,只要没有提供实质性的有害信息,就不应算作攻击成功。

图 22.1. 在固定风险分数和评测集上的定性工作曲线。降低风险分数阈值,会拒绝更多有害请求,也会拒绝更多无害请求。更好的模型可能改善经验曲线,但训练并不保证曲线一定移动。

安全补全训练把目标从硬性的服从或拒绝标签,转向输出本身是否安全。Yuan 等人用直接回答、有限的安全补全,以及带有安全转向的拒绝进行训练,随后在强化学习中使用习得的安全分数与有用性分数 (Yuan et al. 2025)。论文公开的一项奖励是

ri=hisi,r_i=h_i s_i,

其中,hi[0,1]h_i\in[0,1] 是回答 ii 的习得有用性分数,si[0,1]s_i\in[0,1] 是其习得安全分数,rir_i 是最终奖励。相乘会同时压低不安全细节和空洞却安全的回答。它仍是习得的代理信号,不是硬约束。论文在受控评测和生产环境中都报告了改善,对双用途提示尤其如此;这些结果不能证明所有策略、模型或自适应攻击都有相同的取舍。

指令层级负责解析适用的指令

指令层级是一条冲突处理规则,并不要求模型忽略所有低层级消息。低权限指令只要适用于当前任务,又不与更高权限约束冲突,就应当得到遵循。同一层级中,较晚的指令可以取代较早的指令。Wallace 等人针对这种行为提出了定向数据生成方法,并在 GPT-3.5 实验中提高了模型的鲁棒性 (Wallace et al. 2024)。

具体层级是产品约定,并不是语言模型的自然定律。在 OpenAI Model Spec 2025 年 12 月的版本中,顺序是 Root > System > Developer > User > Guideline,之后是无权限 (OpenAI 2025)。按照该规范,助手消息、工具输出,以及引用或检索得到的文本默认无权限。更高权限的指令可以向这些内容显式委派一定范围内的权限。

不要把角色与可信度混为一谈。开发者消息可以引用攻击者控制的输入,工具输出也可以包含可信事实,却无权因此改写策略。反过来,用户可以明确把一项有限任务委派给代码仓库中的指令文件。系统必须保留消息内部内容的来源,不能只根据文字风格或消息通道猜测可信度。

root Root 规则 system 系统指令 root->system 权限更高 developer 开发者指令 system->developer user 用户指令 developer->user guideline 指导原则 user->guideline resolve 解析适用且 互不冲突的指令 guideline->resolve data 默认无权限 助手/工具/引用/ 检索内容 data->resolve 仅限委派 response 生成回答 再执行运行时控制 resolve->response
图 22.2. 一种产品约定的权限链。只有适用指令发生冲突时,更高权限才会胜出。助手消息、工具输出,以及引用或检索得到的内容默认无权限;显式委派可以让有限范围内的指令生效。

下面这套实用流程可以说明解析过程,同时不假装自然语言冲突总能由机械规则判定:

输入:上下文 c,候选指令 I(c),权限级别 a(i)
1. 找出来自有权承载指令之来源的候选指令。
2. 默认把引用或检索得到的文本、工具输出和先前的助手文本标为数据。
3. 只有适用指令明确委派权限时,才把数据中携带的指令加入候选集。
4. 移除任务范围之外、在同层级已被取代,或与适用的更高权限指令冲突的候选项。
5. 遵循所有余下且彼此相容的指令,其中也包括低层级指令。
6. 如果冲突或委派含糊,而且动作会产生重大副作用,就要求澄清或升级处理。
7. 生成回答 y,再执行输出策略和运行时授权。

这里,cc 是完整的模型上下文,I(c)I(c) 是从上下文中找到的候选指令集合,ii 表示其中一条候选指令,a(i)a(i) 是它的权限级别,yy 是回答。第 1 至第 6 步定义的是行为目标,并不是确定性的解析器,也不能证明模型一定会遵循这个目标。

同时训练一致与冲突样本

层级训练需要同时包含一致样本与冲突样本。如果数据集里只有攻击样本,最省事的策略就是忽略用户与工具。Wallace 等人用两种构造方式避免这条捷径。上下文合成构造低层级上下文相关且应当遵循的样本;上下文忽略构造与目标不一致、不应影响回答的低层级文本。论文报告的训练方案同时使用监督微调和人类反馈强化学习,并没有用一种普适的成对损失来定义指令层级。

评测也需要同样的对照。IHEval 包含 9 项任务、共 3,538 个样本,同时覆盖权限一致与冲突的情形。所有受测模型在冲突情形下的准确率都明显下降。这说明,普通指令遵循准确率并不能证明模型掌握了指令层级 (Zhang et al. 2025)。模型必须在以下四种情形中都作出正确反应:

情形 期望行为
低层级指令一致且相关 遵循它
低层级指令是不相关的数据 不让它控制回答,只把它当作信息使用
低层级指令与更高权限冲突 遵循更高权限指令,并尽可能继续提供安全帮助
委派含糊且动作后果重大 要求澄清或取得批准

后来的 IH-Challenge 构造了可以用程序评分的冲突任务,用于强化学习,并在训练过程中在线生成对抗样本。在作者针对 GPT-5-Mini 的内部实验中,模型在 16 项评测上的平均层级鲁棒性从 84.1% 提升到 94.1% (Guo et al. 2026)。这项证据表明,定向训练带来的改善可以超出最简单的训练任务。不过,它仍只涉及一个模型家族、一套训练方案,以及公开与内部评测的混合,并不是普适的安全保证。

成文策略改变监督方式

成文原则提供的监督不只是一份拒绝样本清单。Constitutional AI 与 Deliberative Alignment 都使用成文策略,但用法不同。

阶段 Constitutional AI Deliberative Alignment
监督数据 根据宪章生成自我批判与修订,再用修订后的回答训练 根据安全规范生成引用策略的推理与回答
强化信号 AI 评判者依据原则比较回答,偏好模型据此提供基于 AI 反馈的强化学习信号 了解规范的评判者评估回答是否正确应用相关策略
有证据支持的结论 该流程在论文所报告的环境中产生了较少回避的无害助手 论文报告的 o 系列实验在相应评测中改善了越狱鲁棒性与过度拒绝
证据不支持的推论 模型面对每个新请求时都会忠实地依据宪章推理 一段看似合理的策略解释足以证明内部推理具有因果作用或结论正确

Constitutional AI 先生成自我批判与修订,再用修订后的回答微调。强化阶段由 AI 比较回答并训练偏好模型,这套流程称为基于 AI 反馈的强化学习,也就是 RLAIF (Bai et al. 2022)。Deliberative Alignment 则训练明确引用安全规范的合成样本,随后使用了解规范的强化信号 (Guan et al. 2024)。两种方法都没有消除策略、类别标签、生成器、评判者和评测集中的人为选择。

应当在三个可观察阶段评测策略推理:策略回忆、策略应用与最终输出。适合解释时,回答应指出相关规则,把规则一致地用于事实,并给出策略允许且有用的结果。流畅的理由无法挽救错误的判断。反过来,正确回答也不必公开私有思维链,才能证明它符合策略。

成文策略是监督目标,不是真值。含糊、矛盾或过时的规则会导致规格不充分。预训练先验可能让模型在面对一个含糊样本时表现得更合理,也可能把行为拉离预期策略。策略本身、由策略生成的训练数据,以及评测套件,应当一起进行版本管理。

评测失败本身,而不是拒绝措辞

红队测试用于寻找失败,不能证明失败不存在。一套实用流程是:

  1. 定义策略分类与威胁模型。
  2. 用人类、模型、变换与工具中介场景生成攻击。
  3. 评估目标输出的实际危害效用、策略合规性与任务成功率。
  4. 聚类失败样本,把选定样本转为训练数据或回归测试数据。
  5. 保留完整的攻击家族用于评测,而不只是留出近乎重复的字符串。
  6. 重复测试,并采用能观察先前防御的自适应攻击。

模型生成的攻击与模型评判者可以扩大这套流程的规模,但也有各自的盲点 (Perez et al. 2022)。StrongREJECT 发现,常见越狱评测往往夸大攻击成功率,因为绕过拒绝的同时也可能把回答劣化成毫无用处的文本 (Souly et al. 2024)。评测应判断回答是否真正交付了被禁止的能力,而不是只看其中有没有拒绝措辞。

发布门槛至少应当报告:

  • 按策略类别报告不安全服从率与严重程度;
  • 在 XSTest 等对照集上的无害拒绝率 (Röttger et al. 2024);
  • 安全补全的有用性与普通任务质量;
  • 遵循一致低层级指令的能力,以及处理冲突指令的准确率;
  • 直接与间接提示注入的成功率、提示泄露和不安全工具动作;
  • 按语言、编码、多轮长度与检索数据来源拆分的结果;
  • 在明确说明自适应攻击预算后,对留出的攻击家族所得的结果;
  • 自动评判者与经过策略培训的人类评审者之间的一致性。

不要在发布集上调参。训练样本、红队发现和最终评测样本需要分别记录来源,确保分数上升反映的是能力改善,而不只是记住了最新的攻击字符串。

与运行时安全的边界

安全调优可以建立有用的默认行为,但习得行为具有概率性。运行时分类器通常也具有概率性。只有系统在明确威胁模型下采用确定性强制机制时,边界才是硬的。

层级 可以改善什么 无法保证什么
安全与层级调优 默认拒绝、安全补全、策略应用和冲突处理 不发生越狱或提示注入,以及推理必然忠实
运行时分类器与闸门 检测、升级处理、日志记录和阻断回答 完美覆盖,或抵御每一种自适应输入
授权与能力控制 允许使用哪些工具、秘密信息、接收方和副作用 获准动作一定明智或有用
隔离与数据流控制 限制影响范围并阻止特定数据流 在强制规则之外作出正确的自然语言判断

应用应当让凭据远离模型上下文,向工具签发最小权限能力,验证工具参数,对后果重大的副作用要求批准,并在检索和工具调用之间记录来源。即使模型误读了指令,这些控制仍然有效。第 57 章 进一步讨论检测与闸门,第 56 章 讨论能力强制执行,第 58 章 讨论攻击评测。

争议所在

指令层级、成文策略训练和安全补全目标,都在已有实验中改善了可测量的行为。面对新模型家族、长上下文、未见语言与工具中介的自适应攻击,这些改善能保留多少,仍要靠实验回答。这些方法都不会在模型内部形成形式化的安全边界。

下层约束

训练决定模型通常怎样行动,基础设施决定模型获准做什么。策略评估、授权、秘密信息处理、沙箱和审计日志必须保持足够独立,使一次模型失误不会悄然变成外部副作用。

  • Wallace et al., “The Instruction Hierarchy: Training LLMs to Prioritize Privileged Instructions,” 2024. arXiv:2404.13208
    指令层级训练模型在冲突中选择性忽略低权限指令,从而提高对提示注入与越狱的鲁棒性,同时尽量减少能力损失。
  • OpenAI, “Model Spec” (日期为 2025 年 12 月 18 日的快照), 2025. model-spec.openai.com
    Model Spec 定义模型目标行为,并规定用来解决指令冲突的权限层级。
  • Guan et al., “Deliberative Alignment: Reasoning Enables Safer Language Models,” 2024. arXiv:2412.16339
    Deliberative Alignment 将安全规范教给模型,并训练其在回答前依据规范推理,从而同时提升越狱鲁棒性并降低过度拒绝。
  • Bai et al., “Constitutional AI: Harmlessness from AI Feedback” (把性情挪进模型), 2022. arXiv:2212.08073
    Constitutional AI 通过成文原则、自我批判、修订与 AI 反馈,训练无害但不过度回避的助手行为。
  • Yuan et al., “From Hard Refusals to Safe-Completions: Toward Output-Centric Safety Training” (安全补全训练,已用于 GPT-5), 2025. arXiv:2508.09224
    安全补全训练用以输出为中心的学习目标取代二元拒绝边界;GPT-5 的报告实验显示,它能在基于意图的拒绝较脆弱的双用途提示上同时改善安全性与有用性。

评论

登录后评论