AI 基建
0%
第三部分 · 后训练 · 第 22 章

安全调优与指令层级

作者Changkun Ou
阅读时长约 6 分钟

遵循指令还不够。一个遵循所有用户请求的模型是不安全的;一个把所有看起来有风险的请求都拒绝的模型不可用;一个把工具输出也当成指令的模型,会暴露在提示注入(prompt injection)之下,也就是夹带在那段文本里的未受信任输入劫持了模型自己的指令。安全调优,就是在请求进入运行时系统之前,先把这些边界训练进模型。

训练时的这一层最先到来。运行时过滤器、策略引擎和授权系统,要到 第 57 章第 56 章 才登场。训练时的问题更窄,但也更基础:让模型学会哪些行为可允许,哪类指令有权限,以及怎样依据成文策略做判断,而不是把所有边界请求都拒掉。

安全是一条需要校准的边界

一次拒绝,本质上是一个分类决策,只不过用自然语言表达出来。给定提示词 xx,模型要在若干动作之间选择:回答、拒绝、追问、转换其中安全的部分,或升级处理。一个简单的约束目标能写出其中的张力:

maxπ  E[helpful(x,y)]满足E[risk(x,y)]τ.\max_{\pi}\; \mathbb{E}[\operatorname{helpful}(x,y)] \quad \text{满足} \quad \mathbb{E}[\operatorname{risk}(x,y)] \le \tau.

其中策略 π\pi 追求有用性,但期望风险必须低于阈值 τ\tau。阈值 τ\tau 是政策选择。降低它,模型拒绝更多,有害补全更少,但 过度拒绝(over-refusal) 更多,也就是模型把无害请求也拒掉。提高它,模型更有用,却让更多有害请求通过。RLHF 可以通过比较样本训练这条边界;宪章式方法可以用针对成文原则的 AI 批判来训练它 (Bai et al. 2022)。但只从例子中学来的边界很脆。攻击者会搜索那些例子没有覆盖的空间,而普通用户会在宽泛拒绝模板误伤无害请求时付出代价。

图 22.1. 安全调优是一条前沿,而不是一个开关。移动拒绝阈值,会减少不安全回答,却增加无害拒绝;更好的训练能移动整条曲线,但部署仍要选择工作点。理想化示意。

指令层级

第二个安全问题是权限。现代模型会读很多文本来源:系统提示、开发者消息、用户指令、检索文档、工具输出、网页、邮件、日志和记忆。有些是指令,有些只是未受信任的数据。模型如果分不清,攻击者就能把恶意指令塞进数据里,让模型照做。

指令层级把权限顺序显式化。Wallace 等人定义并训练模型在冲突中偏好高优先级指令:在他们的方案里,系统消息高于用户消息,用户消息高于模型自己先前的输出,后者又高于工具输出,开发者文本则并入系统消息 (Wallace et al. 2024)。OpenAI 的 Model Spec 用更接近产品的语言扩展了这个层级,把开发者单独列为系统与用户之间的一级,并加入 root 与 guideline 层级 (OpenAI 2025)。

root Root / 平台策略 system 系统指令 root->system 更高优先级 model 模型行为 服从最高适用权限 root->model developer 开发者指令 system->developer system->model user 用户指令 developer->user developer->model tool 工具输出、检索文档、网页、邮件 user->tool user->model tool->model 数据,不是命令
图 22.2. 指令层级把安全变成冲突训练。高权限指令应压过低权限指令;未受信任内容被当作数据,而不是命令。

训练样本是一个冲突对。给定上下文 cc,其中包含两条相互冲突的指令,选择遵循高权限指令的回复 y+y^+,拒绝遵循低权限指令的回复 yy^-

Lhier=logσ ⁣(r(c,y+)r(c,y)).\mathcal{L}_{\text{hier}} = -\log \sigma\!\left(r(c,y^+) - r(c,y^-)\right).

这与 第 19 章 中的成对机制相同,但偏好的语义不同。标签不是「哪个回答更好听」,而是「哪个回答尊重权限顺序」。这种差异很要紧,因为它把安全从一串禁区主题,变成了对来源敏感的行为。模型学到的是,同样一段文字,来自不同位置时,命令效力并不一样。

对策略的显式推理

安全样本本身覆盖不了整条边界。Deliberative Alignment 加入了另一种成分:把成文安全规范教给模型,并训练模型在回答前依据该规范推理 (Guan et al. 2024)。它训练模型在推理时回忆并套用政策文本,而不是去匹配一个现成的拒绝模式。这改变的是模型内化的内容。它不只是学习表面拒绝模式,而是学习回忆政策文本、把请求映射到规则,并选择回复类型。Constitutional AI 更早通过依据成文原则自我批判和修订,展示了同一种模式 (Bai et al. 2022);Deliberative Alignment 则把政策推理变得更直接。

收益是泛化。只在「提示词到拒绝」样本上训练的模型,学到的是危险区域附近的局部邻域。训练它依据政策推理,它才有机会把未见过的请求映射到规则上。风险则在于,政策推理可能变成表演。模型可以给出一段看似合理的解释,却没有改善实际决策;也可能背熟政策措辞,而不提升校准。评测因此必须看决策,而不是看解释写得漂亮与否。

这里也重新接回 第 18 章。安全调优模型不可能好过它拿到的政策。如果政策对双用途生物、隐私、自伤或政治劝说含糊,模型会继承这种含糊。成文政策没有消除判断,只是把判断搬到一个可审计的对象里。

拒绝校准

真正困难的不是让模型拒绝,而是让拒绝足够具体。一条好的拒绝边界有几项性质:

  • 拒绝有害转换,而不是拒绝整个话题;
  • 回答相邻的无害请求,而不是把整块区域都当成禁区;
  • 在确有帮助时提供安全替代;
  • 不让角色扮演、翻译、编码或风格把有害请求挪出边界;
  • 在工具使用与检索中保持指令层级。

这些性质彼此拉扯。宽拒绝减少漏放,却增加误拒;窄拒绝保留有用性,却暴露更多边界情形。更好的训练尝试移动整条前沿:在相同无害拒绝率下拒绝更多真正有害请求。但部署时仍然需要选择一个工作点,而这个点是产品与治理决策,不是数学常数。

拒绝这个动作本身,也成了重新训练的对象。OpenAI 的安全补全(safe-completions)方法随 GPT-5 上线,用以输出为中心的训练取代「拒绝或照办」的二元决策:模型学的是在自身输出必须留在安全政策之内这一约束下最大化有用性,而不是先给用户意图分类、再按分类回答或拒绝 (Yuan et al. 2025)。它瞄准的是双用途提示词:同一个问题既服务安全工程师,也服务攻击者,意图分类因此失灵。这正是本章开头那个约束目标(在风险不超过 τ\tau 的前提下最大化有用性)被做成了训练配方,只是约束的对象从请求换成了输出。

与运行时安全的边界

训练时安全必要,但不充分。它必要,是因为模型默认行为本来就该在多数时候尊重策略。它不充分,是因为部署系统会面对新攻击、变化中的政策、工具权限、司法辖区差异,以及模型从未见过的数据。第 57 章 会在模型周围加入过滤器、分类器和响应闸门。第 56 章 会加入能力控制,使模型不能仅凭文本要求就采取行动。第 58 章 则研究越狱以及其他探测这条习得边界的方法。

因此,后训练这一层是模型行为的第一道防线,而不是整个系统的最后一道防线。

争议所在

指令层级和基于政策的显式推理会提升鲁棒性,但不会形成形式化安全边界。模型可以被训练去忽略未受信任指令,仍可能在新组合、长上下文攻击或工具中介的含糊情境里失败。权限既要被模型学习,也要由周围系统强制执行。

下层约束

安全调优设定模型的默认行为,真正的硬边界则属于运行时控制。第 57 章 决定回复何时被过滤或加闸,第 56 章 决定模型能采取哪些动作,第 58 章 则在攻击下探测这条边界。因此,后训练策略只是更大控制系统中的一层,不是它的替代品。

  • Wallace et al., “The Instruction Hierarchy: Training LLMs to Prioritize Privileged Instructions,” 2024. arXiv:2404.13208
    指令层级训练模型在冲突中选择性忽略低权限指令,从而提高对提示注入与越狱的鲁棒性,同时尽量减少能力损失。
  • OpenAI, “Model Spec” (snapshot dated 2025-12-18), 2025. model-spec.openai.com
    Model Spec 定义模型目标行为,并规定用来解决指令冲突的权限层级。
  • Guan et al., “Deliberative Alignment: Reasoning Enables Safer Language Models,” 2024. arXiv:2412.16339
    Deliberative Alignment 将安全规范教给模型,并训练其在回答前依据规范推理,从而同时提升越狱鲁棒性并降低过度拒绝。
  • Bai et al., “Constitutional AI: Harmlessness from AI Feedback,” 2022. arXiv:2212.08073
    Constitutional AI 通过成文原则、自我批判、修订与 AI 反馈,训练无害但不过度回避的助手行为。
  • Yuan et al., “From Hard Refusals to Safe-Completions: Toward Output-Centric Safety Training” (safe-completions training, shipped in GPT-5), 2025. arXiv:2508.09224
    安全补全训练用以输出为中心的目标取代二元拒绝:在输出安全约束下最大化有用性;该方法用于 GPT-5,在意图分类失灵的双用途提示上同时改善安全性与有用性。

评论

登录后评论