AI 基建
0%
第三部分 · 后训练

第三部分 · 后训练:适配、偏好与对齐

作者Changkun Ou
阅读时长约 2 分钟

「把语言模型做得更大,并不会自动让它更善于遵循用户意图。」

Long Ouyang 等,"Training language models to follow instructions with human feedback"

第一部分得到的基座模型学会了文本的结构与规律,第二部分则讨论了从同一基础分化出来的生成式与多模态架构。所谓后训练,就是预训练完成后继续调整模型的阶段。预训练从原始数据中学习文本的结构与规律,后训练则让这个基座模型表现出产品实际需要的行为。本部分重新回到基座模型,处理预训练留下的缺口:它还不知道产品希望它采取什么行为,也不知道策略要求它拒绝哪些请求;不同来源的要求发生冲突时,它该以哪一方为准;面对多个答案时,人会偏好哪一个。权重中已经包含大量能力,但能力本身并不是可用的接口。要把这些能力变成产品接口,还需要引导和约束模型,对输出排序并加以检验,有时还要教它偏好一种回答而非另一种。

第 17 章 从最直接的干预开始:用示范改变模型行为,通常只训练小型适配器,而不必改写整个模型。第 18 章 接着追问偏好信号究竟表示什么,并在优化器接触数据之前,梳理行为规格、宪章、标注规范和多属性偏好数据。到了 第 19 章,奖励建模回路登场:系统不再依赖唯一正确答案,而是从回答间的比较中学习,并用奖励代理替人评分;这个代理本身也是一个习得模型。第 20 章 说明如何用代数方法把这条回路化简为直接偏好目标,也说明各类变体的差别不在口号,而在它们如何权衡不同目标。第 21 章 随后将习得奖励与可核查奖励分开。这一转折把本部分接到 第 28 章 的推理机制上。第 22 章 沿着同一套后训练体系,讨论拒绝、指令层级,以及模型如何依据成文策略作出判断。第 23 章 最后让数据循环闭合:当数据不再直接来自人类标注者时,模型自己参与生成、筛选、评判并改进数据。

随着讨论推进,本部分会逐步收窄「对齐」一词的含义。这里的对齐,是把模型行为塑造成有帮助且安全,而不仅仅是准确。它所指的并不是一个在所有意义上都「好」的模型,而是我们选择什么训练信号、愿意承受哪些代理失效,以及决定监督机制应在回路的哪个位置介入。此时需要付出的不只是算力,还有对训练信号的信任,因为正是它告诉模型何为「更好」。

评论

登录后评论