第三部分 · 后训练:适配、偏好与对齐
「语言模型变大,并不自然意味着它更会遵循用户意图。」
Long Ouyang 等,"Training language models to follow instructions with human feedback"
第一部分造出了一个学到文本形状的基座模型,第二部分则讨论了从同一套基础上分出的生成式与多模态架构。后训练是预训练之后的阶段:预训练从原始数据里学到文本的形状,后训练则把这个基座模型导向产品真正想要的行为。这一部分回到那个基座模型,以及它留下的缺口:它学到的是文本和世界痕迹的形状,还不是一个产品想要的行为。它可能知道很多事,却不知道什么时候该拒绝,什么时候该解释,在指令冲突里该服从谁,怎样的回答更合人意,怎样的风格适合一个具体场景。能力已经在权重里,但还需要被指向、约束、排序、检验。
第 17 章 从最直接的做法讲起,用示范数据改变模型行为,并用参数高效微调避免重写整套权重。第 18 章 先把偏好信号本身拆开:行为规格、宪章、标注协议、多属性偏好数据,都会在优化器接触这些样本之前决定「更好」是什么意思。第 19 章 进入奖励建模回路:人或自动系统给出比较,训练过程再把这些比较变成奖励代理,也就是一个替人给答案打分的习得模型。第 20 章 说明为什么这条回路可以折进直接偏好目标里,也说明那些变体真正不同的是哪一组平衡。第 21 章 把习得奖励与可核查奖励分开,并由此接到 第 28 章。第 22 章 则把同一套后训练机制带到拒绝、指令层级和对成文策略的显式推理。第 23 章 最后把循环再往前推一步,让模型参与生成数据、过滤数据、替代标注者,甚至根据检查器的反馈改进自己。
至于「更好」本身,它从来不是凭空出现的,总要落到某个信号上:示范、偏好、奖励、检查器、过滤器。适配的关键不是口号里的对齐(即把模型的行为塑造得有用、安全,而不只是准确),而是判断这个信号是否可靠,哪里可能被利用,又由谁来纠正。
评论
登录后评论