小结
小结
第三部分从基座模型缺少的接口讲起。示范、适配器、行为规格、偏好比较、奖励模型、直接偏好目标、可验证奖励、安全策略和合成数据回路,都在回答同一个问题:哪一种行为应该留下来?它们的优化器和流水线不同,但都依赖某种信号来说明什么叫更好。
脆弱的正是这个信号。信号过于含糊,模型就会学到风格而不是实质;信号可以被利用,奖励就会沦为可钻空子的目标;评判者不够强,回路就可能对它过拟合,却仍然显得在进步。因此,这一部分不把对齐当成口号,而是看成一种治理,治理的对象是信号、评审者、过滤器、验证器和策略文本。
读者往下读时,可以反复追问四件事:谁写下了这个信号,它怎样被检查,又在哪里失效,以及系统什么时候才能信任自己的输出。未解的问题,是合成数据、AI 反馈和验证器还能把模型推多远,才会撞上评判者、过滤器或策略本身形成的新上限。第四部分要问的是,哪些工作不必被完全固化进权重,而可以留到推断时再做:搜索、验证、工具调用、轨迹记录,以及只在请求需要时才追加的计算。
评论
登录后评论