AI 基建
0%
小结

小结

作者Changkun Ou
阅读时长约 1 分钟

第三部分从基座模型所缺的行为接口出发。示范、适配器、行为规格、偏好比较、奖励模型、直接偏好目标、可核查奖励、安全策略和合成数据回路,都在界定模型应该保留哪些行为。尽管采用不同的优化器和流水线,它们都有一项共同依赖:必须有某种信号告诉模型,什么样的行为算得上更好。

最脆弱的正是这项信号本身。规格不充分时,模型会学会表面风格,忽略实质要求。信号存在可利用的漏洞时,模型会把奖励当作博弈目标。评判者能力不足时,回路可能对它过拟合,即使实际表现没有改善,内部指标仍可能显得更好。因此,本部分关注的对齐首先是一项治理问题,治理对象包括信号、评审者、过滤器、验证器和策略文本。

贯穿全书的检验标准很简单:信号由谁写出,怎样核查,在哪里失效,以及系统何时获准信任自身输出。仍待回答的是,合成数据、AI 反馈和验证器能把改善推进多远;再往前时,评判者、过滤器或策略是否会成为新的能力上限。第四部分将问题转向推断时:哪些工作可以不固化进权重,而在收到请求后再完成,包括搜索、核查、工具调用、推理轨迹,以及只在请求确有需要时才投入的额外计算。

评论

登录后评论