AI 基建
0%
第七部分 · 评测

第七部分 · 评测

作者Changkun Ou
阅读时长约 1 分钟

「所有模型都是错的,但有些模型有用。」

George E. P. Box,"All models are wrong"

评测看起来像结尾处的打分,实际会一路改写前面的选择。一个基准会改变训练目标,一个评判者会改变后训练偏好,一个智能体评测会重塑运行框架,其分量不亚于模型本身。第七部分因此不把评测当成外部裁判,而把它当作系统的一部分来读。

第 47 章 先拆开一个基准数字背后的契约:留出数据、清楚的框架、稳定评分,以及这些条件为什么会衰退。第 48 章 接着问,观测到的差距是否大到值得相信。第 49 章 把人类标签当成一件被设计出来的仪器,而不是原子事实。第 50 章 处理模型评判者与偏好市场,评判者在这里既是工具,也是新的偏差来源。第 51 章 把流畅与有据分开,逐一核查回答里的 claim 与证据。第 52 章 再把状态、工具和后果加进来:评测一个智能体,不能只听它讲自己做了什么,还要看任务完成后的世界变成了什么样。第 53 章 最后把测量接回发布门禁、回滚和回归套件。

这里需要保持怀疑,但不必走向犬儒。坏评测很容易嘲笑,有用评测却是很难的工程。真正要学的是:哪些数字足以推动决策,哪些数字只够触发调查,哪些数字其实测的是框架而不是模型。

评论

登录后评论