小结
小结
第七部分一开始像是在讨论外部打分,读下去才发现,分数会反过来改写系统:基准改变训练激励,统计检验决定差异是否足以相信,评分规程塑造人类标签,模型评判者带来自己的偏差,事实性评测拆开 claim 与证据,智能体评测必须检查任务后的世界,运营评测则决定一次发布能不能继续。
测量很容易在不知不觉中失真:数据会泄漏,任务会饱和,样本可能不足,评判者会被利用,基准也可能转去测运行框架而不是模型本身。因此,一个数字在挡发布、驱动训练或改变产品决策之前,必须先说明自己的权威等级。
读者读完应当保留怀疑,但不必走向犬儒。坏评测容易嘲笑,有用评测却是很难的工程。仍未解决的问题,是怎样在仪器饱和或变成优化目标之前,可靠测量长程任务、职场生产率和智能体副作用。第八部分接着问:一旦系统要被约束,什么证据足够支撑安全主张,谁有权限施加约束,这些约束又在哪里真正执行。
评论
登录后评论