运营评测与治理
离线评测告诉团队,一个模型在受控集合上做了什么。生产评测告诉团队,一个正在运行的系统是否应该继续运行、回滚、请求人工复核,或把新的失败收进下一轮回归套件。两者相连,但不是同一件事。
本章作为第七部分的收尾,把测量变成一项运营纪律。它不重复 第 87 章 里的工具连接,而是定义发布门禁、私有套件、漂移检查、质量-成本前沿、文档和治理契约,正是这些让那些工具有了意义。
发布门禁是一条策略
运营评测套件和研究基准的职责不同。研究基准问的是,在一套公开协议下哪个系统更好。发布门禁问的是,这个具体系统版本是否可以影响用户。因此,门禁是一条策略,不是一张图。
这条策略需要四个字段:
- 范围。 哪个模型、提示、检索索引、工具集、护栏和路由规则正在受测。
- 阈值。 哪些指标必须提升,哪些不能退化,不确定性如何处理。
- 权限。 谁可以覆盖门禁,覆盖时必须记录什么证据。
- 回退。 门禁失败时怎么办:回滚、shadow、人工复核、缩小流量,或补采数据。
这是 第 48 章 的运营版本。没有决策规则的数字,会让每次运行之后都陷入争论;没有不确定性的决策规则,又会变成脆弱自动化。门禁需要两者同时存在。
四道门不该使用完全相同的指标。离线回归套件擅长抓已知失败;shadow 流量擅长抓集成问题:缺工具、schema 错、延迟意外、检索失效。金丝雀擅长在小影响半径内发现分布迁移。生产监控擅长发现漂移和长尾失败。把其中任何一个当成其余几个的替代,都会制造那种熟悉的虚假安慰:系统通过了最容易通过的测试。
私有套件是一项资产
生产系统里最有价值的评测集,往往是无法公开的那一套。公开基准能让工作可比较,但会因为饱和和污染而衰退。私有套件不利于公开排名,却更适合发布决策,因为它可以装入组织自己的失败、政策、客户边界条件和业务成本。
这套套件需要生命周期管理:
PrivateEvalSuite:
source # 事故、工单、红队运行、专家样本、合成探针
owner # 对该失败模式负责的团队
label_protocol # 人类、可执行检查、评判者、状态检查
severity # 阻断发布、护栏、探索
exposure # 谁见过该项目或答案
version # 不可变项目版本
rotation_policy # 何时退休、刷新或隐藏
这正是运营评测继承 第 47 章 教训的地方。套件不是一个提示文件夹,而是一项完整性会被消耗的资产。答案每次泄入训练数据,提示每次被贴到公开 issue,模型每次对着同一项目调优,这套套件判断下一个模型的能力都会下降。轮换不是文书工作,而是门禁继续有效的方式。
Sculley 等人关于隐性技术债的论证,在这里直接适用:模型周围的评测框架、数据依赖和未记录消费者,可能成为系统最大的维护负担 (Sculley et al. 2015)。Breck 等人的 ML Test Score 也从运营角度讲了同一件事:数据、模型、基础设施和监控测试共同构成生产就绪标准 (Breck et al. 2017)。
漂移不止一种
漂移指的是线上输入或行为随时间改变,发生在一个已经通过门禁的版本正在服务用户之后。生产漂移常被当成一个现象,但真正利于调试的切分更细。
- 输入漂移。 用户请求变了,从闲聊转向高风险工作流。
- 上下文漂移。 检索语料、索引、排序模型或文档解析器变了。
- 模型漂移。 托管模型版本改变,或路由策略改变了不同任务会进入哪个模型。
- 策略漂移。 产品、法律或安全策略变化,允许行为也随之变化。
- 指标漂移。 评判者、rubric 或遥测 schema 发生变化。
D'Amour 等人把注意力放在欠定上:许多预测器可以有相近的留出性能,却在部署中表现不同 (D'Amour et al. 2020)。LLM 系统继承了这个问题,还添了更多活动部件。两个版本可以离线打平,却因为提示模板把用户导向不同行为,或检索器改变证据分布,而在线分岔。
所以,运营评测需要为每个分数保存来源。不只要知道哪个模型回答,还要知道哪个提示模板、模型网关路由、工具 schema、检索索引、评判者版本和策略版本参与其中。OpenTelemetry 的 GenAI 语义约定,是试图让这类轨迹跨工具和厂商可携带的一种努力 (OpenTelemetry n.d.)。第 87 章 会讲具体连接;这里的原则是,没有来源的分数无法审计。
质量不是唯一轴
原始质量最高的模型,未必是正确的生产选择。用户感受到延迟,财务团队看到成本,安全团队看到风险,运维者看到失败率。所以,评测应报告前沿,而不是单一胜者。
一个实用的标量可以写成:
其中 是任务质量, 是每任务成本, 是延迟, 是风险或预期复核负担, 是你手动设定的权重,用来表示产品的运营优先级,而不是从数据中学到的参数。这个公式不是通用指标,而是一种迫使权衡显形的工具。客服机器人和代码修复智能体不该使用同一组权重。
这把本章接到 第 76 章。价格变化可以在能力不变的情况下,把一个模型推上或推离前沿。第 82 章 里的更快服务,可以让一个略弱的模型成为更好的运营点。第 91 章 里的更好人工复核表面,可以通过提前捕获不确定样本,降低 。
治理把证据变成记忆
评测证据只有被写进发布会议之后仍然可追溯的形式里,才会变成治理。模型卡报告预期用途、评测过程和分组性能 (Mitchell et al. 2019)。Datasheets for Datasets 为评测和训练依赖的数据做同一件事 (Gebru et al. 2021)。NIST 的 AI Risk Management Framework 则把 measure 与 govern、map、manage 一同列为核心功能 (National Institute of Standards and Technology 2023)。
这些文档有时被当成合规文书。对生产 AI 系统来说,把它们当成运营记忆更有用:
- 哪些评测挡住了上一次发布;
- 哪些切片已知薄弱;
- 哪些私有套件不得进入训练;
- 哪些人工复核门是强制的;
- 哪些基准主张是公开、私有或已废弃的;
- 哪些事故生成了哪些回归测试。
最后一条最重要。每一次严肃生产失败,都应变成一个回归测试,或一个被明确接受的风险。两者都没有发生,组织就没有从失败中学习,只是从失败中恢复了。
真正困难的边界是,发布权限应自动化到什么程度。全人工复核慢且不一致;全自动门禁又可能过拟合老套件,并因错误理由阻断改进。可操作的中间状态是分层权限:确定性断言和高置信回归自动阻断,含混或高影响变更交给人工复核,业务 owner 接受风险时留下明确覆盖记录。这没有单一分数漂亮,但生产系统很少沿着一项指标失败。
运营评测受部署生命周期约束。如果 第 89 章 无法把新版本路由到 shadow 或金丝雀流量,评测层就只有离线证据。如果 第 88 章 绕过模型网关,评判者调用和应用调用就无法在同一套路由、预算和轨迹方案下比较。发布门禁有多真实,取决于它下面的平台原语有多真实。
延伸阅读
- Sculley et al., “Hidden Technical Debt in Machine Learning Systems” (评测债务也是系统债务), 2015. papers.nips.ccSculley 等人描述机器学习系统中的隐性技术债,包括边界侵蚀、纠缠、数据依赖和未声明消费者。
- Breck et al., “The ML Test Score: A Rubric for ML Production Readiness and Technical Debt Reduction” (把测试作为生产就绪标准), 2017. research.googleML Test Score 提供覆盖数据、模型、基础设施与监控测试的生产就绪评分准则。
- D'Amour et al., “Underspecification Presents Challenges for Credibility in Modern Machine Learning” (离线分数相同也可能隐藏不同部署行为), 2020. arXiv:2011.03395本文指出现代机器学习流水线常常欠定:许多预测器留出性能相近,却在部署环境中表现不同。
- National Institute of Standards and Technology, “Artificial Intelligence Risk Management Framework (AI RMF 1.0)” (把度量作为风险管理功能), 2023. nist.govNIST AI RMF 1.0 将 AI 风险管理组织为治理、映射、度量和管理四类功能,贯穿 AI 生命周期。
- Mitchell et al., “Model Cards for Model Reporting” (评测披露), 2019. arXiv:1810.03993模型卡记录预期用途、评测过程和分组性能,支持关于模型部署的透明决策。
- Gebru et al., “Datasheets for Datasets” (不只记录模型,也记录评测数据), 2021. arXiv:1803.09010数据表框架提出标准化数据集文档,覆盖动机、构成、采集、预处理、用途、发布和维护。
- OpenTelemetry, “OpenTelemetry GenAI conventions” (AI 调用的可携带轨迹), 2026. github.comOpenTelemetry GenAI 语义约定为跨厂商追踪模型调用、智能体步骤和生成式 AI 系统行为定义属性与 span。
评论
登录后评论