AI 基建
0%
第七部分 · 评测 · 第 53 章

运营评测与治理

作者Changkun Ou
阅读时长约 7 分钟

离线评测告诉团队,一个模型在受控集合上做了什么。生产评测告诉团队,一个正在运行的系统是否应该继续运行、回滚、请求人工复核,或把新的失败收进下一轮回归套件。两者相连,但不是同一件事。

本章作为第七部分的收尾,把测量变成一项运营纪律。它不重复 第 87 章 里的工具连接,而是定义发布门禁、私有套件、漂移检查、质量-成本前沿、文档和治理契约,正是这些让那些工具有了意义。

2026-06-23T18:51:23.321944 image/svg+xml Matplotlib v3.11.0, https://matplotlib.org/ 0.0 0.5 1.0 1.5 2.0 2.5 每任务相对成本 55 60 65 70 75 80 85 90 任务质量 小模型 路由组合 前沿 慢速巨型模型 便宜但弱 被支配:成本更高 质量没有有用提升 气泡大小 = 延迟
图 53.1. 质量、成本与延迟共同形成运营前沿,也就是一条 Pareto 前沿:在这组运营点上,无法改善一项指标而不让另一项变差。最佳运营点很少就是原始基准分数最高的模型;被支配的选择,也就是落在前沿之外的那些,会付出更多成本或更高延迟,却没有足够质量收益。示意图,非实测数据。

发布门禁是一条策略

运营评测套件和研究基准的职责不同。研究基准问的是,在一套公开协议下哪个系统更好。发布门禁问的是,这个具体系统版本是否可以影响用户。因此,门禁是一条策略,不是一张图。

这条策略需要四个字段:

  • 范围。 哪个模型、提示、检索索引、工具集、护栏和路由规则正在受测。
  • 阈值。 哪些指标必须提升,哪些不能退化,不确定性如何处理。
  • 权限。 谁可以覆盖门禁,覆盖时必须记录什么证据。
  • 回退。 门禁失败时怎么办:回滚、shadow、人工复核、缩小流量,或补采数据。

这是 第 48 章 的运营版本。没有决策规则的数字,会让每次运行之后都陷入争论;没有不确定性的决策规则,又会变成脆弱自动化。门禁需要两者同时存在。

CI 离线 CI 回归套件 SH shadow 流量 不影响用户 CI->SH RB 回滚或 人工复核 CI->RB 失败 CA 金丝雀 小影响半径 SH->CA SH->RB 失败 PR 生产 监控 CA->PR CA->RB 失败 DS 新失败 进入套件 PR->DS 采样失败 DS->CI
图 53.2. 运营评测穿过越来越接近真实流量的门禁。每道门的影响半径和证据类型都不同:离线回归抓已知失败,shadow 流量抓集成失败,金丝雀抓用户分布失败,生产监控抓漂移。

四道门不该使用完全相同的指标。离线回归套件擅长抓已知失败;shadow 流量擅长抓集成问题:缺工具、schema 错、延迟意外、检索失效。金丝雀擅长在小影响半径内发现分布迁移。生产监控擅长发现漂移和长尾失败。把其中任何一个当成其余几个的替代,都会制造那种熟悉的虚假安慰:系统通过了最容易通过的测试。

私有套件是一项资产

生产系统里最有价值的评测集,往往是无法公开的那一套。公开基准能让工作可比较,但会因为饱和和污染而衰退。私有套件不利于公开排名,却更适合发布决策,因为它可以装入组织自己的失败、政策、客户边界条件和业务成本。

这套套件需要生命周期管理:

PrivateEvalSuite:
  source             # 事故、工单、红队运行、专家样本、合成探针
  owner              # 对该失败模式负责的团队
  label_protocol     # 人类、可执行检查、评判者、状态检查
  severity           # 阻断发布、护栏、探索
  exposure           # 谁见过该项目或答案
  version            # 不可变项目版本
  rotation_policy    # 何时退休、刷新或隐藏

这正是运营评测继承 第 47 章 教训的地方。套件不是一个提示文件夹,而是一项完整性会被消耗的资产。答案每次泄入训练数据,提示每次被贴到公开 issue,模型每次对着同一项目调优,这套套件判断下一个模型的能力都会下降。轮换不是文书工作,而是门禁继续有效的方式。

Sculley 等人关于隐性技术债的论证,在这里直接适用:模型周围的评测框架、数据依赖和未记录消费者,可能成为系统最大的维护负担 (Sculley et al. 2015)。Breck 等人的 ML Test Score 也从运营角度讲了同一件事:数据、模型、基础设施和监控测试共同构成生产就绪标准 (Breck et al. 2017)。

漂移不止一种

漂移指的是线上输入或行为随时间改变,发生在一个已经通过门禁的版本正在服务用户之后。生产漂移常被当成一个现象,但真正利于调试的切分更细。

  • 输入漂移。 用户请求变了,从闲聊转向高风险工作流。
  • 上下文漂移。 检索语料、索引、排序模型或文档解析器变了。
  • 模型漂移。 托管模型版本改变,或路由策略改变了不同任务会进入哪个模型。
  • 策略漂移。 产品、法律或安全策略变化,允许行为也随之变化。
  • 指标漂移。 评判者、rubric 或遥测 schema 发生变化。

D'Amour 等人把注意力放在欠定上:许多预测器可以有相近的留出性能,却在部署中表现不同 (D'Amour et al. 2020)。LLM 系统继承了这个问题,还添了更多活动部件。两个版本可以离线打平,却因为提示模板把用户导向不同行为,或检索器改变证据分布,而在线分岔。

所以,运营评测需要为每个分数保存来源。不只要知道哪个模型回答,还要知道哪个提示模板、模型网关路由、工具 schema、检索索引、评判者版本和策略版本参与其中。OpenTelemetry 的 GenAI 语义约定,是试图让这类轨迹跨工具和厂商可携带的一种努力 (OpenTelemetry n.d.)。第 87 章 会讲具体连接;这里的原则是,没有来源的分数无法审计。

质量不是唯一轴

原始质量最高的模型,未必是正确的生产选择。用户感受到延迟,财务团队看到成本,安全团队看到风险,运维者看到失败率。所以,评测应报告前沿,而不是单一胜者。

图 53.3. 质量、成本与延迟定义运营前沿。拖动惩罚权重:当成本或延迟在运营中足够重要时,原始质量最高的模型会停止成为最佳选择。

一个实用的标量可以写成:

U(m)=Q(m)λcC(m)λlL(m)λrR(m),U(m) = Q(m) - \lambda_c C(m) - \lambda_l L(m) - \lambda_r R(m),

其中 QQ 是任务质量,CC 是每任务成本,LL 是延迟,RR 是风险或预期复核负担,λ\lambda 是你手动设定的权重,用来表示产品的运营优先级,而不是从数据中学到的参数。这个公式不是通用指标,而是一种迫使权衡显形的工具。客服机器人和代码修复智能体不该使用同一组权重。

这把本章接到 第 76 章。价格变化可以在能力不变的情况下,把一个模型推上或推离前沿。第 82 章 里的更快服务,可以让一个略弱的模型成为更好的运营点。第 91 章 里的更好人工复核表面,可以通过提前捕获不确定样本,降低 R(m)R(m)

治理把证据变成记忆

评测证据只有被写进发布会议之后仍然可追溯的形式里,才会变成治理。模型卡报告预期用途、评测过程和分组性能 (Mitchell et al. 2019)。Datasheets for Datasets 为评测和训练依赖的数据做同一件事 (Gebru et al. 2021)。NIST 的 AI Risk Management Framework 则把 measure 与 govern、map、manage 一同列为核心功能 (National Institute of Standards and Technology 2023)。

这些文档有时被当成合规文书。对生产 AI 系统来说,把它们当成运营记忆更有用:

  • 哪些评测挡住了上一次发布;
  • 哪些切片已知薄弱;
  • 哪些私有套件不得进入训练;
  • 哪些人工复核门是强制的;
  • 哪些基准主张是公开、私有或已废弃的;
  • 哪些事故生成了哪些回归测试。

最后一条最重要。每一次严肃生产失败,都应变成一个回归测试,或一个被明确接受的风险。两者都没有发生,组织就没有从失败中学习,只是从失败中恢复了。

争议所在

真正困难的边界是,发布权限应自动化到什么程度。全人工复核慢且不一致;全自动门禁又可能过拟合老套件,并因错误理由阻断改进。可操作的中间状态是分层权限:确定性断言和高置信回归自动阻断,含混或高影响变更交给人工复核,业务 owner 接受风险时留下明确覆盖记录。这没有单一分数漂亮,但生产系统很少沿着一项指标失败。

下层约束

运营评测受部署生命周期约束。如果 第 89 章 无法把新版本路由到 shadow 或金丝雀流量,评测层就只有离线证据。如果 第 88 章 绕过模型网关,评判者调用和应用调用就无法在同一套路由、预算和轨迹方案下比较。发布门禁有多真实,取决于它下面的平台原语有多真实。

延伸阅读

  • Sculley et al., “Hidden Technical Debt in Machine Learning Systems” (评测债务也是系统债务), 2015. papers.nips.cc
    Sculley 等人描述机器学习系统中的隐性技术债,包括边界侵蚀、纠缠、数据依赖和未声明消费者。
  • Breck et al., “The ML Test Score: A Rubric for ML Production Readiness and Technical Debt Reduction” (把测试作为生产就绪标准), 2017. research.google
    ML Test Score 提供覆盖数据、模型、基础设施与监控测试的生产就绪评分准则。
  • D'Amour et al., “Underspecification Presents Challenges for Credibility in Modern Machine Learning” (离线分数相同也可能隐藏不同部署行为), 2020. arXiv:2011.03395
    本文指出现代机器学习流水线常常欠定:许多预测器留出性能相近,却在部署环境中表现不同。
  • National Institute of Standards and Technology, “Artificial Intelligence Risk Management Framework (AI RMF 1.0)” (把度量作为风险管理功能), 2023. nist.gov
    NIST AI RMF 1.0 将 AI 风险管理组织为治理、映射、度量和管理四类功能,贯穿 AI 生命周期。
  • Mitchell et al., “Model Cards for Model Reporting” (评测披露), 2019. arXiv:1810.03993
    模型卡记录预期用途、评测过程和分组性能,支持关于模型部署的透明决策。
  • Gebru et al., “Datasheets for Datasets” (不只记录模型,也记录评测数据), 2021. arXiv:1803.09010
    数据表框架提出标准化数据集文档,覆盖动机、构成、采集、预处理、用途、发布和维护。
  • OpenTelemetry, “OpenTelemetry GenAI conventions” (AI 调用的可携带轨迹), 2026. github.com
    OpenTelemetry GenAI 语义约定为跨厂商追踪模型调用、智能体步骤和生成式 AI 系统行为定义属性与 span。

评论

登录后评论