AI 基建
0%
第七部分 · 评测 · 第 48 章

把统计可靠性写成决策契约

作者Changkun Ou
阅读时长约 12 分钟

只有评测设计说明了它在估计什么,基准分数才是估计值。在一套固定且结果确定的题目上,73% 就只是答对题目的比例。只有团队明确目标总体、抽样过程,以及分析打算涵盖哪些变异来源,它才能成为未来任务表现的证据。

这个区别会改变发布问题。「B 的分数是否高于 A?」通常问得不够。更有用的问题接近下面这样:

在目标任务总体上,按照生产环境的解码和评分协议,B 相比 A 的优势是否大到值得行动,同时又没有违反任何护栏?

本章把这个问题整理成一份分析契约。它区分项目、运行和评分者带来的变异,保留配对关系,根据足以影响决策的效应规划评测,并把结果的不确定与测量工具的偏差分开。第 47 章 中的基准契约规定测量什么,本章则说明观测数据能在多大程度上支持一项决策。

2026-06-23T18:50:31.948314 image/svg+xml Matplotlib v3.11.0, https://matplotlib.org/ 模型 A 模型 B 模型 C 68 70 72 74 76 78 带 95% 置信区间的分数估计 看得见的差距,证据仍弱 更清楚的分离
图 48.1. 三组分数估计及各自的 95% 置信区间。图中说明点估计带有不确定性;两个独立区间是否重叠,都不能直接回答配对比较的问题。应当比较模型差值本身的区间。数值仅作示意,并非实测数据。

先明确估计目标,再讨论区间

区间无法挽救一个没有定义清楚的目标。第一步是明确估计目标(estimand),也就是评测究竟要估计哪一个量。对系统 ss 而言,一种通用写法是

θs=EUP,RQ,JH[m(s,U,R,J)].\theta_s = \mathbb{E}_{U \sim P,\, R \sim Q,\, J \sim H} \left[m(s, U, R, J)\right].

这里,UU 是从目标总体 PP 中抽取的独立抽样单位;RR 是从生产分布 QQ 中抽取的运行配置;JJ 是按评分协议 HH 抽取的人工或自动评分者;mm 是预先声明的指标。这个期望可以对其中一种、两种或全部三种变异取平均,评测必须明确自己涵盖了哪些。

这套表示法可以避免几类常见的概念混淆:

变异来源 示例 必须保留的独立单位 能支持的问题
项目 从下个月工作量中抽取的客服工单 工单、用户或租户 系统处理同类工作时会有怎样的表现?
运行 随机解码或不断变化的工具状态 嵌套在同一任务内的重复运行 已部署策略有多稳定?
评分者 标注员或评判模型的多次采样 嵌套在单个回答或回答对内的裁定 结果对评分判断有多敏感?
时间 跨越多天或多个版本收集的流量 如果不同时段的条件不同,就以时间段为单位 估计结果能否经受运行环境的变化?

表格有多少行,并不自动等于样本量有多大。在同一个代码仓库上尝试二十次,对关于代码仓库的主张而言仍然只有一个仓库。一段对话里的五十个轮次,也不是五十段彼此独立的对话。把相关的行当成彼此独立,只会让区间变窄,不会产生新的证据。

固定测试集还有一种需要单独说明的情况。如果一个确定性模型在冻结清单里的每个项目上都接受评测,而且主张只针对这份清单,那么均值就是完整的描述性结果,没有需要估计的项目抽样误差。此时对项目做 bootstrap,引入了一个假想总体。这个假设或许有用,但报告应当明确写出,而不是把区间说成固定文件本身的属性。运行或评分者带来的不确定性仍可能存在。

让估计方法服从评测设计

nn 个彼此独立的二元项目,如果其中 xx 个成功,观测准确率为

p^=xn.\widehat{p} = \frac{x}{n}.

这里,xx 是成功次数,nn 是独立项目数,p^\widehat{p} 是观测到的成功比例。

常见的正态近似,也叫 Wald 近似,给出的 95% 置信区间半宽为

hWald1.96p^(1p^)n.h_{\mathrm{Wald}} \approx 1.96 \sqrt{\frac{\widehat{p}(1-\widehat{p})}{n}}.

这里,hWaldh_{\mathrm{Wald}} 表示点估计到任一端点的近似距离。根号内是估计的标准误,1.96 则是双侧 95% 区间通常采用的标准正态倍数。

它适合作为规划阶段的粗略估算:精度大致随样本量的平方根提高,因此要把半宽减半,约需四倍的独立项目。但它不是通用于生产评测的区间方法。样本较小或比例接近零和一时,它的覆盖率并不好。对独立的二项比例,应当使用覆盖率更好的方法,例如 Wilson 区间,并记录所用方法 (Brown et al. 2001)。

多数评测需要采用别的处理方式:

  • 对评分准则产生的均值,应当按照实际抽样设计估计均值的不确定性,不要把分数硬改造成虚假的伯努利试验。
  • 如果任务按用户、代码仓库、文档或对话聚类,重采样或建模的单位应当是整个聚类,而不是聚类内的每一行。
  • 对随机运行的重复结果,要把重复运行嵌套在任务之内。先说明多次运行如何合成为任务级指标,再汇总不同任务。
  • 对加权指标,每次重采样都使用同一套预先声明的权重,并报告高权重切片背后的有效样本支持。
  • 对比率、通过率、分位数或非线性复合指标,应当重采样独立单位,再重新计算完整的估计量,而不是对已经汇总的单元格做 bootstrap。

bootstrap 的价值在于,它无需为每种估计量重新推导封闭形式,就能近似其抽样分布 (Efron 1979)。近期研究也把同样的设计原则直接用于语言模型评测 (Miller 2024)。但 bootstrap 不会替你找出正确的独立单位,也无法修复有偏样本。对相关行逐行做 bootstrap,只会忠实地自动执行错误的设计。

95% 置信区间还有一层程序上的含义。按照假定的抽样设计反复取样时,生成区间的程序会按其名义覆盖率覆盖那个固定目标。它并不是说,这个已经算出的频率学派区间有 95% 的概率包含目标。如果改用贝叶斯后验区间,就要说明所用模型和先验,不要悄悄换一种解释。

图 48.2. 这里用上面的简单独立二项近似检查精度,说明样本量与区间宽度之间的平方根关系。它不是功效分析、配对比较或发布规则。

在同一批独立单位上比较系统

如果 A 和 B 处理的是同一批任务,就应当分析它们的配对结果。设 ygAy_{gA}ygBy_{gB} 分别是两个系统在独立单位 gg 上的任务级得分。定义

dg=ygBygA,Δ^=1Gg=1Gdg.d_g = y_{gB} - y_{gA}, \qquad \widehat{\Delta} = \frac{1}{G}\sum_{g=1}^{G} d_g.

这里,dgd_g 是 B 在单位 gg 上相对 A 的变化,GG 是独立单位数,Δ^\widehat{\Delta} 是估计的平均变化。应当根据 dgd_g 构造区间,或对成对聚类进行重采样。分别给 A 和 B 画区间,会丢掉二者的协方差。因此,无论「误差棒重叠」还是「误差棒没有重叠」,都不是判断配对差异是否得到支持的可靠捷径。

对二元结果,还要保留分歧表:

B 正确 B 错误
A 正确 n11n_{11} n10n_{10}
A 错误 n01n_{01} n00n_{00}

这里只有 n10n_{10}n01n_{01} 能区分两个系统,它们分别代表 A 与 B 出现分歧的两个方向。McNemar 检验正是围绕这份配对证据构造的 (McNemar 1947)。常见的大样本统计量为

χ2=(n10n01)2n10+n01.\chi^2 = \frac{(n_{10}-n_{01})^2}{n_{10}+n_{01}}.

分子衡量两种分歧方向之间差额的平方,分母则是分歧总数。

如果分歧数很少,应当使用精确的配对二项方法,而不是依赖这个渐近近似。更重要的是保留效应估计及其区间。检验可以说明数据与零差异模型是否相容,却不能告诉你差异是否重要。

保留每个独立单位的结果,还能暴露均值掩盖的工程取舍。平均分可能提高,但某个安全切片却退化;B 也可能只是用一类新失败换掉另一类旧失败。应当保存任务 ID、双方原始输出、运行 ID、评分器版本、解析结果和配对差值。统计可靠性从可重建的记录开始。

预先说明什么结果会改变决策

产品决策很少以零效应为界。收集决定性样本之前,应当定义最小关注效应 δ\delta。这里的 δ\delta 是考虑成本、延迟和风险之后,足以改变决策的最小收益或损失。

对数值越高越好的指标,设 Δ=θBθA\Delta = \theta_B-\theta_A,它的置信区间可以支持几种不同的主张。这里,θA\theta_AθB\theta_B 是两个系统的目标值,因此 Δ\Delta 表示 B 相对 A 的提升:

预期主张 区间条件 可能的行动
具有实际意义的优势 整个区间高于 +δ+\delta 如果护栏全部通过,可以考虑发布
非劣效 整个区间高于 δ-\delta 可以接受没有实质退化,例如换用成本更低的系统
实际等效 整个区间位于 [δ,+δ][-\delta,+\delta] 把质量视为相当,根据其他约束决定
未解决 区间跨过相关边界 保留基线、补充数据或缩小主张范围

这些是不同的研究设计,不能在看过图之后再任选一个标签。等效检验需要证据表明,在既定程序下,落在预先声明区间之外的效应并不可信;没有拒绝精确的零效应,并不等于证明二者等效 (Lakens et al. 2018)。护栏需要各自的单侧界限。对安全指标,通常要问能否排除有害退化,而不是看它的点估计是否恰好有所改善。

功效也应当在这里处理。功效是指在给定假设下,一套指定程序发现指定效应的概率。因此,样本量规划需要说明效应或界限、错误率、目标功效、结果方差、配对关系和聚类方式。「使用 1,000 个样本」并不构成功效分析。自然语言处理研究经常没有足够功效去识别自己想要声称的微小提升,既更容易漏掉真实效应,也更容易夸大筛选出来的胜利 (Card et al. 2020)。

分析计划还要涵盖无效或缺失结果。超时、解析失败、拒答和评分器错误,不能因为让统计处理变麻烦就消失。应当预先声明每种状态算作失败、单列结果,还是允许重跑;无论如何都要报告它们的发生率。

反复查看和多重主张都会消耗证据

如果每小时运行一次相同测试,并在第一次看到有利区间就停下来,所执行的已经不是区间假设的固定样本程序。择机停止会提高假胜利的概率。诚实的设计有两种:

  1. 冻结样本和分析时间,只做一次决定。
  2. 使用在反复查看时仍能保证错误率的序贯设计,例如置信序列,并记录停止规则 (Howard et al. 2021)。

同一个问题也会出现在仪表盘上。一套评测可能包含许多任务、语言、提示模板、评分者、切片和解码设置。只要搜索足够多的单元格,总会有一些因为偶然波动而显得有利。运行之前就要定义主张族,并给每项结果分配角色:

  • 主要主张: 唯一可以为既定发布决策提供依据的比较。
  • 护栏: 预先声明的单侧检查,可以阻止发布。
  • 确认性次要主张: 数量有限,并按照已声明的多重性处理方法分析。
  • 探索性发现: 为下一次评测提供线索,不算本次评测已经证实的胜利。

族错误率控制限制的是已声明主张族中至少出现一次错误拒绝的概率。错误发现率方法,包括 Benjamini--Hochberg,在各自假设下控制错误发现所占比例的期望值,通常更适合范围较广的探索性主张族 (Benjamini and Hochberg 1995)。两类方法都不能为看过结果之后才挑选主张族的做法正名。所有受测主张都要报告,失败和有利的比较也都要保留。

在同一基准上反复选择模型和提示,会形成第二个自适应循环。只校正某一份报告的 pp 值,无法消除数月排行榜反馈已经泄露的信息。应当记录选择历史,保留一份开发期间无法访问的确认集,并只让最终候选在这份锁定集合上评测一次。可复用留出集方法可以在明确的查询机制下限制信息泄漏,但普通的无限制复用,最终会把基准变成开发数据 (Dwork et al. 2015)。

如果使用 pp 值,它衡量的是数据与指定统计模型有多不相容。它不是零假设为真的概率,也不是结果「由偶然造成」的概率,更不是效应大小或产品重要性的度量 (Wasserstein and Lazar 2016)。报告 pp 值时,应当同时给出估计值、区间、假设和决策边界。

精确无法弥补偏差

不确定性描述的是既定协议下的变异。偏差描述的是该协议与目标主张之间的系统性差异。两者需要不同的处理:

观测现象 可能的问题 应对方式
区间很宽 独立单位太少或变异很大 收集更多单位、采用配对设计或缩小主张范围
污染项目上的区间很窄 抽样框无效 更换测量工具或限定主张
评分者偏好稳定,但存在位置偏差 评分者偏差 随机调整顺序、审计评分者或改用其他协议
单一种子掩盖了重复运行的变异 估计目标不完整 按生产环境的方式抽取运行,并报告其分布
搜索数百个切片后发现某项提升 选择偏差 标记为探索性结果,并用新数据确认

精确的估计也可能精确地错。置信区间并不涵盖污染、标签错误、总体漂移、缺乏代表性的提示组合,或偏爱冗长回答的评分者。这些威胁应当写进基准的效度与审计记录。

校准是一个相关但不同的估计目标。如果模型对置信度为 qq 的结果,在目标总体中确实有 qq 的比例成立,就称模型已经校准 (Guo et al. 2017)。测量校准需要带概率的预测、预先声明的分箱或恰当评分方法,以及以正确单位估计的不确定性。只看准确率无法证明模型已经校准;昨天流量上的校准曲线很漂亮,也不能保证分布变化后仍然校准。

结果应当是一份可复现的决策记录

一个标量远远不够。每项达到发布要求的结果,都应当能够追溯到一份带版本的记录:

EvaluationResult:
  decision_id
  evaluation_spec_hash
  target_population
  system_a_revision
  system_b_revision
  item_manifest_hash
  run_protocol_revision
  scorer_revision
  estimand
  estimator
  independent_unit
  cluster_keys
  repeat_policy
  primary_claim
  effect_margin
  interval_method
  confidence_level
  sequential_rule
  multiplicity_family
  selection_history
  confirmation_set_version
  estimate_a
  estimate_b
  paired_delta
  interval
  invalid_outcome_counts
  slice_and_guardrail_results
  known_validity_limits
  decision

实际流程并不长:

  1. 写明决策、目标总体、估计目标、独立单位和系统边界。
  2. 冻结项目清单、模型、运行框架、运行策略、评分器和缺失结果处理规则。
  3. 声明主要主张、护栏、实际效应界限、分析主张族和停止规则。
  4. 根据评测设计和最小关注效应规划样本量。
  5. 让 A 和 B 在同一批单位上运行,保留原始输出,以及嵌套的重复运行或评分者记录。
  6. 在独立单位层面计算预先声明的估计量和配对区间。
  7. 报告每项计划内主张、无效结果、护栏和已知偏差来源。
  8. 应用预先声明的决策规则。结果仍未解决,就如实说明。

三条不变量让这份记录可以审计:任何一行都不能悄悄改变抽样单位,任何结果都不能悄悄改变主张族,任何发布决策都不能在看到数据之后悄悄修改实际效应界限。

争议所在

频率学派区间、贝叶斯后验区间、随机化检验和分层模型,对不确定性的表达方式并不相同。没有哪一种方法适合所有评测。不能妥协的是这份契约:明确估计目标、独立单位、假设、决策边界和结果解释。方法再复杂,也无法弥补总体定义不清或评分器有偏。

下层约束

服务层和编排层决定哪些分析还做得出来。如果没有稳定的任务、用户、对话、运行、工具、模型和评分者标识,评测层就无法重建配对关系、聚类结构或序贯查看记录。因此,可观测性保存的不只是调试轨迹,还包括实验设计。第 87 章 会利用这些记录建立持续评测循环。

下一章 第 49 章 会深入一种格外重要的评分者,分析指令、评分准则、标注员群体和裁定流程如何共同产生人类标签。统计分析通常把这些标签当作数据,但标签本身也需要解释。

延伸阅读

  • Brown et al., “Interval Estimation for a Binomial Proportion,” 2001. projecteuclid.org
    Brown、Cai 与 DasGupta 说明常见 Wald 区间的覆盖率并不稳定,并推荐了包括 Wilson 得分区间在内的更可靠方法。
  • Lakens et al., “Equivalence Testing for Psychological Research: A Tutorial,” 2018. doi.org
    该教程说明如何用预先声明的等效界限证明效应小于具有实际意义的阈值;对零效应检验不显著并不能提供这种证据。
  • Card et al., “With Little Power Comes Great Responsibility,” 2020. aclanthology.org
    Card 等人发现 NLP 实验普遍功效不足,并说明低功效既使有意义的差异更难检出,也会夸大被筛选出来的正面结果。
  • Howard et al., “Time-Uniform, Nonparametric, Nonasymptotic Confidence Sequences,” 2021. projecteuclid.org
    Howard 等人提出了覆盖保证在时间上统一成立的置信序列,使满足假设时的反复查看仍能进行有效推断。
  • Wasserstein & Lazar, “The ASA's Statement on p-Values: Context, Process, and Purpose,” 2016. doi.org
    美国统计协会声明说明,p 值不是假设为真的概率,也不衡量效应大小或实际重要性。
  • Dwork et al., “The Reusable Holdout: Preserving Validity in Adaptive Data Analysis,” 2015. pubmed.ncbi.nlm.nih.gov
    本文形式化说明普通留出保证为何会在自适应复用下失效,并提出在限制过拟合的同时回答重复查询的受控机制。
  • Efron, “Bootstrap Methods: Another Look at the Jackknife” (为脆弱评测提供自助置信区间), 1979. doi.org
    Efron 提出 bootstrap 自助法,用重采样来估计不确定性,而不必为每个统计量推导封闭形式的抽样分布。
  • Miller, “Adding Error Bars to Evals: A Statistical Approach to Language Model Evaluations” (为 LLM 评测加上误差棒), 2024. arXiv:2411.00640
    Anthropic 把 LLM 评测当作统计推断来处理:报告标准误,题目成组时改用聚类标准误,模型比较用配对差值分析,并用功效分析提前规划样本量。
  • McNemar, “Note on the Sampling Error of the Difference Between Correlated Proportions or Percentages” (配对二元比较), 1947. doi.org
    McNemar 检验通过关注两个系统在同一样本上发生分歧的项目来比较配对二元结果,适合许多基准 A/B 比较。
  • Benjamini & Hochberg, “Controlling the False Discovery Rate: A Practical and Powerful Approach to Multiple Testing” (排行榜天然包含多重比较), 1995. doi.org
    Benjamini 与 Hochberg 提出控制错误发现率的方法,为大量同时检验场景提供比族错误率控制更有检验力的选择。
  • Guo et al., “On Calibration of Modern Neural Networks” (置信度本身也是被测性质), 2017. proceedings.mlr.press
    Guo 等人表明,现代神经网络可以准确却未校准,而简单的温度缩放能显著改善概率校准。

评论

登录后评论