AI 基建
0%
第七部分 · 评测 · 第 49 章

人类评测与评分准则

作者Changkun Ou
阅读时长约 7 分钟

人类标签不是原子事实。它是一套协议的产物:请了谁、给他们看了什么、他们遵守哪份评分准则、分歧如何仲裁、哪些样本后来被审计。若协议本身很弱,把结果称作「人类判断」只会把弱点藏起来。

本章位于统计和模型评判者之间,把人类评测当成一件需要先设计、校准和版本化的仪器:只有这样,它才能在 第 19 章 中训练奖励,在 第 50 章 中校验评判者,或在 第 53 章 中为发布把关。

协议创造了标签

「人类偏好」这个词很容易让人以为标签早已存在于标注者脑中。并非如此。标签由一连串选择造出来:抽样、任务表述、界面、评分准则、标注者选择、训练、质量控制、聚合与仲裁。一个模型回答并不会在抽象意义上得到人类标签;它只会在某一套协议下得到标签。

S 抽样提示 与输出 I 标注 界面 S->I R 评分准则 与示例 I->R A 标注者人群 与训练 R->A Q 质量检查 与一致性 A->Q D 仲裁 Q->D L 版本化 标签 D->L
图 49.1. 人类评测是一条测量流水线。最终标签受到抽样、界面、评分准则、标注者人群、可靠性检查与仲裁的共同塑造。只把最终分数当作数据,会把信号在哪里被制造出来藏掉。

正因如此,人类评测并不会自动解决评测问题。Karpinska 等人发现,众包工人即便经过筛选,也可能无法区分开放式故事中的机器文本和人类文本;英语教师和成对示例则能提供更强的信号 (Karpinska et al. 2021)。Clark 等人从另一个角度给出类似警告:随着生成文本越来越流畅,未经训练的评审可能只能在随机水平上区分 GPT-3 文本与人类文本 (Clark et al. 2021)。人类可能是合适的测量仪器,但这件仪器仍然需要测量设计。

对 LLM 系统来说,设计的第一步是看它服务哪个决策。广泛模型比较可以使用普通用户和成对偏好;医疗摘要发布可能需要领域专家和事实错误类别;安全门禁可能需要对抗性评审和伤害分类;产品任务可能需要让用户完成真实下游工作,而不是只盯着文本打分。评审人群本身,就是评测主张的一部分。HealthBench 把这套设计做到了规模化:262 位医生(执业经验覆盖 60 个国家)为每段对话撰写评分准则,共 48,562 条,而应用这些准则的模型评判者,也要先对照医生评分接受核验,其分数才作数 (Arora et al. 2025)。

评分准则是判断的界面

评分准则不是分数外面的装饰,而是测量契约。它告诉评审什么算缺陷、什么可以忽略、不同维度冲突时如何处理,以及不确定时该怎么做。弱准则会把许多性质压进一个含糊的词,通常是「质量」。强准则会把不该暗中交易的维度拆开。

一份有用的 LLM 评分准则通常至少包含四个设计选择:

  • 决策轴。 要判断的性质:正确性、有用性、忠实性、安全性、语气、简洁性或任务成功。
  • 单位。 要判断的对象:回答、claim、引用、轮次、完整对话、工具调用或最终状态。
  • 尺度。 二元通过/失败、有序等级、成对偏好或连续分数。
  • 证据规则。 评审可以使用什么:仅模型输出、检索上下文、标准答案、执行轨迹或生产状态。

这些选择都应版本化。评分准则从「偏好完整回答」改成「偏好简洁回答」,即便模型没有变化,也可能反转排名。在 第 50 章 里,同一个问题会以模型评判者的形式再次出现:评判者提示会把评分准则编码进评测程序。

评分准则还决定这份评测能否后来变成训练数据。在 第 19 章 里,示范和成对偏好会被用来训练奖励模型,也就是学着像人类那样给输出打分的模型,让这个分数在训练中代替真人。若原始准则奖励冗长,奖励模型就会继承这种偏好。若它没有把事实性和礼貌分开,模型可能学会以正确性为代价变得更迎合。人类评测既在行为之后,也在行为之前。

一致性也要被测量

原始一致率是很差的可靠性度量,因为容易的样本会把它推高。如果 95% 的样本都是好样本,每个评审都说「好」,原始一致率就是 95%,但这些标签几乎没有信息量。Cohen 的 κ\kappa 会在两位评审的情况下扣除偶然一致 (Cohen 1960):

κ=pope1pe,\kappa = \frac{p_o - p_e}{1 - p_e},

其中 pop_o 是观测一致率,pep_e 是按两位评审各自标签基率估计的偶然一致率,也就是每位评审不看具体样本、总体上说「好」的比例。若 κ\kappa 接近零,即便原始一致率看起来很高,也说明评审提供的信息没有比基率多多少。

许多 LLM 评测会用多位评审、缺失标签、有序尺度(等级有先后,但相邻等级之间的间距并不固定)或不均匀分配。Krippendorff 的 α\alpha 用观测分歧与偶然分歧之比推广了这件事 (Hayes and Krippendorff 2007):

α=1DoDe.\alpha = 1 - \frac{D_o}{D_e}.

这里 DoD_o 是观测分歧,DeD_e 是偶然分歧。距离函数可以是名义、有序、区间或比率,因此 α\alpha 比单一的双人系数更适合复杂 rubric 数据。

一致性数字不能证明评分准则正确。它只能证明经过训练的评审能够稳定地应用这份准则。即便如此,它也很有价值。低一致性意味着这套评测不能安全地推动发布门禁或奖励模型,除非先澄清准则、改进界面,或把任务拆成更清楚的维度。

成对、绝对与任务式评测

几种常见格式各有失效模式。

成对比较问两份输出哪一份更好。它比绝对打分更容易,也自然衔接 Bradley-Terry 或 Elo 排名:这类方法把一堆胜负投票换算成每个模型一个评分,正如 第 50 章 为模型评判者所做的那样。弱点在于,它给出的是偏好,而不是校准过的质量。一个模型可能因为更长、更顺滑或更自信而赢下成对比较,这正是 第 50 章 要为模型评判者校正的那些偏差。

绝对打分要求评审在固定尺度上给分。它更便宜,也更容易接阈值,但不同评审对尺度点的理解会不同。一个专家的「4 分」可能是另一个专家的「3 分」。锚定示例和校准轮次不是可选项。

任务式评测把生成物交给真实下游工作中的人来使用。它往往是最强证据,因为它测的是效用,而不是表层偏好。代价是慢、贵、领域化。正因如此,许多团队即便产品主张是任务完成,仍会退回偏好或 rubric 分数。

GENIE 展示了界面与质量控制层对可复现文本生成评测有多重要 (Khashabi et al. 2021)。更深的教训是:没有哪种格式天然就是金标准;一种格式是否成立,取决于它要支撑什么主张。

从人类标签到自动评判者

人类评测真正变成基础设施,是在它校准其他仪器的时候。一小批专家标签可以校验模型评判者;周期性审计可以抓住评判者漂移;分歧集合可以暴露哪些 rubric 维度仍然欠定。Fernandes 等人把这条反馈回路讲得更宽:人类反馈不是单一对象,而是一族信号,可用于训练、解码、评测和 AI 反馈系统 (Fernandes et al. 2023)。

移交给模型评判者时,流程应当明确:

  1. 人类在有版本的 rubric 下标注一批代表性且带对抗性的样本。
  2. 在把标签当作真值之前,先测量标注可靠性。
  3. 用这批标签校准模型评判者,包括弃答样本。
  4. 评判者负责扩展规模,但只在校准成立的任务分布内使用。
  5. 新的人类审计周期性重测评判者与人类之间的一致性。

这就是 第 48 章 的同一套纪律,只是应用在人类仪器上。一个在窄写作任务上贴近人类的评判者,可能在法律分析上失败。适合闲聊的众包标签,可能不适合生物学。因此,可信的不是孤立的「人类」或「GPT-4 作评判者」,而是一套协议、一个人群、一份 rubric,以及在某个命名分布上测出来的一致性。

争议所在

尚未解决的问题是,通用 AI 系统到底需要多少专家判断。专家评测慢且贵,而广泛消费模型服务的任务太多,不可能每个切片都请领域专家。众包评测可扩展,但开放式生成研究显示,未经训练的评审会在模型流畅性提高后错过真正要紧的缺陷 (Karpinska et al. 2021; Clark et al. 2021)。实际折中只能分层:高风险或事实性领域用专家 rubric 和审计,低风险风格与有用性用众包或用户偏好,模型评判者则只能在被某个人类层校准之后使用。

下层约束

适配层决定人类标签后来会变成什么。一份为评测采集的标签,可能又被用于奖励建模、合成数据过滤或评判者训练。这种复用让标注来源成为训练栈的一部分。协议若未版本化,第 19 章第 23 章 就无法判断一次行为变化来自模型改进,还是来自人类信号的改变。

延伸阅读

  • Cohen, “A Coefficient of Agreement for Nominal Scales” (扣除偶然一致后的标注一致性), 1960. doi.org
    Cohen κ 衡量两位标注者扣除偶然一致后的协议程度,避免把原始一致率误当成可靠性。
  • Hayes & Krippendorff, “Answering the Call for a Standard Reliability Measure for Coding Data” (多标注者与缺失数据下的 Krippendorff alpha), 2007. doi.org
    Hayes 与 Krippendorff 主张使用 Krippendorff alpha 作为通用可靠性系数,可处理多标注者、缺失数据和不同测量等级。
  • Khashabi et al., “GENIE: Toward Reproducible and Standardized Human Evaluation for Text Generation” (标准化人工评测界面), 2021. arXiv:2101.06561
    GENIE 研究文本生成中的人工评测设计选择,并提出标准化平台,以提升跨任务与跨标注人群的可复现性。
  • Karpinska et al., “The Perils of Using Mechanical Turk to Evaluate Open-Ended Text Generation” (众包判断并不会自动成为真值), 2021. arXiv:2109.06835
    Karpinska 等人发现众包工人可能无法区分开放式故事中的人类文本与模型文本,而专家教师和成对示例能提供更强的评测信号。
  • Clark et al., “All That's 'Human' Is Not Gold: Evaluating Human Evaluation of Generated Text” (流畅性提高后,未训练评审会失效), 2021. arXiv:2107.00061
    Clark 等人表明,未训练评审常常只能以随机水平识别 GPT-3 生成文本,因此需要评审训练与更清晰的协议。
  • Arora et al., “HealthBench: Evaluating Large Language Models Towards Improved Human Health” (HealthBench), 2025. arXiv:2505.08775
    HealthBench 用 262 位医生(执业经验覆盖 60 个国家)撰写的 48,562 条评分准则为健康对话打分,并先用医生评分对模型评分器做元评测,再采信其分数。
  • Fernandes et al., “Bridging the Gap: A Survey on Integrating Human Feedback for Natural Language Generation” (反馈同时是数据、奖励与评测), 2023. arXiv:2305.00955
    这篇综述形式化自然语言生成中的人类反馈,覆盖反馈形式、目标、训练用途、解码用途,以及 AI 反馈的新角色。

评论

登录后评论