AI 基建
0%
第七部分 · 评测 · 第 49 章

把人类评测写成测量协议

作者Changkun Ou
阅读时长约 12 分钟

人做出的判断,并不会因此自动成为真值。它是在一套协议下得到的观测:特定的人通过特定的界面看到了特定的证据,按照特定的评分准则,从特定的选项中作出判断。只要其中一个条件改变,标签也可能随之改变。

因此,真正有用的问题不是「人类更喜欢什么」,而是「哪些人在什么条件下,对哪个单位作出了什么判断,这些观测又能支持怎样的主张」。本章将这套协议明确写出来。第 48 章 中的统计契约仍然适用;人类评测还会把标注者抽样、理解差异、疲劳、激励和仲裁带进测量系统。

从主张出发,而不是先找标注者

招募标注者之前,先写明要支持的决策和待测概念。「质量」太含糊,无法直接指导发布。事实正确性、引用支持、无害性、语气是否合适、任务是否完成,以及用户要付出多少精力,都可能各自变化。只问总体偏好,等于悄悄替这些维度设定了一套取舍。

目标标注者群体取决于评测主张:

评测主张 相关视角 标注者需要的证据
医疗摘要保留了临床上重要的事实 具备相关专业知识的临床医生 原始病历、摘要、错误分类
回答能帮助客户完成一套流程 目标用户或有效的代理人 任务目标、产品状态、最终结果
回答遵守安全政策 接受过培训的政策标注者;高风险领域还需专家 政策版本、完整交互、允许使用的工具
本地化文本读起来自然 目标语言社群中的流利使用者 上下文和地区语言习惯
某个回答更易读 从目标用户中抽样的标注者 隐去来源的候选答案

专业能力没有一条适用于所有任务的统一排名。临床正确性需要相应的专业资质;文化含义可能更依赖亲身经验或社群身份;工作流是否好用,则应由实际用户判断。研究必须说明抽样的是哪一种视角,也不能把结论推广到这个视角之外。

C 决策与待测概念 S 抽样案例与系统 C->S P 评分准则、标注者与界面 S->P A 随机化任务分配 P->A R 原始判断记录 A->R Q 审计;单独仲裁 R->Q O 估计、局限与决策 Q->O
图 49.1. 人类评测必须保留从决策到原始判断的完整路径。可靠性分析和仲裁都以原始记录为输入;仲裁不能覆盖原始记录。

HealthBench 展示了一种领域特定的设计:医生为医疗对话编写了针对每段对话的评分标准,研究者另外将自动评分器与医生判断进行比较 (Arora et al. 2025)。这只能为 HealthBench 的这套协议提供证据,不能证明医生编写的评分准则或模型评分器适用于所有医疗用途。

评分准则是一套可执行界面

评分准则要把抽象概念变成可以观察的判断。每项准则都需要五个部分:

  • 单位: 待判断的是主张、引用、回答、轮次、对话、工具调用,还是完成后的任务。
  • 适用条件: 在什么情况下才使用这项准则。
  • 证据: 标注者可以查看什么,不同来源发生冲突时以哪个为准。
  • 判断选项: 通过或失败、有序类别、分数、成对选择、平局、未知或弃权。
  • 锚定示例: 接近重要边界的示例,以及为什么应当这样判断。

「要有帮助」会迫使标注者各自发明一套规则。相比之下,「找出用户要求的操作,在不加入无依据主张的前提下完成它,并说明仍未满足的前置条件」更容易观察。不应在总分中悄悄互相抵消的性质,必须拆开判断。一个流畅却错误的回答,不应靠文风得分抵消事实错误。

评分准则要靠实验改进。先在普通案例、边界案例、对抗案例和无法评分的案例上试运行,请标注者解释自己如何理解每项准则。反复出现的困惑通常说明措辞有问题。修改说明和锚定示例之后,再冻结一个评分准则版本,用于确认性评测。为了调整准则而收集的试运行标签属于开发数据,不是新的确认数据。

判断选项必须保留不确定性。强制二选一,会把「两者都失败」「无法区分」和「证据不足」变成随意分配的胜负。平局、未知、不适用和弃权代表不同状态,在存储和分析中也必须分开。

任务分配与界面会改变观测结果

再好的评分准则,也可能被呈现方式破坏。协议应当控制与待测概念无关的变量:

  • 除非身份本身就是任务的一部分,否则隐藏模型和提供商身份。
  • 在成对比较中随机安排或平衡候选答案的顺序。
  • 条件允许时随机安排案例顺序,并记录实际呈现顺序。
  • 不同系统在排版、截断、引用和可用工具上保持对称。
  • 将培训和校准项目与计分样本分开。
  • 预先声明排除、超时和缺失回答的处理规则。

被试内设计让同一个人评测多个系统,可以保留有价值的配对关系,却会引入学习、疲劳,以及前面任务留下的影响。被试间设计可以减少这种影响,但需要更多参与者,也可能把系统差异和标注者差异混在一起。平衡不完全区组设计通常是一种实用折中:每位标注者只看数量可控的子集,每个系统被评测的次数相近,同时保留足够重叠来估计标注者效应和项目效应。

界面本身就是测量工具的一部分。van der Lee 等人建议报告并控制问题措辞、呈现顺序、标注者培训、质量检查和统计分析,因为这些选择会影响结果能否复现 (Lee et al. 2019)。GENIE 后来的研究进一步表明,界面和标注者质量设计会明显影响不同任务和标注者群体之间的可复现性 (Khashabi et al. 2022)。每条判断都要保存界面版本。

找对视角,也保护参与评测的人

标注者资格应当检验任务真正需要的能力。通用平台通过率并不能证明一个人具备医疗专业知识、熟悉政策或理解特定文化。应当记录明确的筛选测试、训练集和校准轮次;看到系统结果之后,不能悄悄修改资格门槛。

众包适合一部分低风险的语言偏好任务,但「众包」并不是一个稳定的人群。平台、地区、语言、报酬、设备和劳动激励都会改变谁来参与,以及他们如何作答。Karpinska 等人在开放式故事评测中发现,严格的平台筛选并没有让众包判断与英语教师的判断可以互换;加入成对参考文本改变了任务,也改善了信号 (Karpinska et al. 2021)。Clark 等人也发现,在他们测试的领域中,未经培训的非专家区分 GPT-3 文本和人类文本时,表现只相当于随机猜测 (Clark et al. 2021)。这些结果限制的是相应评测协议,并不意味着非专家通常无法做出有用评测。

参与者不是可以随意消耗的测量零件。预算要覆盖公平报酬、合理工时、休息安排,以及清楚的拒收和申诉规则;还要保护他们免受令人不适内容的伤害。只收集已声明分析真正需要的人口统计信息,尽量缩短平台标识符的保留时间,并接受适用的伦理或法律审查,不要假定付费标注天然不受这些要求约束。Shmueli 等人记录了公平报酬仍无法解决的伤害,包括隐私风险、内容暴露,以及众包工作是否受到人体研究规则保护的不确定性 (Shmueli et al. 2021)。

质量控制要与任务相关。重复项目可以衡量同一标注者自身的稳定性;客观的标准答案项目可以发现对说明的误解;定向复核则可以检查异常快速或答案过于单一的模式。最低用时门槛和隐藏陷阱不能替代有效的任务,还可能惩罚熟练参与者。所有检查都要预先声明,并保留被排除的记录及理由,同时报告排除操作如何改变了估计结果。

仲裁之前,先保留原始判断

每条判断都应保存为不可修改的事件:

JudgmentRecord:
  study_spec_hash
  case_id
  candidate_ids_blinded
  candidate_order
  rubric_revision
  interface_revision
  rater_pseudonym
  rater_population_and_qualification
  assignment_block
  raw_dimension_labels
  tie_unknown_abstain_state
  rationale_and_evidence_refs
  started_at
  submitted_at
  quality_flags

仲裁产生的是派生标签,不能覆盖独立判断。还要保留仲裁者、所用证据、理由和规则,并报告仲裁前的一致性。共识会议可以为生产系统确定一个最终标签,却不能反过来把几个彼此相关的意见算作独立证据。

这个区别也能防止泄漏。为发布评测收集的标签,日后可能被用来训练奖励模型、调整评分准则或校准模型评判者。一旦进入开发流程,这组标签就不再是未被使用过的发布检查。来源记录必须说明哪些判断影响了哪些工件。

用一致性诊断评测协议

原始一致率是多个标注者对同一批单位作出相同判断的比例。它很有用,但没有考虑标签分布。对两位标注者和名义类别,Cohen 的 kappa 定义为 (Cohen 1960)

κ=pope1pe.\kappa = \frac{p_o-p_e}{1-p_e}.

这里,pop_o 是观测一致率;pep_e 是假设两位标注者独立作答,同时保留各自观测到的标签边际频率时,模型预期的一致率。这项修正建立在特定模型上,pep_e 不是普遍适用的所谓偶然一致量。如果两位标注者把所有单位都归为同一类别,那么 po=pe=1p_o=p_e=1,此时 kappa 没有定义,尽管原始一致率是 100%。标签严重不平衡时,原始一致率可能很高,kappa 却可能很低或很不稳定。

如果有多位标注者、缺失分配或非名义尺度,就要选择与评测设计相匹配的系数。Krippendorff 的 alpha 具有下面这种通用形式 (Hayes and Krippendorff 2007; Artstein and Poesio 2008)

α=1DoDe.\alpha = 1-\frac{D_o}{D_e}.

这里,DoD_o 是观测分歧,DeD_e 是该系数所用参考模型下的预期分歧。距离函数必须与响应尺度相符:名义类别没有顺序;有序等级有先后,但没有固定间距;区间分数则假定距离有实际含义。

不存在适用于所有评测的安全阈值。报告应当同时给出系数的不确定性、原始一致率、标签占比、混淆模式、标注者和单位数量、缺失情况,以及具体使用的系数变体。系数必须基于同一评分准则版本下彼此独立的原始判断计算。把仲裁后的标签或多个评分准则版本混在一起,只会得到一个容易计算却没有一致解释的数字。

一致性衡量可靠性,而不是效度。标注者可以一致地执行一份错误准则;有效准则也可能暴露真实存在的视角差异。应当按准则、项目和标注者群体分析分歧。反复出现的分歧可能意味着需要改清楚措辞、拆出单独维度、提供更多证据,或明确报告不同视角下的结果,而不是强行达成共识。

根据主张选择观测形式

成对比较要求标注者在 A、B、平局和无法评分中选择。它降低了不同人使用评分尺度的负担,也适合配对分析,但结果取决于对手集合和呈现情境。它不能给出绝对质量水平,循环偏好或不同群体间的偏好差异也可能真实存在。候选顺序必须反转或随机化,并保留双方的原始位置。

绝对评分或有序评分按照带有锚定示例的等级评价单个输出。它便于设定阈值,也能形成可复用的项目级诊断,但不同标注者的严格程度和用分习惯并不相同。可能需要锚定示例、校准项目,以及显式建模标注者效应和项目效应的方法。不要在没有依据时把有序等级当成等距数值。

准则清单把回答拆成一组可以观察的要求。它能指出失败发生在哪里,也适合日后校准模型评判者,但清单过长会增加疲劳,还可能漏掉不同准则之间的相互作用。

任务式评测观察人在使用系统时发生了什么,例如任务完成、用时、纠正次数、升级处理或下游错误。它最贴近产品主张,但测到的是整个人机工作流,而不只是模型文本。用户能力、界面和辅助政策都属于系统边界。

这些形式不是一条由弱到强的等级。应当选择成本最低、又能直接观察决策相关概念的形式;如果产品主张超出了第一种形式的证据范围,再增加更强的下游研究。

汇总不能抹掉评测设计

独立单位可能是用户、对话、文档、代码仓库或任务,而不是单个复选框。必须保留配对分配,并按照 第 48 章 的要求,按这个单位对重复判断进行聚类。报告要给出带不确定性的系统效应和护栏,而不只是平均分。

汇总时应当保留重要结构:

  • 每项准则的失败率,而不是只有总分;
  • 预先声明的标注者群体和语言切片;
  • 平局、弃权、缺失和无效率;
  • 顺序和界面诊断;
  • 在任务分配允许估计时,报告标注者效应和项目效应;
  • 结果对排除规则和仲裁规则的敏感性。

如果不同视角之间确实存在合理分歧,那么分布本身往往就是结果。多数票可以用于产生一个业务标签,却会抹掉少数判断和不确定性。汇总规则和原始证据应当同时保留。

把人类证据交给模型评判者时要谨慎

人类标签可以用来校准自动评分器,但这次交接本身也是一次评测,不是把人类标签提升为真值。应当使用一组锁定的人类标注数据,覆盖普通案例、边界案例、对抗案例和弃权案例。按准则和切片衡量模型评判者,测试它是否存在顺序偏差、偏爱冗长回答、自我偏好,以及能否适应分布变化,并为证据不足的案例保留人工复核路径。

不要只用仲裁后的共识标签做验证。原始判断能够说明模型跟随的是稳定的人类信号,还是某位仲裁者的裁定规则。持续监控新样本上的人机分歧,尤其是在更换受测模型、评分准则、模型评判者、提示或领域之后。第 50 章 将进一步说明这套自动评判契约。

实际流程如下:

  1. 写明决策、待测概念、单位、目标案例总体和标注者视角。
  2. 写出可观察的准则、证据规则、锚定示例和不确定状态。
  3. 试运行评分准则和界面,修改之后冻结版本。
  4. 预先声明抽样、任务分配、盲测、顺序、排除、仲裁、汇总和分析方法。
  5. 按照声明的目标群体招募、培训、付费并保护标注者。
  6. 先收集不可修改的原始判断,再做任何仲裁。
  7. 报告效应、不确定性、一致性诊断、排除项和效度局限。
  8. 如果判断被用于训练或校准模型评判者,就把这次复用记入来源记录。
争议所在

分歧有时是测量误差,有时正是待测现象。政策合规任务可能需要一个可执行的统一结论;涉及价值取向的偏好,则可能需要分别报告不同视角下的分布。不能等看到难以处理的分歧后,再决定它究竟算误差还是结果。收集标签之前,就要说明目标是专家标准、用户效用、政策解释、社群视角,还是总体偏好。

下层约束

标注服务必须保留稳定的案例、候选答案、标注者、任务分配、评分准则、界面和呈现顺序标识。缺少这些信息,评测层就无法重建配对关系、发现泄漏、估计标注者效应或审计排除项。适配层还必须记录评测判断何时变成训练数据,否则日后所谓的「留出」人类评测,可能早已影响了它正在评测的模型或评判者。

延伸阅读

  • Lee et al., “Best Practices for the Human Evaluation of Automatically Generated Text,” 2019. aclanthology.org
    本文把人工评测的有效性与可复现性连接到明确的规划、参与者选择、问题措辞、呈现顺序、培训、质量控制、统计分析和报告。
  • Artstein & Poesio, “Inter-Coder Agreement for Computational Linguistics,” 2008. aclanthology.org
    Artstein 与 Poesio 综述了计算语言学标注中的一致性系数、假设与解释,强调系数必须匹配研究设计和量表。
  • Shmueli et al., “Beyond Fair Pay: Ethical Implications of NLP Crowdsourcing,” 2021. aclanthology.org
    作者说明众包工作的伦理问题不止时薪,还包括隐私、可识别数据、有害内容暴露、同意和现有人体研究审查框架的局限。
  • Cohen, “A Coefficient of Agreement for Nominal Scales” (扣除偶然一致后的标注一致性), 1960. doi.org
    Cohen κ 衡量两位标注者扣除偶然一致后的协议程度,避免把原始一致率误当成可靠性。
  • Hayes & Krippendorff, “Answering the Call for a Standard Reliability Measure for Coding Data” (多标注者与缺失数据下的 Krippendorff alpha), 2007. doi.org
    Hayes 与 Krippendorff 主张使用 Krippendorff alpha 作为通用可靠性系数,可处理多标注者、缺失数据和不同测量等级。
  • Khashabi et al., “GENIE: Toward Reproducible and Standardized Human Evaluation for Text Generation” (标准化人工评测界面), 2022. aclanthology.org
    GENIE 研究文本生成中的人工评测设计选择,并提出标准化平台,以提升跨任务与跨标注人群的可复现性。
  • Karpinska et al., “The Perils of Using Mechanical Turk to Evaluate Open-Ended Text Generation” (众包判断并不会自动成为真值), 2021. aclanthology.org
    Karpinska 等人发现众包工人可能无法区分开放式故事中的人类文本与模型文本,而专家教师和成对示例能提供更强的评测信号。
  • Clark et al., “All That's 'Human' Is Not Gold: Evaluating Human Evaluation of Generated Text” (流畅性提高后,未训练评审会失效), 2021. aclanthology.org
    Clark 等人表明,未训练评审常常只能以随机水平识别 GPT-3 生成文本,因此需要评审训练与更清晰的协议。
  • Arora et al., “HealthBench: Evaluating Large Language Models Towards Improved Human Health” (HealthBench), 2025. arXiv:2505.08775
    HealthBench 用 262 位医生(执业经验覆盖 60 个国家)撰写的 48,562 条评分准则为健康对话打分,并先用医生评分对模型评分器做元评测,再采信其分数。

评论

登录后评论