模型评判者与偏好排名
模型评判(model-as-judge),也就是用模型担任评分器,可以把一份成文的评分准则变成成千上万次可重复的判断,却不能把含糊的质量概念变成真值。它的裁定取决于收到的证据、评分准则与提示、评判模型与采样设置、候选答案顺序,以及案例总体。任何一项改变,测量结果都可能改变。
因此,不该问「哪个评判者最好」,而该问「这位评判者针对哪些决策、准则、案例和错误代价接受过验证」。第 49 章 中的人类判断,仍然只是相应协议下的观测。模型评判者是根据这些观测或可核验结果校准的第二件测量工具,不能取代真值来源。
选择刚好够用的最窄评分器
开放式输出并非全都无法核验。一份回答里,事实主张可以与给定证据核对,代码可以执行,引用可以解析,文风则需要人来判断。选择评分器之前,先把评测拆开:
| 待测性质 | 优先选择 | 原因 |
|---|---|---|
| 模式、语法或执行结果 | 确定性验证器 | 精确、便宜、可复现 |
| 有权威证据可查的事实主张 | 受证据约束的检查器,再加审计 | 评判者可以比较指定证据,不必依靠记忆 |
| 政策准则 | 有版本的规则检查器或受训标注者 | 政策版本定义了评测目标 |
| 语气、有用性或偏好 | 合格的人类;需要扩大规模时使用经过验证的模型评判者 | 目标视角必须进入抽样设计 |
| 下游任务是否成功 | 实际观测到的任务结果 | 文本偏好只是代理指标 |
当准则可以观察、必要证据能够放进它的输入,而且能在代表性样本上复查错误时,使用模型评判者最有依据。如果任务依赖拿不到的事实、难以言传的领域经验,或评判者不具备的权限,它就不是合适的选择。G-Eval 在摘要和对话任务中表明,结构化准则和表单式填写可以提高模型评分与人类评分的对应程度,同时也发现了偏爱模型生成文本的现象 (Liu et al. 2023)。这只证明这套协议在受测任务上的表现,不是通用认证。
HELM 把「整体」评测定义为跨场景和指标的广泛、标准化覆盖,同时保留原始提示和回答以供分析 (Liang et al. 2023)。整体评测并不是让一个评判者把所有性质压成一个分数,而是把用例、能力、风险、效率和不确定性组成的矩阵保留到真正的决策规则能够使用它为止。
把评判者冻结为有版本的测量工具
评判者不只是一个模型标识,而是从案例到裁定的整套转换过程:
JudgeSpec:
judge_model_and_revision
rubric_revision
prompt_template_hash
evidence_policy
output_schema
candidate_order_policy
sampling_parameters
parser_and_repair_revision
abstention_and_escalation_rule
JudgeRecord:
judge_spec_hash
evaluation_spec_hash
case_and_candidate_ids
candidate_order
evidence_refs
raw_model_output
parsed_dimension_labels
tie_or_abstention_state
rationale_refs
latency_cost_and_attempts
created_at
凡是可能改变裁定的字段都要固定下来。改写一条准则、升级评判模型、调整温度,或换用新的解析器修复格式错误,都会产生新的评判者版本。重新评分时,要在旧记录旁新增一条记录,不能覆盖历史记录。
错误和后果不同的维度必须分开。即使一次 API 调用同时返回正确性、引用支持、语气和完整性,这些性质也需要各自的准则和标签。如果发布规则之后要合并它们,应当在评测规格中记录权重、否决条件和缺失数据处理方式,不能把这些选择藏在评判提示里。
输出还要如实保留不确定状态。「平局」「双方都失败」「证据不足」「准则不适用」和「评判者失败」不能混为一谈。强制选出胜者,会把信息缺失和解析错误变成偏好数据。即使解析失败也要保留原始回答,并按照升级处理规则,把相应案例交给合格的人或确定性检查器。
先验证,再扩大规模
先在开发案例上调整评分准则、提示、示例和解析器,然后冻结 JudgeSpec,再用没有参与这些选择的锁定数据集评测它。参照协议必须符合实际决策:用户偏好由合格用户判断,领域正确性由专业人员判断,合规性由政策标注者判断;能直接执行时,则以执行结果为准。
验证必须按准则和切片分别进行。至少要报告:
- 人类评测协议、案例总体和独立单位;
- 原始一致率和混淆模式,包括平局与弃权;
- 有参照标签时的假通过率和假失败率;
- 按预先指定的准则、语言、领域、难度、候选模型家族和输出风格报告结果;
- 按实际独立单位聚类计算的不确定性;
- 结果对评判者采样、移除证据,以及提示或解析失败的敏感性。
Zheng 等人在 MT-Bench 和 Chatbot Arena 实验中报告,GPT-4 的判断与人类偏好一致率超过 80%,同时也记录了位置、冗长、自我增强和推理方面的局限 (Zheng et al. 2023)。这个结果只证明它在这些受测协议中的表现,并不意味着换一套评分准则、领域、评判者版本或受测模型分布后仍有 80% 的准确率。
正如上一章所述,一致不等于有效。评判者可能稳定地复现一套有缺陷的仲裁政策。既要拿它与仲裁标签比较,也要与彼此独立的原始人类判断比较;还要检查分歧,并尽可能保留可执行的反例。如果评判者输出一个声称代表置信度的概率,就要验证其校准情况。文字理由或数值分数也不会自动成为概率。
测量残余偏差,而不是要求模型保持中立
要求模型「不要有偏差」并不是控制措施。应当对输入做一些理论上不该改变目标判断的变换,再测量裁定是否随之改变。
| 风险 | 受控探针 | 应报告或采取的措施 |
|---|---|---|
| 位置 | 交换 A 与 B,并重复完全相同的一对答案 | 反转率和同一对答案前后不一致的比率;随机化顺序 |
| 长度与风格 | 保持实质不变,只改变长度、标题或润色程度 | 残余偏好变化;同时报告控制前后的估计 |
| 自我偏好 | 在人类评价相当时比较不同候选模型家族 | 按模型家族统计的错误;加入独立评判者或人工审计 |
| 证据薄弱 | 移除证据、加入矛盾证据,或让证据不足 | 证据不足时仍下确定结论的比率,以及弃权表现 |
| 评判者非确定性 | 在固定采样器下重复完全相同的调用 | 裁定分布和重试策略 |
| 对抗文本 | 在候选答案中放入诱导高分的指令或通用攻击短语 | 攻击成功率、解析安全和人工升级处理 |
即使只改变回答顺序,位置偏差也可能让比较结果反转。Wang 等人针对所测试的评判者和回答对展示了这种影响,并提出一套校准框架 (Wang et al. 2024)。交换顺序可以暴露问题,却不能保证消除问题。协议可以要求两种顺序下结果一致;如果输出确有合理的概率解释,也可以对概率取平均;否则就应保留一个明确的「不一致」状态。
长度控制同样是在定义一个估计目标,而不是在提示里加一句话。Length-Controlled AlpacaEval 用回归估计长度差为零时的偏好,并展示了校正后排名可能改变 (Dubois et al. 2024)。校正结果回答的是两份回答等长时的反事实问题;未校正结果回答的是包含长度在内,完整输出之间的偏好。应当说明哪一种结果服务于当前决策,而不是把其中任何一种说成普遍正确。
自我偏好也必须直接测试。Panickssery 等人在受控条件下发现,评判模型能够识别并偏爱自己生成的内容,而且自我识别能力与偏差强度相关 (Panickssery et al. 2024)。换用不同模型家族的评判者或使用多个评判者,或许能分散这类错误,但都不能证明中立。
最后,候选文本是不可信输入。Raina 等人发现,短小的对抗短语可以从替代评判者迁移到目标评判者并抬高分数;在他们的实验中,绝对评分比比较式评测更容易受攻击 (Raina et al. 2024)。候选内容要用清楚的边界隔开,不能获得指令权限;输出要结构化,并由严格解析器处理;回归测试中要保留攻击探针;还要避免让模型评判者成为高影响决策的唯一关卡。
把成对投票变成有条件的排名
一次 成对比较(pairwise comparison) 会在同一个案例上询问:两个候选答案中,哪一个更符合某项准则,同时允许平局和无法评分。它减轻了不同人使用评分尺度时的锚定负担,却不能消除标注者偏差,也不会产生绝对质量水平。
Bradley 与 Terry 在 1952 年为不完全区组设计提出了成对比较模型,今天的模型排行榜沿用了同一种潜在评分思路 (Bradley and Terry 1952)。竞技场式系统会用 Bradley-Terry 模型或相关评分系统汇总大量比较。对于第 次比较,可以使用下面这项扩展:
这里, 表示候选系统 在第 次比较中胜过系统 ; 和 是它们的潜在评分; 是记录下来的协变量向量,例如顺序或长度差; 包含相应的系数; 表示转置,所以 是两者的内积; 是逻辑函数。还需要施加一项约束,例如 ,因为给所有评分加上同一个常数并不会改变任何概率 (Bradley and Terry 1952)。
常见的 Elo 显示方式,用以 10 为底的参数化表达同一条逻辑曲线。在常用的 400 分尺度上,评分相同对应 50% 的预期胜率,400 分差距对应约 91% 的胜率。尺度改变的是显示出来的评分差,不是底层证据。
这个模型是一项紧凑的假设:各系统在抽样比较总体上具有一个标量强度,而这些强度足以解释可传递的偏好。发布全局排名之前,需要检查这项假设掩盖了什么:
- 有向胜负图是否强连通,也就是把系统任意分成两组时,两组之间是否都有双向流动的胜负路径?若不满足这一条件,不败或彼此隔离的模型组可能让无正则化的极大似然评分发散 (Ford 1957)。
- 提示、用户、语言和对手分配,是否来自目标总体?
- 偏好是否存在异质性或循环,以至于一个标量无法表达?
- 平局是否被建模、单独报告,还是悄悄算作半胜?二元 Bradley-Terry 模型不描述平局概率;能够处理平局的扩展会增加一种结果和一个参数 (Davidson 1970)。
- 同一位用户、同一个提示或同一段对话产生的重复投票,是否被误当成彼此独立?
- 模型可用性、选择性提交或撤回,是否改变了比较池?
Chatbot Arena 展示了如何用众包提示和投票开展大规模成对评测,并分析了其收集总体中大众标注者与专家标注者的一致性 (Chiang et al. 2024)。因此,它的评分只是参与用户、提示、模型和界面条件下的偏好估计,不是内在能力常数。
估计不确定性时要保留原有任务分配。如果一个提示或用户贡献了多次观测,应当对独立的提示或用户聚类重采样,而不是对单张选票重采样。报告要包含评分区间、排名概率或排名集合、投票数、平局率,以及对加权规则和参评资格规则的敏感性。即使拟合代码相同,人工投票排名与模型评判排名仍应分开标识。
整体评测要保留结果向量
一个偏好分数无法回答所有部署问题。结果应当保留为场景与指标组成的矩阵:
- 任务成功情况和各项准则下的质量;
- 事实性和证据支持;
- 安全、公平和政策护栏;
- 延迟、成本和资源使用;
- 评判者覆盖率、弃权率和错误率;
- 不确定性和已知的效度局限。
发布决策可以指定一个主要目标、非劣效界限和硬性护栏;另一项决策也可以使用 Pareto 前沿,而不是加权总分。只要在看到候选结果之前写明规则,两种做法都有依据。没有写明规则的平均值并不整体,它只是在掩盖哪些失败被拿去交换了别的收益。
把确认集守成一道信息边界
访问受控的 私有测试集(private test set) 可以减少直接暴露和反复调参,却不能证明预训练中从未出现语义等价的案例;污染检测器也不能证明数据不存在。Shi 等人形式化了黑盒预训练数据检测,并在他们的基准上展示了一种方法,同时指出训练语料不公开正是这个问题的根源 (Shi et al. 2024)。应当把这类审计当作带误差的证据,而不是证书。
公开评测、在线评测和私有评测各有用途。公开套件便于复现和共同诊断。在线偏好系统不断更新提示,却会继承平台的人群、界面、提交和抽样政策。私有确认集能够支持内部决策,但不便跨团队比较,而且反复查询仍会导致过拟合。即使数据从未离开评测服务,自适应复用仍是统计问题 (Dwork et al. 2015)。
这道边界需要通过运行规则来维护:
- 把开发案例与确认案例分开,并限制访问后者的原始内容。
- 记录每次评测、候选版本、评判者版本和选择决策。
- 限制重复查询,并在最终推断中纳入完整的选择历史。
- 防止确认结果和人工纠错悄悄流入训练数据。
- 从生产故障中收集的新案例先进入开发集;另行收集一批案例,留作后续确认集。
- 轮换或停用已经暴露的案例,同时保留旧版本用于历史审计。
新鲜度不只取决于保密。训练数据截止时间之后新收集的案例,可以加强「预训练时未见」这一证据;把旧公开基准私下复制一份则不能。反过来,从错误用户或任务中抽取的秘密数据集仍然无效,再严密的保护也无法补救。
模型评判式评测的运行契约
模型评判分数要用作发布关卡,其记录必须回答以下问题:
- 它服务于什么决策、待测概念、案例总体和独立单位?
- 哪些性质由确定性检查、人类、模型评判者或实际观测结果来判断?
- 每条原始裁定来自具体哪一版
JudgeSpec和证据政策? - 哪一份锁定参考集验证了这个版本,哪些案例又曾用于调整它?
- 它在各项准则和切片上的假通过、假失败、平局、弃权和解析失败率分别是多少?
- 它对顺序、长度、风格、模型家族、非确定性、证据缺失和对抗内容有多敏感?
- 平局、重复观测、聚类、权重和评分不确定性如何处理?
- 确认集的访问、查询、复用、轮换和升级处理规则如何保持独立性?
- 哪些模型、评判者、评分准则或领域变化需要重新验证?
向训练环节的交接也必须明确。偏好标签可能用于训练单独的奖励模型或筛选示例,因此评判者错误会影响后续行为。奖励模型并不等同于通过提示调用的模型评判者,它是另一件学习得到的评分工具,有自己的数据、目标函数和验证契约。第 19 章 将进一步说明这一区别。
模型评判者可以低成本复现一部分人类判断,但究竟该以哪一类判断为准,仍没有统一答案。一个团队可能关心专家认定的正确性,另一个关心目标用户效用,还有一个关心某种政策解释。即使与一个参照人群高度一致,也不能由此决定该由哪个人群作主。最稳妥的表述只能是局部的:这份冻结的评判者在这个案例总体上,以这些实测误差复现了这套参照协议。更广的主张需要新的证据。
评测服务必须把候选内容当作数据,而不是权限来源;必须在解析或仲裁之前保留原始输出,并把每条裁定绑定到不可变的案例、候选答案、评判者、评分准则、证据、顺序和尝试标识。训练层和注册表层还要记录评测数据何时影响了模型或奖励系统。没有这些连接,评测层既无法重建排名、发现自适应复用,也无法区分模型进步与评判者漂移。
延伸阅读
- Zheng et al., “Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena,” 2023. proceedings.neurips.cc本文在 MT-Bench 与 Chatbot Arena 数据上验证基于 GPT-4 的评判,同时记录位置、冗长、自我强化和推理局限;其一致性结果只适用于这些协议。
- Liu et al., “G-Eval: NLG Evaluation using GPT-4 with Better Human Alignment,” 2023. aclanthology.orgG-Eval 用明确准则和结构化表单评测摘要与对话,在这些任务上提高了与人工评分的对应程度,也指出了偏好模型生成文本的潜在偏差。
- Wang et al., “Large Language Models are not Fair Evaluators,” 2024. aclanthology.org作者展示大语言模型评测中的位置敏感判决并测试校准框架,说明回答顺序不变性必须测量,不能只靠提示要求。
- Dubois et al., “Length-Controlled AlpacaEval: A Simple Way to Debias Automatic Evaluators,” 2024. openreview.netLength-Controlled AlpacaEval 用回归估计回答长度差为零时的自动偏好,明确给出反事实估计量及其任务特定假设。
- Panickssery et al., “LLM Evaluators Recognize and Favor Their Own Generations,” 2024. proceedings.neurips.cc受控实验把评判模型的自我识别与自我偏好联系起来,说明同源模型评分可能系统性偏离人工判断。
- Raina et al., “Is LLM-as-a-Judge Robust? Investigating Universal Adversarial Attacks on Zero-shot LLM Assessment,” 2024. aclanthology.org本文构造可迁移的短语来抬高评判分数,并发现其测试的绝对评分协议比比较式评测更易受攻击。
- Chiang et al., “Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference,” 2024. proceedings.mlr.pressChatbot Arena 构建大规模人工成对偏好平台和统计排名方法;其估计取决于抽样用户、提示、模型池与协议。
- Liang et al., “Holistic Evaluation of Language Models” (HELM), 2023. openreview.netHELM 在标准化的场景与指标矩阵上评测模型并公开原始提示和补全,把整体评测界定为透明覆盖,而不是单一汇总分数。
- Shi et al., “Detecting Pretraining Data from Large Language Models,” 2024. proceedings.iclr.cc本文形式化黑盒预训练数据检测,并在受控与真实数据设置上评测 Min-K% Prob;它提供暴露证据,而不是未暴露证明。
- Dwork et al., “The Reusable Holdout: Preserving Validity in Adaptive Data Analysis,” 2015. doi.org可复用留出集框架说明,即使留出记录保持秘密,对评测结果的自适应重复访问仍会破坏普通留出推断。
评论
登录后评论