AI 基建
0%
第七部分 · 评测 · 第 51 章

事实性、有据性与证据

作者Changkun Ou
阅读时长约 12 分钟

回答可能真实,却没有依据;也可能忠实于一份错误来源,因而并不真实;引用也可能只是装饰,根本没有支持其中任何主张。这些是不同的失败。把这些问题一概称为「幻觉」,会掩盖评测本应服务的决策。

真正有用的测量单位,是一项主张连同它的证据边界、状态和来源。协议必须说明以哪个世界状态或哪类来源为准、以什么时间为准、是否允许搜索、哪些主张必须有证据,以及现有证据不足时怎么办。只有写清这些条件,分数才能区分模型错误与检索、上下文、引用或评测器错误。

指标之前,先定义主张

几个相近术语回答的是不同问题:

维度 问题 所需参照
求真性 回答是否避开基准针对的错误信念或误解? 基准接受的答案和目标人群
事实性 在指定权威来源和时间下,这项主张是否正确? 世界状态或参照政策
忠实度或有据性 这项主张是否得到系统按要求使用的上下文支持? 给定上下文,即使上下文本身不完整或有错
来源归属 可以向外核查的主张,是否得到已标明来源材料的支持? 标注政策下附着的来源片段
引用质量 必须有证据的主张是否都有覆盖,引用是否附着正确,来源是否适用? 主张与来源的映射关系,以及来源政策

TruthfulQA 用 817 个问题把求真性落实为一个具体任务,这些问题专门针对错误信念和常见误解。论文发现,较大的模型总体上更容易给出不真实的回答,但这个结论只适用于所测试的模型和对抗性问题,不能推广成模型规模的一般规律 (Lin et al. 2022)。事实性范围更广,必须指定权威来源和时间,因为汇率、任职者或临床建议都可能变化。有据性的范围更窄。摘要即使忠实于原文,若原文本身有错,在现实世界中仍可能不真实;如果任务要求依据给定文档回答,那么从记忆补充的真实事实也可能没有依据。

注明来源并不能证明内容为真。「可归属于已标明来源」框架询问的是:在明确标注规范下,一项有关外部世界的陈述是否得到独立且已标明的来源支持 (Rashkin et al. 2023)。来源质量和时效性仍需另行判断。引用质量又多一层要求:界面必须把每项需要核查的主张连到真正支持它的片段,不能只在文末列一份文档清单。

这些术语应当成为记录字段,而不是同义词。「无支持」只表示评测器没有在声明的证据边界内找到充分支持,本身不等于错误。「被反驳」要求存在明确的冲突证据。「证据不足」必须与前两者分开。

冻结证据契约

评测器是一条有版本的流水线,不是一个询问回答是否真实的提示。比较不同系统之前,要冻结完整契约:

FactualitySpec:
  decision
  failure_costs
  case_population
  authority
  as_of_time
  mode:
    closed_book
    supplied_context
    bounded_search
  corpus_snapshot
  access_and_source_policy
  claim_policy_and_revision
  retrieval_and_span_policy
  verdict_policy_and_judge
  citation_mapping_policy
  abstention_policy
  aggregation_policy

ClaimRecord:
  case_id
  response_id
  claim_id
  claim_text
  resolved_context
  checkworthiness
  weight
  candidate_evidence_spans
  cited_evidence_spans
  verdict
  extractor_revision
  retriever_revision
  judge_revision
  raw_verdict
  rationale
  adjudication

闭卷模式用参照集评测模型参数中已有的回答能力,受测系统不包含检索器。给定上下文模式要求回答严格依据固定上下文。有界搜索模式则把语料库、搜索服务、查询日期、访问权限和检索预算都纳入案例。三种模式的结果不能互换。

要保留准确的文档与片段标识、内容哈希、检索分数、上下文顺序、截断情况、候选文本、引用偏移量和评判者原始输出。重新评分时要追加新的裁定,不能抹掉产生旧裁定的证据和评测器版本。

D 决策与错误代价 B 权威来源与证据边界 D->B T 检索与生成轨迹 B->T C 消解后的原子主张 T->C E 有版本的证据片段 C->E V 主张与引用裁定 E->V O 指标、局限与发布政策 V->O
图 51.1. 事实性结果只有保留从决策、证据边界、系统轨迹、主张与证据片段,到裁定和发布政策的完整来源链,才能复现。

拆解,但不能丢掉覆盖度

依据证据核查事实,并不是大语言模型时代才出现的方法。FEVER 针对一份固定的 Wikipedia 快照,把主张标为「支持」「反驳」或「信息不足」。前两类附有证据句,最后一种标签并不表示主张为假 (Thorne et al. 2018)。FActScore 在 2023 年把同一种主张级思路用于长文本生成:先把人物传记拆成原子事实,再相对于知识来源衡量事实精确率 (Min et al. 2023)。

这里,yy 表示一份回答,抽取政策会生成主张序列 C(y)=(c1,,cm)C(y)=(c_1,\ldots,c_m)。不加权的 FActScore 可以写成:

FK(y)=1mi=1m1[S(ci,K)=1].F_K(y)= \frac{1}{m}\sum_{i=1}^{m}\mathbf{1}[S(c_i,K)=1].

其中,FK(y)F_K(y) 是回答 yy 相对于知识来源 KK 的 FActScore;C(y)C(y) 是从回答中抽取出的原子主张序列;cic_i 是第 ii 项主张;mm 是抽取出的主张数;S(ci,K)=1S(c_i,K)=1 表示协议认定知识来源 KK 支持 cic_i,否则 S(ci,K)=0S(c_i,K)=01[]\mathbf{1}[\cdot] 是指示函数。自动实现的协议必须把证据检索与支持标签分开记录。m=0m=0 时,这个分数没有定义,不能算作满分。没有可核查内容的回答,应由参评资格或任务完成规则处理。

原子主张是一句自成一体、只表达一项可以独立核查的信息的陈述,其中的代词、日期、单位和局部上下文都已经消解。原子性是协议选择,不是唯一正确的语言学事实。「试验招募了 400 位患者,并降低了死亡率」至少包含两项主张;「这件事发生在第二年」一旦丢掉所指事件和日期,就无法核查。

主张抽取本身也是一次测量。要审计抽取器是否漏掉带保留语气的主张、把一个并列句拆成几个容易得分的主张、重复同一事实,或因语言和文风不同而改变边界。保留原始片段和父子关系,仲裁者才能还原回答。还要在人类标出的样本上测量抽取召回率,并检查合理的重新拆分是否会实质改变结果。

只报告事实精确率会奖励少说话。除了支持比例,还要报告需要核查的主张数量与权重、用户要求内容的覆盖度、矛盾率和回答资格。SAFE 明确展示了这项取舍:它把受支持事实的精确率与用户指定的目标事实数量结合起来。在 LongFact 实验中,SAFE 对 16,011 个已经由人类拆解的事实作出裁定,与众包标签的一致率为 72%。研究者另外审计了 100 个分歧案例,能够使用更广泛网络资料的研究人员有 76% 的时候更认可 SAFE 的裁定。按 2024 年的模型与搜索价格计算,论文报告的评测器成本也比人工低二十倍以上 (Wei et al. 2024)。这些数字不能验证端到端的主张抽取,也不能证明搜索智能体通常比人更准确。

先验证评测器,再评模型

主张评分器可能在抽取、证据搜索、来源选择或最终支持判断上出错。要在锁定且经过独立仲裁的案例上逐段验证。报告主张抽取遗漏;如果存在完备的标准证据,则报告证据检索遗漏;并给出「支持、矛盾、证据不足和不可核查」四类裁定的混淆矩阵。结果还要按领域、语言、时间敏感性、数值推理、多来源主张、否定表达和候选文风拆分。

验证器只能使用声明过的证据,不能悄悄用参数记忆补全。对抗案例应当包括:候选答案要求评测器忽略评分准则;引用指向主题相近却不提供支持的段落;证据彼此冲突;以及正确结论本来就应是证据不足。与 第 50 章 相同,评判者和解析器要固定版本,弃权和失败要保留,模型裁定要与未经仲裁的原始人类判断比较,并在任何重大变更后重新验证。

不能只凭最终标签推断根因。无支持主张可能来自语料库缺口、检索遗漏、上下文打包丢失、生成器编造、引用附着错误、抽取器错误或评测器假阴性。根因判断需要完整轨迹。

把弃答当作决策策略

短答案消除了拆解问题,却没有消除决策问题。SimpleQA 包含 4,326 个简短事实问题,设计目标是每题预期只有一个无争议答案,评分结果为正确、错误或未作答 (Wei et al. 2024)。「未作答」描述的是观测到的回答,不能证明模型识别出了自己的不确定性。研究者人工检查了随机抽取的 300 份回答,但论文没有报告正式的评分器研究。因此,这个基准测量的是一组通过对抗方式收集的闭卷问题和一套评分协议,而不是所有形式的事实性。后来的 SimpleQA Verified 预印本审计了标签、重复题和主题平衡,并建立了经过筛选的 1,000 题衍生版本,没有原地修补原始数据集 (Haas et al. 2025)。

拒答的研究早于语言模型评测。Chow 在 1970 年形式化了错误与拒答之间的取舍 (Chow 1970)。系统为候选答案给出置信度 pnp_n,部署时只在置信度达到阈值 tt 时发布答案,此时应同时报告覆盖度和选择性风险:

Coverage(t)=1Nnan(t),Risk(t)=nan(t)(1zn)nan(t).\begin{aligned} \operatorname{Coverage}(t) &= \frac{1}{N}\sum_n a_n(t), \\ \operatorname{Risk}(t) &= \frac{\sum_n a_n(t)(1-z_n)}{\sum_n a_n(t)}. \end{aligned}

这里,NN 是评测案例数;nn 表示案例,每项求和都从 n=1n=1NNpn[0,1]p_n\in[0,1] 是系统报告的候选答案置信度;t[0,1]t\in[0,1] 是锁定的发布阈值;an(t)=1[pnt]a_n(t)=\mathbf{1}[p_n\ge t] 表示是否发布;当候选答案正确时 zn=1z_n=1,错误时 zn=0z_n=0。覆盖度是已发布案例的比例。选择性风险是已发布答案中的错误率,系统一个答案也不发布时没有定义。还要报告整体答对率 N1nan(t)znN^{-1}\sum_n a_n(t)z_n,这样拒答全部案例也不会显得表现很好。系统如果直接生成拒答,就要给这些拒答本身打标签,不能替它们编造置信度。

应当展示整个覆盖度范围内的风险,不能看过测试结果后才挑阈值。部署阈值属于成本政策:医疗助手、问答工具和内部搜索框,对错误、拒答和升级处理的代价并不相同。校准与选择彼此相关,但并不相同。若随机变量 PPZZ 分别表示目标总体上的报告置信度和候选答案正确性,那么概率校准要求在相关的 pp 取值上满足 Pr(Z=1P=p)=p\Pr(Z=1\mid P=p)=p。应用弃答阈值之前,要先检查这项关系。只在已发布答案上校准会描述一个经过筛选的子集,可能把阈值以下的失败藏起来。

逐段诊断有据生成流水线

检索增强生成会增加失效面,并不会让回答天然有据。每个阶段都要用它实际收到的工件来测试:

阶段 受控测试 失败能够说明什么
语料库 在允许使用的快照中搜索经过仲裁的证据 证据边界内是否包含已知支持材料
候选检索 在拥有完备标准证据的案例上执行检索 所记录截断位置和查询政策下的召回率
重排与打包 跟踪已知证据是否经过选择、排序和截断后仍然保留 只说明上下文暴露情况,不能证明生成器使用了证据
生成 提供预先确认正确的证据,并保留准确的提示 支持材料存在时,生成器能否保持忠实
引用附着 使用经过仲裁的主张与片段配对 引用是否覆盖并支持目标主张
端到端 重放生产流水线 用户可见质量,不能自动给出因果诊断

如果标准证据并不完备,就不能把模型评判的相关性分数称为检索召回率。应当把它报告为该评判者下的相关性估计。同样,生成之后找到支持段落,只能说明材料可用,不能证明生成器在因果上使用了这段材料。

RAGAS 提出了一组不依赖人工参考答案的代理指标,包括忠实度、答案相关性和上下文相关性,这些指标依赖模型和嵌入判断 (Es et al. 2024)。正式论文没有定义上下文召回率。ALCE 从流畅度、任务特定正确性、引用召回率和引用精确率几个方面评测带检索的回答;它的自动引用裁定本身也是 NLI 模型的估计 (Gao et al. 2023)。2025 年最初发布的 FACTS Grounding 基准使用最长 32,000 个词元的长文档,另设参评资格关卡,并汇总三个模型评判者来衡量回答级有据性 (Jacovi et al. 2025)。应把这套设计当作有版本的基准契约。多个评判者可以降低对单个评判者的依赖,却不能把裁定变成真值。

把引用评成主张与来源之间的连接

引用完整度和引用正确性回答的是不同问题。设 II 为必须有外部证据的主张集合;cic_i 是其中第 ii 项主张;wi>0w_i>0 是预先声明的重要性权重;AiA_i 是附着在 cic_i 上的来源片段集合;当这些片段合起来提供了充分支持且不与主张冲突时,Q(Ai,ci)=1Q(A_i,c_i)=1,否则为 0。那么:

Ccite=iwiQ(Ai,ci)iwi.C_{\mathrm{cite}}= \frac{\sum_i w_i Q(A_i,c_i)}{\sum_i w_i}.

要衡量单条链接的正确性,设 LL 为附着的主张与片段链接 (i,j)(i,j) 的集合,其中 jj 标识一个被引用片段;当片段 jj 为主张 cic_i 提供支持且不与之冲突时,qij=1q_{ij}=1,否则为 0:

Plink=(i,j)LqijL.P_{\mathrm{link}}= \frac{\sum_{(i,j)\in L}q_{ij}}{|L|}.

这里,CciteC_{\mathrm{cite}} 表示引用完整度,每个 i\sum_i 都遍历 iIi\in IPlinkP_{\mathrm{link}} 表示链接正确性,L|L| 是引用链接的数量。如果 IILL 为空,相应指标不适用,除非协议另行确认这份回答确实不需要引用。矛盾、引用位置错误、来源过时和来源质量要单独报告。一份回答可能把一项主张引用得非常准确,却漏掉其余所有主张,因此链接正确性很高,完整度却很低。

弱信号只用来分诊

不查权威证据的信号可以安排复核优先级,却不能证明内容为真。SelfCheckGPT 对黑盒模型反复采样,在 WikiBio 实验中把句子层面的不一致当作预警信号 (Manakul et al. 2023)。多次采样可能反复给出同一个常见错误;不一致也可能来自歧义或多个都正确的答案。引用数量、网址是否有效、词汇重合度、评判者置信度,以及相关模型之间的一致程度,都有相同局限:它们可以指出可疑案例,却都不能证明事实获得了支持。

证据评测的运行契约

事实性或有据性结果要成为发布关卡,其记录必须回答:

  1. 哪项决策、案例总体、权威来源、有效时间和错误代价定义了目标?
  2. 系统采用闭卷、给定上下文还是有界搜索,准确的证据边界是什么?
  3. 哪些主张必须有证据,如何抽取主张,又如何审计抽取召回率?
  4. 哪些状态分别表示支持、矛盾、证据不足和不可核查内容?
  5. 保留了哪些语料库、检索器、排序结果、打包上下文、生成器和引用工件?
  6. 抽取器、检索器、验证器和模型评判者如何在锁定案例与切片上验证?
  7. 哪些指标能够展示事实精确率、用户要求内容的覆盖度、矛盾、弃答和引用质量,同时不掩盖遗漏?
  8. 时间变化、来源冲突、访问控制和来源质量如何处理?
  9. 哪些失败会触发人工复核、确定性检查、检索修复或拒答?
  10. 哪些数据、模型、提示、语料库、政策或评判者变化需要重新验证?

交给 第 46 章第 44 章 的是完整轨迹,而不只是分数。交给 第 53 章 的,则是一个只追加、不修改的回归案例,其中包含证据边界,以及复现失败所需的每个阶段。

争议所在

不存在普遍适用的事实性指标,因为评测目标本身就在变化。开放世界中的真相可能有争议或随时间改变;给定上下文的忠实度可能奖励对错误来源的忠实复述;长文本原子评分依赖主张抽取和证据搜索;自动支持判断也继承评判者的局限。站得住的只能是局部结论:在这项权威来源、证据边界、案例总体和评测器版本下,这些主张得到这些状态,并伴随这里测得的误差。

下层约束

只有保留检索和上下文工件,评测才能定位证据在哪一层丢失。如果正确片段从未进入打包后的上下文,之后的事实性分数也不可能把它补进生成器的输入。如果片段已经出现,同一条轨迹就能区分生成失败与引用附着失败,并把修复任务交给正确的层。

延伸阅读

  • Lin et al., “TruthfulQA: Measuring How Models Mimic Human Falsehoods,” 2022. aclanthology.org
    TruthfulQA 用围绕错误信念和误解设计的 817 个问题进行测试,说明在这一对抗性题目群体上,真实性不同于模仿准确率。
  • Rashkin et al., “Measuring Attribution in Natural Language Generation Models,” 2023. aclanthology.org
    AIS 框架把归因定义为在明确标注准则下由独立、可识别来源提供支持,同时把来源质量保留为另一项判断。
  • Thorne et al., “FEVER: a Large-scale Dataset for Fact Extraction and VERification,” 2018. aclanthology.org
    FEVER 把 claim 与固定维基百科快照中的证据配对,并标记为支持、反驳或证据不足,从而把缺少证据与错误区分开。
  • Min et al., “FActScore: Fine-grained Atomic Evaluation of Factual Precision in Long Form Text Generation,” 2023. aclanthology.org
    FActScore 将长文本生成拆成原子事实,并测量其中被指定知识来源支持的比例;它估计的是事实精确率,而不是召回率。
  • Wei et al., “Long-form Factuality in Large Language Models,” 2024. proceedings.neurips.cc
    LongFact 与 SAFE 测试长文本回答的搜索增强核查;其人工一致率、分歧复核和成本结果取决于论文的拆分方式、证据访问范围与 2024 年评判配置。
  • Wei et al., “Measuring Short-Form Factuality in Large Language Models,” 2024. cdn.openai.com
    SimpleQA 使用 4,326 个对抗式收集、预期只有一个公认答案的短问题,并把回答标为正确、错误或不作答。
  • Es et al., “RAGAs: Automated Evaluation of Retrieval Augmented Generation,” 2024. aclanthology.org
    RAGAS 提出由模型介入、无需人工参考答案的忠实度、回答相关性与上下文相关性代理指标;其正式论文没有定义上下文召回。
  • Gao et al., “Enabling Large Language Models to Generate Text with Citations,” 2023. aclanthology.org
    ALCE 分别评估长文本回答质量、引用正确性与引用完整性,而不是把出现引用当作充分条件。
  • Jacovi et al., “The FACTS Grounding Leaderboard: Benchmarking LLMs' Ability to Ground Responses to Long-Form Input,” 2025. arXiv:2501.03200
    原版 FACTS Grounding 基准使用给定的长文档、独立的合格性门控和三个模型评判器,在版本化的 2025 年协议下估计回答级 grounding。
  • Manakul et al., “SelfCheckGPT: Zero-Resource Black-Box Hallucination Detection for Generative Large Language Models,” 2023. aclanthology.org
    SelfCheckGPT 把黑盒模型重复采样之间的不一致作为句级预警信号;样本彼此一致并不构成真实证据。

评论

登录后评论