事实性、Grounding 与引用支持
一个回答可以流畅、受偏好,却仍然是假的。它也可以给出引用,却并没有被那条来源支持。因此,事实性评测不能化约成一个基准分数或一次偏好裁定。它问的是更窄的问题:系统提出了哪些 claim,哪些证据支持这些 claim,以及系统是否知道什么时候不该回答。
本章把评测接到 第 44 章、第 46 章、第 70 章 与 第 87 章。测量单位也不再只是回答本身:要先把回答拆成一个个 claim,连到来源,再对照来源内容逐一判断。
四个词不能混成一个
事实性评测里有几个词常被混用。
- Truthfulness 问的是模型是否避免复述常见错误观念。TruthfulQA 正是围绕那些模仿人类文本反而会给出错误答案的问题构造的 (Lin et al. 2021)。
- Factuality 问的是回答里的陈述,在世界中或某份约定参考中是否为真。
- Faithfulness 问的是回答是否忠实于给定来源,即便那份来源不完整或本身有错。
- Attribution 问的是每个需要支持的 claim,是否有一条真正蕴含它的来源(也就是说,来源明确陈述了该 claim,或在逻辑上推出它)。
这些轴可以彼此冲突。模型可以忠实于一段误导性检索材料,因此并不 factual。它可以说出一个真的 claim,却引用了一条并不支持该 claim 的来源。它也可以给出受偏好的回答,却掩盖不确定性。因此,评分前必须先选清楚要测哪一根轴。
这就是事实性需要单独成章的原因。第 50 章 可以判断哪个回答更受偏好,第 47 章 可以判断模型答对了哪些封闭题。它们都不足以处理这样一段生成文本:十二个 claim 里,九个被来源支持,两个无支持,一个被来源反驳。
从回答到 claim
长文本事实性只有在回答被拆开之后才容易测量。FActScore 明确做了这件事:把生成文本拆成原子事实(即一段回答能拆出的、可被单独核查的最小陈述),再计算其中被可靠来源支持的比例 (Min et al. 2023)。示意地写:
其中 是回答, 是第 个原子 claim, 是为该 claim 检索或指定的证据, 是被抽取出的 claim 数量。
这个单位变化很重要。回答级二元分数会把大体正确但混有错误的回答,和完全编造的回答一起惩罚;也可能因为一段回答大多读着顺,就放过其中的假 claim。claim 级评分保留了梯度,也产生更好的调试数据:无支持 claim 往往指向检索失败,被反驳 claim 往往指向综合失败,过度自信 claim 则指向校准失败。
代价是,claim 抽取本身也是模型介导的一步。系统可能漏掉 claim,把一个 claim 切成几个更容易过关的小 claim,或让证据搜索过于宽松。因此,人类审计不仅要审生成器,也要审评分器。
SAFE 是 FActScore 在搜索增强方向上的后继,它把证据这一步做成显式流程:一个 LLM 智能体为每条原子 claim 发起搜索查询,再在结果上推理。在 LongFact 提示集上,这个自动评分器与众包标注者的一致率为 72%,分歧样本上胜率 76%,成本却只有人工的约二十分之一 (Wei et al. 2024)。成本降到这个程度,claim 级核查就可以持续运行,而不必停留在一次性的研究。
短答案与弃答
短事实问答有用,是因为它去掉了许多自由度。SimpleQA 刻意使用只有单一明确答案的问题,并把回答标成正确、错误或不作答 (Wei et al. 2024)。第三个标签正是设计重点。一个少答一些题、但避免错误 claim 的模型,可能比一个自信乱猜的模型更安全。这件仪器自己也没能免于审计:SimpleQA Verified 是一个 1,000 题的修订版,找出并修正了原集里的错误标签、主题偏斜和重复题目 (Haas et al. 2025)。
这把事实性接回校准,也就是 第 48 章 讨论的模型自信程度与其准确率之间的吻合。系统有两个变量:它是否知道答案,以及它是否尝试回答。产品风险常常来自那个非对角位置:它不知道,却仍然回答。TruthfulQA 在更早一代模型上暴露了相近的失败:规模提升会改善许多 NLP 任务,但模仿式训练的大模型也可能更容易复现流行错误观念 (Lin et al. 2021)。
因此,一套事实性评测至少应报告三个率:
- 正确率。 正确回答的问题占比。
- 错误率。 错误回答的问题占比。
- 尝试率。 未弃答的问题占比。
只看第一个不够。模型可以通过什么都答来提高正确率,同时提高有害错误率;也可以通过什么都拒答来降低错误率。运营点是一项策略选择,不是单一分数。
检索系统里的 grounding
RAG(检索增强生成,第 44 章 一章的主题,模型在查询时检索文档来作答,而不是只依赖参数)改变了失效面。检索可能没找到正确证据;上下文构造器可能把它丢掉;生成器可能忽略它;引用层可能指向错误片段。RAGAS 因此把评测拆成检索和生成维度,例如上下文相关性、上下文召回、忠实度和答案相关性 (Es et al. 2023)。ALCE 则把引用质量明确拉出来,检查生成答案的引用是否真正支持文本 (Gao et al. 2023)。FACTS Grounding 把有据生成做成了常设排行榜:长文本回答必须完全立足于给定的、最长 32k 词元的文档,由来自不同家族的评判模型组成评审组,分别核查回答是否切题、是否有据 (Jacovi and others 2025)。
关键区别在于来源是否可用。闭卷事实性问模型从参数里知道什么;检索 grounded 事实性问系统能否使用给定证据。一个基准如果混掉这一区别,结果就难以行动。闭卷失败可能需要弃答或检索;grounded 失败可能需要更好的检索、分块、重排、上下文预算或引用评分。
FEVER 的历史价值在于,它把事实核查组织成 claim、证据和标签,而不是单独看答案文本 (Thorne et al. 2018)。同一个形状回到 RAG 评测里:一个 claim 被检索证据支持、反驳,或证据不足。区别在于,LLM 应用需要在凌乱的生成回答上持续运行这套协议,而不只是在数据集 claim 上运行。
弱信号及其边界
有些事实性信号不需要标准证据。SelfCheckGPT 对黑盒模型多次采样,并检查回答之间的矛盾:如果模型知道某个事实,多次采样应当一致;如果它在幻觉,采样之间更可能分岔 (Manakul et al. 2023)。这是一种便宜预警,但不是真相。许多采样可以一致地复述同一个错误,尤其当这个错误在训练数据里很常见时。
同样,引用数量不是引用支持。一个带五条引用的回答,可以比只带一条来源的回答更差,只要那五条引用只是装饰。来源标题可能与回答主张方向相反;检索片段可能真实,却并不关于这个 claim。评分器要检查 claim 与证据之间的蕴含关系,而不是 URL 是否存在。
它在栈中的位置
事实性评测向全书其他部分输出三类信号。
第一,它服务 第 46 章。如果系统反复因为证据处在长上下文中部而被忽略,产生无支持 claim,那么问题是上下文摆放,而不只是模型质量。
第二,它服务 第 44 章。如果 claim 失败是因为证据从未被检索到,失败归属在索引、检索、重排或文档解析。
第三,它服务 第 53 章。在生产中,高置信的无支持 claim 应该进入回归套件。如果失败来自缺失证据,回归样本必须带上检索器状态;如果失败来自综合,样本必须带上检索片段和模型输出。否则下一次运行无法复现错误。
领域内还没有统一的事实性指标。claim 级指标诊断性更好,却依赖 claim 抽取和证据检索;短事实基准标签更清楚,却测不到长文档综合;RAG 指标可以少依赖人工参考,但常常又依赖模型评判者,重新引入评判者偏差。比较耐久的教训更窄:报告正在测的那个轴。Truthfulness、factuality、faithfulness 与 attribution 相关,但不能互相替代。把其中一项偷换成另一项,正是流畅回答带着装饰性引用被误认为 grounded 的方式。
Grounding 质量在生成器开口之前,就已经受检索和上下文约束。如果 第 44 章 返回了错误片段,或 第 46 章 丢掉了正确片段,任何事实性评分器都无法事后恢复一个 grounded 回答。评测层能揭示失败,并把它路由给正确 owner,但不能让缺失证据凭空出现在上下文窗口里。
延伸阅读
- Lin et al., “TruthfulQA: Measuring How Models Mimic Human Falsehoods” (真实性不同于模仿训练语料), 2021. arXiv:2109.07958TruthfulQA 测试语言模型是否复现人类常见错误观念,发现更大的模仿式训练模型在对抗性问题上可能更不真实。
- Min et al., “FActScore: Fine-grained Atomic Evaluation of Factual Precision in Long Form Text Generation” (原子事实级精确率), 2023. arXiv:2305.14251FActScore 将长文本生成拆成原子事实,并计算其中被可靠来源支持的比例,使真假混杂的段落可被测量。
- Wei et al., “Long-form Factuality in Large Language Models” (SAFE and LongFact), 2024. arXiv:2403.18802SAFE 把长文本回答拆成原子 claim,再由一个发起 Google 搜索查询的 LLM 智能体逐条核查,与众包标注者一致率 72
- Wei et al., “Measuring Short-Form Factuality in Large Language Models” (正确、错误或不作答), 2024. arXiv:2411.04368SimpleQA 用只有单一明确答案的短事实问题评测模型,将回答标为正确、错误或不作答,以衡量模型是否知道自己知道什么。
- Thorne et al., “FEVER: a Large-scale Dataset for Fact Extraction and VERification” (基于证据的 claim 验证), 2018. arXiv:1803.05355FEVER 提出大规模 claim 验证数据集,系统需要检索证据并判断 claim 是被支持、被反驳,还是证据不足。
- Gao et al., “Enabling Large Language Models to Generate Text with Citations” (把引用质量变成可测维度), 2023. arXiv:2305.14627ALCE 从回答正确性、流畅性和引用质量评测带检索的生成,显示强模型也常常缺少完整引用支持。
- Jacovi & others, “The FACTS Grounding Leaderboard: Benchmarking LLMs' Ability to Ground Responses to Long-Form Input” (FACTS Grounding), 2025. arXiv:2501.03200FACTS Grounding 评测长文本回答是否完全立足于给定的、最长 32k 词元的文档,由来自不同家族的评判模型组成评审组,分别核查回答是否切题、是否有据。
- Es et al., “RAGAS: Automated Evaluation of Retrieval Augmented Generation” (检索与生成有各自失效轴), 2023. arXiv:2309.15217RAGAS 为 RAG 流水线提出无参考指标,包括上下文相关性、上下文召回、忠实度和答案相关性。
- Manakul et al., “SelfCheckGPT: Zero-Resource Black-Box Hallucination Detection for Generative Large Language Models” (用采样一致性作为弱事实性信号), 2023. arXiv:2303.08896SelfCheckGPT 通过对黑盒大语言模型多次采样并检查句级不一致,检测生成文本中的幻觉。
评论
登录后评论