能力地平线及其测量
前沿不再是排行榜上的一个数字,而是一道移动的地平线:任务、可靠性、成本和监督各有极限,而且移动速度并不相同。因此,前沿不是一个标量,而是一个测量问题。头条数字仍然可以提供信息,但必须连同测量契约一起解读:受测系统是什么、抽取了哪些任务样本、允许多少资源预算、采用什么成功阈值,以及数据来自哪个快照日期。
这一区分很重要,因为同一份证据可以支持截然不同的叙述。任务地平线上升,可能代表经得起复测的进步,也可能部分只是算力堆出来的表象。模型可以在盲评中胜过专家的一份交付物,却无法自动完成交付物周围的整项工作。基准分数快速上升,既可能源于能力进步,也可能是工具改变或测量工具更容易被利用。本章将分别讨论这些主张,不把它们压缩成一个分数。
地平线是拟合得到的阈值
任务完成地平线并不等于智能体实际运行了多久。它用人类完成时间作为任务难度的代理量,再估计任务变长时,系统的成功率如何变化。METR 最初的研究主要考察范围明确的软件开发、机器学习和网络安全任务。因此,研究结果描述的是该任务分布上一个固定的系统与协议,不是系统在所有同等时长的现实任务上成功的概率 (Kwa et al. 2025)。
设任务 的人类完成时间为正数 ,其中 标识任务。对第 次重复尝试,如果受测系统成功,则令 ;否则令 。拟合模型的一种简单形式是
其中, 是二元结果, 是人类完成时间, 是拟合截距, 是拟合斜率, 是自然对数, 把拟合值映射为概率。给定成功阈值 ,对应的地平线为
表示拟合成功概率等于 时所对应的人类任务时长。它是带有不确定性的估计值,不是观测到的任务边界。模型检查点、智能体运行框架、工具权限、任务分布、人类时间基线、重复尝试、词元预算、时间预算、评分规则和测量日期,全都属于这项协议。
阈值会改变答案
50% 地平线便于传播,但许多部署场景要求高得多的可靠性。80% 地平线来自同一条拟合曲线。它与 50% 地平线之间的距离为
也就是说,两者之比取决于拟合斜率 ,不是普适常数。原始研究中的拟合结果约四到六倍,后续模型的估计则分散得更广 (Kwa et al. 2025)。因此,「短五倍」可以描述某一次经验拟合,却不能上升为定律。
下面的计算把 18 小时和 3.5 小时作为 2026 年初公开区间的示例中点,只反推出这两个阈值隐含的斜率。它不会重新拟合 METR 的逐任务数据。
from math import log
h50 = 18.0
h80 = 3.5
beta = log(4.0) / log(h50 / h80)
print(f"fitted slope: {beta:.3f}")
print(f"50% / 80% horizon ratio: {h50 / h80:.3f}")
另一种直觉有时也有帮助,但必须与地平线拟合分开。假设一项任务由 个相互独立且性质相同的步骤组成,每一步以概率 成功,那么所有步骤都成功的概率是 。这个玩具模型说明了长流程为什么容易失效。真实的智能体轨迹并不满足步骤相互独立、性质相同的假设,而地平线研究也没有认定逐步失败就是作用机制。因此,它只是示意,不是因果解释。第 69 章 讨论的恢复与错误累积,在工程上与此相关,但不能用来推导地平线曲线。
测量层选择的阈值,决定了自主层可以安全承担什么。50% 地平线适合追踪能力,通常不足以支持无人监督的生产承诺。真正需要的阈值,应由失败成本和 第 52 章 所述的复核路径决定。推理时算力和训练后方法都可能移动测得的曲线,但必须识别各自影响,不能想当然(参见 第 30 章 和 第 28 章)。
趋势估计取决于条件
地平线套件 1.1 版把这个测量问题直接暴露出来。任务数量从 170 项扩展到 228 项,其中 31 项预计需要人类至少八小时完成。只有其中五项测得了真实的人类时间基线,其余都使用估计值。2026 年 1 月发布的结果显示,Claude Opus 4.5 的 50% 地平线为 320 分钟,区间为 170 至 729 分钟 (METR 2026)。也就是说,约五小时的点估计周围有一个很宽的区间。
报告中的倍增时间也会随回归窗口变化。Time Horizon 1.1 的混合序列,用全部历史数据拟合得到 196.5 天;从 2023 年开始拟合得到 130.8 天;从 2024 年开始拟合则得到 88.6 天。这些是不同的拟合窗口,并不是同一只时钟在几周内从七个月加速到三个月。任务构成、基线估计、模型选择和较短的近期窗口都会影响趋势。
到 2026 年 2 月和 3 月,METR 报告了一个内部共享模型:50% 地平线的点估计在 16 至 20 小时之间,80% 地平线在三至四小时之间。同一份报告也警告,套件无法可靠测量超过 16 小时的地平线,因为只有五项任务长于这一时限。这个内部共享模型不是具名的公开检查点,而且每次运行使用了 1,600 万至 6,400 万词元,高于早期历史测试的预算 (METR 2026)。这说明前沿正在逼近测量工具的边界,但不能视为一月公开模型序列的直接延续。
经济任务衡量的是偏好,不是岗位
GDPval 不再使用考试题,而是比较专业交付物。完整数据集包含美国经济九个行业、44 种职业的 1,320 项任务,任务编写者平均有 14 年经验。首次公开评测采用 220 项开放金标子集,让职业背景相符的专家在不知道来源的情况下,比较模型交付物与任务编写者的交付物 (Patwardhan et al. 2025)。
首次发布时,Claude Opus 4.1 在 47.6% 的已评分比较中获得「更好或相当」的判断。这是胜出与持平之和,不是单纯的胜率,更不是 47.6% 的岗位已经自动化。OpenAI 在 2026 年 4 月 23 日发布的后续结果显示,GPT-5.5 在原始 GDPval 上达到 84.9% 的胜出与持平比例,测试使用 xhigh 推理并在研究环境中进行 (OpenAI 2026)。后续发布没有披露足够细节,不能假定每一项采样与评分选择都与首次测试完全相同。
这些任务都是要求明确的一次性交付,省略了工作中的许多环节:判断该做什么、收集隐性背景、协商需求、与客户反复修改,以及为结果承担责任。所谓时间或成本约低一百倍,只计算纯模型推理与 API 费用,不包含人工监督、系统集成、迭代和返工。因此,84.9% 是一项基准中的交付物偏好率,不是职业自动化率。
RE-Bench 测量的是另一种对象。它包含七个独立的机器学习研究工程环境。人类对照由 61 名不同的人类专家完成,共计 71 次八小时尝试。在每个环境两小时总计算机时间预算下,最佳智能体配置的标准化分数约为人类平均标准化分数的四倍。预算增至八小时时,人类略微领先;到 32 小时,人类分数约为最佳智能体的两倍 (Wijk et al. 2025)。这些结果采用特定资源分配下的 best-of-k,不一定来自一次连续尝试。七个工程环境上的标准化分数能说明短预算搜索能力,但不是端到端研究自动化。
能力不等于生产力
一项随机对照研究具体展示了这种迁移差距。2025 年 2 月至 6 月,16 名拥有丰富开源经验的开发者,在自己熟悉的代码仓库中完成了 246 项任务。他们主要使用 Cursor Pro 与 Claude 3.5 或 3.7 Sonnet,但完成任务反而多花了 19% 的时间。研究开始前,他们预计会快 24%;研究结束后,仍认为自己快了 20% (Becker et al. 2025)。这个结果只适用于该样本、这些工具与任务,却有力说明了感知速度和实测速度可以背离。
2026 年 2 月的一次后续研究给出未经校正的估计:回访开发者有 18% 的提速,新加入的开发者有 4% 的提速。METR 认为两项信号都不可靠,因为回访参与者和任务存在选择偏差、报酬制度发生变化,而且同时使用多个智能体,使完成时间不再是可靠代理量 (Becker et al. 2026)。这次更新没有推翻随机对照结果,而是说明原协议已不能准确测量新的工作方式。基准能力、任务耗时、自报价值和因果生产力是四个不同的量,目前没有已知的稳定换算关系。
基准会以不同方式老化
测量工具可能因上限效应、污染、协议漂移或可利用性而失去价值。这些是不同的故障。已经饱和的基准仍能发现较弱系统的回归,只是在前沿没有多少区分空间。2026 年发表的 HLE 论文指出,前沿系统在 MMLU 上已超过 90%,因此构建了一套更难的题集,包含 100 多个学科的 2,500 道专家级问题 (Center for AI Safety et al. 2026)。
HLE 本身也说明了为什么必须标注协议。截至 2026 年 8 月 7 日,Scale 官方不使用工具排行榜的最高分是 46.44%。另行报告的启用工具结果则超过 50%。不使用工具和启用工具的分数不属于同一条干净的曲线,因为检索和代码执行改变了受测系统 (Scale AI 2026)。
ARC-AGI-2 的变化也很快。2025 年 5 月的技术报告中,领先模型的基线低于 5% (Chollet et al. 2025)。DeepMind 在 2026 年 2 月报告了经 ARC Prize 验证的 84.6% 分数 (Google DeepMind 2026)。模型结果与报告中的人类平均分来自不同的评测集,两套题只经过难度校准,并非完全相同的题目。算力、成本和访问条件也不同。2026 年的竞赛仍在完全私有题集上设置 85% 的奖金门槛。按该协议,这项基准尚未被解决。
构念效度会先问一个更基础的问题:这个分数声称测量的究竟是什么能力?一项 NeurIPS 综述邀请 29 名专家审查 445 篇基准论文,最后提出八项建议。研究发现,构念定义、现实任务覆盖、统计检验和效度论证经常存在缺口,但并没有证明每一项基准都毫无测量价值 (Bean and others 2025)。作为补充,General Scales 研究在 15 个语言模型和 63 项任务上演示了 18 份需求量规,用逐实例标注来解释和预测难度。这是一种经过初步测试、值得关注的方法,还不是通用的评测替代方案 (Zhou et al. 2026)。
可利用性的问题更直接。BenchJack 在 2026 年的预印本中审计了十个智能体基准,记录 219 个缺陷,并在没有完成原定任务的情况下,为十个中的九个构造出接近满分的利用方式 (Wang et al. 2026)。这是一项掌握基准内部信息、刻意寻找漏洞的对抗性审计,不代表普通模型运行总是在作弊。它证明的是:一个分数若未经对抗性审计,就不足以支持宽泛的能力主张。
在某些快速发展的领域,测量工具饱和得比新工具建成还快,但饱和既不是唯一故障,也不会必然发生在每项测试上。替换一项基准,只有在提高难度的同时改善构念、协议和抵抗捷径的能力,才真正有用。
预测是情景,不是测量
只要假设始终清楚可见,趋势外推仍然有用。一项探索性的八参数模型预计,2032 年前后超过 99% 的 AI 研发任务可以自动化。作者明确说明,参数值只是有依据的猜测,模型与文章共花费约 15 小时,没有回测,而且他本人并不看重这个精确日期 (Kwa 2026)。这是情景推演,不是测量结果,也不代表机构共识。
进步究竟能否持续,还是主要来自新增算力,不能靠挑选一条偏爱的拟合曲线来裁决。主张趋势将延续,需要证明收益在冻结任务、系统预算和可靠性阈值后仍然存在。主张约束即将出现,则需要证明某项具名资源成为瓶颈后,趋势确实转弯。强化学习、智能体运行框架和测试时算力的变化都可以作为候选解释,却不能仅从地平线本身推出结论。资源层面的机制见 第 5 章。
- 移动的究竟是什么? 基座模型、智能体运行框架、工具、预算和任务套件都能移动地平线。目前还没有一套长期冻结的协议,能够隔离每一项贡献。
- 哪种可靠性才重要? 50% 适合追踪趋势。现实部署可能要求 80%、98%,甚至超过 99%,具体取决于失败成本和复核机制。
- 分数能否迁移为价值? 交付物偏好、研究环境分数、任务耗时和职场生产力彼此相关,却不是同一个量。
- 基准快速进步是否持久? 它可能来自真实进步、工具权限、协议漂移、污染、漏洞利用,或其中几项共同作用。
- 应该多大程度相信预测? 透明的情景会暴露假设,但不会把假设变成观测事实。
建立测量台账
前沿主张只有连同测量契约一起交付,才有使用价值。每项结果至少应记录:
| 台账字段 | 记录内容 |
|---|---|
| 构念 | 结果试图代表的能力或结果 |
| 任务样本 | 纳入规则、抽样框架、人类时间基线与排除项 |
| 系统定义 | 模型检查点、智能体运行框架、工具、提示与调整方式 |
| 资源预算 | 墙钟时间、词元与推理预算、重试次数和并行度 |
| 重复次数 | 每项任务的运行次数、采样策略,以及各次尝试是否相互依赖 |
| 评分者 | 成功标准、评判者身份、平局处理与裁决流程 |
| 完整性 | 污染检查、隐藏题集与对抗性审计结果 |
| 不确定性 | 区间、任务差异、评判者差异,以及结果对拟合选择的敏感程度 |
| 快照 | 测量日期、代码和数据集版本,以及后续协议变更 |
| 部署关联 | 证明基准构念与目标工作流有关的证据 |
| 责任人 | 负责重新运行、解释和停用这项测量的人 |
这份台账不会让某一项基准成为最终标准,却能让比较接受审计。系统、任务或部署发生变化后,它也能说明一项结果何时已经过期。
因此,前沿是一组不断移动、且依赖条件的极限。地平线可以揭示已经饱和的问答题无法显示的进步;经济任务让评测更接近工作;对照研究则检验这种价值能否在部署中保留下来。三者不能相互替代。第 72 章 会往前再走一步:当模型能够产出普通审查者无法低成本验证的工作时,能力测量就必须让位于验收与控制。
延伸阅读
- METR, “Time Horizon 1.1” (地平线这把尺子,以及 50% 对 80% 可靠性的方法学), 2026. metr.orgMETR 发布 Time Horizon 1.1,使用更多任务和新评测基础设施更新 AI 智能体任务完成时间跨度的基准估计。
- Kwa et al., “Measuring AI Ability to Complete Long Software Tasks” (地平线这把尺子,以及 50% 对 80% 可靠性的方法学), 2025. arXiv:2503.14499METR 提出以智能体能自主完成的任务时长衡量 AI 进展,发现该指标在过去 6 年中每约 7 个月翻倍一次。
- METR, “Frontier AI Risk Report: February–March 2026” (超过 16 小时后的测量饱和警告,以及高预算内部模型的结果), 2026. metr.orgMETR 报告称,一个共享的内部模型已接近 Time Horizon 1.1 的可测上限,并警告该测试套件无法可靠区分 16 小时以上的任务跨度。
- Patwardhan et al., “GDPval: Evaluating AI Model Performance on Real-World Economically Valuable Tasks” (经济任务完成:交付物对照人类专家评判), 2025. arXiv:2510.04374GDPval 是一个覆盖 44 个职业、9 个美国 GDP 行业、共 1,320 个任务的基准测评,通过成对比较显示前沿模型正在接近行业专家水平。
- Wijk et al., “RE-Bench: Evaluating Frontier AI R&D Capabilities of Language Model Agents against Human Experts” (AI 研发自动化:智能体在短预算下赢,在长预算下输), 2025. proceedings.mlr.pressRE-Bench 是一个包含七个机器学习研究工程任务的基准,将前沿 AI 智能体与 61 位人类专家进行对比,发现智能体在 2 小时预算下得分是人类的 4 倍,但人类在 8 小时及更长时间预算下超越了智能体。
- Becker et al., “Measuring the Impact of Early-2025 AI on Experienced Open-Source Developer Productivity” (19% 减速,作为 2025 年初的一张快照), 2025. arXiv:2507.09089一项随机对照试验(RCT)对16名有经验的开源开发者进行研究,发现使用2025年初前沿 AI 工具实际使任务完成时间增加了19%。
- Becker et al., “We Are Changing Our Developer Productivity Experiment Design” (解释后续原始生产率估计为何不能沿用原实验方案作可靠推断), 2026. metr.orgMETR 报告了原始数据中看似正向的估计,同时说明样本选择、补偿方式和并发使用智能体为何使后续研究无法可靠衡量因果效应。
- Center for AI Safety et al., “A Benchmark of Expert-Level Academic Questions to Assess AI Capabilities” (抗饱和的前沿基准,却仍爬得飞快), 2026. nature.comHumanity's Last Exam(HLE)是一个包含 2500 道专家级题目的评测基准,覆盖多个领域,旨在对前沿大语言模型构成极限挑战。
- Chollet et al., “ARC-AGI-2: A New Challenge for Frontier AI Reasoning Systems” (抗饱和的前沿基准,却仍爬得飞快), 2025. arXiv:2505.11831ARC-AGI-2 是 ARC-AGI-1 的升级版基准测试,包含更难且不易被暴力搜索攻克的抽象推理任务,并提供大规模第一方人类基线。
- Zhou et al., “General Scales Unlock AI Evaluation with Explanatory and Predictive Power” (测量科学的大修), 2026. nature.com本文提出 18 条通用需求级别评分准则,对大语言模型基准测试实例进行标注,从而生成可解释的能力画像。
- Bean & others, “Measuring What Matters: Construct Validity in Large Language Model Benchmarks” (测量科学的大修), 2025. papers.neurips.cc一项涵盖 445 篇基准论文的系统综述记录了反复出现的缺陷,并提出八项提升构念有效性的建议。
- Wang et al., “Do Androids Dream of Breaking the Game? Systematically Auditing AI Agent Benchmarks with BenchJack” (对十项智能体基准可利用性的对抗性审计), 2026. arXiv:2605.12673BenchJack 汇总了 219 项缺陷,并在刻意对抗的协议下,为十个受审计智能体基准中的九个构造出接近满分的捷径。
- Kwa, “A Simpler AI Timelines Model Predicts 99% AI R&D Automation in ~2032” (平台期与自我改进推断之争), 2026. metr.orgMETR 提出一个仅含 8 个参数的 AI 时间线预测模型,预测到约 2032 年 AI 研发将实现约 99% 的自动化。
评论
登录后评论