AI 基建
0%
第九部分 · 基础设施、算力与前沿 · 第 71 章

能力地平线与对它的测量

作者Changkun Ou
阅读时长约 11 分钟

全书一直在每一层追问同一组问题:一个系统能不能做这件事,代价多大,又能不能信任它。基础设施这一弧的最后一章,要问的是整座技术栈迟早都要回答的问题:前沿到底有多强,我们又凭什么知道?到 2026 年,「前沿」不再是一个排行榜数字,而成了一道移动的地平线;衡量这道地平线最有用的尺子,同时也遮蔽了它最尖锐的极限;测量仪器饱和得比新仪器造出来还快;而这个领域最深的分歧,也就是近来的加速究竟是可持续的进步,还是由算力支撑的短期表象,越来越取决于更好的测量,而不只是另一个更好的模型。本章里的头条数字很可能很快过期,而这份过期本身,正是要点。

2026-06-21T23:30:59.063314 image/svg+xml Matplotlib v3.11.0, https://matplotlib.org/ 1 0 0 1 0 1 模型代际 0.2 0.4 0.6 0.8 完成率 短任务 长任务
图 71.1. 能力地平线的示意图。短任务最先饱和,而更长任务更晚移动;只有测量跟着地平线向外推进,进步才会显现。理想化曲线,非实测。

前沿是一道地平线,不是一个分数

多年来,进步就是一列基准百分比。问题在于这些百分比会饱和:一旦最好的模型在一项测试上越过八十几、九十几,就像在 MMLU(大规模多任务语言理解,一类广覆盖的知识考试)和 GPQA(研究生水平、抗搜索的科学问答)上那样,这测试就不再能把它们区分开,而一项饱和的测试在前沿处什么也测不出。本章采用的重构,把分数换成了一道地平线,量的是一个模型能自主完成的人类任务有多长。这样量出来的前沿是一段时长,而这段时长一直在快速上升。参考工作把一个领先模型在 2026 年初定在约 5 小时的任务完成时长上,几周后又定在约 15 小时,趋势的倍增时间从大约七个月降到几个月 (METR 2026)。这个数字一定还会变大,保持记录的模型也会继续更换。这把尺子之所以宝贵,恰恰因为它是连续的,更接近部署,而不是会饱和的,但它也正是本章核心张力所在。

score 逐渐饱和的分数 (MMLU、GPQA 接近上限) horizon 任务完成地平线 2026 年初 50% 可靠性下约 5h → 15h 倍增时间从约 7 个月降到数月 score->horizon 被取代为 gap 但 80% 可靠性地平线 约短 5 倍 (真正有用的门槛) horizon->gap
图 71.2. 把前沿重构成一道地平线:一个模型能自主完成的任务有多长,快速上升,倍增时间同时缩短。头条是 50% 可靠性下的地平线;具有经济价值的 80% 地平线大约要短五倍,而这道差距正是核心约束。

会遮蔽极限的头条数字

地平线是按某个成功率报出来的,而选定的成功率会让能力看起来更强。头条数字,是一个模型有一半时候能完成的任务有多长。可真实工作需要的不止是五成把握;在高可靠性门槛下,也就是十次里完成八次的地平线,大约要短五倍 (Kwa et al. 2025)。一个有着 15 小时五成地平线的模型,八成地平线大概只有 3 小时,而真正框定它能被信任去独立担起多少事的,是第二个数字。这就是本章的核心约束:一个模型有时能完成的任务,和它能可靠完成的任务,两者之间隔着一道又宽又顽固的差距,后者明显落在前者后面。

第 69 章 里压低长智能体可靠性的那套复合逻辑,这里也在起作用:每一步的可靠性在一个长任务的许多步上复合,衰减得很快,于是单步上再高的胜任度,仍只换来完整完成长任务的很低概率。地平线这把尺子量的是症状,复合衰减才是根因。

下层约束

五成与八成可靠性之间的差距,是模型层每步成功率的一个性质,它把具有经济价值的地平线压到头条的大约五分之一。底层的可靠性,决定了上面那个自主层能担起哪些任务(参见 第 52 章)。而整条趋势的斜率,同样是由更下面一层定的:近来的提速,大半来自强化学习和测试时算力,于是这把前沿尺子走多快,取决于一个训练后算力的选择,而不是预训练的规模。预训练是从原始数据出发、一遍跑下来构建出基座模型的那次大规模训练;训练后则是之后有针对性地打磨它的工作,包括强化学习和额外的推断时算力(参见 第 30 章第 28 章)。

把能力和价值对应起来

如果说地平线是让能力有所指的一种尝试,那么经济评测就是另一种。经济基准不再考问答题,而是给真实的工作产物打分,那是从许多职业里抽出的交付物,由专家盲评。在其中最直接的一项工作上,2025 年 9 月的首轮结果是:最好的模型 Claude Opus 4.1 在将近一半(47.6%)的任务上,产出了被评为不逊于甚至优于人类专家的交付物,而所花的时间和成本约为百分之一 (OpenAI 2025)。「将近一半」在当时读作逼近持平,而不是已经持平。这个读法没撑过一年:到 2026 年,最好的模型在大约七成的盲评对比中胜过或追平人类专家 (Epoch AI 2026)。按这套基准自己的标准,持平线已经越过,悬而未决的问题也随之挪了位置:不再是模型能不能追平盲评里的专家,而是赢下的对比在真实工作里值多少。还有一条平行的线索,问的是模型能不能做出造下一个模型的研究,结果显出一个很能说明问题的形态:智能体在短时间预算下胜过人类专家,在长时间预算下又输给他们 (Wijk and others 2025)。这又是那道地平线极限,短程胜任能成功的地方,恢复与远程规划却失败了。

这一切能否换成可测量的生产力,是另一个有争议的问题,而最干净的一项研究是个警示。2025 年初一项对照试验发现,有经验的开发者在 AI 辅助下慢了约 19%,却自以为更快了 (METR 2025)。那个结果是 2025 年初那批工具的一张快照,不是一条定律:同一批人后来报告说,用 2026 年的工具,提升看起来是正的,同时也警告,选择效应让这个新信号很弱。谨慎的说法是:能力和可测量的生产力不是同一个量,自我报告会夸大,而从基准到职场的迁移确实存在,只是比那些头条暗示的更小、更慢。

仪器在饱和

朝地平线和经济价值的重构,本就是被饱和逼出来的,而饱和如今也开始追上这些新仪器。专门造的高难度基准有效期很短:一项刻意设置为高难度的专家考试(Humanity's Last Exam,HLE),发布几个月内就从三十几个百分点爬过五十 (Center for AI Safety and Scale AI 2026),而一项为抵抗记忆而设计的抽象与推理挑战(ARC-AGI-2),在一年多一点的时间里从基本为零越过人类平均分,冲到八十五上下 (Chollet et al. 2025; ARC Prize Foundation 2026)。连锚定本章的那套地平线测试组,如今也逼近饱和,这正是它最新的头条带着一个跨越将近一个数量级的置信区间的原因。那把仪器本是为了比别的尺子用得更久才造的,如今也撞上同一堵墙,维护者已经在造继任者。本章的核心张力可以概括为一个事实:对前沿的测量,老化得和前沿一样快。

图 71.3. 一项基准的最高分,在发布之后的几个月里,从接近零一路爬到饱和。陡峭度越高,高难度基准被解决得越快;它饱和得越快,下一把尺子就得越早造出来。
saturation mmlu MMLU / GPQA 已饱和(>88%、约 94%) hard HLE / ARC-AGI-2 刻意造难,快速攀升 mmlu->hard 逼出 horizon 任务地平线套件 如今接近饱和 hard->horizon 逼出 next 后继测量工具 (建设中) horizon->next 继续逼出
图 71.4. 仪器饱和得比能造出来还快。每一代基准都为抵抗饱和而生,在模型把它耗尽时陡峭攀升,又逼出下一把尺子。那套为了比分数活得更久而造的地平线测试组,如今自己也逼近饱和。

回应不只是更难的测试,还有对测量本身的重建。一场构念效度运动,审查一个基准究竟有没有测出任何定义明确的能力,发现许多并没有,于是夸大了自己的普适性。一个通用尺度项目,围绕能力画像和实例级预测重建评测,力求让一个分数能解释,而不只是一个孤立的数字 (Hernández-Orallo and others 2026; Construct Validity Review 2025)。还有人直接审视地平线这把尺子,追问它的人类时长基线能不能更便宜地推断出来,以及这条趋势反映的是真实能力,还是任务选择造成的表象。与此并行的,是一条更硬的证据:基准是能被利用的。好几套智能体测试组在并没真正解决任务的情况下,被推到接近满分,这就把「基准表演」从一句抱怨变成了一种被证实的失效模式。

这加速是真的吗?

这就把问题带到了一个仍然悬而未决的判断,这个判断应当一直敞开,而不是假装已经了结。地平线在攀升,倍增时间在缩短。一派把这读成可持续的加速,认为前沿正在朝通用能力持续积累,并最终朝能改进自己继任者的系统推进;这个推断最审慎的版本,把对 AI 研究的大规模自动化放在 2030 年代初,前提是关于算力和软件效率的激进假设,而它把自己标作一个推断,而非一个结果,因为还没有任何已发表的系统在一个闭环里实质地改进了自己的继任者 (METR 2026)。另一派把这提速读成由算力支撑的短期增益:近来的收益大半来自强化学习和测试时算力,置信区间很宽,而一旦那份算力变得紧张,倍增就可能退回它更老的步伐。平台期观点最有力的论断认为,靠规模取得进步的时代正在终结,前沿将由可适应性的成本、而非由模型尺寸来定义 (Hooker 2026);延续观点最有力的论断则认为,规模化是在换轴,不是在停下。

争议所在
  • 可持续的加速,还是由算力支撑的短期表象? 一派把缩短了的倍增时间看作一条真实、持续的趋势。另一派,包括测量者自己的告诫,看到的是来自强化学习和测试时算力的一次性收益,一旦算力变成约束就会回退。置信区间宽到能同时容下两者。
  • 规模化是不是遇到了框住前沿的约束? 一个数据见顶派认为,靠规模做预训练正在终结,可适应性成为主要成本。一个延续派认为,增长只是搬到了训练后和推断时算力上。其中的机理留到 第 5 章 再谈;这里有争议的,是被测出的能力趋势会不会继续。
  • 基准到底测没测出通用能力? 一个构念无效派说,多数基准缺少一个被定义的构念,并夸大其辞。一个改革派想围绕能力画像重建评测。一个务实派只把排行榜当作筛选,而在自己的任务上信赖分层的人工复核。
  • 是真实的证据,还是基准表演? 饱和、污染,以及已被证实的可被利用性,都论证那些头条分数是营销。而专门造的、盲评的、控制了污染的评测,则论证它们仍能区分模型,也仍比老考题更能预测部署。
  • 能力会变成生产力吗? 被感知到的提升很大;一项对照试验发现了减速;后来的信号是正的,但很弱。这份迁移是真实的,比宣称的小,且难以测量。

地平线也是测量工具

这一弧落在测量工具上,而不是落在模型上。严谨地测量,能力是一道地平线;它确实在上升,也确实在要求可靠性之后比头条更短。效率重构了趋势本身:这加速由推断时和训练后算力支撑,于是进步的斜率如今既是一个科学问题,也同样是一个支出问题,这又绕回到开启本部分的算力与电力约束。信任构成本章的核心:这个领域还无法证明自己的数字真如其所宣称的那样,因为这些仪器会饱和、能被利用、又不会干净地迁移到工作上,而一家需要信任一个模型的企业,仍只能退回到对自己任务的分层人工复核。

因此,2026 年的前沿不是一个数字。它是一组移动的极限,其中许多在芯片之下,许多在模型之上。测量是这些上层极限之一,但还不是最后一个。第 72 章 会往前再走一步:如果模型能产出一个普通审查者不能迅速检查的结果,前沿就已经从能力移动到了接受机制。

延伸阅读

  • METR, “Time Horizon 1.1” (地平线这把尺子,以及 50), 2026. metr.org
    METR 发布 Time Horizon 1.1,使用更多任务和新评测基础设施更新 AI 智能体任务完成时间跨度的基准估计。
  • Kwa et al., “Measuring AI Ability to Complete Long Tasks” (地平线这把尺子,以及 50), 2025. metr.org
    METR 提出以智能体能自主完成的任务时长衡量 AI 进展,发现该指标在过去 6 年中每约 7 个月翻倍一次。
  • OpenAI, “GDPval: Evaluating AI Model Performance on Real-World Economically Valuable Tasks” (经济任务完成:交付物对照人类专家评判), 2025. arXiv:2510.04374
    GDPval 是一个覆盖 44 个职业、9 个美国 GDP 行业、共 1,320 个任务的基准测评,通过成对比较显示前沿模型正在接近行业专家水平。
  • Wijk & others, “RE-Bench: Evaluating Frontier AI R&D Capabilities of Language Model Agents against Human Experts” (AI 研发自动化:智能体在短预算下赢,在长预算下输), 2025. arXiv:2411.15114
    RE-Bench 是一个包含七个机器学习研究工程任务的基准,将前沿 AI 智能体与 61 位人类专家进行对比,发现智能体在 2 小时预算下得分是人类的 4 倍,但人类在 8 小时及更长时间预算下超越了智能体。
  • Center for AI Safety and Scale AI, “Humanity's Last Exam” (抗饱和的前沿基准,却仍爬得飞快), 2026. agi.safe.ai
    Humanity's Last Exam(HLE)是一个包含 2500 道专家级题目的评测基准,覆盖多个领域,旨在对前沿大语言模型构成极限挑战。
  • Chollet et al., “ARC-AGI-2: A New Challenge for Frontier AI Reasoning Systems” (抗饱和的前沿基准,却仍爬得飞快), 2025. arXiv:2505.11831
    ARC-AGI-2 是 ARC-AGI-1 的升级版基准测试,包含更难且不易被暴力搜索攻克的抽象推理任务,并提供大规模第一方人类基线,旨在更精细地衡量 AI 向通用智能的进展。
  • Hernández-Orallo & others, “General Scales Unlock AI Evaluation with Explanatory and Predictive Power” (测量科学的大修), 2026. arXiv:2503.06378
    本文提出 18 条通用需求级别评分准则(ADeLe),对大语言模型基准测试实例进行标注,从而生成可解释的能力画像,并实现分布内外的实例级性能预测。
  • Construct Validity Review, “Measuring What Matters: Construct Validity in Large Language Model Benchmarks” (测量科学的大修), 2025. openreview.net
  • METR, “Measuring the Impact of Early-2025 AI on Experienced Open-Source Developer Productivity” (19), 2025. arXiv:2507.09089
    一项随机对照试验(RCT)对16名有经验的开源开发者进行研究,发现使用2025年初前沿 AI 工具(Cursor Pro 配合 Claude 3.5/3.7 Sonnet)实际使任务完成时间增加了19
  • Hooker, “On the Slow Death of Scaling” (平台期与自我改进推断之争), 2026. papers.ssrn.com
  • METR, “A Simpler AI Timelines Model Predicts 99% AI R&D Automation in  2032” (平台期与自我改进推断之争), 2026. metr.org
    METR 提出一个仅含 8 个参数的 AI 时间线预测模型,预测到约 2032 年 AI 研发将实现约 99
  • Epoch AI, “GDPval” (2026 年对专家盲评的胜或平比率), 2026. epoch.ai
    Epoch AI 对 GDPval 基准的持续追踪:2026 年最好的模型在约 71
  • ARC Prize Foundation, “ARC-AGI Leaderboard” (截至 2026 年年中的 ARC-AGI-2 最高分), 2026. arcprize.org
    ARC-AGI 实时排行榜:到 2026 年 6 月,ARC-AGI-2 最高分已到八十五上下,远超人类平均分。

评论

登录后评论