AI 基建
0%
第九部分 · 基础设施、算力与前沿 · 第 70 章

学习在哪里遇到极限

作者Changkun Ou
阅读时长约 10 分钟

前面几章走到了物理机器的极限。下一道极限藏在学习本身之内。过去七年推动进步的廉价资源正在接近耗尽;每一种替代方案都仍有争议,而非已有定论;已部署的模型无法从所见之物里继续学习;幻觉看上去也不像一个等着打补丁的 bug,而更像目标函数本身的一个属性。数据墙、合成数据、在推理上做强化学习、测试时算力、持续学习、幻觉,并非六个各自独立的问题,而是同一个科学问题的六个侧面:一个系统被训练去模仿一个有限的语料,然后被冻结,它学到了什么,又停止学习了什么;这个领域提出的几条出路,哪些真正改变了这个答案,哪些只是把它往后推。

2026-06-21T23:31:17.709656 image/svg+xml Matplotlib v3.11.0, https://matplotlib.org/ 2024 2025 2026 2027 2028 2029 2030 年份 0.0 0.5 1.0 1.5 2.0 2.5 相对词元压力 高质量存量 训练需求
图 70.1. 高质量训练数据压力的示意图。易得存量耗尽后需求仍可能继续上升,迫使学习转向过滤、经验与合成信号。理想化曲线,非实测。

一个支撑训练配方的数字

深度学习时代的大半时间里,配方都很简单:更多算力、更多参数、更多文本、更低损失,正如 第 5 章 所阐述的。这个配方依赖一种低成本资源,也就是互联网上积累起来的公开文本。前沿的麻烦在于这份资源是有限的。Epoch AI 估计,经质量调整后的公开人类文本,其有效存量约在 300T 词元量级,不确定性很大;他们预测它有 80% 的概率会在 2026 到 2032 年之间的某个时点被完全消耗掉,而前沿实验室已经在实践的激进过度训练,把这个时点推向了窗口的近端 (Villalobos et al. 2024)。训练算力每年仍在数倍增长,高质量人类文本的供给却基本持平。这两条曲线相交,就是数据墙。

本章其余内容,都从这两条曲线的交点展开。一旦没法简单地再添更多人类文本,往前走的路就只剩下几条:制造一种替代品,从文本之外的信号里学习,把更多算力花在推断而非训练上(测试时算力),或者从已有的数据里提取更多信号。每一条都是一个活跃的研究项目,而它们之所以都有争议,恰恰因为每一条都在试图替换那份已经消失的廉价进步来源。

wall 数据墙 ~300T 有效人类词元 2026--2032 耗尽 80% syn 合成数据 (累积,而非替换) wall->syn rl 可验证奖励的 RL (信号,而非文本) wall->rl ttc 测试时算力 (花在推断上) wall->ttc eff 数据效率 (从同一存量里提取更多) wall->eff
图 70.2. 数据墙作为整章之下的约束。算力每年数倍增长;高质量人类文本的存量则基本持平。两条曲线相交之处,每一条出路都是在试图制造或替代缺失的学习信号,而每一条都有争议。
下层约束

有限的人类文本存量,在往上两层的地方决定了训练策略。它正是前沿运行为何会过度训练、远远越过 第 5 章 那条 Chinchilla 词元对参数比(在计算最优时约为每个参数二十个训练词元)的原因,也是合成数据流水线为何变得居于核心(第 23 章)的原因,更是边际研究经费为何转向把强化学习和测试时算力当作增长轴的原因。一个关于数据供给的数字,重塑了整套训练配方。

合成数据能否替代人类数据?

最直接的替代品是合成数据:由模型生成、用来训练模型的文本。其危险是模型崩溃。在一个模型自己的输出上递归训练会使它退化,一个著名的结果显示,这种退化会跨代累积,直到分布收窄成噪声 (Shumailov et al. 2024)。粗心地读,这个结果像在说合成数据有害。仔细地读,它说的是一件更狭窄、也更有用的事:崩溃发生在合成数据替换真实数据的时候。当合成数据是在真实存量旁边累积、而非替换它时,误差保持有界 (Gerstgrasser et al. 2024)。因此 2025 年的共识是有条件的:如果合成数据是添加在人类数据之上、而非替代它,它就能延展预训练,而万亿词元规模的生产流水线,靠的正是这一区分。

有两个保留意见,使这远算不上一个明确结论。第一个是知识崩溃:即便损失保持有界,合成的体制也可能在保住流畅度的同时悄悄丢失事实,于是模型听上去仍然对,懂得却更少。第二个则指向相反方向,使整个「数据已经耗尽」的框架更复杂:一项关于在实际无限算力下做预训练的研究发现,配上重度正则化和集成,一个固定的数据存量能持续产出改进,这意味着这道约束在一定程度上是一个数据效率的问题,而不只是数据数量的问题 (Kim et al. 2025)。如果一个实验室愿意投入算力,从已有文本里提取更多信号,这个约束就可能远得多。

从信号而非语料里学习

另一条出路是不再模仿文本,转而去优化一个奖励。可验证奖励的强化学习,第 28 章 那些推理模型背后的引擎,从可以被机械检验的信号里学习,比如一个正确的数学答案、一个通过的单元测试,而不是从人写的词元里学习。因为奖励来自世界、而非来自语料,它就不会像文本那样被数据墙以同样的方式束缚。

悬而未决的科学问题,比工程上的成功所暗示的更尖锐:这种强化学习是创造出了新的推理能力,还是只激发了基座模型(即未经任何后训练的原始预训练模型)本就具备的能力?一批证据指向激发。一个经强化训练的模型,在每个模型都只许尝试一次时胜过它的基座模型,但当两者都被允许尝试数百次时,基座模型会追上来并反超它,这表明训练锐化的是对那些基座模型本就能找到的解的采样,而不是添加了它本找不到的解 (Yue et al. 2025)。相反的证据则指向创造:有报告称,经过延长的、被稳定下来的强化学习,能在很多次尝试下仍提升性能,解出基座模型在任何预算下都做不出的问题 (Liu et al. 2025)。最新的读法是,争论中心的度量本身就值得怀疑,因为多次尝试这个指标捕捉的可能是一个模型探索得有多宽,而非它能力的边界,这意味着激发与创造之争并未结束,而是被重新打开了。测试时算力,即把更多推断花在更长的思维链或搜索上,是第三条轴,它同样有一个有争议的上限:回报递减,而且过了某一点,更长的推理反而会丢掉一个本来正确的答案,所以想得更多并不是单调地更好。

无法从部署经验中学习的模型

一个已部署的前沿模型是被冻结的。它的权重不会因为训练之后所遭遇的任何东西而改变;所有部署后的适配都活在提示词、上下文窗口或一个外部存储里,从不进入参数。这是这些系统和任何日常意义上的学习之间最鲜明的鸿沟,而它与其说是一个选择,不如说是一个约束。在新信息上更新一个已部署模型的权重,往往会覆盖掉旧信息,因为知识纠缠在数十亿参数之间,一次微调(在更窄的数据集上继续训练)会重塑整片地貌。这就是灾难性遗忘,它在前沿处仍未被解决。

研究方向是真实的,但还很早期。稀疏的、定向到记忆的微调,更新一小片参数,以更少地扰乱其余部分的方式来添加知识 (Lin and others 2025);一些架构提案则把模型当作以不同速率更新的嵌套记忆层级,报告出比普通微调高得多的旧任务保持率。这些都还凑不出一个能从自身部署里持续学习的前沿模型。

下层约束

因为权重无法在线更新,能力的持久性被往栈上推。一个模型在训练之后需要「记住」的一切,都必须活在上下文里、检索里,或一个外部记忆系统里,这正是 第 39 章第 44 章第 46 章 之所以作为厚重的工程层而存在的原因。学习层处的冻结权重这一极限,制造出了它上面的编排层。

幻觉作为一种属性,而非一个 bug

这些系统的残余误差有一个名字,而且越来越有了一套理论。2025 年的一个论证,把幻觉从一个等着打补丁的缺陷,重新框定为训练目标的一个统计后果:一个被训练去估计某语料密度、然后从中生成的模型,在那些真相被它所学之物欠定的输入上,会产出自信的谬误,因为目标函数从未奖励说「我不知道」(Kalai et al. 2025)。这个论证还有第二个、更尖锐的半边:幻觉之所以持续,是因为给模型打分的那些基准,奖励一个自信的猜测胜过一个诚实的弃答,于是评测层训练出了它随后又去测量的那种行为。后来的信息论工作,把幻觉的一个下限和模型对其训练数据的压缩绑在一起,强化了如下论点:某些残余是结构性的,而非可修复的。

对立的阵营并不天真。校准感知的训练、弃答奖励、检索接地,能在窄任务上可测量地降低幻觉,有时降得很猛,而实践中的发生率远不是一个无法撼动的常数。分歧在于极限:这份残余能否被压到零,还是说生成式目标保证了一个下限,缓解只能把它挪个地方。

争议所在
  • 数据约束是固定的还是可移动的? 一个阵营主张高质量人类文本基本持平,最廉价的收益已经没了。另一个阵营主张累积的合成数据加上数据效率的收益,能把这个约束向后推得很远。崩溃对累积那个结果坐在两者之间:替换会发散,累积保持有界,而知识崩溃仍可能悄悄进入。
  • RL 是创造推理还是激发推理? 激发阵营把多次尝试下的反超读作证据,证明强化学习只是锐化了基座模型本就能采样的东西。创造阵营把延长训练读作在扩展边界。当前的转折是,那个决定胜负的度量本身就有争议,所以这个问题是开放的,而非已被回答的。
  • 预训练还划算吗? 平台期观点看到原始规模化的回报在变平。仍划算的一方指出,把一个更小的模型过度训练、越过 Chinchilla 是划算的,因为推断是永远要付的成本。轴转移观点则说,增长已经搬到了强化学习和测试时算力上,预训练如今是一个底座,而非引擎。
  • 幻觉能被压到零吗? 结构派说生成式目标保证了一个下限。可修复派说校准和接地不断把发生率往下压。分歧在于极限,而非方向。
  • 一个被冻结的模型能聪明吗? 一个阵营说上下文和检索替代了权重更新,冻结是一个安全特性。另一个阵营说真正的智能需要终身适配,而灾难性遗忘是那个核心的、未被解决的障碍。

廉价语料之后的学习

在这一层,能力不再是规模的一个简单函数。一旦高质量文本见底,前沿能力就变成从更少数据里学到更多,从信号而非语料里学,从花在推断上的算力里学。效率成了核心科学变量,而非一个部署上的顾虑:一个固定的数据存量能产出多少有用的行为,如今决定了这个约束能退多远。信任则受限于幻觉下限和冻结权重;这两处正是学习系统的可信性和可适配性被目标函数与架构约束,而不是靠投入努力就能突破的地方。下一章把同一个问题移出文本,进入像素、视频和物理世界,那里数据墙以一种更严酷的形式重现:这些系统所需的那种数据,从来就没有过一个互联网。

延伸阅读

  • Villalobos et al., “Will We Run Out of Data? Limits of LLM Scaling Based on Human-Generated Data” (约 300T 词元的存量与 2026--2032 的耗尽窗口), 2024. arXiv:2211.04325
    本文预测,按当前大语言模型发展趋势,训练数据需求将在 2026 至 2032 年间耗尽全部公开人类生成文本,并探讨合成数据与迁移学习作为应对策略。
  • Kalai et al., “Why Language Models Hallucinate” (幻觉作为目标函数的统计属性,由二元打分的评测维系), 2025. arXiv:2509.04664
    本文通过将大语言模型(LLM)生成错误归约为二分类问题,论证幻觉在预训练阶段由统计压力产生,并因主流基准奖励猜测而非表达不确定性而在后训练阶段持续存在。
  • Yue et al., “Does Reinforcement Learning Really Incentivize Reasoning Capacity in LLMs Beyond the Base Model?” (激发对创造之争), 2025. arXiv:2504.13837
    RLVR(可验证奖励的强化学习)提升了低 pass@k(至少一次成功率)下的采样效率,但不会产生超出基础模型分布的新推理能力,基础模型构成 RLVR 训练模型的推理上界。
  • Liu et al., “ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models” (激发对创造之争), 2025. arXiv:2505.24864
    ProRL 通过 KL 散度控制与参考策略重置实现持续强化学习训练,证明 RL 能真正扩展大语言模型推理边界,并训练出在多项基准上超越 DeepSeek-R1-7B 的 Nemotron-Research-Reasoning-Qwen-1.5B 模型。
  • Shumailov et al., “AI Models Collapse When Trained on Recursively Generated Data” (替换会崩溃,累积保持有界), 2024. nature.com
    在大语言模型自身合成输出上递归训练会导致模型崩塌,跨代累积后输出分布退化为噪声。
  • Gerstgrasser et al., “Is Model Collapse Inevitable? Breaking the Curse of Recursion by Accumulating Real and Synthetic Data” (替换会崩溃,累积保持有界), 2024. arXiv:2404.01413
    在模型迭代训练中累积真实与合成数据(而非替换旧数据)可证明地避免模型崩溃,替换策略则导致性能逐步退化。
  • Kim et al., “Pre-training under Infinite Compute” (数据效率能把这堵墙往后推), 2025. arXiv:2509.14786
    在数据受限、算力不受限的预训练场景下,结合强正则化、参数扩展与集成扩展,可比标准方案实现更低的扩展律渐近损失并提升 5.17 倍数据效率。
  • Lin & others, “Continual Learning via Sparse Memory Finetuning” (持续学习与万亿规模合成数据这两条前沿), 2025. arXiv:2510.15103
    稀疏记忆微调通过 TF-IDF 排名仅更新记忆增强 LLM 中的特定记忆槽,在持续学习新知识的同时避免全量微调和 LoRA 所引发的灾难性遗忘。
  • DatologyAI, “BeyondWeb: Lessons from Scaling Synthetic Data for Trillion-Scale Pretraining” (持续学习与万亿规模合成数据这两条前沿), 2025. arXiv:2508.10975
    BeyondWeb 是一个通过有针对性的文档改写生成合成预训练数据的框架,在 14 项基准上平均超越 Cosmopedia 最高 5.1 个百分点,训练速度比原始网络数据快 7.7 倍。
  • Silver & Sutton, “Welcome to the Era of Experience” (为越过人类数据极限的学习设定议程的论点), 2025. storage.googleapis.com
    Silver 和 Sutton 认为,AI 智能体将通过从以人类生成数据为主转向基于真实环境的持续强化学习来超越人类水平。

评论

登录后评论