AI 基建
0%
第十部分 · 前沿与极限 · 第 70 章

学习在哪里遇到极限

作者Changkun Ou
阅读时长约 17 分钟

上一部分最后讨论了一台必须在组件不断失效时继续工作的机器。学习问题也需要同样清楚地划定边界。公开语料有限,属于资源极限;下一个词元预测带来的是目标函数极限;模型检查点一旦发布,就形成了适应边界;系统既无法为答案提供依据,也不能安全弃答时,遇到的则是证据极限。这些极限会相互影响,但不能混为一谈。

推动现代语言模型进步的廉价资源,是公开的人类文本。本章仍会讨论合成数据、推理强化学习、测试时算力、持续学习与幻觉,但不会把它们当成同一个问题。一个被训练去模仿有限语料的模型,后来还可以接收合成样本、经过验证的经验、检索到的证据或参数更新。每条路径改变的边界不同。公开文本不足以后,学习能否继续?真正有用的问题是:哪些方法真正改变了答案,哪些只是推迟问题,以及每种方法移动的究竟是哪一道边界。

上一章用故障契约界定可靠性。判断学习是否遇到极限,也需要同样的纪律:先写明任务分布、信息来源、更新规则、计算预算和验收测试,再把结果称为一道边界。

resource 资源极限 可用信息 objective 目标函数极限 训练信号 resource->objective state 适应边界 可变状态 objective->state evidence 证据极限 回答或弃答 state->evidence
图 70.1. 四种边界常被压缩成一句笼统的学习极限。有效的极限主张必须说明,真正受限的是资源、目标函数、可变状态,还是验收测试。

语料存量预测不是耗尽倒计时

Villalobos 等人对公开的人类文本做的是条件性预测,而不是测量一个即将见底的储罐。他们在 2024 年的 ICML 论文中估计,已编入索引的网络文本原始存量中位数为 510 万亿词元,95% 区间很宽,从 130 万亿至 2,100 万亿。随后,作者根据过滤质量和重复数据的有限价值做了调整,得到模型交点处约 400 万亿词元的有效存量 (Villalobos et al. 2024)。

论文根据历史数据,估计重要训练数据集的数据集规模每年增长约 2.4 倍。在结合历史趋势与算力约束的预测中,单次训练的有效数据需求会在 2026 至 2032 年之间达到模型设定的存量,中位数为 2028 年。假设训练数据量是计算最优值的五倍,交点会提前约一年;论文给出的结论允许提前一到两年。这是预测,不是观测结果。它假设增长趋势持续、网络内容继续扩张,并采用特定的质量修正和重复轮次模型。所谓存量用尽,是指一次训练已经充分利用模型中的存量,不是文本在物理上被消耗掉。

这里必须区分三种词元计数:

  • 去重后保留的唯一词元,统计获准进入数据集且互不重复的样本;
  • 数据集规模,把保留语料完整计数一次;
  • 训练词元暴露量,统计训练期间实际呈现的每一个词元实例,包括不同轮次中的重复。

下面这个小模型说明,交点年份为何对输入十分敏感:

D(t)=D0gtt0,t=t0+ln(S/D0)lng.D(t)=D_0 g^{t-t_0}, \qquad t^* = t_0+\frac{\ln(S/D_0)}{\ln g}.

其中:

  • D(t)D(t) 是年份 tt 的预计数据集需求,单位为词元;
  • D0D_0 是参考年份 t0t_0 的数据集需求;
  • g>1g>1 是假设的年增长因子;
  • SS 是以相同词元单位计量的假设可用存量;
  • tt^* 是简单模型满足 D(t)=SD(t^*)=S 时的年份;
  • ln\ln 是自然对数。

这个方程假设 SS 固定,且 gg 代表固定的指数增长率。论文使用了更完整的不确定性模型;这里仅做敏感性计算

from math import log

stock_trillion = 400.0
start_trillion = 15.0
start_year = 2024.0

for annual_growth in (2.4, 1.8, 3.0):
    crossing = start_year + log(stock_trillion / start_trillion) / log(annual_growth)
    print(f"{annual_growth:.1f}x/year crossing: {crossing:.2f}")

15 万亿词元的起点和 400 万亿词元的存量,取自论文报告的 2024 年规模与有效交点存量,仅用作示例。若每年增长 2.4 倍,这个简单计算得到的交点是 2027 年末;增长放慢后,结果会推迟数年。它并不复现论文的蒙特卡洛预测。

raw 网络原始存量 中位数 510 万亿 effective 质量 + 重复修正 有效约 400 万亿 raw->effective crossing 模型交点 中位数 2028 effective->crossing demand 数据集需求 条件性增长 demand->crossing
图 70.2. 交点日期属于模型输出。存量定义、质量修正、重复数据价值、增长率或过度训练策略改变,日期也会改变。
约束如何向上传导

可用公开文本的有限存量会改变上层设计。数据筛选必须保留来源、主动去重并测量覆盖范围(第 6 章)。数据量或整个生命周期的推断成本变化后,第 5 章 中的计算最优比例也不能继续被当作常数。Hoffmann 等人给出的每个参数约二十个词元,描述的是一种稠密 Transformer、只考虑训练算力的条件 (Hoffmann et al. 2022)。Sardana 等人进一步表明,当预计推断需求很高时,训练时间更长的小模型可能更合算,但结果取决于整个生命周期的需求和目标质量 (Sardana et al. 2024)。合成数据系统还必须证明自己增加了什么信息(第 23 章)。

合成数据改变的是生成协议

合成数据可以改善格式、覆盖范围、难度或信息密度,却不会自动增加超出教师模型、提示来源、工具或验证器的信息。因此,第一个问题不应是「真实还是合成」,而应是「下一代训练集由什么递归协议生成」。

替换协议会丢弃早期数据,只用第 nn 代模型生成的样本训练第 n+1n+1 代。累积协议则保留人类数据基底与此前各代数据:

An=Hi=0n1Gi.\mathcal{A}_n = \mathcal{H} \cup \bigcup_{i=0}^{n-1}\mathcal{G}_i.

其中:

  • nn 是当前待训练模型的代次;
  • H\mathcal{H} 是保留的人类数据基底;
  • Gi\mathcal{G}_i 是第 ii 代模型拟合后生成的合成数据集;
  • An\mathcal{A}_n 是训练第 nn 代模型时使用的累积数据集;
  • ii 表示此前某一代;
  • \cup\bigcup 分别表示普通集合并集与重复并集。实际流水线通常使用多重集,因此还必须记录混合权重与去重策略。

Shumailov 等人研究了模型与数据之间的递归反馈,说明低概率的尾部事件为何最先消失。但他们的语言模型实验并非前沿预训练:实验反复使用五路束搜索生成的续写,在 WikiText-2 上微调 OPT-125M。被测试的替换协议导致困惑度变差;保留 10% 的原始数据则减轻了退化。论文后期收敛到点分布的现象,来自解析模型、高斯混合和 VAE 实验,而不是一个前沿语言模型最终变成噪声 (Shumailov et al. 2024)。

Gerstgrasser 等人在 TinyStories 上,用小型 GPT-2 与 Llama 2 实验比较替换和累积协议。在被测试的若干代中,累积协议避免了发散式退化。论文给出的有限上界,是基于远比现代预训练狭窄的假设得到的线性模型定理 (Gerstgrasser et al. 2024)。这并不能证明,只要保留旧数据,就能在前沿规模下避免所有形式的崩溃、偏差放大、污染或罕见知识流失。

source 人类基底 H + 教师策略 replace 替换 只留最新样本 source->replace accumulate 累积 保留此前数据 source->accumulate verify 留出人类评测 覆盖 + 尾部 replace->verify accumulate->verify
图 70.3. 替换与累积是两种不同实验。结果还取决于教师模型、解码器、混合权重、过滤器、验证器和留出分布。

正面的合成数据结果也必须限定适用范围。BeyondWeb 在包含 60% RedPajama 与 40% 合成文本的混合数据中进行定向改写。10 亿参数模型训练了 1 万亿词元;30 亿和 80 亿参数模型各训练了 1,800 亿词元。论文在 14 项基准上报告,相比 Cosmopedia 最高提升 5.1 个百分点;在一种特定的匹配比较中,训练速度最高达到开放网络基线的 7.7 倍 (Maini and others 2025)。这些结果支持该流水线中的定向改写,并不能证明任意自生成文本都能替代人类证据。

固定的数据也可能在不增加文档的情况下提供更多价值。Kim 等人使用 2 亿至 16 亿词元的初始语料,发现更强的正则化与集成可以改善拟合后的损失渐近线。其中,在 2 亿词元上得到的 5.17 倍数据效率,是嵌套的扩展律外推;直接观测到的最佳集成增益更小。各条曲线都会趋近有限的渐近线,因此这并不意味着固定语料可以带来无限改进 (Kim et al. 2025)。

因此,合成数据记录应保留来源溯源、教师检查点、生成策略、提示来源、温度和过滤器、人类数据基底、去重策略、混合权重、验证器版本,以及留出的人类评测集。缺少这些记录时,「合成」只说明数据从哪里来,不能说明它提供了什么学习信号。

可验证经验改变监督瓶颈

可验证奖励的强化学习(RLVR),也就是可验证奖励强化学习,会在条件允许时用自动检查器替代人工编写的完整解题轨迹。数学等式、编译器、单元测试或形式证明检查器,都可以低成本地标记大量采样结果。这改变了 第 21 章第 28 章 所述的监督瓶颈,但任务本身、正确的检查器、探索算力和留出评测仍然不可缺少。奖励覆盖率不完整时,系统仍可能出现奖励欺骗(reward hacking),也就是奖励投机。

「激发已有能力还是创造新能力」的争论,很大程度上依赖 至少一次成功率(pass@k)。对固定题目 xx、固定解码器和固定验证器,下面的公式衡量候选覆盖范围:

p=Pr[v(x,Y)=1],pass@k(x)=1(1p)k.p = \Pr[v(x,Y)=1], \qquad \operatorname{pass}@k(x) = 1-(1-p)^k.

其中:

  • xx 是一道题;
  • YY 是针对 xx 从固定解码分布采得的一个结果;
  • v(x,Y){0,1}v(x,Y)\in\{0,1\} 是接受或拒绝该结果的固定验证器;
  • Pr\Pr 表示概率;
  • pp 是单个样本被验证器接受的概率;
  • kk 是相互独立的采样次数;
  • pass@k(x)\operatorname{pass}@k(x) 是这些样本中至少有一个被接受的概率。

若候选池包含 nkn\ge k 个样本,其中 cxc_x 个通过验证,Chen 等人给出了不放回抽样的估计式:

pass@k^(x)=1(ncxk)(nk).\widehat{\operatorname{pass}@k}(x) = 1- \frac{\binom{n-c_x}{k}}{\binom{n}{k}}.

这里,nn 是候选池大小,cxc_x 是其中被接受的数量,(ab)\binom{a}{b} 是从 aa 个元素中选取 bb 个元素的组合数,上方的帽子表示估计量 (Chen and others 2021)。两种表达式都假设样本来自固定解码器,彼此可交换或相互独立,而且验证器可信。它是覆盖率指标,不是最终返回答案的可靠性。部署系统仍然需要选择规则。高 pass@k 无法判断应该返回哪个候选结果;有限 kk 下没有观察到成功,也不能证明 p=0p=0

Yue 等人在 NeurIPS 2025 发表的研究中,在数学、编程和视觉推理任务上评估了六种 RLVR 算法。在所测试的设置中,强化学习后的检查点在较小 kk 下更好;kk 增大后,强化学习开始前的初始检查点会追平或超过它。对这些模型家族、提示、解码器与预算而言,结果支持「激发」解释 (Yue et al. 2025),但它并不是强化学习无法创造新策略的定理。

ProRL 使用了不同的训练协议:在 KL 控制下延长强化学习,定期重置参考模型,使用多样化任务,并从一个 15 亿参数的蒸馏推理模型开始。论文报告,候选预算增加到 256 时仍有增益,其中一些任务在初始检查点的 256 个样本中没有观察到成功 (Liu et al. 2025)。有限样本中的零成功,不代表任何预算下都不可能成功。这两项研究反映了真实的经验分歧,但不能据此确定绝对的能力边界。

测试时算力必须解决选择问题

测试时算力至少包含两种不同操作:并行生成更多候选结果,或用更多连续词元反复修订一条轨迹。两者都需要生成器、验证器或评判器,以及选择器,最后只返回一个通过验收的结果。增加候选数量只有在两个条件同时满足时才有用:生成器覆盖了可用答案,选择机制也能识别它。

Snell 等人在 MATH 基准上比较了 best-of-N 采样和验证器引导的修订。最佳方法会随题目难度和预算改变。在论文报告的若干点上,考虑算力的分配策略比所测试的 best-of-N 基线高效四倍以上。在 FLOPs 相同的比较中,如果小模型原本就有不可忽略的成功率,它可以胜过参数规模大 14 倍的模型 (Snell et al. 2025)。该结果取决于 PaLM 2 的若干模型版本、专用修订模型与验证器、数学基准,以及特定的训练和推断 FLOPs 计量方式。它并非普遍适用的扩展律,也不能说明推断算力总能替代模型参数。

在生成候选结果之前,记录提示、可用工具、解码器、验证器、成本预算和验收规则。
并行采样、延长单条轨迹或执行搜索。这些策略消耗的时延和算力不同。
检查器必须覆盖真正需要的结果,而不是只测一个方便的代理指标。被拒绝和被接受的证据都要保留。
候选池覆盖率再高,如果系统无法判断应该返回哪个候选,仍然没有实际价值。
同时报告已验收准确率、弃答率、时延和算力。只有边际价值仍高于边际成本时,增加尝试次数才有意义。
图 70.4. 测试时算力是一条生成、验证、选择与验收流水线。Pass@k 只衡量候选集中是否包含一个通过验收的结果。

部署系统有三类可变状态

在线服务中的检查点通常会在一次请求期间保持参数不变,但冻结权重是一项发布策略,并非理论上无法更新已经部署的模型。下面这个状态模型把参数、会话上下文和外部记忆分开:

Ytpθt(xt,ct,mt),(ct+1,mt+1)=V(ct,mt,xt,Yt),θt+1=U(θt,et).Y_t \sim p_{\theta_t}(\,\cdot\mid x_t,c_t,m_t), \qquad (c_{t+1},m_{t+1}) = V(c_t,m_t,x_t,Y_t), \qquad \theta_{t+1} = U(\theta_t,e_t).

其中:

  • tt 表示某次交互或更新区间;
  • xtx_t 是当前输入;
  • YtY_t 是采样得到的输出;
  • pθtp_{\theta_t} 是由权重 θt\theta_t 参数化的模型分布,\cdot 表示所有可能的输出值;
  • ctc_t 是临时会话或上下文状态;
  • mtm_t 是可变的外部记忆;
  • VV 是更新上下文与外部记忆的版本化规则;
  • ete_t 是一批经过审核的新训练经验;
  • UU 是生成下一检查点 θt+1\theta_{t+1} 的参数更新过程。

上下文学习改变 ctc_t,检索或记忆服务改变 mtm_t,持续预训练或微调改变 θt\theta_t。把三者都叫作「学习」,会掩盖它们在持久性、隐私、投毒风险、评测和回滚方面的不同性质。

顺序参数训练长期面临稳定性与可塑性问题:学习新分布可能破坏模型在旧分布上的表现。Kirkpatrick 等人 2017 年提出的弹性权重巩固方法,会保护对旧任务重要的参数。它是一种影响深远的缓解方法,而不是普遍解法 (Kirkpatrick and others 2017)。运行时应同时测量新知识获取与旧能力保留:

Anew=Qnew(θafter)Qnew(θbefore),Δold=Qold(θafter)Qold(θbefore).A_{\mathrm{new}} = Q_{\mathrm{new}}(\theta_{\mathrm{after}}) - Q_{\mathrm{new}}(\theta_{\mathrm{before}}), \qquad \Delta_{\mathrm{old}} = Q_{\mathrm{old}}(\theta_{\mathrm{after}}) - Q_{\mathrm{old}}(\theta_{\mathrm{before}}).

这里,QnewQ_{\mathrm{new}}QoldQ_{\mathrm{old}} 是在新旧留出分布上固定的评测得分,θbefore\theta_{\mathrm{before}}θafter\theta_{\mathrm{after}} 是更新前后的检查点,AnewA_{\mathrm{new}} 衡量新知识获取,Δold\Delta_{\mathrm{old}} 衡量旧能力保留变化。新知识获取得分很高,不能抵消一项没有报告的负向保留得分。灾难性干扰是指在明确的旧任务测试集上出现大幅负向保留变化,它描述结果,不解释成因。

Lin 等人给出了一项范围明确的新结果。他们把 13 亿参数模型中的一个前馈层替换为大型稀疏记忆池,并评估两个问答任务。在新知识获取水平相同的条件下,完整微调后的 NaturalQuestions F1 下降 89%,LoRA 下降 71%,稀疏更新的稀疏记忆层模型下降 11% (Lin et al. 2025)。这不能证明前沿规模的开放式持续学习已经可行,也没有证明推理与安全能力可以保留,更没有证明系统能够安全地从未经审核的生产流量中学习。

在线更新参数还会新增一道安全边界。在一项红队研究中,十条对抗性微调样本就破坏了所测试 GPT-3.5 Turbo 设置的安全行为;普通微调也造成了较小的退化 (Qi et al. 2024)。因此,生产更新路径需要来源记录、隔离区、重放或复习数据、保留能力测试集、安全与隐私测试、发布门禁、检查点版本、金丝雀发布和回滚。持续学习并不意味着持续发布。

request 请求 上下文 c_t memory 外部记忆 m_t 版本化写入 request->memory candidate 候选检查点 更新 U(θ,e) memory->candidate gate 发布门禁 获取 + 保留 + 安全 candidate->gate serving 服务检查点 θ 回滚目标 gate->serving
图 70.5. 上下文、外部记忆与参数采用不同的更新路径。参数学习应经过发布边界,而不是悄悄改变正在服务的检查点。

这道边界解释了 第 44 章 与上层记忆系统为何仍然重要:外部状态可以快速更新,同时让模型版本保持可测试。它是一项工程权衡,并不能证明参数永远不该在线学习。

幻觉问题需要证据边界

「幻觉」常被用来描述几种不同故障:闭卷回答中看似合理但实际错误的陈述、无法由既定检索证据支持的答案、与提示相矛盾的回答,或无法验证的猜测。这些情况需要不同的测试。第 51 章 详细说明证据契约;这里的关键是,错误率取决于任务分布、可用证据,以及系统能否选择弃答。

Kalai 和 Vempala 在生成式校准模型下,证明了关于某类任意事实的下界。这个结果并不以相同方式适用于系统性事实或训练数据中反复出现的事实 (Kalai and Vempala 2024)。Kalai 等人后来区分了两种机制:闭卷基础模型中的统计误差,以及在正确答案得 1 分、错误答案和「我不知道」都得 0 分时奖励猜测的评测激励 (Kalai et al. 2025)。二元计分会影响后训练、模型选择和排行榜,但运行一次评测本身不会更新模型。

更重要的是,幻觉并非每个完整系统都不可避免。论文明确允许系统在有限领域外使用检索、数据库、计算器或弃答。这样做可能减少回答数量,因此必须把错误率与覆盖率一起报告 (Geifman and El-Yaniv 2017)。一个对所有问题都弃答的零错误系统毫无用处;一个覆盖率很高却自信地给出错误答案的系统则不安全。

下面的期望效用公式表示是否接受答案的决策:

E[U(answer)x]=q(x)ucorrect+[1q(x)]uwrong,\mathbb{E}[U(\mathrm{answer})\mid x] = q(x)u_{\mathrm{correct}} + [1-q(x)]u_{\mathrm{wrong}},

只有满足下式时才回答:

q(x)uabstainuwrongucorrectuwrong.q(x) \ge \frac{u_{\mathrm{abstain}}-u_{\mathrm{wrong}}} {u_{\mathrm{correct}}-u_{\mathrm{wrong}}}.

其中:

  • xx 是当前问题及其可用证据;
  • q(x)q(x) 是提议答案正确概率的校准估计,1q(x)1-q(x) 是答案错误的估计概率;
  • UU 是决策效用,E\mathbb{E} 表示期望;
  • ucorrectu_{\mathrm{correct}} 是正确回答的效用;
  • uwrongu_{\mathrm{wrong}} 是错误回答的效用;
  • uabstainu_{\mathrm{abstain}} 是弃答的效用;
  • 不等式假设 ucorrect>uabstain>uwrongu_{\mathrm{correct}}>u_{\mathrm{abstain}}>u_{\mathrm{wrong}}

只看准确率的基准,实际上会把弃答与答错赋予同样价值,从而降低验收阈值并鼓励猜测。高风险系统可以让自信错误的效用低得多,从而提高阈值。校准、证据检索和效用都取决于部署场景,因此不存在统一的幻觉下限。

query 问题 + 证据 estimate 校准后的 q(x) 针对任务切片 query->estimate threshold 验收阈值 错误成本与覆盖率 estimate->threshold action 回答 · 检索 · 弃答 threshold->action verify 评测已验收答案 准确性 + 证据支持 action->verify
图 70.6. 完整系统可以回答、检索更多证据或弃答。阈值取决于经过校准的正确概率,以及错误答案的相对代价。

让每条突破路径都可以证伪

评审学习极限时,应把不同路径放进同一份台账:

路径 必须记录 验收证据
更多或重复使用人类数据 来源溯源、唯一词元、训练词元暴露量、去重、污染 按来源和罕见切片统计的留出损失与能力
合成数据 教师、提示来源、解码器、过滤器、人类基底、混合比例、验证器 留出的人类分布、尾部覆盖、偏差与污染
RLVR 或经验 任务来源、检查器版本、采样与训练算力、奖励覆盖率 pass@1、pass@k、独立正确性、奖励投机测试
测试时算力 生成器、验证器、选择策略、候选与词元预算 已验收准确率、时延、算力与边际增益
参数更新 更新数据、重放数据集、优化器、变更参数、检查点谱系 新知识获取、保留能力测试集、安全、隐私、金丝雀发布、回滚
检索或弃答 证据快照、校准集、验收阈值 回答覆盖率、弃答率、已验收答案的准确率与证据支持

每一行还要记录时间戳,保留不受优化影响的留出分布,并指定证据失败时的责任人。如果只报告更高的分数,却不说明信息来源、计算预算或选择策略发生了什么变化,就无法判断究竟移动了哪一道边界。

争议所在
  • 公开文本何时真正成为约束? Villalobos 等人给出的是 2026 至 2032 年的条件性窗口,不是倒计时。数据增长、访问权、质量、重复数据、多模态迁移和数据效率都可能移动交点。
  • 合成数据能否扩展知识? 定向转换和经过检查的生成可以提高训练效率。递归实验并不能证明,一个未经验证的教师模型能够提供其提示、工具、环境或人类基底中原本不存在的信息。
  • 强化学习会创造推理能力吗? Yue 等人在所测试的现有方法中观察到较小 kk 下的集中效应,却没有看到较大 kk 下覆盖范围扩大。ProRL 则在更长、更稳定的 15 亿参数训练协议下报告了覆盖扩展。两者的初始检查点、解码器、验证器、任务集和有限预算都不同。
  • 模型是否应该在部署中实时学习? 参数在技术上可以更新。尚未解决的系统问题是,前沿规模的更新能否在获取有用信息的同时,保留旧能力、安全、隐私、来源、可复现性和回滚能力。
  • 幻觉是否不可避免? 下界只在明确的闭卷与校准假设下成立。检索与弃答会移动边界,但也会用覆盖率交换错误率,而且依赖可信证据。

极限是一道接口

只有明确边界,极限才有意义。 公开文本可能变得稀缺,但这不等于学习终止。合成数据可以提高效率,却未必创造独立的事实来源。强化学习可以改变策略,却不能由此证明绝对能力边界。测试时算力可以扩大候选覆盖范围,却未必选得出正确候选。参数更新可以获取新事实,也可能损害旧能力。弃答可以通过拒绝有用工作,消除系统实际输出的错误陈述。

下一章 第 71 章 将讨论能力前沿究竟移动了多远。本章给出它的前提:任何进步主张都必须说明,输入了什么信息,改变了什么状态,花费了多少算力,以及用什么测试验收结果。

延伸阅读

  • Villalobos et al., “Position: Will We Run Out of Data? Limits of LLM Scaling Based on Human-Generated Data” (约 300T 词元的存量与 2026--2032 的耗尽窗口), 2024. proceedings.mlr.press
    本文预测,按当前大语言模型发展趋势,训练数据需求将在 2026 至 2032 年间耗尽全部公开人类生成文本,并探讨合成数据与迁移学习作为应对策略。
  • Shumailov et al., “AI Models Collapse When Trained on Recursively Generated Data” (替换会崩溃,累积保持有界), 2024. nature.com
    在大语言模型自身合成输出上递归训练会导致模型崩塌,跨代累积后输出分布退化为噪声。
  • Gerstgrasser et al., “Is Model Collapse Inevitable? Breaking the Curse of Recursion by Accumulating Real and Synthetic Data” (替换会崩溃,累积保持有界), 2024. arXiv:2404.01413
    在模型迭代训练中累积真实与合成数据(而非替换旧数据)可证明地避免模型崩溃,替换策略则导致性能逐步退化。
  • Kim et al., “Pre-training under Infinite Compute” (数据效率能把这堵墙往后推), 2025. arXiv:2509.14786
    在数据受限、算力不受限的预训练场景下,结合强正则化、参数扩展与集成扩展,可比标准方案实现更低的扩展律渐近损失并提升 5.17 倍数据效率。
  • Maini & others, “BeyondWeb: Lessons from Scaling Synthetic Data for Trillion-Scale Pretraining” (持续学习与万亿规模合成数据这两条前沿), 2025. arXiv:2508.10975
    BeyondWeb 是一个通过有针对性的文档改写生成合成预训练数据的框架,在 14 项基准上平均超越 Cosmopedia 最高 5.1 个百分点,训练速度比原始网络数据快 7.7 倍。
  • Yue et al., “Does Reinforcement Learning Really Incentivize Reasoning Capacity in LLMs Beyond the Base Model?” (激发对创造之争), 2025. arXiv:2504.13837
    RLVR(可验证奖励的强化学习)提升了低 pass@k(至少一次成功率)下的采样效率,但不会产生超出基础模型分布的新推理能力,基础模型构成 RLVR 训练模型的推理上界。
  • Liu et al., “ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models” (激发对创造之争), 2025. arXiv:2505.24864
    ProRL 通过 KL 散度控制与参考策略重置实现持续强化学习训练,证明 RL 能真正扩展大语言模型推理边界,并训练出在多项基准上超越 DeepSeek-R1-7B 的 Nemotron-Research-Reasoning-Qwen-1.5B 模型。
  • Snell et al., “Scaling LLM Test-Time Compute Optimally Can be More Effective than Scaling Parameters for Reasoning” (最优推理计算分配取决于问题难度、生成器、验证器和预算), 2025. arXiv:2408.03314
    在所研究的 PaLM 2 模型、MATH 数据集、过程奖励模型与离线难度估计条件下,最优测试时策略取决于题目难度和预算。
  • Lin et al., “Continual Learning via Sparse Memory Finetuning” (持续学习与万亿规模合成数据这两条前沿), 2025. arXiv:2510.15103
    稀疏记忆微调通过 TF-IDF 排名仅更新记忆增强 LLM 中的特定记忆槽,在持续学习新知识的同时避免全量微调和 LoRA 所引发的灾难性遗忘。
  • Kalai et al., “Why Language Models Hallucinate” (幻觉作为目标函数的统计属性,由二元打分的评测维系), 2025. arXiv:2509.04664
    本文通过将大语言模型(LLM)生成错误归约为二分类问题,论证幻觉在预训练阶段由统计压力产生,并因主流基准奖励猜测而非表达不确定性而在后训练阶段持续存在。
  • Silver & Sutton, “Welcome to the Era of Experience” (为越过人类数据极限的学习设定议程的论点), 2025. storage.googleapis.com
    Silver 和 Sutton 认为,AI 智能体将通过从以人类生成数据为主转向基于真实环境的持续强化学习来超越人类水平。

评论

登录后评论