AI 基建
0%
第一部分 · 基座模型的形成 · 第 6 章

数据筛选与训练分布

作者Changkun Ou
阅读时长约 17 分钟

第 5 章 把算力预算换算成模型规模和训练词元数,却没有告诉我们该用哪些词元。这正是数据筛选要解决的问题。

当架构、优化器和词元预算固定后,选择什么数据、怎样采样,会在很大程度上决定最终得到什么模型。它们决定模型见到哪些语言、领域、文体和重复模式,也决定后续评估测到的究竟是泛化能力,还是模型碰巧见过基准答案。这些影响必须针对目标模型和评估套件来测量,无法靠一个普适的质量分数提前选定整套语料。

因此,数据筛选的产物不只是一个装满文本的目录,而是一套有版本的训练分布:按来源划分的数据分片、采样策略、排除决定、沿袭记录,以及一份 去污染(decontamination)报告,也就是说明哪些基准重叠已从训练语料中移除、执行过哪些检查的审计记录。

训练过程消耗的是分布,不是文件夹

下面四个概念很容易混淆:

  1. 采集池是从各个来源快照中收集到的全部内容。
  2. 保留语料是经过策略审查、提取、去重和质量判断后留下的内容。
  3. 混合分布为各个保留来源分配采样概率。
  4. 训练流是训练实际消耗的、按顺序排列的词元实例。

一种来源可能占存储字节的 20%,却只得到 5% 的采样词元。较小的来源可能被采样多个有效轮次,较大的来源则可能只读取一部分。因此,语料库存并不等于模型学到的分布。

每个阶段使用的单位也不同。采集阶段处理文件、网页和代码仓库修订版本;去重阶段可能处理文档、段落或片段;模型最终消耗的是词元。每份报告都应明确所用单位,不能在文档、字节和词元之间悄然切换。

在每个阶段记录沿袭关系

流水线会逐步缩小采集池,而每次拒绝也会产生证据。计数、原因代码、策略版本和稳定记录 ID 都必须随数据一起流转。

A 来源登记表 出处 + 策略 B 不可变快照 网页 / 书籍 / 代码 / 论文 A->B C 提取 + 规范化 保留原始身份 B->C D 策略关卡 权利 / 隐私 / 安全 C->D E 去重 精确 / 片段 / 模糊 D->E F 质量 + 覆盖范围 按切片审计过滤器 E->F G 去污染 对照冻结的评估登记表 F->G H 按来源划分的文本分片 用清单记录成员 G->H I 分词 + 打包 见 sec-tokenization H->I J 词元分片 + 采样策略 I->J S 合成记录 生成器 + 父级沿袭信息 S->D R 评估登记表 版本 + 受保护条目 R->G
图 6.1. 一条可追溯的数据筛选流水线。每种来源都带着出处进入流水线,合成记录保留父级沿袭信息,冻结的评估登记表则在分词前约束去污染。

这份契约可以写成一套算法:

1. 把每种采集来源冻结为不可变快照。
2. 在内容过滤前,附上出处信息并作出策略决定。
3. 在提取和规范化过程中保留稳定记录 ID。
4. 执行带版本的策略、去重和质量转换。
5. 把每个保留阶段的内容,包括合成数据,与冻结的评估登记表比较。
6. 写出按来源划分的分片、成员清单、拒绝统计和采样计划。
7. 使用固定版本的分词器和确定性顺序完成分词与打包。

这些工作通常在加速器训练任务启动前,运行于以 CPU 为主的批处理基础设施上。吞吐量固然重要,可恢复性同样重要。某个阶段失败后,应能从不可变输入重新启动,而且不能改变最终保留下来的记录。

决定一种来源能否进入语料

公开可访问、允许抓取、获得许可和得到同意,是四种不同的属性。Common Crawl 提供带时间戳的网页快照,但不会替其中每个页面授予统一许可证。书籍、论文、代码仓库、授权数据集和模型生成的记录,都需要接受同样的来源级审查。

一条出处记录应包含来源 URL 或代码仓库修订版本、获取时间、原始内容摘要、已知的创作者或发布者、声明的许可证及其证据 URL,以及对相关网站条款或抓取偏好的带日期记录。它还应写明项目所依据并留档的使用理由。情况未知或不兼容的内容应进入隔离区,而不是悄悄混入语料。Longpre 等人审计了超过 1,800 个文本数据集,发现许可证缺失和分类错误的问题十分普遍,因此仅有数据集级标签并不够 (Longpre et al. 2023)。是否合法仍取决于政策和司法辖区,第 79 章 会进一步讨论这条边界。

个人信息控制也必须是一套流程,而不能只靠正则表达式。先定义需要排除的信息类别,再结合规则和基于模型的检测器,审阅针对不同地区和语言环境抽取的样本,并记录检测器版本与错误率。任何检测器都不能证明语料中完全没有个人信息。被标记的内容需要限制访问;收到投诉或删除请求时,还必须能向前追踪到每个派生分片和训练任务。对公开语料的审计已经发现,个人信息会与重复内容、合成文本和基准材料同时存在 (Elazar et al. 2024)。

提取与规范化不能抹掉来源

网页快照中包含标记、菜单、Cookie 提示、损坏的字符编码,以及在许多页面间复制的样板内容。提取阶段负责识别正文和文档边界。随后,规范化阶段采用有据可查的 Unicode 形式,修复事先选定的提取伪影,并且只统一流水线已经明确判定为无关的特征。

原始内容和规范化内容的摘要都应保留在沿袭记录中。Unicode 处理、样板移除或空白规则一旦改变,内容的精确身份也会改变,后续去重结果可能随之变化。换用新提取器重新构建语料,应当生成新的语料版本,而不是被当成不可见的实现更新。

语言识别同样会出错。低置信度可能表示文本混用了多种语言、发生语码转换、采用音译,也可能只是分类器没有充分覆盖该语言。Kreutzer 等人审计多语言网络语料时发现了严重的标签和内容质量问题,在低资源语言中尤其明显 (Kreutzer and others 2022)。因此,应按语言报告保留率,并请具备相应语言知识的人审阅受影响样本。

有些过滤器看似只在删除不良文本,却也会抹掉合理的语言变体。Dodge 等人发现,C4 的屏蔽词表不成比例地移除了少数群体创作或与其相关的文本 (Dodge et al. 2021)。规则比学习式评分器更容易检查,但两者都不会天然没有偏差。

按真正有意义的单位去重

去重承担着几种不同的任务:

  • 精确文档去重对规范化后的文档字节求哈希,删除完全相同的记录。
  • 精确片段去重使用后缀数组或其他重复子串索引,寻找不同文档中大段复制的文字。
  • 模糊文档去重比较 shingle 集合,例如相互重叠的词序列,从而找出只经过少量修改的文档。
  • 语义去重使用嵌入寻找语义层面的相似内容。它能发现词法方法漏掉的改写,但也会带入嵌入模型自身对“相似”的定义 (Abbas et al. 2023)。

减少冗余既能降低记忆,也能节省训练步数。Lee 等人的实验中,逐字记忆减少了十倍,同时用更少训练步数取得了相同或更好的准确率 (Lee et al. 2022)。但这并不意味着去重越多越好。全局策略可能删除有价值的重复材料,也可能留下不寻常的残余分布。例如,FineWeb 在受控消融后选择了按每次抓取分别做模糊去重,而不是全局去重 (Penedo et al. 2024)。

Jaccard 相似度与 MinHash

把文档 dd 表示为 shingle 集合 S(d)S(d)。文档 aabb 的 Jaccard 相似度为

J(a,b)=S(a)S(b)S(a)S(b).J(a,b)=\frac{|S(a)\cap S(b)|}{|S(a)\cup S(b)|}.

其中,S(a)S(a)S(b)S(b) 是由互不重复的 shingle 组成的集合,\cap 表示集合交集,\cup 表示集合并集,|\cdot| 表示集合元素个数。两个集合互不相交时结果为零,完全相同时结果为一。

若对 nn 篇文档逐对套用这个公式,就需要比较 n(n1)/2n(n-1)/2 次。Broder 在 1997 年把 最小哈希(MinHash) 用于估计文档相似度。该方法用一个较短的随机签名代替每个 shingle 集合 (Broder 1997)。设 πi\pi_i 是 shingle 全集上的随机排列,定义

hi(S)=minxSπi(x),J^(a,b)=1mi=1m1 ⁣[hi(S(a))=hi(S(b))].h_i(S)=\min_{x\in S}\pi_i(x), \qquad \widehat J(a,b)=\frac{1}{m}\sum_{i=1}^{m} \mathbf{1}\!\left[h_i(S(a))=h_i(S(b))\right].

这里,hi(S)h_i(S) 表示集合 SS 在第 ii 个排列下的最小排列秩,xx 是一个 shingle,mm 是签名长度;条件成立时,1[]\mathbf{1}[\cdot] 为一,否则为零;J^\widehat J 是 Jaccard 相似度的估计值。在理想的独立排列下,E[J^]=J\mathbb{E}[\widehat J]=J,且 Var(J^)=J(1J)/m\operatorname{Var}(\widehat J)=J(1-J)/m。增加签名项可以降低方差,但某一次实际估计并不一定单调改善。

局部敏感哈希(LSH)把每个签名分成 bb 个分带,每个分带有 rr 行,因此 m=brm=br。若两篇文档的 Jaccard 相似度为 ss,至少一个分带完全匹配的理想概率为

Pcandidate(s)=1(1sr)b.P_{\mathrm{candidate}}(s)=1-\left(1-s^r\right)^b.

其中,Pcandidate(s)P_{\mathrm{candidate}}(s) 表示一对文档成为候选对的概率,s[0,1]s\in[0,1] 是真实 Jaccard 相似度,bb 是分带数,rr 是每个分带的行数。在签名长度固定时,增加分带数会提高候选召回率,也会增加假阳性;增加每个分带的行数会收紧门槛,也可能增加假阴性。LSH 只产生候选对,不能证明两篇文档重复。实现可以再用精确 Jaccard 或另一条固定规则核验候选,然后才建立重复簇。

图 6.2. 二十个分带下的理想化 LSH 候选概率。增加每个分带的行数会让匹配条件更严格,并把概率转折推向更高的 Jaccard 相似度。任何设置都无法同时消除假阳性和假阴性。

下面的代码在两个集合的并集上使用同一套随机顺序,这等价于为 MinHash 抽取一次随机排列。两个集合的精确 Jaccard 相似度为 0.60.6;估计值就是最小元素相同的排列比例。

from math import sqrt
from random import Random

rng = Random(18)
universe = list(range(5000))

# 两个集合各有 800 个元素,其中 600 个相同:J = 600 / 1000 = 0.6。
A = set(rng.sample(universe, 800))
outside_A = [x for x in universe if x not in A]
B = set(rng.sample(sorted(A), 600) + rng.sample(outside_A, 200))

true_j = len(A & B) / len(A | B)
elements = sorted(A | B)
max_perm = 1024
matches = []

for _ in range(max_perm):
    order = elements.copy()
    rng.shuffle(order)  # 对并集使用同一个随机排列
    min_a = next(x for x in order if x in A)
    min_b = next(x for x in order if x in B)
    matches.append(min_a == min_b)

for m in [16, 64, 256, 1024]:
    estimate = sum(matches[:m]) / m
    standard_error = sqrt(true_j * (1 - true_j) / m)
    print(
        f"m={m:>4}  estimate={estimate:.3f}  "
        f"true={true_j:.3f}  standard error={standard_error:.3f}"
    )

图 6.3 把全配对基线与一种表现良好的索引情况分开画出。它的成本上界由两部分组成:构建签名需要 O(nm)O(nm),索引产生的 KK 个候选对还需要额外处理,因此总工作量大致为 O(nm+K)O(nm+K)。只有当每篇文档对应的候选数量有界时,它才接近线性。在退化的桶中,KK 仍可能接近 n(n1)/2n(n-1)/2

2026-08-03T20:26:04.893321 image/svg+xml Matplotlib v3.11.0, https://matplotlib.org/ 1 0 3 1 0 4 1 0 5 1 0 6 1 0 7 1 0 8 1 0 9 语料文档数 (n) 1 0 4 1 0 6 1 0 8 1 0 1 0 1 0 1 2 1 0 1 4 1 0 1 6 1 0 1 8 两两比较次数 全量两两比较 O(n²) 索引示例(每篇文档 8 个候选)
图 6.3. 模糊去重工作量的示意对比。全配对比较按平方增长;索引曲线假设每篇文档有八个候选,展示的是一种有利的工作区间,而不是对 LSH 最坏情况的保证。

重复簇也必须以确定性方式处理。先按稳定身份排序记录,建立所有经过核验的相似边,再计算连通分量,并按固定策略选择一个代表。仅仅因为文档落入同一个 LSH 桶就将其删除,可能误删不同文本;选择最先读到的记录,则会让语料取决于分区顺序。

质量是测量出来的属性

不存在脱离上下文的“高质量文本”标签。一个过滤器可能偏爱流畅散文,却伤害代码;可能偏爱接近维基百科的语言,却删除对话;也可能改善一项评估,同时缩窄另一个领域的覆盖范围。

常见工具大致分为两类:

  • 规则测量长度、重复度、符号比例、样板模式、语言置信度等可检查特征。
  • 学习式评分器估计文本与参考集的相似度,或预测“教育价值”等标签。

在目标得到定义并用人工审阅的数据验证之前,不能假定任何一类工具天然具有高召回率、高精确率或无偏性。例如,CCNet 的参考模型困惑度衡量的是文本与其维基百科来源参考分布的相似程度,不是名为“流畅度”的客观属性 (Wenzek et al. 2020)。应按相关语言、方言、地区、来源和主题切片报告保留率与错误率,并同时检查被接受和被排除的记录。

最有力的验证方法是固定预算的训练消融实验。保持原始采集池、分词器、模型、优化器、词元预算和评估套件不变,只改变一项数据筛选决定,再比较损失和下游切片。FineWeb 公开消融了提取、过滤和去重方案。DataComp-LM 随后提供了一个 240 万亿词元的原始池,并用标准化模型训练比较数据配方;在它的基线设置中,基于模型的过滤十分重要 (Penedo et al. 2024; Li and others 2024)。这些是受控结果,不是数据集的普适排名。

图 6.4 以思想实验说明预期机制。只有当筛选后的训练流让目标分布从每个消耗的词元中得到更多有用信号时,它才会更好。若过滤删除了有用覆盖范围,曲线也可能向相反方向移动。

2026-08-03T20:26:12.223166 image/svg+xml Matplotlib v3.11.0, https://matplotlib.org/ 1 0 0 1 0 1 1 0 2 1 0 3 消耗词元数(对数刻度) 留出损失 未过滤数据流(有效词元率较低) 策展数据流(有效词元率较高)
图 6.4. 有用词元取舍的概念图。在图示假设下,经过筛选的训练流在每个采样词元中提供了更多与目标相关且不重复的信号。曲线不是实测损失,也不是对语料的普适排序。
争议所在

规模与质量并不是两个对立阵营。FineWeb 既规模庞大,又经过了大量过滤;FineWeb-Edu 是从抓取文本中经学习式过滤得到的子集,并非完全生成的语料。RefinedWeb 的实验表明,只用经过过滤的网络数据也能胜过若干公开混合语料;Dolma 则选择了另一条路线,强调有据可查的来源多样性 (Penedo et al. 2023; Soldaini et al. 2024)。真正没有定论的问题是:对于明确的模型、预算和评估目标,应该采用什么采集池、保留策略、混合分布和训练计划。

把保留的数据源变成采样词元

假设保留语料包含 KK 种来源。每个静态混合分布都定义了

Ptrain(x)=k=1KwkPk(x),wk0,k=1Kwk=1.P_{\mathrm{train}}(x)=\sum_{k=1}^{K}w_kP_k(x), \qquad w_k\geq 0, \qquad \sum_{k=1}^{K}w_k=1.

其中,Ptrain(x)P_{\mathrm{train}}(x) 是训练时采到词元序列 xx 的概率,Pk(x)P_k(x) 是来源 kk 内部的采样分布,wkw_k 是该来源的混合权重,KK 是来源数量。若总预算为 DD 个采样词元,来源 kk 预期贡献 Dk=wkDD_k=w_kD 个词元。

若来源 kk 含有 UkU_k 个保留词元实例,其预期有效轮数定义为

ek=DkUk=wkDUk.e_k=\frac{D_k}{U_k}=\frac{w_kD}{U_k}.

这里,eke_k 是完整遍历来源 kk 的预期次数,DkD_k 是分配给它的采样词元数,UkU_k 是其中不重复的保留词元数。只看混合百分比时,意外的过度采样很容易被掩盖,而这个量能把问题显现出来。

权重可以来自专家判断,也可以来自算力匹配的代理实验。DoReMi 先按初始领域权重训练一个小型参考模型,再用同样规模的代理模型,针对各领域的超额损失执行分组分布鲁棒优化。它对训练中不断变化的权重取平均,并据此为更大的模型重新采样数据 (Xie et al. 2023)。论文报告的从 2.8 亿参数的代理模型迁移到 80 亿参数模型,是该实验中的证据,并不保证能跨分词器、领域定义、模型族或规模复现。

静态混合分布让每个 wkw_k 保持不变。课程编排则使用随时间变化的权重 wk(t)w_k(t),其中 tt 表示训练进度;它也可以在训练过程中改变样本顺序。训练后期提高优质或特定领域切片的权重,是课程编排的一种形式;若与最后的学习率阶段配合,通常称为数据退火或冷却混合。它与训练计划的相互作用放在 第 11 章 讨论。

把合成数据视为派生来源

合成数据可以改写现有文本、生成教科书式示例、蒸馏更强模型,也可以创建经过验证的练习。TinyStories 表明,狭窄的合成故事分布可以让不到一千万参数的模型学会生成连贯英文 (Eldan and Li 2023)。phi-1 实验报告称,一个 13 亿参数模型在包含合成教科书和练习的精选混合数据上训练后,取得了很强的代码生成结果 (Gunasekar et al. 2023)。WRAP 把真实 C4 文本与模型生成的改写混合,在其实验设置中提高了效率 (Maini et al. 2024)。

生成的词元并不会自动变得廉价、真实、新颖或有用。生成本身消耗推断算力,验证也会增加成本;生成器还可能复现基准内容、来源错误或单一文风。Shumailov 等人研究的高风险模型崩溃场景,是用一代代模型的输出递归替换原始数据;保留原始数据的合成增强属于另一种情形 (Shumailov et al. 2024)。

每条生成记录都应保留父来源 ID、生成器提供方和检查点、提示或模板版本、解码设置、时间戳、验证结果,以及适用的使用条款。在为合成来源分配混合权重前,应评估事实忠实度、多样性、来源覆盖、污染情况和下游表现。

去污染保护的是评估结论

去重问的是训练记录是否彼此重复,去污染问的则是训练数据是否包含受保护的评估材料。要回答后一个问题,必须在数据筛选开始前冻结一份基准版本登记表。

若一条很短的基准题被复制进很长的网页,整篇文档的 Jaccard 相似度并不是合适的检测量。对于评估条目 ee 和训练文档 dd,从评估条目一侧计算的 nn-gram 包含分数定义为

Cn(e,d)=Gn(e)Gn(d)Gn(e).C_n(e,d)=\frac{|G_n(e)\cap G_n(d)|}{|G_n(e)|}.

其中,Gn(z)G_n(z) 是文本 zz 经过规范化后得到的词元 nn-gram 集合,nn 是选定的序列长度,Cn(e,d)C_n(e,d) 是评估条目中有多少比例的 nn-gram 出现在训练文档里。策略可以在 Cn(e,d)τC_n(e,d)\geq\tau 时标记该文档对,其中 τ\tau 是针对具体基准设定的阈值。规范化方式、nn 的取值、常见 n-gram 抑制、检索方法、阈值和裁决规则都必须写入报告。

词法匹配存在明确边界。改写、翻译、代码重写和合成式复述可以保留答案,却只共享很少的表层字符串。Yang 等人演示了这类规避方式,也在合成数据集中发现了重叠 (Yang et al. 2023)。语义匹配或模型辅助审阅可以扩大覆盖范围,但会引入自身的错误。一份去污染报告只能证明检查过什么、移除了什么,不能证明完全不存在泄漏。

下层约束

评估会反过来约束数据准备。第 47 章 必须在最终语料构建前提供受保护条目的版本和登记表摘要。数据团队与评估团队共同规定匹配和裁决规则。已确认的匹配项要在训练前删除或隔离;训练结束后,存在污染嫌疑的评估条目只能被排除并披露,不能在训练后从模型中追溯删除。

交接材料应包含基准与语料版本哈希、检测器与规范化版本、阈值、人工审阅样本、按来源和基准统计的删除数量、删除的词元总数,以及处理前后的语料清单。对于受限材料,应使用不透明的记录 ID,不要把私有数据或基准答案复制到广泛可见的报告中。

让每条保留记录都可追溯

可复现并不意味着假装在线 URL 永远不会变化。原始快照和接受后的分片应冻结为不可变、按内容寻址的对象。用这些输入和固定版本的代码重建时,应能复现记录中的成员关系和分片校验和。重新获取在线来源会生成新的语料版本。

一份机器可读的清单至少应包含:

corpus:
  id: <稳定的语料名称>
  version: <语义版本>
  owner: <责任团队>
  intended_uses: [...]
  excluded_uses: [...]
source_record:
  uri_or_revision: <WARC 记录、URL 或代码仓库提交>
  retrieved_at: <时间戳>
  raw_digest: <内容哈希>
  origin: <人工、模型生成或未知>
  rights_evidence: <许可证、条款、同意及带日期的证据>
pipeline:
  code_commit: <代码修订版本>
  environment_digest: <容器和依赖项摘要>
  transforms: <模型、阈值、种子和配置>
  stage_counts: <按原因统计的接受与拒绝数量>
lineage:
  parent_record_ids: [...]
  dedup_cluster_id: <稳定的重复簇>
  retained_representative: <稳定记录 ID>
evaluation:
  registry_digest: <受保护的基准版本>
  detector_policy: <规范化、匹配、阈值和审阅>
output:
  tokenizer_digest: <固定版本的分词器>
  shard_digests: [...]
  sampling_policy: <权重和计划>
  consumed_by_runs: [...]
  tombstones: <删除记录及受影响的派生项>

公开的数据说明书可以概述用途、来源、转换、已知限制和各切片统计。敏感原始记录、个人信息和受保护的基准材料仍应受到访问控制。Dolma 展示了同时公开语料文档和筛选工具的价值 (Soldaini et al. 2024);Datasheets for Datasets 则提供了更广泛的数据集文档框架 (Gebru et al. 2021)。

在完整训练前验证语料

只有在多个尺度上拿出证据,一套语料才配得上完整训练预算:

  1. 阶段账目。 核对每次转换前后的文档数、字节数和词元数;保留率若出现意外跳变,必须查明原因。
  2. 人工审阅样本。 按来源、语言、分数区间和策略原因,分别抽取接受与拒绝的记录,并估计带有不确定性的错误率。
  3. 分布比较。 测量每个阶段增加或移除了哪些领域、语言、主机、许可证和文档类型。
  4. 重复审计。 报告精确重复、片段重复和模糊重复的簇分布,包括最大的簇及其代表选择策略。
  5. 污染审计。 对进入语料的每条路径运行冻结的评估登记表,其中包括合成数据和导入的数据集。
  6. 采样器测试。 生成一次试运行训练流,核验实际权重、有效轮数、顺序、打包和分片均衡情况。
  7. 算力匹配的消融实验。 每次只改变一项数据决定来训练小模型,再比较留出损失和目标切片。
  8. 回放与删除。 既要能把采样记录向后追溯到来源,也要能把某个来源向前追踪到全部派生项和使用它的训练任务。

在批准完整训练前,应记录采集快照、策略依据、保留成员、过滤审计、混合权重、训练计划、有效轮数、去污染局限、分词器版本和输出分片哈希。这份记录让模型学到的分布可以检查,也让后续评估能够说明模型究竟可能见过什么。

延伸阅读

  • Penedo et al., “The FineWeb Datasets: Decanting the Web for the Finest Text Data at Scale” (Web 规模去重与质量过滤), 2024. arXiv:2406.17557
    FineWeb 是一个从 96 个 Common Crawl 快照中提取的 15 万亿词元预训练数据集,采用消融实验驱动的过滤策略与逐快照最小哈希去重,性能优于其他公开预训练数据集;FineWeb-Edu 是 1.3 万亿词元的教育子集,在 MMLU 和 ARC 上表现显著更好。
  • Penedo et al., “The RefinedWeb Dataset for Falcon LLM: Outperforming Curated Corpora with Web Data, and Web Data Only,” 2023. arXiv:2306.01116
    RefinedWeb 表明,对 CommonCrawl 进行严格过滤与去重后得到的五万亿词元纯网页数据,可训练出超越使用精心策划语料库(如 The Pile)所训练的大语言模型。
  • Wenzek et al., “CCNet: Extracting High Quality Monolingual Datasets from Web Crawl Data,” 2020. aclanthology.org
    CCNet 是一条自动化流水线,通过去重、语言识别和基于维基百科困惑度的过滤,从 Common Crawl 中提取大规模高质量单语数据集。
  • Lee et al., “Deduplicating Training Data Makes Language Models Better,” 2022. aclanthology.org
    对大语言模型训练数据去重可将逐字记忆率降低十倍、减少训练-测试集重叠,同时以更少训练步骤达到相同或更高的准确率。
  • Abbas et al., “SemDeDup: Data-efficient Learning at Web-scale through Semantic Deduplication,” 2023. arXiv:2303.09540
    SemDeDup 利用预训练模型的嵌入向量识别并去除语义相似但非完全相同的重复样本,可将网络规模训练数据减少 50% 同时几乎不损失性能。
  • Xie et al., “DoReMi: Optimizing Data Mixtures Speeds Up Language Model Pretraining,” 2023. openreview.net
    DoReMi 在小代理模型上应用分组分布鲁棒优化来确定预训练领域权重;在其 8B 模型实验中,平均少样本下游准确率提高 6.5 个百分点,并以少 2.6 倍的训练步骤达到基线准确率。
  • Gao et al., “The Pile: An 800GB Dataset of Diverse Text for Language Modeling,” 2020. arXiv:2101.00027
    The Pile 是一个由 22 个多样化来源组成的 825 GiB 英语文本语料库,旨在提升大语言模型预训练的跨领域泛化能力。
  • Raffel et al., “Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer” (T5 与 C4), 2020. jmlr.org
    T5 提出统一的文本到文本框架,将所有自然语言处理任务转化为同一格式,并系统比较预训练目标、模型架构与数据规模,在多个基准上达到最优水平。
  • Soldaini et al., “Dolma: an Open Corpus of Three Trillion Tokens for Language Model Pretraining Research,” 2024. aclanthology.org
    Dolma 是一个开放的三万亿词元英语预训练语料库,来源涵盖网页、科学论文、代码、图书、社交媒体和百科内容,并附完整文档和数据策划工具包。
  • Gunasekar et al., “Textbooks Are All You Need” (phi-1), 2023. arXiv:2306.11644
    phi-1 是一个 1.3B 参数的代码模型,用 7B 词元的过滤代码、合成教科书和练习数据训练;论文报告其微调后在 HumanEval 上达到 50.6% pass@1。
  • Eldan & Li, “TinyStories: How Small Can Language Models Be and Still Speak Coherent English?,” 2023. arXiv:2305.07759
    TinyStories 提出一个由简单短故事构成的合成数据集,证明参数量低于 1000 万的语言模型也能生成流畅连贯的英文文本并涌现出推理能力。
  • Maini et al., “Rephrasing the Web: A Recipe for Compute and Data-Efficient Language Modeling” (WRAP), 2024. arXiv:2401.16380
    WRAP 方法用指令微调的 LLM 将嘈杂网页文本改写为多种风格的合成数据,与在原始网页语料上预训练大语言模型相比,可将所需计算量减少约 3 倍、数据量减少约 5 倍。
  • Yang et al., “Rethinking Benchmark and Contamination for Language Models with Rephrased Samples” (大语言模型去污染方法,以及 n 元语法重叠阈值与其局限), 2023. arXiv:2311.04850
    本文表明改写的基准测试样本(改述或翻译)可绕过 n-gram 与嵌入式去污染检测,并提出一种基于大语言模型的去污染方法,用于发现预训练数据集中的此类污染。
  • Qin et al., “ToolLLM: Facilitating Large Language Models to Master 16000+ Real-world APIs” (作为训练数据的 ToolBench 工具使用轨迹), 2023. arXiv:2307.16789
    ToolLLM 构建了包含 16,464 个真实 API 的指令微调数据集 ToolBench,并在此基础上对 LLaMA 进行监督微调得到 ToolLLaMA,其工具调用能力达到与 ChatGPT 相当的水平。

评论

登录后评论