AI 基建
0%
第一部分 · 基座模型的形成

第一部分 · 基座模型的形成

作者Changkun Ou
阅读时长约 1 分钟

「损失会随模型大小、数据集大小以及训练算力呈幂律变化。」

Jared Kaplan 等,"Scaling Laws for Neural Language Models"

前面画出的地图,到这里开始变成真实支出。一个模型还没有被部署、没有接工具、没有被评测时,许多决定已经做出:训练预算有多大,语料从哪里来,哪些文本会留下,字节怎样切成词元(文本被切成的整数片段,第 7 章),哪个 Transformer 块(把序列变成计算的那层重复结构)来处理这些词元,训练作业如何在几千张卡上稳定跑完。这些决定看似属于准备阶段,实际会一路影响后面的服务、适配、安全和成本。第一部分要看的正是基座模型如何在这些决定中成形:后面能动用的自由在这里买下,后面要背负的约束也在这里锁定。

第 5 章 先讲训练规模为什么必须事前决定。第 6 章第 7 章 处理模型入口处的两道关口:原始网络材料怎样变成语料,文本又怎样变成模型能读取的整数。第 8 章第 9 章 进入结构本身,讲稠密 Transformer、混合专家、状态空间模型与混合架构怎样围绕容量、上下文和缓存做取舍。到 第 10 章,问题回到集群:并行如何切分,精度如何降低,通信如何隐藏,检查点如何保护一次昂贵的训练运行。第 11 章 收束这一部分,讨论宽泛网页预训练之后、后训练之前的那段桥接:高质量退火、领域混合、专门化继续训练与上下文扩展,这些都是对数据配比和训练计划的调整,而非改动训练目标。

真正值得问的,不只是预训练怎样工作,而是哪些选择以后还能改,哪些已经长进模型本身、再难挪动。服务、适配、评测与安全,日后都要从这里继承答案:有些答案是数学给定的,有些是工程上的折中,还有些是硬件留下的伤疤。

评论

登录后评论