AI 基建
0%
小结

小结

作者Changkun Ou
阅读时长约 1 分钟

第一部分讨论的是基座模型在成为产品之前如何形成:规模与算力预算如何确定,如何筛选数据,分词器如何把字节转换成词元,Transformer 变体如何组织计算,以及如何让一次训练在整个集群上稳定跑完。最后,中段训练一章说明,宽泛预训练与后训练之间并非空白。模型的行为被明确塑造之前,质量、领域混合、专门化程度和上下文长度都可以在这里调整。

贯穿这一部分的主线,是这些选择往往难以逆转。数据混合、词表、架构、数值精度、并行方案,以及继续训练时的数据安排,起初都像准备工作,最终却都会成为后续系统继承的约束。后续的服务、适配、评测和安全工作可以补偿其中一部分影响,却无法随意改写这些选择。

基座模型的形成本身就是基础设施,而非背景知识。仍然悬而未决的问题是,当自然语料日渐稀缺、硬件成本约束不断收紧时,继续扩大规模还有多少空间。更高质量的数据、合成数据和中段训练或许能让规模化收益延续更久,但这只是有待检验的可能性,而不是可以预设的承诺。也正因此,本书没有紧接着讨论后训练,而是先在第二部分转向另一类生成问题。第一部分说明文本如何组织成词元序列,以及基座模型如何继承这种顺序;第二部分则要追问,当对象变成图像、声音、视频或具身经验时,系统必须为这些对象构造一种顺序,训练、采样、缓存和评测才有可操作的基础。真正衔接两部分的,并不是在文本之后罗列更多媒体格式,而是同一个基础设施问题:对于不天然以字符串形式出现的对象,怎样把它们组织成可供模型学习的结构。

评论

登录后评论