小结
小结
第一部分跟随基座模型在成为产品之前怎样形成:规模怎样定预算,数据怎样取舍,字节怎样变成词元,结构怎样安排计算,一场训练怎样在集群上跑完。中段训练又说明,广泛预训练和后训练之间并不是空白,而是质量、领域、专门化和上下文长度被重新调配的地方。
这一部分的核心担忧是不可逆性。数据混合、词表、结构、精度、并行方案和继续训练课程,看起来像准备工作,后来却会变成服务、适配、评测和安全共同继承的约束。后面的层可以补偿其中一部分,却很难自由重写它们。
因此,基座模型形成不是背景知识,而是第一笔基础设施投资。仍未解决的问题,是在自然语料变薄、硬件经济性变紧之后,高质量数据、合成数据和中段训练还能把规模化曲线延长多少。这里不能预设答案,只能把它当作之后各层都会遇到的约束。这也解释了为什么第二部分会暂时离开语言模型的主线:第一部分说明文本怎样被整理成词元序列,并让一个基座模型继承这套顺序;第二部分要问的是,当对象变成图像、声音、视频或具身经验时,系统怎样为它们制造可训练、可采样、可评估的顺序。两部分之间连接的不是「文本之后还有多模态」这个题材清单,而是同一个问题:基础设施怎样把原始世界变成模型可以学习的结构。
评论
登录后评论