第二部分 · 生成式与多模态架构
第二部分 · 生成式与多模态架构
「直接从描述图像的原始文本中学习,是一种很有前景的替代方案。」
Alec Radford 等,"Learning Transferable Visual Models From Natural Language Supervision"
第一部分构建了让模型处理词元的整套机制。第二部分暂时离开文本模型的主线,沿着一条并行路线展开:当生成对象本身并不是一串天然从左到右排列的字符串时,系统该如何组织生成过程。图像、音频、视频、语音和具身观察都迫使我们面对同一个难题:模型必须生成连贯的结果,但生成对象未必存在唯一的自然顺序。自回归语言模型的生命周期将在第三部分继续;本部分讨论的,是与它并行发展的其他架构,而不是取代它的后继者。
这一部分讨论的,正是为解决这一难题而发展出来的架构。第 12 章 从去噪与流匹配讲起:模型学习的不再是序列中的下一个词元,而是一条从噪声通往结构的路径。第 13 章 把问题带回语言,考察非自回归与扩散语言模型在放弃自回归模型的缓存能力与简洁清晰的服务方式后,得到了什么,又失去了什么。随后,第 14 章 与 第 15 章 依次讨论语音识别、语音生成、视觉与语言融合、图像生成和视频。到了 第 16 章,视野进一步扩展到世界模型、机器人与具身系统;这些领域缺少的往往不是更大的模型,而是持续、可靠且扎根现实的经验数据流。
本部分不是媒体格式的导览,而是研究顺序如何被构造。图像、音频或机器人只是表层主题,真正的问题是:系统为模型构造了怎样的序列,训练、缓存、采样和评测才得以进行。架构正是这套人为构造的顺序。
评论
登录后评论