第二部分 · 生成式与多模态架构
第二部分 · 生成式与多模态架构
「直接从图像相关的原始文本中学习,是一种有前景的替代方案。」
Alec Radford 等,"Learning Transferable Visual Models From Natural Language Supervision"
第一部分搭好了处理词元的模型机制。第二部分暂时离开文本模型主线,转向另一组生成问题:当要生成的对象并不天然是一条从左到右的字符串时,架构该怎样组织生成。图像、音频、视频、语音和具身观察都提出同一个问题:对象并没有单一的自然顺序,可模型仍然要学习怎样从条件走向结果,怎样采样,怎样缓存,怎样评估。自回归语言模型的生命周期会在第三部分接着展开;这里的架构是它的旁支,而不是它的后继。
这一部分追踪围绕这些对象发展出来的架构。第 12 章 从扩散与流匹配开始,把生成看作从噪声恢复结构的过程。第 13 章 把这条线带回语言,问非自回归和扩散语言模型为什么有吸引力,又为什么会在服务层付出代价。第 14 章 与 第 15 章 进入语音、图像、视频和多模态融合,重点是不同模态怎样被压缩成模型可以共同处理的表示。第 16 章 再把问题推向世界模型、机器人和具身系统,在那里,缺的常常不是更大的网络,而是足够可靠的经验来源。
这一部分表面上在讲多种模态,背后其实在讲顺序。每一章都在回答同一个问题:面对一个没有天然词元序列的世界,系统造出了怎样的顺序,好让模型得以训练、缓存、采样和评估,又为这套顺序付出了什么。
评论
登录后评论