小结
小结
第二部分不再沿着从左到右生成文本的主线展开,而是转向那些并非天然按词元排列的生成对象。无论是扩散与流匹配、非自回归语言模型、语音、图像、视频,还是世界模型与机器人系统,都面对同一个结构性问题:系统该为这些对象构造怎样的顺序,才能据此学习、采样、缓存并评测结果?
构造顺序必然有代价。有些表示方式便于训练,却会增加服务难度;提高采样保真度,往往意味着延迟成倍增加;多模态融合还可能让证据来源变得模糊。因此,关键不在于覆盖了多少种模态,而在于把现实世界的物体或感知信号转换成模型可以处理的表示时,需要付出什么代价。
多模态架构的核心,是为原本没有明确顺序的对象构造顺序。尚未回答的是,来自现实世界的经验和机器人数据,能否表现出接近文本数据的扩展规律。如果不能,瓶颈就会从模型设计转移到物理世界数据的采集、复用和验证。第三部分会回到行为本身:模型能够依照这些顺序完成生成之后,下一步要决定哪些行为该鼓励、哪些该拒绝,又该如何排序或纠正。
评论
登录后评论