AI 基建
0%
小结

小结

作者Changkun Ou
阅读时长约 1 分钟

第二部分暂时离开从左到右的文本主线,转向那些并不天然是一串词元的对象。扩散、流匹配、非自回归语言模型、语音、图像、视频、世界模型和机器人,都要回答同一个结构问题:系统要发明怎样的顺序,训练、采样、缓存和评测才有可能进行?

这种被发明出来的顺序从不免费。某种表示可能让训练变容易,却让服务变难;某种采样过程可能提高质量,却放大延迟;某种多模态融合可能遮住证据的来源。因此,这一部分表面上讲模态,实际讲的是把物理或感知对象翻译成模型可处理对象时付出的代价。

这一部分应留下的判断是:多模态架构首先是一种构造顺序的工作。仍然开放的问题,是具身经验、机器人数据和世界模型训练能否像文本一样稳定扩展。如果不能,瓶颈就会从模型结构转移到物理世界数据的收集、继承和验证。第三部分会回到行为本身:当模型已经能沿着这些顺序生成,下一步就要问哪些行为该被鼓励、拒绝、排序或修正。

评论

登录后评论