AI 基建
0%
小结

小结

作者Changkun Ou
阅读时长约 1 分钟

第五部分从训练结束之后开始,但服务的成本形状和训练不同。预填充与解码给机器施加压力的方式不同,KV 缓存随上下文和并发增长,批处理改善吞吐却扰动延迟,量化和算子改变字节流动,结构化输出、长上下文和多模态输入又让原本整洁的文本服务问题变得复杂。

真正起约束作用的常常不是 FLOPs,而是内存移动、尾延迟、缓存驻留、批形状,以及支持特殊请求路径时不破坏普通路径的成本。服务层把能力变成产品约束,这种约束又会反推模型结构。

到这里,一个模型是否足够强已经不是唯一问题。它还必须能在某个团队承受得起的延迟和价格下重复交付。仍然开放的是:哪些模型和运行时设计能让长上下文、多模态和结构化生成变得可承受,而不把服务层变成特例堆。第六部分从这里开始:当一个已经能服务的模型被要求完成更长的任务,工具、记忆、检索和恢复循环就不再是外围装饰,而会变成系统本身。

评论

登录后评论