AI 基建
0%
第五部分 · 推断与服务

第五部分 · 推断与服务

作者Changkun Ou
阅读时长约 1 分钟

「大型在线服务需要把不那么可预测的部件,组成响应可预测的整体。」

Jeffrey Dean 与 Luiz Andre Barroso,"The Tail at Scale"

训练结束后,留下的是一组权重;服务层要交付的,是一串按时出现、成本可承受的词元。推断不是训练阶段的简化版本,而是另一类工程问题:预填充与解码占用的资源不同,计算和显存互相牵制,单个请求还必须与同一批中的其他请求共同排队。预填充一次读完整段提示词,解码再逐步吐出每个词元。

第 31 章 先把核心矛盾摆出来:生成每个词元的 FLOPs 未必最贵,真正限制系统的常常是内存移动和不断增长的 KV 缓存。第 32 章 把缓存当成要管理的资源,讲分页、连续批处理、前缀共享和阶段拆分。第 33 章 讨论怎样让一次昂贵前向传播产生多个词元。第 34 章 从字节和算子下手,让权重、激活和缓存更便宜。第 35 章第 36 章 则说明,结构化输出、长上下文和视觉词元怎样让文本服务问题重新变得复杂;所谓视觉词元,是图像切块不经过文本分词器、直接作为词元送进模型。

这一部分的关键词是「成本可承受」。一个模型再强,只要太慢、太占显存、太难批处理,就还算不上基础设施。服务层把能力变成可重复交付的东西,也把成本压力反推回模型设计。

评论

登录后评论