领域地图与如何阅读本书
第 1 章区分了模型开发和请求执行。本章把全书其余内容放在这两条主线周围:每一部分解决什么问题,哪些联系是依赖关系而不是阅读顺序,不同说法得到多强的证据支持,以及读者怎样从中间某处开始,而不必先读完前面的每一章。
由此得到的结构并不是一条管线。有些部分描述模型生命周期的阶段,有些描述运行时组件、证据、物理约束或运营条件。如果把它们全部排成连续步骤,反而会遮住本书真正要说明的联系。
两个过程与若干贯穿全书的议题
模型开发过程负责产出并修订可部署的模型,包括数据准备、基座模型形成、后训练、评测和发布。请求执行过程始于部署之后,包括模型服务、模型调用、工具使用、观测结果和面向用户的输出。推理方法可能作用于任一过程:有些会改变训练,有些则在模型调用期间分配更多计算。
还有几类议题贯穿两个过程。算力基础设施限制能够训练和服务什么模型;评测为系统行为提供证据;安全与治理规定哪些行为可以发生、需要哪些控制;经济条件决定哪些设计能够长期维持;运营则把这些选择落实为服务目标、事故处理流程,以及下一次发布所需的反馈。
本章所说的依赖关系,是指一项设计需要另一项设计提供某个工件或属性。反馈关系,是指下游的证据或成本改变了前面的决策。两者都不决定相关章节的阅读顺序。
十二个部分各在何处
图 2.1 只画出第一至第十二部分之间的一部分依赖关系。它有意不画成完整的系统图,因为如果把所有评测、安全、经济和运营关系都放进去,图就无法阅读。图后的表格会直接说明每一部分的作用。
| 部分 | 核心问题 | 在本书中的作用 |
|---|---|---|
| I. 基座模型的形成 | 数据和算力怎样产出有用的基座模型? | 扩展律(scaling law) 是根据模型规模、数据量和算力预测损失的经验公式,可用于规划训练。本部分继而讨论数据、分词、架构、分布式训练和中段训练(第 5 章、第 11 章)。 |
| II. 生成式与多模态架构 | 模型怎样生成图像、音频、视频和其他模态? | 从自回归文本模型扩展到扩散、流匹配和多模态系统(第 12 章、第 15 章)。 |
| III. 后训练 | 基座模型怎样变成行为符合要求的助手? | 讨论示范学习、偏好学习、奖励、安全调优和合成数据(第 17 章、第 19 章)。 |
| IV. 推理与测试时算力 | 额外计算能在何处改善困难任务? | 区分训练方法与运行时的搜索、验证和路由(第 24 章、第 30 章)。 |
| V. 推断与服务 | 怎样把模型权重变成响应及时、成本可控的服务? | 展开批处理、缓存管理、更快的解码、量化和长上下文服务(第 31 章、第 32 章)。 |
| VI. 编排 | 怎样把模型调用与工具、记忆、检索和上下文结合起来? | 描述智能体运行时及模型调用周围的系统(第 38 章、第 46 章)。 |
| VII. 评测 | 哪些证据能够支撑能力主张或发布决定? | 讨论基准、不确定性、人类评测、模型评判者、智能体评测和发布门槛(第 47 章、第 53 章)。 |
| VIII. 安全、可解释性与治理 | 哪些行为可以发生,能否被观察和控制? | 研究内部机制分析、监督、授权、运行时防护、隐私和政策(第 54 章、第 56 章)。 |
| IX. 基础设施与算力 | 哪些硬件和系统约束会影响训练与服务? | 讨论加速器、网络、框架、编译器、集群、芯片、电力和故障恢复(第 62 章、第 68 章)。 |
| X. 前沿与极限 | 数据、测量和验证在何处不足以支撑更强的主张? | 研究学习、能力测量和验证的极限(第 70 章、第 72 章)。 |
| XI. 生态与经济 | 哪些外部条件会影响技术选择? | 讨论模型访问、工件、标准、成本、市场结构、技术采用和数据权利(第 73 章、第 76 章)。 |
| XII. 实践与运营 | 怎样选择、部署、监督并改进一个完整系统? | 把前面的机制用于模型选型、部署、人类监督、生产数据和运营契约(第 81 章、第 91 章、第 93 章)。 |
全书编号只是编辑顺序,图中画的是依赖关系。例如,第九部分排在第一部分之后,却画在它下面,因为硬件会约束模型训练。第七和第八部分画在已部署系统附近,但评测与安全同样会约束数据、训练和发布决策。第十二部分位于全书末尾,是因为它综合运用前面的内容,而不是因为运营只在开发完成后才开始。
两类反馈关系会在全书反复出现。第一,运行时需求会反过来影响模型开发决策。对于达到同一质量目标的模型,当服务量超过某个值时,训练成本较高但服务成本较低的设计可能更合适。这个结论取决于工作负载、硬件利用率、输入与输出长度以及模型寿命,不是把小模型延长训练当作普遍准则 (Sardana et al. 2024)。第 1 章给出了生命周期成本模型及其盈亏平衡条件。
第二,评测和运营会影响后续版本。一次失败可能暴露出缺失的测试、不安全的权限、欠缺的训练示例或服务能力上限,应该怎样处理取决于根因。重新训练模型无法修复运行时授权错误,修改基准也无法补全产品需求。
下层约束会点明一项具体依赖及其方向。判断这类关系时要问四个问题:需要哪种属性,哪个组件提供它,依赖在什么条件下成立,又有哪些证据支持它。答案既可能指向上游,也可能指向下游。服务需求反过来影响模型选择,是从下游到上游的关系;加速器内存限制模型放置,则是从上游到下游的关系。
说法有多可靠?
如果把定义、测量结果和假设写得同样肯定,技术文字就会令人困惑。本书把说法大致分为三类。
| 说法类型 | 依据 | 阅读方式 |
|---|---|---|
| 定义明确的机制 | 方程、算法、协议或代码规定组件做什么。 | 检查假设,再沿着机制推导。即使具体实现不同,Transformer 层或键值缓存仍可按这种方式描述。 |
| 经验规律 | 测量结果表明,某种关系会在给定范围内反复出现。 | 查看数据集、硬件、指标、不确定性和观测范围。超出该范围的外推属于新的主张。 |
| 尚无定论的解释或设计问题 | 现有证据允许多种解释,或者没有一种设计在所有工作负载上都占优。 | 把各种方案视为需要检验的立场,不要因表述自信就把它当作定论。 |
扩展律是第二类说法的重要例子。Kaplan 等人在所研究的范围内发现,语言模型损失与模型规模、数据量和训练算力之间近似服从幂律关系 (Kaplan et al. 2020)。只考虑算力时,可以用下面的简单拟合表示:
这里, 是拟合范围内的训练算力, 是使用算力 完成训练后的验证集交叉熵损失, 是拟合得到的损失下限, 决定可约损失的尺度, 是拟合出的扩展指数。这个方程概括了在特定数据分布、架构族和训练流程下测得的规律。一旦这些条件改变,它并不保证指数仍然相同。
下面的交互图只画归一化的可约项 ,并令 、,以便看清斜率。 表示归一化可约损失,其余符号沿用上面的定义。这只是形状示意,不是对真实训练任务的预测。
后续章节会按同样方式处理开放问题,下面是三个例子。
- 推理训练。 DeepSeek-R1-Zero 表明,即使没有先做监督微调,强化学习也能提高报告中的推理表现,并产生可辨认的推理行为 (Guo et al. 2025)。但这项结果本身无法确定训练是否创造了新的任务相关能力、让原有能力更容易被引出,或两者兼有(第 28 章)。
- 机械可解释性。 稀疏自编码器可以提取出比单个激活更容易命名的特征 (Bricken et al. 2023)。跨层转码器还能在近似替代模型中构建局部且针对特定提示的归因图 (Ameisen et al. 2025)。这些表示是否在因果上忠实、稳定而且足够完整,仍无定论(第 54 章)。
- 智能体设计。 记忆、工具接口、上下文管理和多智能体分解解决的是不同问题,也可以组合使用。它们的价值取决于任务、失败成本、延迟预算和可用评测(第 39 章、第 43 章)。
本书范围与互补资料
本书面向希望理解模型、系统、产品与运营决策如何相互影响的读者。它会讲到足以准确说明依赖关系的机制,但不能替代完整的语言模型实现课程或加速器集群编程课程。刚接触 Transformer 的读者,宜先阅读 第 7 章 和 第 8 章,再进入服务、推理和编排部分。
以下资料会针对更窄的任务讲得更深。
| 目标 | 互补资料 |
|---|---|
| 从头实现一个紧凑的 GPT 风格模型 | Raschka 的 Build a Large Language Model (From Scratch) (Raschka 2024) |
| 通过作业学习语言模型实现 | Stanford CS336,Language Modeling from Scratch (Hashimoto and Liang 2025) |
| 理解分布式训练和加速器性能 | Austin 等人的 How to Scale Your Model (Austin et al. 2025),以及 Ultra-Scale Playbook (Tazi et al. 2025) |
| 基于基础模型开发应用 | Huyen 的 AI Engineering (Huyen 2025),以及 Pai 的 Designing Large Language Model Applications (Pai 2025) |
本书关注的是这些专业领域之间的联系。服务负载会改变模型的经济性,评测协议会改变后训练奖励的目标,权限边界会排除某些原本能力足够的智能体设计,硬件容量、能源供应和成本则会缩小团队实际能够运营的模型范围。这些影响都有明确的成立条件,不是决定整个系统的单一原因。
怎样使用各章
各章并不套用同一套固定标题,但会反复回答以下问题:
- 这个组件要解决什么问题或约束?
- 它的机制怎样工作,又依赖哪些假设?
- 哪些证据支持它,还有哪些说法尚不确定?
- 它在能力、效率或运营复杂度上要付出什么代价?
- 哪些早期选择会约束它,它又会影响哪些后续选择?
「争议所在」框标记尚无定论的解释或设计选择,「下层约束」框标记跨越章节边界的依赖关系。它们都不能代替周围正文中的证据。
能力、效率和信任是三个评测问题,不是一笔固定预算。能力考察系统能否完成预期任务,效率考察结果需要多少资源和延迟,信任则追问哪些证据、控制和恢复机制足以让人依赖这个结果。一项干预可能同时改善多个维度,也可能损害其中一个,或者不产生影响。
选择阅读路线
| 如果你的目标是…… | 建议路线 |
|---|---|
| 建立完整的概念框架 | 按全书顺序阅读,各部分的导言与小结会负责衔接。 |
| 理解模型开发 | 先读第一部分,再读第三和第四部分;用第七和第八部分评测并约束最终行为。 |
| 开发应用或智能体 | 从第五部分开始,接着读第六部分;部署前再读第七、第八和第十二部分。 |
| 理解基础设施和运营成本 | 从第九部分开始,把它与第五和第十一部分联系起来,再用第十二部分了解部署与运营。 |
| 研究极限或有争议的能力主张 | 从第七和第十部分开始,再沿交叉引用回到被测量的机制。 |
如果从中途开始阅读,应当持续追问四件事:这里涉及哪个过程或贯穿性议题,它依赖什么,证据能支持多强的说法,以及它会改变哪项下游选择或上游反馈。比起背下一条线性的技术栈,这些问题更有用。
延伸阅读
- Huyen, Chip. AI Engineering: Building Applications with Foundation Models. O'Reilly Media, 2025. oreilly.comChip Huyen 的著作介绍 AI 工程实践:基于基础模型构建生产应用,涵盖评测、模型适配技术(提示工程、RAG、微调、智能体)与推理部署。
- Raschka, Sebastian. Build a Large Language Model (From Scratch). Manning Publications, 2024. manning.com本书手把手引导读者从头实现大语言模型(LLM)的注意力机制与 GPT 风格的 Transformer 架构,涵盖训练、微调与指令跟随。
- Pai, Suhas. Designing Large Language Model Applications: A Holistic Approach. O'Reilly Media, 2025. oreilly.comSuhas Pai 所著 O'Reilly 图书,介绍将大语言模型(LLM)从原型过渡到企业生产级应用的设计模式与工程决策。
- Tazi et al., “The Ultra-Scale Playbook: Training LLMs on GPU Clusters,” 2025. huggingface.coHugging Face Nanotron 团队的专门指南,聚焦在大型 GPU 集群上训练大语言模型,并提供 PDF 与交互网页版本。
- Hashimoto & Liang, “CS336: Language Modeling from Scratch,” 2025. cs336.stanford.eduStanford 的实现密集型语言模型课程,覆盖分词器构造、Transformer 实现、系统优化、扩展律、数据处理、评测与对齐。
- Austin et al., “How to Scale Your Model,” 2025. jax-ml.github.ioDeepMind/JAX 的系统书,讲真实 TPU 与 GPU 硬件上的 LLM 扩展,覆盖屋顶线、分片、训练、推断、服务与剖析。
评论
登录后评论