第零部分 · 入门定位
「我们只能看见前方很短的一段路,但那里已经有许多事情要做。」
艾伦·图灵(Alan Turing),《计算机器与智能》
多数读者接触 AI 基础设施,并不是从技术栈最底层开始,而是从中途某个具体问题切入:模型发布、基准成绩跃升、GPU 账单、延迟故障,或一个昨天还能正常运行、今天却突然失灵的智能体演示。问题看似出在局部,原因却很少止于局部。某项服务技术可能反过来影响模型架构;后训练最终会强化什么行为,取决于基准如何设定;智能体能否尝试某项操作,最终要看安全规则是否允许;一项建模思路之所以可行,也可能只是因为技术栈下方几层的硬件限制为它留下了空间。
在后续章节同时引入大量机制之前,第零部分先把这条路径完整呈现出来。第 1 章 从一项普通任务出发:让助手在小型代码仓库中找出错误、提出修复方案并说明原因。我们跟着这项请求依次经过数据、分词(把文本切成整数片段)、基座模型形成(训练原始模型)、适配(调整训练后模型的行为)、服务、检索和智能体运行时。暂时不必深入掌握这些层。关键是看清后续章节并非彼此割裂的专题,而是同一条路径上的不同成本与选择。
看清这条路径后,第 2 章 把视角拉远,呈现全书的整体结构。它为技术栈勾勒出稳定框架,也标明哪些内容已经稳定到足以作为工程实践,哪些仍有争议,例如推理能力的提升、可解释性、智能体架构和评测。本书反复使用的「下层约束」也在这里第一次出现:看到看似随意的设计选择时,向下追一层,看看究竟是谁在承担成本。
接下来要处理的是语言。第 3 章 区分借来的机制与借来的图景。「压缩即预测」并非比喻,而是从信息论角度理解训练目标。扩散方法最初从物理学借来的框架,确实提供了数学支撑,尽管今天的实践已经很少沿用热力学的说法。相比之下,「神经元」「注意力」「记忆」和「System 2」这些词与实际机制的关系更弱。它们可以帮助建立直觉,却不应把这些词误当成事物本身。
第零部分最后划定本书主题的边界。第 4 章 把生成式 AI 技术栈与此前已经支撑着信息流、搜索排序和广告竞价的 AI 基础设施放在一起,考察新技术栈继承了什么、哪些无法复用,又在哪里逐渐汇合。弄清本书讨论到哪里为止,可以避免后续章节在不经意间作出超出范围的主张。
读完第零部分,全书就可以加快节奏。至此,一项请求走完整条技术栈的路线已经清楚;哪些主张仍有争议,哪些已经成为稳定结论,也已分明;借来的词汇有了恰当的定位;与上一代 AI 基础设施的边界也已划定。有了这些准备,就可以开始逐层拆解这台机器。
如何阅读本书
本书不要求从头到尾顺读。读者可以从任何一个实际问题切入,从最初促使自己翻开本书的地方开始。要让这种读法顺畅,需要养成三个习惯。
第一,专业术语在每章首次出现时都会写出中文全称和英文原文,并链接到术语表。术语表会给出一句话定义,并指向这个概念第一次得到完整解释的位置。遇到陌生词时,可以先打开链接,再继续阅读。
第二,像 第 31 章 这样的交叉引用,会指向机制得到完整阐释的章节。这样,一处顺带提及就不必重复全部背景。
第三,第 2 章 引入的「下层约束」会标出当前设计其实由下一层成本决定的地方。
有一项前置知识,本书不会从零讲起:Transformer 如何把词元变成预测。尚不了解这一架构的读者,应当先读 第 7 章 和 第 8 章,再进入服务、推理和编排部分,因为这些部分会默认读者已经理解注意力、键值(KV)缓存、预填充和解码阶段。第 8 章 会从残差流讲起,逐一建立这些概念。
评论
登录后评论