前言
人工智能成为基础设施,是一个逐步发生的过程。推动这个过程的,是几条开始相互牵引的曲线:模型能力、训练算力、加速器供给、推断流量、数据中心电力和公众预期。没有哪个模型突然跨过了一道明确门槛,负荷只是不断累积,直到人们不得不把周边系统建起来。前一年看上去还只是研究演示的成果,第二年便可能成为产品不可或缺的依赖。如今,同一类模型已经进入搜索框、IDE、呼叫中心、课堂和政务流程。社会看到的是劳动、教育、媒体和监管的变化,工程师面对的则是一类新系统:必须为它做好预算、持续监控、保障安全、定期升级,并建立问责机制。
AI 领域常常笼统地谈论「指数增长」。本书只关心它带来的一个朴素工程后果:当能力、流量和成本同时增长,局部决策就不再只影响局部。扩大上下文窗口,会改变内存调度方式;基准成绩一变,产品对外宣称的能力也会随之改变。模型的单位成本决定了谁负担得起部署费用;合成媒体则悄然改写了信任边界,因为许多机构过去一直把眼见耳闻当作证据。本书之所以写成,正是因为读者需要看清这些相互牵连的关系,而不能把其中任何一层当成全貌。
本书所说的「基础设施」,取的是工程语境里最朴素的含义:它是其他软件和组织共同依赖的一层,有可用性要求、成本曲线、故障模式、安全边界和升级路径,也有人负责运营。模型依然重要,却已不是我们要考察的全部。围绕模型,还有数据管线、训练系统、推断引擎、检索层、评测框架、智能体运行时、策略检查点、硬件供应链,以及决定哪些方案能经得起生产环境检验的经济条件。
本书关注的,正是这些层彼此衔接的地方。它无意成为扩展律、分布式训练、内核或推断引擎最详尽的专门手册,因为这些主题已经有优秀的公开资料。本书讨论的是各层如何相互制约:服务成本怎样反过来影响预训练决策,评测框架怎样改变后训练数据,安全边界为何会约束智能体运行时,以及市场结构如何决定哪些方案最终能够部署。
全书沿着一项能力的生命周期展开:从原始算力和语料构建开始,一直写到这种能力部署后成为可测量、可约束、可运营的系统行为。书中的每一层不仅要说明机制如何运作,还要解释它为何会形成今天的样子:是什么约束逼出了这套设计,它替代了什么,让哪部分成本降了下来,又把哪些风险转移到了别处。
为了不让这条主线中断,各章采用同样的论述顺序:先说明问题和真实约束,再看哪些设计能够满足这些约束,追溯它的演变,交代其中的取舍,最后再进入实现细节。本书虽然包含实践内容,却不是一本照着步骤做就行的操作手册。每章既要讲清「怎么运行」,也要同样清楚地回答「为什么要这样设计」。
本书结构
全书以一项能力的生命周期为骨架,从赖以形成的基础一路写到部署后的行为。
- 第零部分,入门定位。 先快速走一遍完整技术栈,梳理领域版图和从其他领域借来的概念,回顾生成式 AI 之前的基础设施,并说明本书的读法。
- 第一部分,基座模型的形成。 扩展律、数据、分词、模型架构、大规模训练,以及承上启下的中段训练。
- 第二部分,生成式与多模态架构。 扩散与流匹配、非自回归与扩散语言模型、语音、多模态融合,以及文本之外的世界模型与具身智能。
- 第三部分,后训练:适配、偏好与对齐。 微调、行为规格、偏好数据、RLHF、直接偏好优化、可验证奖励、指令层级与自我改进。
- 第四部分,推理与测试时算力。 推理能力的引出、结构化搜索、程序与求解器、验证器、RLVR 训练、推理数据与蒸馏,以及生产中的测试时算力。
- 第五部分,推断与服务。 服务问题、调度、更快的解码、量化、长上下文与多模态服务。
- 第六部分,编排。 训练智能体去行动、智能体架构、记忆、个性化、运行框架、计算机使用、多智能体系统、检索、嵌入与上下文。
- 第七部分,评测。 基准、统计可靠性、人类评分准则、模型评判、事实性、智能体评测与运营治理。
- 第八部分,安全、可解释性与治理。 可解释性、可扩展监督、安全与授权、运行时护栏、对抗鲁棒性、隐私与遗忘、机密推理,以及法律与监管。
- 第九部分,基础设施与算力。 加速器、网络、框架与自动微分、编译器与内核、集群编排与数据基础设施,并把视线推进到由硅片、电力和大规模故障共同界定的算力前沿。
- 第十部分,前沿与极限。 学习在何处耗尽数据和可用信号,能力主张的可测范围有多大,以及一个结果获得认可之前,验证它需要付出多少代价。
- 第十一部分,生态与经济。 模型开放性、模型制品与供应链、工具标准、算力市场、市场结构、采用与生产率、数据权利,以及智能体经济。
- 第十二部分,实践与运营。 从选择和连接实际工具开始,再讨论如何部署和运营它们,包括可靠性、生产数据引擎、SLO、成本治理、事故和多租户。
两条线索贯穿全书,抓住它们,就能看清相距很远的章节如何彼此呼应。第一条是三个循环:训练循环、推断循环和智能体循环在不同层级上复现着同一种控制结构。第二条是每章结尾的能力、效率、信任框架:系统能否完成任务,成本是多少,结果是否可信。除此之外,还要留意那些从下往上的约束,也就是底层条件迫使上层改变选择的地方。这些连接处正是沿着技术栈依次阅读的价值所在。它们也构成了本书的核心观点:硅片、电力、地理位置、价格和运营义务并非 AI 基础设施的外部背景,而是会逐层向上传导,直接塑造模型、产品和治理设计的约束。
适合谁读
本书写给构建和运营 AI 系统的工程师,也写给想了解理论如何进入生产环境的研究者。我们假定读者至少熟悉一门编程语言,具备基础的概率论和线性代数知识,也了解运行生产软件所需的常用工具。
本书是一部持续更新、按版本演进的草稿。各章保留来源线索,明确区分已经稳定的机制和尚在变化的判断,并把未决问题直接写出来。每章结尾都会用「争议所在」框列出尚无定论的问题,不会把分歧含混带过。
书中有若干完整示例会用到作者亲手开发的 latere.ai 技术栈,包括 Lux 模型网关、Cella 沙箱、Topos 智能体平台、Wallfacer 编排工具和 Lectio 文档层。之所以使用这些产品,是因为作者熟悉其内部设计,可以据此展开说明,并不意味着它们优于其他方案。每当其中一项产品出现在实践建议中,书中都会同时列出其他中立的备选方案,明确披露作者与该产品的关系,并只把它当作某种设计模式的一个实例,而不是最终答案。第 75 章 会完整介绍这套技术栈,后文再次提及时会链接回该节。
评论
登录后评论