AI 基建
0%
第九部分 · 基础设施、算力与前沿

第九部分 · 基础设施、算力与前沿

作者Changkun Ou
阅读时长约 1 分钟

「免费的午餐已经结束。」

Herb Sutter,"Welcome to the Jungle"

这套栈可以画成软件图,但最底下始终是物理机器。芯片有引脚和带宽,机架有网络层级,长训练要穿过存储和调度,电力建设按年来算,故障在足够大的规模下会变成统计必然。第九部分往模型之下走,看看数学开始之前,机器已经替我们决定了什么。

第 62 章 从带宽讲起,那是许多训练与服务决策背后隐藏的形状。第 63 章 转向把模型数学映射到这套硬件上的软件基座:自动微分、围绕它建起来的框架,以及分片如何进入编程接口。第 64 章 顺着这层基座下到设备代码:算子融合、IO 感知的内核与编译器栈决定硬件底座有多少真正够得着,行业最深的软件护城河也在这里。第 65 章 讲一场长训练怎样从故障中恢复、让加速器持续有数据可算、并保持可观测。第 66 章第 67 章 从机架推进到封装、HBM、供应链、出口管制与算力的地理分布,第 68 章 再把电力拉进来:它在讨论里往往排到最后,在部署里却最先变成约束。第 69 章 讲规模下的故障,第 70 章 讲数据、信号和可学习性的边界,第 71 章 则回到能力前沿本身,问我们用什么仪器测它,又什么时候仪器已经饱和。第 72 章 把这一部分收在前沿的另一面:当模型产出主张的速度超过人类检查它们的速度,证明、复现、监督和接受机制也会变成基础设施。

这一部分要记住的是:智能总要运行在基础设施上。再优雅的模型设计,最后都会变成流量、热、显存压力、供应链、电力合同、地理位置、运维制度和电表。所谓前沿,不只是在能力增长的地方,也是在约束变得清楚的地方。

评论

登录后评论