AI 基建
0%
第九部分 · 基础设施与算力 · 第 68 章

给它供电:当通电时间成为瓶颈

作者Changkun Ou
阅读时长约 13 分钟

第 62 章 讲到机架便止步。订购多少块加速器已经不是下一步要回答的问题。真正要问的是,何时能在某个具体厂址让这些设备投入运行。对于一些大型 AI 园区,稀缺的不是发电容量,而是通电时间,也就是在指定地点、可靠性水平和日期下可交付的兆瓦数。这项判断并非普遍规律。当前约束仍可能来自硅、融资、土地、许可、网络设备或需求。因此,任何判断都必须说明厂址、产品与日期。

有三句常见说法把这段转变压缩得太过简单。只有当现场供电项目跨过商业、监管与调试验收关口后,园区才能说自己“选择自发电,而不是等待电网”。对高密度机架而言,把液冷作为默认方案可能是合理的产品决策,却不代表所有数据中心都必须采用液冷。大型计算负荷也只有在接入明确的模型、遥测、保护方案与运行协议后,才是电网运营商必须主动管理的对象。本章会把每句口号还原成可核验的量。

电力是一份有日期的交付契约

“这座园区拥有一吉瓦电力”是一句不完整的话。它可能指公用事业接入申请、发电机铭牌、购电协议、并网点上限、设施设计容量或实测 IT 负载。这些数字不能互相替代。真正有用的问题是:在明确的事故情景下,到指定日期为止,有多少净额、稳定的兆瓦可以送达已经验收的 IT 设备?

项目进度也不是几条彼此独立的队列,不能简单地挑出工期最长的一项。取得厂址控制权可能先于并网研究;变电站设计可能要等待研究结论;冷却系统施工可以同时推进;调试验收则要等待多条分支汇合。完工时间需要按关键路径计算:

Tready=maxpPapDa.T_{\mathrm{ready}} = \max_{p \in \mathcal{P}} \sum_{a \in p} D_a .

其中:

  • TreadyT_{\mathrm{ready}} 是从声明的项目起点到可用 IT 产能通过验收所经历的时间;
  • P\mathcal{P} 是从该起点通往验收节点的所有依赖路径;
  • pp 是其中一条依赖路径;
  • aa 是该路径上的一项活动;
  • DaD_a 是该活动的工期,包括等待与执行时间。

方程本身是确定性的。真实计划还应给出情景分析或模拟结果,例如 P50 与 P90 通电日期。分位数不能机械地相加。各项活动的 P90 通常不等于整个项目的 P90,尤其是在工期彼此相关时。

tasks = {
    "interconnection": {"months": 18, "after": []},
    "substation": {"months": 14, "after": ["interconnection"]},
    "onsite generation": {"months": 12, "after": []},
    "cooling plant": {"months": 10, "after": []},
    "commissioning": {
        "months": 3,
        "after": ["substation", "onsite generation", "cooling plant"],
    },
}

finish = {}
paths = {}
pending = set(tasks)
while pending:
    ready = sorted(
        name for name in pending
        if all(parent in finish for parent in tasks[name]["after"])
    )
    if not ready:
        raise ValueError("dependency graph contains a cycle")
    for name in ready:
        parents = tasks[name]["after"]
        parent = max(parents, key=lambda item: finish[item]) if parents else None
        start = finish[parent] if parent else 0
        finish[name] = start + tasks[name]["months"]
        paths[name] = (paths[parent] if parent else []) + [name]
        pending.remove(name)

critical = paths["commissioning"]
print("Critical path: " + " -> ".join(critical))
print(f"Ready after: {finish['commissioning']} months")

上面的示例数字不是预测。改变工期或依赖关系,结果就会清楚地变化。这比反复说“兆瓦需要几年才能到位”更有用。

grid 并网 18 个月 sub 变电站 14 个月 grid->sub accept 调试验收 3 个月 sub->accept gen 现场供电 12 个月 gen->accept cool 冷却系统 10 个月 cool->accept
图 68.1. 交付进度是一张依赖图。并行工作在验收节点汇合,其中最长的依赖路径决定模型给出的日期。图中工期仅作示例。

从电源到可用的 IT 电力

日历上的就绪日期只是问题的一半。设施还需要一条统一的电力计量边界。一个简洁的上界是

PIT,max(t)=min ⁣(Psource(t)PUE(t),Psub(t)PUE(t),Pdist(t)PUE(t),Qcool(t)),NrackPIT,max(t)Prack.P_{\mathrm{IT,max}}(t) = \min\!\left( \frac{P_{\mathrm{source}}(t)}{\operatorname{PUE}(t)}, \frac{P_{\mathrm{sub}}(t)}{\operatorname{PUE}(t)}, \frac{P_{\mathrm{dist}}(t)}{\operatorname{PUE}(t)}, Q_{\mathrm{cool}}(t) \right), \qquad N_{\mathrm{rack}} \le \left\lfloor \frac{P_{\mathrm{IT,max}}(t)}{P_{\mathrm{rack}}} \right\rfloor .

其中:

  • PIT,max(t)P_{\mathrm{IT,max}}(t) 是时刻 tt 最大可支持的 IT 有功功率;
  • Psource(t)P_{\mathrm{source}}(t) 是合同允许使用的电网与现场电源所提供的净额稳定有功功率,不能重复计算;
  • Psub(t)P_{\mathrm{sub}}(t)Pdist(t)P_{\mathrm{dist}}(t) 分别是已验收的变电站与下游配电系统上限;
  • PUE(t)\operatorname{PUE}(t)电源使用效率(PUE),也就是数据中心总耗电除以 IT 设备耗电的比值,并且必须按同一边界和时间区间测量;
  • Qcool(t)Q_{\mathrm{cool}}(t) 是冷却能力换算成它所能支持的 IT 功率负载,换算时要说明供液温度与故障情景;
  • NrackN_{\mathrm{rack}} 是可支持的整机架数量;
  • PrackP_{\mathrm{rack}} 是选定的每机架设计功率。

电源、变电站与配电三项必须使用净额稳定有功功率、同一种事故假设与同一个平均区间。冷却能力也要采用相同的环境条件与冗余假设。机架数量的商只是规划上界,而不是耗电预测。机架铭牌功率、实测同时用电、负载多样性余量与设计冗余必须分别报告。

PUE 衡量设施辅助系统的开销,并不衡量有效计算。Uptime Institute 2025 年的调查称,按受访者加权的年均 PUE 为 1.54,六年来变化很小,但样本包含多种设施类型与气候 (Donnellan et al. 2025)。这个结果不能证明效率提升已经枯竭,也不能把公司全体设施的平均值与单个厂址直接比较。

source 净额稳定电源 MW sub 已验收变电站 MW source->sub dist 配电 MW sub->dist it 可用 IT MW dist->it rack 已验收机架 it->rack cool 冷却上限 IT-MW 等价量 cool->it
图 68.2. 可用 IT 电力受交付链上的每一道环节和冷却能力限制。所有数值都要采用相同的运行区间、事故情景与验收边界。

并网队列不是交付预测

“队列”一词掩盖了两类不同对象。Lawrence Berkeley National Laboratory 的 Queued Up 数据集跟踪的是发电项目并网队列中的拟建发电与储能项目,不是等待负荷接入的数据中心队列 (Rand et al. 2025)。它可以解释新增电源为何到得很慢,却无法单独证明某个大型负荷要等待多久。

大型负荷申请还有自己的证据问题。同一开发商可能在选定厂址前提交多个接入申请。申请方也可能尚未取得厂址控制权、订购设备、落实融资或完成研究。FERC 已明确警告,投机性申请与重复申请会扭曲预测,并要求电网运营商采用可观察的就绪里程碑 (Rosner 2025)。因此,队列总量必须同时给出各成熟度关口的数量。单独一个总数不是交付预测。

一套有用的状态阶梯是:大型负荷申请;厂址与商业准备状态已核验;研究完成;协议已签署;所需升级工程在建;获准通电;实测已通电负荷。每一级都记录兆瓦数与日期。设备也要遵循同样的纪律。美国能源部报告称,大型电力变压器需要定制、运输困难,近期报价的交付周期可达或超过 36 个月,最长甚至达到 60 个月 (U.S. Department of Energy 2024)。这可以为指定变压器提供风险区间,却不能据此给所有电压等级和设计指定一个统一交付周期。

表后供电改变了边界

现场发电可以缩短关键路径的一条分支,却不能消除燃料供应、排放许可、用水、噪声、设备交付周期、保护研究或备用服务义务。“表后”也没有回答现场机组跳闸时由谁供电。电气单线图与电价条款才定义边界,口号不能。

所有项目都应采用同一套证据阶梯来报告:公告、合同、许可或执照、融资、施工、调试验收与运行。购电协议已经签署不等于产能已经投运,贷款已经交割不等于监管已经批准,反应堆重启也不是一次普通维护计划。

Christopher M. Crane Clean Energy Center 说明了为何必须区分这些状态。美国能源部在 2025 年 11 月完成一笔 10 亿美元贷款,帮助为一项 835 MW 的重启项目融资,但项目仍取决于 NRC 的许可批准 (U.S. Department of Energy 2025)。截至 2026 年 8 月 7 日,NRC 仍将该电厂的执照状态列为 SAFSTOR,并把重启描述为包含许可、修复、检查与监督的流程 (U.S. Nuclear Regulatory Commission 2026)。项目真实且进展显著,但还不是一项正在运行的电源。评估 小型模块化反应堆(SMR) 协议与现场燃气方案时也应采用相同标准:记录已经跨过的关口,而不是最大的公告吉瓦数。

因此,“自发电”也不等于脱离电力系统。园区可能仍依赖电网来启动设备、安排维护、提供事故备用、输出电力或执行紧急操作。稳定产能必须能承受声明的停运情景,成本也必须包含保留的电网服务与网络容量。

冷却方式取决于产品与设施契约

NVIDIA 规定,满配 GB300 NVL72 机架的输入功率最高 142 kW,并采用液冷 (NVIDIA 2026)。这是针对具体产品的最大设计要求,不是实测平均功率、年用电量或设施总负载。

在这种密度下,供应商架构把芯片直冷纳入机架设计。更广泛的工程选择仍取决于部件热流密度、机架功率密度、冷却液与空气供回温度、液冷捕获热量的比例、当地气候、可维护性与既有建筑。ASHRAE 的改造指南建议为高密度 AI 系统采用混合冷却:液冷带走高热流部件的热量,空气处理剩余热量 (ASHRAE 2026)。冷板、后门换热器与浸没式冷却可以互为替代或补充,并非一条普遍适用的成熟度阶梯。

验收计划不能止于“支持液冷”。它应明确冷却液分配单元、供回液温度、流量与压力、水质与化学控制、材料兼容性、过滤、泄漏检测、剩余空气负载、控制逻辑,以及泵或电源故障后的行为。只有在带走实测热量,同时满足设备限制与冗余目标时,冷却设计才算通过验收。

约束如何向上传导

机架架构会一直影响到建筑。产品的功率与散热要求会约束母线、开关设备、冷却液回路、排热系统、楼板承重与调试验收。这些设施上限又会限制 第 62 章 所述硬件中究竟有多少可以运行,无论已经交付多少硬件(参见 第 82 章)。

电网需要负载行为模型

大型计算负荷的特殊之处不仅是规模大,还在于大量电力电子设备与同步工作负载可能同时响应。2026 年 5 月 4 日,NERC 在观察到客户主动触发的大型负荷骤降,以及数秒内出现的显著振荡后,发布了三级重大行动警报,指出实时调度人员几乎没有响应时间 (North American Electric Reliability Corporation 2026)。NERC 的说明涵盖 AI、加密货币与其他应用在内的计算负荷,却不代表每起事件都是 AI 训练作业,也不代表所有 AI 园区的行为完全相同。

因此,并网需要一份可测试的运行契约。电网模型应覆盖稳态、暂态响应、谐波、保护、故障穿越、最大负荷投入与切除、爬坡速率,以及限电后的反弹。调试验收应验证这些模型。运行阶段需要时间同步遥测、事件记录、通信路径与明确的运行边界。固件、工作负载控制、UPS 行为或保护方案发生变化,并且改变了模型中的响应时,就必须重新审查。

数据中心有时可以通过转移工作、降低功率,或调用储能与现场电源来提供灵活性。只有当限电量、通知时间、持续时长、恢复方式与可用性都写进合同并通过测试,这项服务才有价值。工作负载截止时间、检查点成本、安全爬坡限制与反弹峰值,都会压缩理论上的灵活空间。LBNL 的一场研讨会既发现了真实机会,也指出高成本、监管碎片化,以及对标准控制机制和激励措施的需求 (Kirchstetter et al. 2025)。

规则仍在变化。FERC 2025 年 12 月针对 PJM 的命令提出,为同址负荷设置稳定合同需求(Firm Contract Demand)与非稳定合同需求(Non-Firm Contract Demand)服务 (Federal Energy Regulatory Commission 2025)。2026 年 6 月 18 日,FERC 还要求其管辖下六家区域电网运营商说明或改革大型负荷并网电价 (Federal Energy Regulatory Commission 2026)。截至 2026 年 8 月 7 日,这些仍是命令与持续进行的合规程序,不是全国统一并网方案已经生效的证据。

model 已验证负载模型 limits 运行边界 model->limits telemetry 遥测 + 事件 limits->telemetry response 受控响应 telemetry->response evidence 事后复盘 response->evidence evidence->model 更新
图 68.3. 大型负荷通过一条运行闭环变得可管理:验证行为、同步遥测、运行限制、受控响应与事后证据。

每项成果的能耗必须声明边界

总量能耗估算只能说明规模,不能证明某个厂址已经就绪。IEA 估计,全球数据中心 2024 年用电量约为 415 TWh,约占全球用电量的 1.5%;其基准情景在 2030 年达到约 945 TWh (International Energy Agency 2025)。LBNL 估计美国数据中心 2023 年使用了 176 TWh,并给出 2028 年 325 至 580 TWh 的模型范围 (Shehabi et al. 2024)。后一个区间是条件情景范围,而不是置信区间。每年 TWh、平均 GW、已接入 MW 与发电机铭牌功率回答的是不同问题。

对于一个工作负载与报告窗口,可以定义

eresult=t0t1Pfac(t)dtNaccept.e_{\mathrm{result}} = \frac{\displaystyle \int_{t_0}^{t_1} P_{\mathrm{fac}}(t)\,dt} {N_{\mathrm{accept}}} .

其中:

  • eresulte_{\mathrm{result}} 是每项合格成果的设施能耗;
  • t0t_0t1t_1 界定声明的测量窗口;
  • Pfac(t)P_{\mathrm{fac}}(t) 是按照已公布的分摊规则,归属于该工作负载的实测设施功率;
  • NacceptN_{\mathrm{accept}} 是该窗口内达到声明的质量门槛与服务等级目标的输出数量。

“每次查询”不是充分的方法说明。可复现的报告要说明模型与运行时、硬件、请求组合、输入输出大小、缓存状态、批处理、重试、吞吐量、延迟分布与质量门槛。它还要说明电表覆盖加速器、服务器、集群 IT 或整座设施中的哪一层;闲置容量与共享服务如何分摊;是否排除了训练摊销、隐含能耗、外部网络与用户设备。报告应给出总能耗与分布,而不只给出中位数。

例如,Google 的生产研究估计,2025 年 5 月 Gemini Apps 文本提示的中位能耗为 0.24 Wh,计算采用其自有分摊方法。核算边界包括活跃加速器、主机 CPU 与内存、已分摊的闲置容量和设施开销,同时排除训练、外部网络、用户设备与数据存储 (Elsworth et al. 2025)。这项证据适用于该产品、机队、工作负载分布与月份。它不是“AI”的常数,其中位数也不能决定整个机队的总能耗。

如何核验通电时间

一份站得住脚的审查可以收进一张证据登记表。先冻结电气单线图与物料清单版本。说明并网点 MW、设施 MW 与 IT MW,并区分稳定产能与条件产能。对于每项依赖,记录计划日期与实际日期、当前状态、证据负责人、来源文件、验收标准,以及 P50 与 P90 预测。把许可、研究、协议、采购订单、出厂测试、现场测试与运行遥测,链接到它们所支持的具体事项。

然后测试故障边界。对规定的事故情景、失去电网或现场电源、变压器或冷却液回路故障、负荷阶跃、限电与反弹进行建模。每个未达成的里程碑都要有恢复情景、决策日期与责任人。这样才能把“一个一吉瓦园区”从新闻稿里的数字变成可审计的交付主张。

request 申请 厂址 + MW + 日期 study 研究 模型上限 request->study agreement 协议 稳定 + 条件 study->agreement build 施工 设备已核验 agreement->build energize 获准通电 build->energize operate 实测运行 energize->operate
图 68.4. 申请电力只有跨过带有证据的关口后,才会成为可用电力。项目报告应同时展示已经跨过的关口和下一项验收测试。
争议所在
  • 什么会最先成为约束? 一个厂址可能受电力交付限制,另一个则可能受加速器、融资、许可或需求限制。答案需要一份带日期的物料清单与依赖图,而不是一句覆盖整个行业的口号。
  • 申请负荷中有多少会真正落地? 队列总量反映研究工作量与商业兴趣。准备状态筛查可以减少重复计算,但每项申请最终投入运行的概率仍不确定。
  • 现场发电会不会降低社会成本? 它可能缩短项目周期,却把燃料、排放、用水、噪声、可靠性与网络成本转移到别处。答案取决于园区保留了哪些电网服务,以及比较的替代方案是什么。
  • 算力究竟有多灵活? 一些推理与训练工作可以转移或暂停,另一些则受截止时间、状态传输成本或可用性义务限制。灵活性是一种经过测量的运营产品,不是“AI 负荷”的固有属性。
  • 哪种能耗边界才公平? 加速器边际能耗与设施完全分摊能耗、生命周期能耗回答的是不同问题。比较必须采用相同的边界、工作负载、质量与服务等级目标。

约束如何向上传导

电力不会取代它上方的约束,而是加入这些约束。机架可能先于变电站交付,发电机可能先签合同、后拿许可,园区可能已经通电,但负载行为尚未获准。可用集群受所有进度与产能的交集限制。这个交集决定服务栈中有多少部分能够运行,以及运行时的可靠性与成本(参见 第 76 章)。

长期有用的能力,是把一项电力主张变成带日期的证据链:电源到变电站、变电站到机架、机架到冷却系统、模型到运行记录。下一章 第 69 章 会从这些关口全部通过后开始,讨论当一台通电的机器拥有如此多部件,以至于几乎总有某处发生故障时,可靠性究竟意味着什么。

延伸阅读

  • International Energy Agency, “Energy and AI” (全球基线:2024 年约 415 TWh,走向 2030 年约 945 TWh), 2025. iea.org
    国际能源署对计算设备和设施基础设施带来的数据中心用电需求建模,并说明其能源情景背后的假设。
  • Shehabi et al., “2024 United States Data Center Energy Usage Report” (美国负载的标杆研究,2023 年 176 TWh 到 2028 年 325--580 TWh), 2024. escholarship.org
    该报告估算了美国数据中心的用电量,并根据设备、利用率和设施效率方面的明确假设预测未来需求。
  • Rand et al., “Queued Up: 2025 Edition. Characteristics of Power Plants Seeking Transmission Interconnection” (支撑通电时间论点的并网排队数据), 2025. emp.lbl.gov
    2025 年《Queued Up》报告衡量了美国并网队列中项目的容量、位置、技术类型和开发状态。
  • Elsworth et al., “Measuring the Environmental Impact of Delivering AI at Google Scale” (全栈的每次提示 0.24 Wh 数字与测量边界之争), 2025. arXiv:2508.15734
    谷歌在生产环境中测量 Gemini Apps 推理的完整技术栈能耗、碳排放与水消耗,发现中位数文本提示消耗 0.24 Wh,一年内碳足迹降低 44 倍。
  • U.S. Department of Energy, “Large Power Transformer Resilience” (关于大型电力变压器定制、运输与交付周期的一手资料), 2024. energy.gov
    美国能源部评估了大型电力变压器在供应、制造、运输、更换和韧性方面的风险。
  • Kirchstetter et al., “DOE Data Center Load Flexibility Workshop Summary” (数据中心负载灵活性的机会、运行要求、成本与监管障碍), 2025. eta.lbl.gov
    该研讨会报告列出了把数据中心负载用作电网灵活性资源所需的技术、市场和运营条件。
  • NVIDIA, “NVIDIA NVL72 AI Factory: System Hardware and Components” (GB300 NVL72 产品特定的液冷设计与最高 142 kW 机架要求), 2026. docs.nvidia.com
    NVIDIA 记录了 GB300 NVL72 机架的计算托盘、网络、供电、冷却、管理和可维护硬件组件。
  • ASHRAE, “Retrofit and Modernization Strategies: AI Data Center Energy Performance Framework” (面向高密度 AI 系统的混合冷却与调试指南), 2026. ashrae.org
    ASHRAE 围绕供电、冷却、控制、测量和在运设施的约束,梳理了 AI 数据中心的改造决策。
  • Donnellan et al., “Uptime Institute Global Data Center Survey 2025” (调查样本与按受访者加权的年度 PUE 结果), 2025. intelligence.uptimeinstitute.com
    该调查汇总了运营方对数据中心容量、故障、人员、可持续性和基础设施投资的实际观察。
  • North American Electric Reliability Corporation, “Large Loads Action Plan” (2026 年 5 月 4 日三级警报及计算负载可靠性行动), 2026. prod.nerc.com
    北美电力可靠性公司行动计划列出了预测、研究、并网和运营快速增长的大型负载时需要开展的可靠性工作。
  • Federal Energy Regulatory Commission, “FERC Launches Aggressive Targeted Action to Speed Large Load Integration” (2026 年 6 月 18 日第 206 条说明理由令及消费者保障), 2026. ferc.gov
    美国联邦能源监管委员会提出一套有针对性的流程,以加快大型负载接入,同时保障可靠性和透明的成本分摊。

评论

登录后评论