AI 基建
0%
第九部分 · 基础设施、算力与前沿 · 第 68 章

给它供电:通电时间作为瓶颈约束

作者Changkun Ou
阅读时长约 10 分钟

第 62 章 收在机架处。下一道约束出现在机架接入电力的地方。2026 年,AI 能力的瓶颈约束从芯片下沉到了电力这一物理层。此时稀缺的不是发电容量,而是通电时间:一座前沿园区如今选择自发电,而不再等电网;一台耗电堪比几十户人家的机架,迫使液冷成为新的散热默认值;一座数据中心也不再只是电网服务的负载,而成了电网运营商必须主动管理的对象。

2026-06-21T23:30:29.190642 image/svg+xml Matplotlib v3.11.0, https://matplotlib.org/ 2024 2025 2026 2027 2028 2029 2030 年份 1 2 3 4 5 6 7 相对容量 AI 负载需求 已交付电力
图 68.1. 通电时间差距的示意图。AI 负载需求可能比电网可交付容量增长更快,因此电力到达的时钟慢于芯片。理想化曲线,非实测。

前两章顺着一条约束线索往下走:从一块芯片能搬动多少字节,到决定芯片数量的中介层与内存堆栈。现在这条线索抵达物理栈的底部。芯片之下、封装之下,是电力,而电力设限的时间尺度,比这两者都要长。

芯片以月计到货,兆瓦以年计到货

一座前沿训练园区如今需要约一吉瓦的专用电力,与一座中型城市或一个核电机组相当。最常见的担忧,是世界发不出这么多电,但那不是 2026 年的约束。约束是时间。一笔芯片订单数月内就能交付;支撑它的电力却要数年才到,因为有三道前置时间的排队串在一起,园区只有在最慢的那道清空时才通电。

第一道排队是并网。把一个大型新负载或新电源接入输电系统,要走一套研究加审批的流程。在美国,这套流程积压了好几年:活跃的并网排队里压着约两千吉瓦的项目,远超全国的总装机容量,典型等待以多年计 (Rand et al. 2025)。这股压力在单一市场里就看得见:得克萨斯州的大负载并网申请,从 2024 年底的约 63 GW,跳到一年后的约 226 GW,其中绝大多数是数据中心。第二道排队是长交期设备。一台大型电力变压器,也就是把电网电压降下来供给园区的设备,在结构性供给短缺之下,交期约 128 周 (Wood Mackenzie 2025)。第三道排队是原动机:现场发电所依赖的燃气轮机本身也在积压,一家主要制造商的订单积压在 2025 年越过 80 GW (Cardwell 2025),连同预订量到 2026 年初已达约 100 GW,2030 年之前的产能基本售罄 (Martucci 2026)。

chip 加速器 约数月 live 园区通电 chip->live 早到,等待 q1 电网接入 多年排队 q1->live q2 长交期设备 变压器约 128 周 q2->live q3 原动机 燃气轮机售罄到 2030 年 q3->live
图 68.2. 把通电时间看作三道串联的排队。一座前沿园区只有在最慢的那道清空时才通电,所以瓶颈约束是日历时间,而非发电容量。相比之下,芯片以月计就能出货。
下层约束

并网、变压器、燃气轮机这三段串联的前置时间,给集群规模能多快增长设了上限,与买家手里有多少资本、多少芯片无关。一旦瓶颈排队变成一座变压器工厂或一份燃气轮机积压,更多的钱、更多的加速器,也不能让建设周期自动缩短。如今定时间表的是兆瓦,不是 GPU(参见 第 76 章)。

电表后面的供电

既然并网排队耗时最长,最大的几家建设者干脆不在里面排了。2026 年那个决定性的运营动作,是在电表后面自发电:在园区自身建起电力供给,而不是从一个还要等数年的电网接口里取电。

现场燃气是快的选项。运营商围绕数十台现场运行的燃气轮机建起园区,规划中最大的建设能达到一到数吉瓦。这是通往大体量电力的最快路径,但它直接受制于燃气轮机积压和空气质量法,因此成了本章最尖锐的争议点。核电则是稳的选项。这一轮里最显眼的一笔交易,是在一份长期购电协议下重启一座已关停的反应堆,来服务一家超大规模厂商,目标是 2027 年恢复运行,背后还有一笔联邦贷款支撑 (NucNet 2025);其他的重启与增容,也在相近的时间线上添出稳定的吉瓦。监管路径并不顺畅:有一笔标志性的同址协议,本想把一座数据中心直接放在一座核电厂的电表后面,却被联邦监管者否决,不得不重组为一份常规的并网协议。这提醒人们,电表后面不只是一种工程安排,也是一种法律安排。

小型模块化反应堆(SMR)是被讨论得最多的第三个选项,关键是把它放在时间线上的正确位置。签约的项目储备在 2025 和 2026 年里长得很大,多份数吉瓦级的协议落笔,但没有一台专供 AI 的商用机组在运行,头几台预计最早也要到约 2030 年。它们是下一个十年的真实对冲,而不是缓解 2026 到 2028 年这段紧张的电源。把合同错当成千瓦,是这部分讨论里最常见的错误。

这些选项的底下,还藏着一个更不动声色的反转。上面每个选项都是把电力送到算力那里:先定下园区,再发电或签约凑齐兆瓦给它通电。相反的做法是把算力搬到电力那里,把机器建在能源本已搁浅的地方。Crusoe 最初的生意就是这样:把模块化数据中心放到油井旁,消耗那些本会被烧掉的天然气,在井口把一股废流变成算力;此后它发展为一家能源优先、垂直整合的厂商,把吉瓦级 AI 园区建在搁浅与可再生电力之上 (Yee and Lochmiller 2025)。这条起家的逻辑至今仍标出地图上最便宜的电力,也就是别人没有条件去用的搁浅、被弃或偏远的能源,于是建在哪里的问题,就变成了富余电力本已在哪里的问题。

机架变成热问题

电力问题在机架内部以热问题的形式再次出现。当前一台旗舰机架约耗 120 kW,观测到的数字超过 130 kW,这是强制风冷哪怕用上激进工程,也只能从一台机架带走的热量的好几倍。风冷贯穿了数据中心此前的全部历史,可它根本带不走这些热。直冷到芯片的液冷,让冷却液流过压在加速器上的冷板,成了这一档硬件的默认方案;浸没式则把电路板泡进介电液里,是为随后到来的更高密度准备的下一档。与此同时,设施效率的前沿已经走平:行业平均的电源使用效率(PUE),也就是数据中心总耗电除以 IT 设备耗电的比值,多年来停在约 1.54,而最好的超大规模厂商跑在约 1.1。这意味着设施层面那些容易拿的收益已经花完,剩下的效率必须来自硅,靠每瓦词元数(每瓦功率产出的输出词元数),也来自电网。

下层约束

越过风冷上限的机架功率密度,决定了整座设施的热架构:一台 120 kW 的机架使直冷到芯片的液冷成为默认值,这重塑了数据大厅、管路,以及散热设备的供应链。这正是 第 62 章 那个每机架功率,一路向下伸进了建筑(参见 第 82 章)。

电网必须管理的数据中心

早先框架漏掉的前沿,是吉瓦尺度上的数据中心负载。在这个尺度上,一座 AI 数据中心不是温顺的负载,而是它所在电网稳定性的一个隐患。当一个作业停下,或一次故障触发保护,一个大型训练集群能在数秒内甩掉或接上一千兆瓦。这么大、这么快的一次摆动,是大电力系统当初设计时就没想着要吸收的。在一连串这类事件之后,包括一次主干互联故障期间一吉瓦以上的负载骤降,北美可靠性当局在 2026 年 5 月发出了一份罕见的高严重度预警,如今一批研究正着手厘清大型 AI 负载诱发的广域振荡与故障穿越行为。监管层在并行推进:2025 年底,联邦监管者指示最大的电网运营商,为发电厂处的数据中心同址制定规则,2026 年开始合规。这正是上述电表后面供电动作底下的法律框架。

同样的尺度也催生了一场成本之争。总得有人为一座吉瓦园区所要求的输电升级和容量买单,而当数据中心负载把容量拍卖价推到创纪录的高位,到底由普通用电户、还是数据中心自己承担这笔成本,就成了州监管机构那里一场正在进行的战斗。一条更合作的路径也在成熟:把集群当作一个灵活的、可中断的负载,让它短暂降功率来纾解电网,这样就能让远更多的算力得以并网,而无需新增稳定电源;这个想法在这段时期里从研究走到了试点。AI 负载究竟是一个要被管理的威胁,还是一种可调度的灵活资源,尚无定论。

grid dc 吉瓦级 AI 园区 hazard 隐患: 数秒内的 GW 负载摆动 NERC 预警,振荡风险 dc->hazard flex 资源: 可中断负载 无需新增稳定电源即可并网 dc->flex cost 成本之争: 谁为升级付费 (普通用户 vs 运营者) dc->cost
图 68.3. 把吉瓦园区看作一个两面的对象:一个电网必须吸收的可靠性隐患(数秒内的多吉瓦负载摆动),以及,潜在地,一种为了更快并网而中断的灵活资源。哪一面占上风,是本章的开放问题。

总量与口径

总量数字框定了利害。全球数据中心用电量在 2024 年约为 415 TWh,约占世界需求的 1.5%,预计到 2030 年将大致翻倍到约 945 TWh,其中 AI 优化负载增长最快 (International Energy Agency 2025)。在美国,被引用最多的研究把数据中心 2023 年的用电定在 176 TWh,到 2028 年升至 325 到 580 TWh 的区间,约占全国电力的 7% 到 12% (Shehabi et al. 2024)。这个区间的宽度才是关键:未来取决于效率提升和建设速率,而这些现在谁也钉不死。

按单次查询算,这幅图景之所以有争议,恰恰因为边界有争议。一家厂商的全栈核算把中位数文本提示的能耗定在约 0.24 Wh,含闲置容量与开销,并声称比前一年大幅下降 (Elsworth et al. 2025)。批评者指出,有利的边界取舍,加上不计入训练摊销,使跨模型比较不可靠,而且不存在经审计的标准。每词元能耗这个数字是真实的、有用的,但作为比较还不可信。

争议所在
  • 是电力先设限,还是硅先设限? 电力受限派主张芯片有货而兆瓦没有,所以每瓦词元数定营收。供应链派主张瓶颈环节逐年在 HBM、封装、变压器、燃气轮机之间迁移,而 2026 年它是电气设备,不是芯片。两派都同意,瓶颈已经不再是 FLOPs。
  • 需求预测是不是被夸大了? 怀疑者认为负载预测长期被高估,效率会吸收掉大部分增长 (Koomey et al. 2025)。公用事业公司和几个研究团队则认为,这轮建设是真实而巨大的。真相取决于对效率和建设速率的假设,而这些假设本身就是分歧所在。
  • 核电与 SMR 电力是真实的还是一种对冲? 重启与增容是签约的稳定吉瓦,在 2027 到 2028 年到货。新的小型反应堆最早也是一个约 2030 年的命题,所以无论签约储备长得多大,它们都缓解不了近期的紧张。
  • 现场燃气是过渡方案,还是一项负债? 一派把电表后面的燃气,称作 2030 年前通往吉瓦的主要办法。另一派指向空气质量诉讼和被打破的气候承诺。这场争斗是升级而非平息,还以国家安全为由引入了联邦干预。
  • 窄口径还是全栈的能耗核算? 没有经审计的标准,每一个发表的单次查询数字都是一次边界取舍,而边界本身就是争论。

兆瓦决定模型

在这里,能力、效率、信任落到一份日历上。能力如今受制于这份日历:一个只要电力到位本可以训练的模型,要等最慢的排队清空才能开训,于是前沿能推进到哪里,有一部分取决于基础设施何时交付。效率不再是一个设施指标,而成了一个硅与电网的指标,因为数据大厅那些容易取得的收益已经花完,剩下的住在每瓦词元数和灵活负载里。这一层的信任是字面意义上的:电网对一个能在数秒内摆动一吉瓦的负载的信任,社区对隔壁那座烧着燃气的园区的信任。从一块芯片内部的字节起步的那条下层约束,如今伸到了电网和许可办公室,并回指整座栈:兆瓦决定模型。下一章回到电力供给的那个集群内部,去问为什么一台十万块加速器的机器,几乎总有某处在出故障。

延伸阅读

  • International Energy Agency, “Energy and AI” (全球基线:2024 年约 415 TWh,走向 2030 年约 945 TWh), 2025. iea.org
  • Shehabi et al., “2024 United States Data Center Energy Usage Report” (美国负载的标杆研究,2023 年 176 TWh 到 2028 年 325--580 TWh), 2024. escholarship.org
  • Rand et al., “Queued Up: 2025 Edition. Characteristics of Power Plants Seeking Transmission Interconnection” (支撑通电时间论点的并网排队数据), 2025. emp.lbl.gov
  • Elsworth et al., “Measuring the Environmental Impact of Delivering AI at Google Scale” (全栈的每次提示 0.24 Wh 数字与测量边界之争), 2025. arXiv:2508.15734
    谷歌在生产环境中测量 Gemini Apps 推理的完整技术栈能耗、碳排放与水消耗,发现中位数文本提示消耗 0.24 Wh,一年内碳足迹降低 44 倍。
  • Cardwell, “GE Vernova Expects to End 2025 with an 80-GW Gas Turbine Backlog That Stretches into 2029” (原动机与长交期设备的排队), 2025. utilitydive.com
    GE Vernova 预计 2025 年底天然气轮机积压订单将达 80 GW,延伸至 2029 年,预约量预计在 2026 年底前售出至 2030 年。
  • Wood Mackenzie, “Power Transformers and Distribution Transformers Will Face Supply Deficits of 30% and 10% in 2025” (原动机与长交期设备的排队), 2025. woodmac.com
  • Koomey et al., “Electricity Demand Growth and Data Centers: A Guide for the Perplexed” (需求怀疑派的立场), 2025. bipartisanpolicy.org
  • Yee & Lochmiller, “How Crusoe Powers and Transforms AI with Stranded Energy” (把算力放到搁浅能源处,与把电力送进园区相反), 2025. mckinsey.com
    在 McKinsey 的访谈里,Crusoe CEO Chase Lochmiller 描述了公司能源优先的模式:起步时把模块化数据中心放在油井旁,消耗本会被烧掉的天然气,后来发展为把大型 AI 园区建在搁浅与可再生电力之上的垂直整合厂商。
  • Lochmiller & Agrawal, “Economics of the AI Supercycle, Class 3” (Crusoe 的 CEO 谈 AI 数据中心的融资、选址与供电), 2026. youtube.com
    斯坦福 MS&E 435 关于 AI 栈经济学研讨课的第 3 讲:与 Crusoe 联合创始人兼 CEO Chase Lochmiller 的对谈,从能源优先的视角谈大型 AI 数据中心的融资、选址与供电。
  • Martucci, “GE Vernova Gas Turbine Backlog Hits 100 GW as Prices Rise” (一年之后的积压加预订数字), 2026. utilitydive.com
    GE Vernova 的燃气轮机积压加预订量在 2026 年第一季度达到 100 GW,公司预计到年底 2030 年之前的预约将全部售罄。

评论

登录后评论