算力市场与单位经济
整个技术栈最终都会落实为一套成本结构。经济地图先要说明算力在哪里购买,训练与推断为什么是两种性质不同的成本,什么时候该自建一个模型、什么时候该通过 API 买一个。最尖锐的反馈回路,是「推断主导全生命周期账单」这个论断:如果它在某个部署上成立,就会反向上溯,影响 第 5 章 里的架构与扩展选择。
成本有它的形状
前面各章的每一个决策,最终都落成成本表上的某个数字。参数量是一笔训练账单。一种注意力变体意味着一份 KV 缓存,也就是按小时租来的内存。采样预算是服务账本上的一列。于是问题变成:既然算力是稀缺的输入,它如何定价,价格如何在「造一个模型」和「跑一个模型」之间切分,而这种切分又如何反过来影响该造什么。
这个问题有三层难处。算力是在一个价格波动的市场里租来的,所以一次 FLOP 的成本是个移动的目标,不是常数。训练只付一次,推断会持续发生,于是两种成本按不同的时钟增长。最便宜的答案往往是从别人那里买能力,这意味着自建的决策要去和一个无从掌控、还在下跌的市场价格竞争。所以这张成本表的形状由三件事决定:两种成本结构各按自己的时钟增长,二者之间张开一道缺口,而一个盈亏平衡点决定该买还是该造。
两种成本结构,各按各的时钟增长
统领全局的事实是:一个 AI 系统有两种成本结构,而不是一种,二者行为的差别之大,混为一谈就会做出错误决策。
训练是一笔资本性支出(CapEx):像资本开支一样一次性付出,规模大、批量化,而且在任何价值返回之前就已发生。团队占用集群数周,支付一笔固定成本,换来一组权重。这笔开销主要来自最终那一次训练,再加上找出配方的研究与消融训练。Epoch AI 分析了约 45 个前沿模型,发现最终训练那一次的摊销硬件与能源成本自 2016 年以来每年增长约 2.4 倍,其中硬件占最大的单项份额,研发人员也占不小份额,能源只占很小的余量 (Cottier et al. 2024)。这些头部数字会过时,也只指方向:GPT-4 约 4000 万美元,Gemini Ultra 约 3000 万美元,照这一趋势,最大的训练会在 2027 年前后跨过十亿美元 (Cottier et al. 2024)。
推断是一笔运营性支出(OpEx):像运营开支一样随请求持续发生,每调用一次模型就付一次。它每次请求很小,所以随用量扩展,而不随训练预算扩展。它的单位成本,有一个好用的一阶模型:
其中分子是加速器每小时价格,分母是服务栈每小时能交付的词元数,再乘上实际利用率。它告诉我们推断成本有三个影响因素:加速器的租用价格、服务栈能提供的吞吐,以及硬件被占满的程度。透过这个等式来看,第五部分的服务章节都在改进分母:第 32 章 用批处理提高利用率,第 33 章 与 第 34 章 提高吞吐;第 9 章 里的注意力变体则从模型侧收缩每词元工作量。
两种成本结构会分解成不同的驱动项,图 76.3 把它们并排摆出来:训练归结为最终训练各加项之和,推断则归结为一个比值,它的分母正是第五部分服务优化的目标。
分子由算力市场设定。加速器在各大超大规模云商,以及一层专业 GPU 云上按小时出租,有三个价格档:承诺费率最低的预留容量,为灵活性多付溢价的按需,以及用「会被抢占」换最深折扣的 spot。物理输入也不只是加速器。数据中心电力、冷却、互连、区域与利用率,都会进入每小时价格,这也是 第 68 章 把能源视为 AI 基础设施的一部分、而不是外部背景的原因 (International Energy Agency 2025)。方向性的事实比任何单一报价都重要:一次被交付的 FLOP 的价格会随时间变化,而一份按去年价格写就的服务计划,可能以复利方式积累误差。
剪刀:训练上升,推断下降
两个时钟不只是走得快慢不同。它们常常朝相反方向奔跑,而它们张开的那道缺口,是这里最有分量的经济转变:这些年下来,自建还是购买,默认答案已经反转。
早期,能力只存在于少数几家实验室之内,自建是拿到前沿模型的唯一办法,购买根本不是选项。随着托管 API 成熟,购买成为可能,随后第二条曲线接管了局面:一个推断词元的价格开始在软件效率、架构变化与竞争的共同作用下快速下降。Du 的 2026 年定价研究报告称,2020 到 2026 年间词元价格约下降 600 倍,经济型和中端模型的价格下降速度快于摩尔定律,而旗舰推理模型仍保留溢价 (Du 2026)。强开放权重模型的发布,其中包括 DeepSeek-V3,给了每个闭源提供商一个可供对标的低价参照点,加速了这一过程 (DeepSeek-AI 2024)。
衰减参数越高,每词元价格下降得越快;这正是自建决策必须面对的市场变化。
两条曲线并置后,剪刀差就显现出来。训练成本在前沿每年上升约 2.4 倍 (Cottier et al. 2024),而许多被服务的词元价格会随着推断市场商品化而快速下降 (Du 2026)。二者之间不断张开的缺口,正是默认选择从自建转向购买的原因。从零自建一个前沿模型,要去和一个可能在系统完成前继续下降的市场价格竞争,所以自建只在某种市场不能提供的东西利害攸关时才划算:不能离开自己边界的专有数据,API 满足不了的延迟或可用性下限,托管模型不肯接受的定制,或者大到自托管胜过按词元加价的推断量。
自建账也变了。DeepSeek-V3 是一个 6710 亿参数的混合专家模型,报告里它最终训练约 278.8 万 H800 GPU 小时,按假设的每 GPU 小时两美元算,约合 560 万美元 (DeepSeek-AI 2024)。这个数字引人注目,而报告很谨慎地说明了它排除了什么:先前的研究、架构与数据的消融,以及一切不属于那一次最终训练的东西。对自建决策的教训是:头部训练数字只是露出水面的尖端,找出配方的研究是水下的成本,它不会出现在那一次训练的发票上。
推断是否主导全生命周期账单,是活跃的争论,而非已成定论的事实。标准论证很有力:训练只付一次,推断则在模型整个部署生命里按请求一次次付,对一个被广泛服务的模型,运营性支出会以很大的差距盖过资本性支出 (Sardana et al. 2024)。但推理模型和测试时算力,也就是 第 30 章 的主题,只会从推断这一侧把这道平衡搅得更复杂,而非就此了结这场争论。一次请求若消耗很长的内部思维链(CoT),也就是在作答前一步步推理,成本可比一个直接答案高出数个数量级,这会剧烈抬升每请求成本,把总开销中更大的一块推回推断一侧,而不是训练一侧。主导成本究竟是许多次便宜调用,还是更少次昂贵调用,并无定论,且因产品而异。把这个切分当作某个具体部署的可测量属性,而不是一个普适的比值。
第 5 章 已经点出过一条从服务成本向上、影响模型规模选择的约束:高的全生命周期推断量,足以证明应当把一个更小的模型过度训练到超过 Chinchilla 最优点,也就是模型规模与训练数据的算力最优配比,(Hoffmann et al. 2022; Sardana et al. 2024)。经济学在这里补上第二条朝相反方向走的约束。一个被服务词元的单位成本,由加速器的市场价格除以服务栈的吞吐设定,正是它定下了自建与购买决策里的盈亏平衡量。低于这个量,下跌的 API 价格胜出,于是买;高于这个量,付给提供商的按词元加价超过自己的边际成本,于是造。决定一个工作负载落在这条线哪一侧的,是推断等式,而不是某种策略偏好。
拐点在哪里
每个经济选择都是一个带拐点的平衡,越过那个点,更便宜的选项就翻了过来。
- 资本性成本还是运营性成本。 在 第 5 章 的意义上,把一个更小的模型过度训练到超过 Chinchilla 最优点,从而在训练上多花钱,会压低未来每一笔推断账单 (Sardana et al. 2024)。这笔交换只有在全生命周期词元量大到足以摊销那笔额外训练开销时才划算,所以正确的点取决于一个用量预测,而这个预测得在还没有用量的时候就做出来。
- 自建还是购买。 通过 API 购买,把一笔资本性支出转成按词元的运营性支出,并借助下跌的市场价格,代价是交出对数据、延迟和定制的掌控。自建把它转回资本性支出,再加一份固定的服务占用,只有越过某个盈亏平衡量、或某个非价格约束构成硬要求时才胜出。
- 预留容量还是 spot 容量。 预留算力每小时更便宜、也可预测,适合稳定的生产服务。spot 还要更便宜,但可能被抢占,适合可中断的工作:批量推断、带检查点的训练、超参数扫描。把工作负载的中断容忍度对准定价档,就是大部分节省的来源。
- 质量还是单位成本。 一个更大、或更重推理的模型,答得更好,每请求也更贵。经济上正确的模型,是能越过任务质量门槛的最小模型,这也是为什么把一个工作负载在一排不同规模的模型之间做路由,往往胜过把一切都丢给最大的模型。
资本这一层
上面的单位经济学假定加速器已经存在。往上退一层,看购买它们的钱从哪里来,就会浮现出第二个经济体,而它的会计选择会左右本章报出的那些数字。它始于一个貌似技术性的问题:一块 GPU 要用几年才算折旧完?一块训练加速器无论何时买入花的现金都一样,但记入报表的成本是这笔现金摊到它的使用年限上,所以「使用年限」这个选择,决定了有多少成本落到某一年里。2022 到 2023 年间,各大超大规模厂商把服务器使用年限从四年延长到六年,都以效率提升为由,而每一次延长都把报表利润每年抬高约三十亿美元 (Computer Weekly 2023)。反向的动作同样说明问题:Amazon 在 2025 年掉了头,把一部分服务器缩回五年,理由是「技术发展加快,尤其在人工智能领域」(Amazon 2025)。年限两个方向都在动,因为底下那个事实本身有争议。看空的一方在 2025 年底公开而尖锐地主张:加速器一年一代的节奏,使其「经济」寿命只有两到三年,哪怕硅片能跑六年,所以被拉长的折旧年限少计了折旧、抬高了全行业的利润 (CNBC 2025)。厂商的反驳则指向仍在服役、以接近原价续租的上一代部件 (CNBC 2025)。下面的可运行单元把这套机制算得具体:同一笔现金,买到的却是差别很大的报表成本。
fleet_capex = 60e9 # 一年的加速器采购额,美元
horizon = 6
for life in [3, 6]: # 两种有争议的直线折旧年限
annual = fleet_capex / life
charges = [annual if y < life else 0.0 for y in range(horizon)]
print(f"{life} 年年限: ${annual/1e9:.0f}B/年 -> "
f"{[f'{c/1e9:.0f}' for c in charges]}")
gap = fleet_capex/3 - fleet_capex/6
print(f"仅折旧年限选择带来的报表成本摆幅: ${gap/1e9:.0f}B/年")
print("无论哪种,第 0 年离开公司的现金都一模一样")
折旧之所以有争议,是因为它底下的第二个变化是实打实的:债务已经以运营现金流不再覆盖的规模进了这场建设。一份分析把到 2028 年的全球数据中心支出估到近三万亿美元,而超大规模厂商现金流大约只有一半,留下约一万五千亿的融资缺口,其中很大一部分预期来自资产支持的私募信贷 (Morgan Stanley Research 2025);央行研究者则记录到科技巨头 2025 年债券发行突破一千亿美元,且大量借贷被挪进表外的特殊目的实体 (Eren et al. 2026)。这些工具是新的:以 GPU 作抵押的贷款,抵的是芯片已签约的收入而不是它的残值 (CoreWeave 2023);还有数据中心合资结构,由信贷基金持有园区的大部分、超大规模厂商再回租算力,把债务留在自家账本之外 (Meta 2025)。而钱在打圈流动,招来与互联网泡沫时代电信厂商融资的类比:一家芯片厂商向一家承诺买它芯片的模型实验室投下数百亿,一家供应商为一笔订单向客户授予股权认股权证,一家云厂商持有那家已签约在它云上花四分之一万亿美元的实验室的大量股份 (NVIDIA 2025; AMD 2025; Microsoft 2025)。怀疑者把这些回路读作需求在自己制造证据;反方则指向服务侧推理量同比增长约二十倍,这很难靠打圈做出来 (Alphabet 2025)。所以看空论点更尖锐的版本,争的不是量,而是每词元的价格与利润率。
这份敞口已经上升到宏观层面。信息处理投资这个类别比数据中心更宽、但由它主导,贡献了 2025 上半年美国已测 GDP 增长的绝大部分 (Furman 2025);而 AI 相关投资占 GDP 的比重,如今已高于 1990 年代末的电信高峰,同时仍低于铁路与电气化建设 (Goldman Sachs 2026)。值得记取的历史对照,是 Odlyzko 对铁路狂潮的研究:一项真正变革性的技术与一场毁灭性的资本破坏并不互斥,而当年为过度建设背书的需求外推,事后看正是无视了眼前现成的量化证据 (Odlyzko 2010)。
这场建设究竟是自我供血,还是一场靠信贷催起来的过度建设,确实悬而未决,而两种说法预示不同的结局。到 2024 年,支出还大体来自超大规模厂商的利润;到 2026 年,其中几家已把大部分运营现金流投进产能、缩减回购,并靠发债与 SPV 债务补齐其余 (Eren et al. 2026)。有三个信号能把自我供血与过度建设区分开,而且都看得见:会不会有更多厂商像 Amazon 那样缩短、而不是拉长折旧年限;脱离合同的加速器租金会守在接近原价的水平,还是掉头向下;以及 SPV 与新云债务是靠真实的终端客户收入偿付,还是按资产仍会升值的假设去再融资。技术是真的,并不能了结这个问题,而这恰恰是铁路与电信狂潮留下的教训。
两个必要计算
经济学要落到操作上,靠的是两个会进入团队表格的计算,每个时钟一个。
第一个是推断单位成本。要把它变成一个数字,需要算力市场给的加速器小时价格、服务栈以每小时词元计的实测吞吐,以及实际达到的利用率。同一个等式也解释了第五部分的服务优化为什么能直接回本:吞吐或利用率翻倍,每词元成本就减半,而每词元成本正是下游每一笔利润据以计算的基准。
第二个是自建与购买的盈亏平衡。其中 是每词元的 API 价格, 是来自上面等式的每词元自有边际成本, 是搭建并预留自有服务容量的固定成本。买,在用量 上支付 ;造,支付 。当用量越过下面这道门槛,自建胜出
这个式子读作一次摊销检验:分子 是必须摊回来的固定投入,分母 是每个词元从购买切到自建后节省的钱。只有当边际成本 低于 API 价格 时,这个正阈值才存在。盈亏平衡点会随时间朝不利的方向移动,因为 随市场下降,所以一笔今天算得过来的自建,必须在投入资本之前,对照明年更低的 API 价格重新核算一遍。
试着改一改下面的年降价比例或固定成本:当 API 价格朝边际成本靠近,盈亏平衡量会一路攀升。
import numpy as np
F = 2_000_000.0 # 搭建并预留服务容量的固定成本(美元)
c = 0.20 # 自托管每百万词元边际成本(美元)
p0 = 2.00 # 今天的每百万词元 API 价格(美元)
decline = 0.40 # API 价格每年下降的比例
for year in range(4):
p = p0 * (1 - decline) ** year
if p > c:
breakeven = F / (p - c) # 证明自建划算所需的百万词元数
print(f"year {year}: p=${p:5.2f}/Mtok break-even = {breakeven:,.0f} Mtok")
else:
print(f"year {year}: p=${p:5.2f}/Mtok build never pays (p <= c)")
完整的决策不是一个不等式,而是一条短的分支路径,画在 图 76.6 里:一个非价格约束直接短路到自建,其余的由用量阈值决定,而下跌的 会在任何资本花出之前,强制一次重新核算。
失效模式是经济性的,不是数值性的。对着下跌的购买价格去自建,是最经典的一种:一个按今年 API 价格论证得通的自托管计划,一年后可能已经亏本,而资本早就支出了。为尖峰需求长期配置预留容量,会浪费掉波谷;用纯按需或 spot 去服务尖峰需求,则要么在波峰付溢价,要么冒被抢占的风险。而在训练时把推断量预测得过低,会让一个将被服务得远超预期的模型训练不足,留下永久的每词元成本,任何服务优化都无法完全把它挽回。
延伸阅读
- Cottier et al., “How Much Does It Cost to Train Frontier AI Models?,” 2024. epoch.aiEpoch AI 分析显示,前沿 AI 模型的训练成本每年增长 2-3 倍,持续八年,预计到 2027 年最大规模模型的训练成本可能超过十亿美元。
- Sardana et al., “Beyond Chinchilla-Optimal: Accounting for Inference in Language Model Scaling Laws,” 2024. arXiv:2401.00448本文将扩展律扩展至涵盖推理成本,证明预期大规模推理需求的从业者应训练比计算最优更小、词元数更多的模型。
- Hoffmann et al., “Training Compute-Optimal Large Language Models” (Chinchilla), 2022. arXiv:2203.15556
- DeepSeek-AI, “DeepSeek-V3 Technical Report” (训练成本与 GPU 小时核算), 2024. arXiv:2412.19437
- Cottier et al., “The Rising Costs of Training Frontier AI Models” (Epoch AI 数据集), 2024. arXiv:2405.21015Cottier 等人构建详细成本模型,表明前沿 AI 模型训练成本自 2016 年以来每年增长 2.4 倍,GPT-4 与 Gemini Ultra 的训练成本均达数千万美元。
- Du, “Tiered Super-Moore's Law: Price Evolution, Production Frontiers, and Market Competition in Large Language Model Inference Services” (系统性词元定价数据集与市场集中度分析), 2026. arXiv:2603.28576Du 记录了 2020 至 2026 年间约 600 倍的词元价格下降,经济型和中端模型价格下降快于摩尔定律,同时市场集中度下降。
- International Energy Agency, “Energy and AI” (数据中心用电需求与能源系统影响), 2025. iea.orgIEA 报告分析 AI 如何推高数据中心用电需求,同时影响电力系统、能源安全、排放、创新与可负担性。
- Computer Weekly, “Google saves almost $3bn by running servers for six years” (把使用年限延长、每年为报表利润省下约 30 亿美元), 2023. computerweekly.com报道 Alphabet 2023 年把服务器使用年限从四年延长到六年,使折旧减少 39 亿美元、净利润增加 30 亿美元,是全行业模式的一部分。
- Amazon, “Amazon Form 10-Q (server useful-life reduction)” (唯一一家缩短了 AI 时代服务器年限的超大规模厂商), 2025. sec.govAmazon 自 2025 年起把一部分服务器与网络设备的年限从六年缩回五年,理由是人工智能与机器学习领域的技术发展加快。
- CNBC, “Michael Burry accuses AI hyperscalers of artificially boosting earnings” (对拉长折旧年限的看空论点), 2025. cnbc.com报道 Michael Burry 的主张:超大规模厂商把加速器使用年限拉长到超出其两到三年的经济寿命,将在 2026 至 2028 年间少计约 1760 亿美元折旧。
- CNBC, “AI GPU depreciation: CoreWeave, Nvidia respond to Michael Burry” (利益相关方以利用率作出的反驳), 2025. cnbc.comNvidia 与 CoreWeave 回应称,A100 等上一代加速器仍高度满载、以接近原价续租,为四到六年的折旧年限辩护。
- Morgan Stanley Research, “Bridging a $1.5tr Data Center Financing Gap” (对融资缺口的经典测算), 2025. morganstanley.com估算到 2028 年全球数据中心支出约 2.9 万亿美元,而超大规模厂商现金流约 1.4 万亿,留下约 1.5 万亿的融资缺口,其中约 8000 亿来自资产支持的私募信贷。
- Eren et al., “Financing the AI infrastructure boom: on- and off-balance sheet borrowing” (央行视角下的 SPV 影子借贷), 2026. bis.org国际清算银行季度评论的研究,记录科技巨头 2025 年债券发行突破千亿美元,以及在超大规模厂商、私募信贷与银行之间制造新联系的 SPV 影子借贷。
- CoreWeave, “CoreWeave Secures $2.3 Billion Debt Financing Facility” (第一笔规模化的 GPU 抵押贷款), 2023. prnewswire.com第一笔规模化的 GPU 抵押债务融资,以已签约的加速器收入、而非芯片残值作抵押。
- Meta, “Meta and Blue Owl Capital to Develop Hyperion Data Center” (表外的数据中心合资结构), 2025. about.fb.com一个约 270 亿美元的合资项目,由信贷基金持有数据中心园区的大部分,Meta 再回租算力,从而把债务留在自身资产负债表之外。
- NVIDIA, “OpenAI and NVIDIA Announce Strategic Partnership to Deploy 10GW of NVIDIA Systems” (以股权出去,以芯片收入回来), 2025. nvidianews.nvidia.com一份部署至少 10GW 英伟达系统的意向书,英伟达计划随每吉瓦部署逐步向 OpenAI 投资最多 1000 亿美元。
- AMD, “AMD and OpenAI Announce Strategic Partnership (Form 8-K exhibit)” (供应商为一笔订单以股权支付客户), 2025. sec.gov一份 6GW AMD Instinct GPU 的承诺,附带给予 OpenAI 最多约 10
- Microsoft, “The next chapter of the Microsoft-OpenAI partnership” (约 27), 2025. blogs.microsoft.com微软持有 OpenAI 新营利实体约 27
- Alphabet, “Sundar Pichai on Alphabet Q3 2025 earnings (token volume)” (服务侧推理量同比增长约 20 倍), 2025. blog.googleAlphabet 披露的月度词元处理量在 2025 年同比增长约 20 倍,是反驳「纯厂商融资」批评的需求侧证据。
- Furman, “Information-processing investment and US GDP growth (public remarks)” (信息处理投资贡献了 2025 上半年大部分 GDP 增长), 2025. x.comFurman 的发现:约占 GDP 4
- Goldman Sachs, “Tracking Trillions: the assumptions shaping the scale of the AI build-out” (AI 投资与铁路、电气化、电信建设的对照), 2026. goldmansachs.com把 AI 相关投资定在 2026 年约占美国 GDP 的 1.5
- Odlyzko, “Collective Hallucinations and Inefficient Markets: The British Railway Mania of the 1840s” (变革性技术与毁灭性投资狂潮并存), 2010. papers.ssrn.com以铁路狂潮为范例,说明真正变革性的技术如何与灾难性的资本毁灭并存,而需求证据就在眼前却被无视。
评论
登录后评论