AI 基建
0%
第八部分 · 安全、可解释性与治理 · 第 60 章

机密推理:可信执行与私密服务

作者Changkun Ou
阅读时长约 11 分钟

上一章问的是权重记住了什么、怎样让它遗忘;这一章对服务路径本身提出一个更冷的问题。当一家企业把提示词发给托管模型时,「我们不会用你的数据训练」是一句写在合同里、事后靠审计、机器里没有任何东西强制执行的承诺。从用户的 TLS 连接到 GPU 之间的每一个环节,提示词对机器的运营者都是可读的。机密推理要做的,就是把这句承诺换成一个机制:让硬件能证明自己在运行什么软件,连运营它的人也挡在外面。本章依次讨论威胁模型、从 CPU 隔离区到覆盖整块 GPU 的可信执行谱系、值得研读的已部署设计、密码学替代方案为何在成本上差出几个数量级,以及这道硬件边界仍然守不住什么。读完本章,读者能说出一套机密服务栈究竟保护什么、防的是谁、开销多大,以及信任最终落在了谁身上。

承诺不是机制

先把对手列出来,因为不说清防的是谁,「私密」就无从谈起。一套托管推理栈上,至少有五方可以在没有本章机制的情况下读到提示词。云运营者控制着服务虚拟机之下的虚拟机监控器。内部人员握有日常运维授予的凭证。同一台物理机上的其他租户共享着微架构层面的攻击面。AI 服务商自己运营着服务软件,它的隐私声明因此是自我作证。而服务商读得到的东西,传票就能强制交出。合同性的控制手段,零留存协议与合规审计,对这五方给出的都是承诺;没有一个是从构造上成立的保证。

这个问题还是对称的,而对称性容易被忽略。用户的提示词需要防住基础设施,服务商的权重也需要防住同一套基础设施:一个部署到租来的或客户控制的硬件上的前沿模型,是一个以训练成本计价的盗窃目标。已发表的机密推理设计把两个方向放进同一个架构处理:权重只释放给证明过自己身份的环境,提示词也只加密给同一个被证明过的环境 (Anthropic and Pattern Labs 2025)。请记住这两条流向;同一套机制同时承载它们。

能保守秘密的硬件

这个机制就是可信执行环境(trusted execution environment,TEE),核心思想是远程证明(attestation):硬件度量自己加载的软件,把启动链每一级的哈希记入以硅片内熔铸密钥为根的寄存器,事后可以对这些度量值签出一份报文,远端在核对签名链与期望值之后,才释放任何敏感数据。信任从「运营者说是」变成「硅片为这套软件栈签了字」。这个领域花了十五年学会的,是这道保证的边界应该画在哪里。

第一次画得很紧。Intel 于 2015 年推出的 SGX 保护的是单个进程的隔离区(enclave),对机器上其余一切设防,包括操作系统 (Costan and Devadas 2016)。对机器学习来说,它的形状错在三处:受保护内存起初以 MB 计,模型却以 GB 计;应用必须改写成隔离区一半、不可信一半;GPU 则完全无法参与。它还给这个领域留下了最让人清醒的教训:瞬态执行攻击提取出了 SGX 自己的证明密钥,从此确立了两件事,一是经过证明的硅片仍会从微架构侧信道泄漏,二是这道边界是工程造物,不是数学证明 (Van Bulck et al. 2018)。第二次画界吸收了两个教训。AMD 的 SEV-SNP 与 Intel 的 TDX 对整台虚拟机做加密与完整性保护,于是一套未经修改的服务栈,连推理引擎带驱动,全都跑在一台机密虚拟机里:它的内存,虚拟机监控器既读不出,也无法在不被察觉的情况下篡改 (AMD 2020; Cheng et al. 2024)。SEV 架构师的复盘坦率承认,走到这一步花了十年的修补 (Kaplan 2023)。Arm 的对应设计在出货前就完成了形式化验证,是这个领域最干净的纸面方案,仍在等待量产硬件 (Li et al. 2022)。

attestation silicon 硅片信任根 出厂熔铸的密钥 boot 度量启动链 固件与内核哈希 silicon->boot cvm 机密虚拟机启动 SEV-SNP / TDX 度量 boot->cvm gpu GPU 证明 驱动与固件状态 cvm->gpu quote 签名报文 gpu->quote verify 核验方对照期望度量值 检查报文 quote->verify key 客户端释放会话密钥 提示词(或权重)流入 verify->key
图 60.1. 机密服务栈的证明链。每一环由下一环度量,并在任何秘密流入之前由客户端的策略核验;链条锚定在某家厂商硅片里熔铸的密钥上,信任最终就落在那里。

把边界扩到 GPU

一台机密虚拟机若没有配套的机密 GPU,就等于保护了一切,唯独漏掉要害,所以决定性的一步发生在 NVIDIA 的 Hopper 一代给加速器装上自己的信任根之时。在机密计算模式下,GPU 的固件与机密虚拟机的报告一起接受证明,CPU 与 GPU 之间的流量经由受保护虚拟机里的中转缓冲区,加密后再穿过 PCIe 总线。封装内部,模型、KV 缓存(key-value cache)与激活值住在由硬件访问控制而非整体内存加密守护的 HBM 里;明文孤岛只有两个硅片封装,两者之间线缆上的一切都是密文。

这样做要付出的代价,正是让整个行业转向的那个结果:对大语言模型服务而言,几乎不用付。对 H100 的测量发现,开销全部集中在加密的 CPU 到 GPU 传输上,典型 LLM 负载的吞吐损失低于 5%,且随模型增大、批次拉长而趋近于零,因为主导大模型推理的计算时间把一笔固定的按字节传输税摊薄了 (Zhu et al. 2024)。下面的可运行单元仅凭成本模型就复现了这个结论的形状。剩下的边界缺口,多加速器服务里 GPU 之间的流量,由 Blackwell 受保护的 NVLink 补上,一道经过证明的边界从此覆盖整个服务节点,厂商声称吞吐量接近持平。

# 每请求耗时 = 计算 + 传输 * (1 + 税):这笔税只落在 PCIe 一段上
compute_per_tok, xfer_per_req, tax = 8e-3, 6e-3, 0.35   # 秒,秒,机密模式开销
for batch in [1, 4, 16, 64, 256]:
    plain  = compute_per_tok * batch + xfer_per_req
    cc     = compute_per_tok * batch + xfer_per_req * (1 + tax)
    print(f"批次 {batch:4d}: 机密模式减速 {(cc/plain - 1)*100:4.1f}%")
print("固定的按传输计的税在计算之下消失:小批次高频交互付得最多,")
print("大模型大批次的服务把它摊到近乎为零")

生产环境里的设计

到 2026 年,这个设计空间已经有了真实出货的样本,把它们放在一起读,能看到一个行业从三个方向收敛到同一个形状。

Apple 的 Private Cloud Compute 于 2024 年随助手查询开始上云而发表,至今仍是陈述得最完整的设计,它的五项要求值得当作这个领域的检查清单记住:无状态计算,用户数据不在请求之外留存;可强制执行的保证,性质必须从机制推出而不是从政策推出;无特权运行时访问,即使排障也没有 shell 或调试通道;不可定向,无法把选中的用户路由到被攻破的节点,部分靠第三方中继实现;可验证的透明性,每一份生产软件镜像都发布到密码学日志,客户端设备先查日志再发送任何数据,被悄悄改动的服务器因此收不到流量 (Apple Security Engineering and Architecture 2024)。Apple 把它建在自家硅片上;输出给行业的是这五项要求,不是那块芯片。Meta 的 WhatsApp Private Processing 用通用部件重建了同一套要求,SEV-SNP 机密虚拟机加 NVIDIA 的 GPU 机密模式,再配匿名中继实现不可定向 (Meta 2025);Google 的 Private AI Compute 则给出第三条硅片路线,让 Gemini 模型跑在 TPU 隔离区里,作出同样的「包括我们自己也看不见」的承诺 (Google 2025)。在这些为隐私而设计的系统之下,超大规模云厂商出售原材料:Azure 与 Google Cloud 的机密 H100 实例把机密虚拟机与 GPU 证明打包上架。AWS 的 Nitro Enclaves 值得一条谨慎的脚注,而不是同一份名单里的一席:它靠架构隔离并证明自己所运行的软件,但不对平台自身加密内存,被设计排除在外的是客户自己的管理员,AWS 仍在信任边界之内 (Trail of Bits 2024)。本章能教给读者的,大半就是细读每个系统防的是谁、为谁而防。

替代方案输在成本上

有密码学背景的读者,想必一直在等这个反驳:可信硬件是信任的搬迁,不是信任的移除,而密码学提供的保证不依赖任何人的硅片。这个反驳是对的,只是眼下还付不起。全同态加密(FHE)直接在密文上计算,对哪怕不大的 Transformer 也还停留在每词元数分钟的量级,部分原因是现有 FHE 方案都无法高效复用 KV 缓存,自回归解码因此放弃了服务所依赖的那个最关键的优化。安全多方计算(MPC)好一个数量级,但对交互式使用仍然无望:里程碑结果是三方协作推理 LLaMA-7B,每生成一个词元约五分钟 (Dong et al. 2023)。还有两种相邻技术,恰恰因为太常被错认成本章问题的解,值得把位置摆清楚。差分隐私约束的是训好的模型能泄漏多少训练样本的信息 (Abadi et al. 2016),对谁能读到推理时的提示词只字未提。推理的零知识证明让服务商能证明自己确实运行了所声称的模型,但证明者看得到明文数据:那是完整性,不是机密性。把这些都画到同一根开销轴上,市场的选择就不言自明了:明文 1.0 倍,TEE 约 1.05 倍,MPC 接近一万倍,FHE 超过十万倍。TEE 是曲线上唯一与生产服务兼容的点,而它的价钱不用吞吐量支付,用信任支付:保证的成色,就是硅片厂商的设计、密钥与固件的成色。

边界守不住的东西

这些局限值得同等的篇幅,因为一道被夸大的边界,会在部署中失守。第一,加密的流仍然有形状。一项测量研究表明,流式助手回复逐词元的报文长度,足以让网络观察者在不解密任何东西的情况下精确重建 29% 的回复、推断出超过一半回复的主题 (Weiss et al. 2024);解法是填充与合批,这笔延迟代价,任何 TEE 都无法代为支付。第二,从 SGX 至今的微架构记录说明,侧信道只能被管理,从未被根除。第三,边界包住的是计算,不是计算里面的行为:一个有工具访问权的模型可以被提示词注入诱导,把硬件保护着的上下文亲手送出去,这是 第 56 章 的问题,到了这里也不会消失。第四,证明把信任集中化:每一份报文都沿签名链追溯到 Intel、AMD、NVIDIA 或 Apple,核验服务与厂商一样集中。透明性日志,也就是 PCC 的回答,缓解的是运营者的自由裁量,改变不了锚点的归属。而锚点的归属也是一个主权事实:所有已出货的信任根都属于美国公司,一个购买机密推理的政府,等于把对美国云的信任换成了对美国硅片的信任。

下层约束

硅片能证明什么,决定了上面各层能承诺什么。一句由机密计算边界背书的隐私承诺,客户端可以在数据流出之前核验;一句超出可证明边界的承诺,关于侧信道、关于模型拿读到的东西做了什么、关于司法辖区,就只能是合同性的。当 第 61 章 检视那些要求「可证实的数据保护」的监管体制时,「部署能证明的」与「部署只能许诺的」之间那条线,其实早在这里,在熔铸的密钥究竟为链条的哪几环签字这件事上,就已经画好了。

争议所在

这个年轻的层面上有三场争论。其一,机密推理会成为企业默认还是停在强监管行业的小众市场:近乎为零的开销与现成的云产品站在「默认」一边;多年来被普遍接受的合同式零留存,以及运营一个任何运营者都无法查看的服务的成本,站在「小众」一边。其二,验证是否必须透明:Apple 一派坚持客户端强制核对公开镜像日志,否则没有日志的证明只是把承诺换了个地方;未做客户端强制的部署则回应说,一份签名报文相对于一纸合同已是性质上的进步。其三,开放权重是否直接消解了问题:把下载来的模型跑在自己机房里,托管提示词的问题确实整个消失,但企业最想要的前沿模型下载不到,而服务商那一侧的问题,在自己不拥有的基础设施上保护权重,在开放权重能力越强的世界里只会更难。每一方立场手里的生产证据,都比这本书还年轻。

延伸阅读

  • Costan & Devadas, “Intel SGX Explained” (从硅片讲起的隔离区模型), 2016. eprint.iacr.org
    Intel SGX 的权威解读:隔离区、度量与远程证明在硅片层面究竟如何运作,至今仍是理解可信执行的最佳入门。
  • AMD, “AMD SEV-SNP: Strengthening VM Isolation with Integrity Protection and More” (机密云实际部署的虚拟机级威胁模型), 2020. amd.com
    虚拟机级机密计算的白皮书:对整台虚拟机做加密与完整性保护以对抗恶意虚拟机监控器,让未经修改的软件栈也能机密运行。
  • Kaplan, “Hardware VM Isolation in the Cloud” (SEV 架构师的亲历复盘), 2023. dl.acm.org
    AMD SEV 的架构师回顾十年间在真实攻击下迭代虚拟机隔离设计的历程,是机密计算如何一步步变硬的坦率记录。
  • Cheng et al., “Intel TDX Demystified: A Top-Down Approach” (不用啃七百页规范的 TDX), 2024. dl.acm.org
    对 Intel 信任域虚拟机自顶向下的学术剖析:架构、证明流程与信任边界,读者无需去啃厂商规范。
  • Van Bulck et al., “Foreshadow: Extracting the Keys to the Intel SGX Kingdom with Transient Out-of-Order Execution” (经过证明的硅片依然泄漏), 2018. usenix.org
    利用瞬态执行提取出 SGX 自身证明密钥的攻击,重置了整个领域的预期:可信执行边界是工程造物,而非数学证明。
  • Li et al., “Design and Verification of the Arm Confidential Compute Architecture” (形式化验证过的第三条路,尚未量产), 2022. usenix.org
    Arm 基于 realm 的机密架构,设计与固件的形式化验证同步完成,是该领域最干净的纸面设计,仍在等待量产硬件。
  • Zhu et al., “Confidential Computing on NVIDIA Hopper GPUs: A Performance Benchmark Study” (让「接近原生」站得住的那次测量), 2024. arXiv:2409.03992
    对 H100 机密计算模式做 LLM 服务基准测试:典型查询开销低于 5
  • Apple Security Engineering and Architecture, “Private Cloud Compute: A new frontier for AI privacy in the cloud” (五项要求;已发表的最完整设计), 2024. security.apple.com
    Apple 的机密 AI 服务设计及其五项要求:无状态计算、可强制执行的保证、无特权运行时访问、不可定向,以及可验证的透明性。
  • Meta, “Private Processing for WhatsApp” (用通用硅片重建 PCC 的那套要求), 2025. ai.meta.com
    Meta 的技术白皮书,用通用部件重建 Private Cloud Compute 的要求:SEV-SNP 机密虚拟机、NVIDIA GPU 机密模式与匿名中继,规模是整个 WhatsApp。
  • Google, “Private AI Compute: our next step in building private and helpful AI” (TPU 隔离区的变体), 2025. blog.google
    Google 的机密服务设计把 Gemini 模型放进 TPU 隔离区运行,CPU 侧配 SEV-SNP,是通往「包括我们自己也看不见」这一承诺的第二条自研硅片路线。
  • Anthropic and Pattern Labs, “Confidential Inference Systems: Design principles and security risks” (模型所有者的那一侧:让权重防住基础设施), 2025. assets.anthropic.com
    机密推理的设计原则,覆盖信任问题的两个方向:用户数据防住服务商,模型权重防住基础设施运营者。
  • Weiss et al., “What Was Your Prompt? A Remote Keylogging Attack on AI Assistants” (加密流为何仍从词元长度与节奏中泄漏), 2024. arXiv:2403.09751
    证明加密流式响应中的词元长度模式,能让网络观察者在不解密的情况下精确重建 29
  • Dong et al., “PUMA: Secure Inference of LLaMA-7B in Five Minutes” (MPC 的最好水平,成本差距写在标题里), 2023. arXiv:2307.12533
    LLM 安全多方计算的里程碑:三方协作推理 LLaMA-7B,每生成一个词元约需五分钟,也由此标定了与可信硬件之间的成本差距。
  • Trail of Bits, “A few notes on AWS Nitro Enclaves: Images and attestation” (对这种非 TEE 信任模型的怀疑式解读), 2024. blog.trailofbits.com
    从业者对 AWS Nitro Enclaves 的分析:它的证明究竟覆盖什么,以及没有内存加密的隔离为何把平台厂商留在了信任边界之内。

评论

登录后评论