模型版图
训练前沿模型的各家实验室,分歧不只在它们训练出了什么,也在它们愿意展示多少。有用的地图,是一条从开放到封闭的连续区间:一次发布能披露哪五样东西,权重许可证又允许拿这些权重做什么。几乎每一项已公开的训练实践,都出自少数开放实验室,而不是那些最大的闭源实验室。
开放权重不等于开源 AI
围绕开放性的词汇之所以变得混乱,是因为权重文件比产生它的训练系统更容易发布。Open Source Initiative 的 Open Source AI Definition 画出了一条更严格的线:一个开源 AI 系统必须赋予使用、研究、修改与分享的自由,而机器学习系统的可修改首选形式,必须包括数据信息、代码与参数 (Open Source Initiative 2024)。Model Openness Framework 则把这道压力变成了可操作的分层,检查一次发布是否包含足以支持复现、透明与复用的组件 (White et al. 2024)。
这并不意味着开放权重不重要。开放权重常常是本地推断、微调(在自有数据上继续训练)、蒸馏(训练一个小模型去模仿更大的模型)与价格竞争的分界线。但它能证明的事情,比许多说法更窄。一次发布可以很有用、许可证也可以宽松,并且在经济上很重要,同时仍然保留了检查其生成过程所需的数据与代码。这点区别到 第 79 章 才落到实处,因为买方有时不只关心能不能运行权重,更关心能不能说清训练数据的来路。
披露不对称塑造版图
假设要搞清楚一个前沿模型究竟是怎么训练出来的:参数量、词元预算、矩阵乘法的精度、数据喂入的顺序。能力最强的地方,恰恰找不到答案。关于前沿训练最详尽的公开记述,来自那些发布中等规模模型的开放实验室,而不是最大的那些闭源系统。后者那些关键数字,参数量、词元数、单次训练算力、训练框架,根本不曾披露。GPT-4 技术报告说得很明白,它不透露任何架构、模型规模、硬件、训练算力、数据集构建或训练方法 (OpenAI 2023)。任何对闭源前沿的推断,都是从开源前沿外推出来的。
这种不对称属于前沿系统,而不属于实验室本身。OpenAI 在 2025 年 8 月以 Apache 2.0 发布了 gpt-oss-120b 与 gpt-oss-20b,是它自 GPT-2 以来的首批开放权重模型 (OpenAI 2025);Google 也在闭源的 Gemini 之外维持着 Gemma 这条开放权重副线。这些副线落在开放权重层级,权重公开、数据保留,所以它们非但没有模糊、反而凸显了前文开放权重与开源 AI 的区分;而同一批实验室出售的前沿系统,依旧不作披露。
从业者真正要把握的,正是这项不对称,因为开放程度是唯一能预测其余几乎一切的维度。它决定了能运行什么、能改造什么、能复现什么,以及哪些只能靠猜。两个模型可以在同一个基准上拿到相同分数,却分处这个维度的两端,而正是这点差别,决定了究竟能微调权重、审计数据,还是只能调用一个端点。下文围绕「一次发布展示了什么」来组织,而不是围绕「谁领先」来排名,因为只看展示、不排座次的视角,才能在一个每隔几个月就重新洗牌的格局里站得住。
一次发布的解剖
一次发布可以展示的五件事
开放程度不是一个比特,而是若干个,一个模型可以在某些维度上开放、在另一些维度上封闭。一次发布可以披露的内容,按大致递增的慷慨程度排列如下:
- 权重。 训练好的参数,可下载、可运行。这是多数人所说的「开放模型」那条线。
- 代码。 训练与推断代码,使架构清晰可读、训练在原则上可重新执行。
- 数据。 预训练语料与配比,使结果可被复现与审计,而非只能信任。
- 检查点。 训练全程的中间状态,把单一产物变成一项对训练动力学的研究。
- 日志。 数据加载器顺序、超参数调度与训练遥测,是真正可复现性的原料。
这五样定义出一个连续区间,而非一个二元对立。一端是完全开放的努力,五样全部公开:权重、数据、代码、数千个中间检查点,以及精确的数据顺序,从一开始就是为了让训练动力学可被研究、让整次训练可被重建。Pythia 套件是最清晰的例子,它提供公开检查点与可重建的数据加载器顺序,正是为了让训练与扩展能在训练全程被研究 (Biderman et al. 2023);OLMo 2 则以其训练稳定性配方与两阶段课程编排,延续了这种完全开放的姿态 (OLMo Team 2025)。中间是开放权重的发布,交付权重和一份详尽的技术报告,却把数据留了下来:能运行和微调模型,也读得到它是怎么构建的,但复现不了它。Llama 3 是开放权重训练报告的范本 (Grattafiori and others 2024);Qwen3 给出报告,数据则保留 (Yang and others 2025)。封闭的一端,是那些只披露一个方法方向或一套系统栈、却从不给出规模数字的系统:Gemini 点名了自己的系统栈,规模却保留 (Gemini Team, Google 2024),Constitutional AI 记录了一家本来封闭的实验室的方法 (Bai et al. 2022);再往外,则是关于训练几乎什么都不披露的系统 (OpenAI 2023)。图 73.3 把五个维度对照各个层级展开,直接呈现了这条论点:越过第一列之后,披露几乎归零。
许可证作为闸门
许可是叠在权重之上的第二层,属于法律层。采用宽松许可证(如 Apache 2.0 或 MIT)的开放权重,可以被商业地运行、修改与再分发。采用自定义或源代码可见许可证的开放权重,可能按公司规模、用途或再分发加以限制。无权重的模型则只能通过 API 触及。决定一次权重发布能否撑起一个由微调和衍生品构成的商业生态的,是许可证,而不是下载链接本身。图 73.4 展示了这道闸门:同样是可下载的权重,仅凭许可证文本,就会走向一个繁荣的衍生生态,或是一个被封死的生态。
许可证是一个法律产物,却支配着下游生态能构建什么。让一个由微调、蒸馏与衍生产品构成的商业生态成为可能的,是一份宽松的开放权重许可证;而一份受限或无权重的许可证,无论模型多有能力,都会把它封死。一个看似纯粹关乎模型质量的决策,落到生态层面,其实是由附在权重上的许可证文本所设定的。
格局的形成
有两股潮流塑造了今天的格局。
第一股力量,是开放权重的发布从一种慈善之举,变成了一种刻意的策略。早期的大模型权重发布附带完整的技术报告,而该领域最完整的单篇训练论文,就属于这个开放权重层级 (Grattafiori and others 2024)。在宽松许可证下发布权重,会播下一个由微调、衍生品与工具构成的生态,这是闭源 API 做不到的,它还把外部开发者变成了实验室的延伸。如今方法披露最丰富的地方,正是开放权重层级,其中包括对前沿规模技术的首次公开演示,那些技术闭源实验室想必也在用,只是不会记录下来 (DeepSeek-AI 2024)。
开放权重也是一种实验室会进入、也会退出的策略。2025 年 4 月 Llama 4 表现不及预期之后,Meta 重组了它的 AI 团队,此后发布的前沿模型转为闭源 (AI News 2026);OpenAI 则反向而行,以 gpt-oss 重回开放权重 (OpenAI 2025);如今扛起开放权重前沿的,主要是中国的实验室,DeepSeek、Qwen、Kimi 与 GLM 都在其中。Llama 3 仍是开放权重训练报告的范本 (Grattafiori and others 2024),尽管它的发布者已经转向。这正是格局洗牌的一个具体实例,也再次说明为什么「看一次发布展示了什么」才是更耐久的框架。
第二股力量,是训练发生的地点变了。早先的模式是从超大规模云租用容量;当下的模式是自建专用的、多吉瓦级的、定制供电的园区,往往通过多方融资载体来实现。这提高了在前沿训练的资本门槛,把它集中到那些能以工业规模为电力和硅片买单的组织手里。硬件本身则是几代并行运转:当前世代的加速器承载新的训练,上一代仍是已部署容量的主体,承载其余的训练。定制硅片如今与占主导的 GPU 产品线并存,而能力最强的闭源实验室会把训练分散到不止一个加速器家族上,不押在单一供应商身上。这些数字变化很快,是本领域最易过时的论断,所以这里陈述趋势、不给出数字。
训练方法本身有一条已公开的演进弧线,可以沿着开放发布一路追溯:监督微调,接着是通过基于人类反馈的强化学习做的偏好优化 (Ouyang et al. 2022),再是它那些更直接的后继者,然后是用于推理的、带可验证奖励的强化学习 (Guo et al. 2025)。这条弧线由 第 19 章、第 20 章 和 第 28 章 讲述;此处要紧的是,它的每一步能进入公开记录,靠的都是某一次主动选择把它写下来的发布。
实验室的两难与从业者的两难
开放程度是一种平衡,实验室和从业者会以不同方式来权衡它。
- 对实验室:控制与生态。 封闭权重让一项能力保持专有、在 API 后面计量收费,防范滥用与竞争性复制,并让训练配方保持私有。开放权重放弃那份控制,换来采用、外部贡献与标准制定,并把一个模型转化为他人 在其上构建的平台。
- 对从业者:运行与复现。 带封闭数据集的开放权重,让人能运行、微调与服务一个模型,却无法复现或完整审计它。使用者继承了数据里的一切,却无法检视它。完全开放的模型用一些前沿能力,换取研究与验证每个 阶段的能力。
- 许可:宽松与受限。 Apache 或 MIT 权重可以锚定一个商业衍生生态。按公司规模或用途设限的自定义许可证,可能恰好封死一个团队所需的那些商业用途,一个在新闻稿里「开放」的模型,一旦读了许可证,对 某个特定产品可能就不可用。无权重模型则彻底封死了衍生生态。
发布开放权重是否净有益,是一个真正未定论的问题。一种立场认为开放权重不可或缺:它们使独立的安全研究、可复现性、审计,以及一个防止能力集中到少数闭源提供方手中的竞争性生态成为可能。相反的立场认为,发布前沿权重是一种不可逆的扩散:权重一旦公开,就能被微调以移除安全训练,且再也无法召回,因此能力最强的权重应当保持封闭。两种立场都由严肃的研究者本着善意提出,而哪些能力适合开放发布的那条界线,会随前沿一起移动。这是一场关乎价值与证据的辩论,不是一个已成定论的技术问题。
开放层级留下的公共知识
开放层级的实际回报,是它已经公开了一份可迁移的训练实践清单。如今常用的几乎每一项技术,都能在某份公开报告里找到可引用的源头,而每一项的深入论述都在前面某一章,所以下面提到的名字只是提醒,而非要在此处吸收的新词汇。真正要紧的是,这份清单之所以存在,全有赖于开放权重层级和完全开放层级。
这些技术贯穿了整个技术栈。在精度与架构上,开放层级最先演示了前沿规模的低精度(FP8)训练、面向混合专家模型的无辅助损失均衡,以及由潜在注意力、多词元预测、分组查询注意力构成的注意力效率家族 (DeepSeek-AI 2024; Wang et al. 2024; DeepSeek-AI 2024; Ainslie et al. 2023);参见 第 34 章、第 10 章、第 9 章 与 第 8 章。在扩展上,它公开了计算最优训练、为推断经济性而过度训练一个更小模型的刻意偏离、超参数迁移,以及让「先继续训练再退火」配方可组合的 warmup-stable-decay 调度 (Hoffmann et al. 2022; Sardana et al. 2024; Yang et al. 2022; Hu et al. 2024);参见 第 5 章。在数据上,它公开了收益随规模强烈变化的高质量退火阶段、Web 规模的去重与质量过滤、学习得到的配比权重,以及随生成流水线一同发布的高合成占比对齐数据 (Penedo et al. 2024; NVIDIA 2024);参见 第 6 章 与 第 23 章。在后训练上,它勾勒出从基于人类反馈的强化学习,经直接偏好优化,再到可验证奖励的演进弧线,以及从大规模强化学习中涌现的推理 (Ouyang et al. 2022; Guo et al. 2025);参见 第 19 章、第 20 章 和 第 28 章。在系统上,它记录了 3D 并行、分片的优化器状态、选择性激活重计算,以及作为一次数周训练底座的快速检查点 (Narayanan et al. 2021; Mohan et al. 2021);参见 第 10 章。
开放性揭示了什么
开放性让这幅版图能成为证据。在能力上,闭源前沿或许在原始分数上领先,却对方法缄默。在效率上,几乎每一个降低词元成本的配方,FP8、潜在注意力、无辅助损失的均衡、推断感知的过度训练,都首先在开放中被演示出来,如今已成为公共财产。在信任上,只有完全开放的层级才能让人端到端地复现、审计、验证一个模型,这也是为什么一场关乎开放权重的价值辩论至今未定论,而非已有定论。
闭源前沿留下的结论是:关于前沿训练方法最详尽的地图,是从开放层级和开放权重层级绘制出来的,而对闭源系统的推断,就意味着从那幅地图外推。这些选择底下的经济学,参见 第 76 章;承载这些训练的加速器与网络,参见 第 62 章。
延伸阅读
- Grattafiori & others, “The Llama 3 Herd of Models” (开放权重训练报告,4D 并行,公开的可靠性数据), 2024. arXiv:2407.21783Meta 发布 Llama 3 系列密集 Transformer 大语言模型,参数量分别为 8B、70B 和 405B,在 15T 词元上预训练,跨任务性能与 GPT-4 相当。
- Gemini Team, Google, “Gemini 1.5: Unlocking Multimodal Understanding Across Millions of Tokens of Context” (点名系统栈,规模数字保留), 2024. arXiv:2403.05530Gemini 1.5 Pro 和 Flash 是多模态混合专家模型,在文本、视频和音频模态下对最长 10M 词元的上下文实现近乎完美的召回。
- Bai et al., “Constitutional AI: Harmlessness from AI Feedback” (一个闭源实验室的方法披露), 2022. arXiv:2212.08073Constitutional AI 仅凭一组书面原则和 RLAIF(从 AI 反馈中做强化学习)训练出无害且不回避问题的助手,无需人工标注有害性数据。
- OpenAI, “GPT-4 Technical Report” (不披露任何架构、规模、硬件、数据或方法), 2023. cdn.openai.comGPT-4 是一个经 RLHF 训练的多模态 Transformer,在多项专业学术基准上达到人类水平,并可通过扩展律从使用少 1,000 倍算力的小模型预测其能力。
- OpenAI, “Introducing gpt-oss” (以 Apache 2.0 发布 gpt-oss-120b 与 gpt-oss-20b,OpenAI 自 GPT-2 以来的首批开放权重), 2025. openai.comOpenAI 以 Apache 2.0 许可证发布 gpt-oss-120b 与 gpt-oss-20b 两个开放权重混合专家推理模型,是其自 GPT-2 以来首次发布开放权重语言模型;较大的模型可在单张 80 GB GPU 上运行,推理基准接近 o4-mini。
- DeepSeek-AI, “DeepSeek-V3 Technical Report” (开放权重报告,前沿规模 FP8,无辅助损失的 MoE 均衡,多词元预测), 2024. arXiv:2412.19437
- Guo et al., “DeepSeek-R1 incentivizes reasoning in LLMs through reinforcement learning” (通过大规模 RL 实现推理,从纯 RL 中涌现), 2025. arXiv:2501.12948
- Yang & others, “Qwen3 Technical Report” (开放权重报告;数据保留), 2025. arXiv:2505.09388Qwen3 发布涵盖稠密模型与混合专家(MoE)架构(参数量从 0.6B 到 235B)的统一大语言模型(LLM)系列,将思考模式与非思考模式集成于单一模型,并引入思考预算机制以控制推理时计算资源分配。
- Jiang et al., “Mistral 7B” (GQA 加滑动窗口注意力), 2023. arXiv:2310.06825Mistral 7B 提出一个 70 亿参数语言模型,采用分组查询注意力(GQA)和滑动窗口注意力(SWA),在全部基准测试上超越 Llama 2 13B,同时降低推理成本。
- Jiang et al., “Mixtral of Experts” (稀疏 MoE,8 选 2 专家), 2024. mistral.aiMixtral 8x7B 是一个稀疏混合专家(MoE)仅解码器模型,总参数量 46.7B,每词元仅激活 12.9B 参数,在 Apache 2.0 许可下以 6 倍更快的推理速度超越 Llama 2 70B。
- Mistral-AI et al., “Magistral” (异步在线 RL 推理系统), 2025. arXiv:2506.10910Magistral 介绍了 Mistral 首个推理模型,基于自研可验证奖励的强化学习(RLVR)流水线与组相对策略优化(GRPO)训练,无需蒸馏即在 AIME-24 上提升约 50
- xAI, “Open Release of Grok-1” (开放权重 MoE,无方法论文), 2024. x.ai
- OLMo Team, “2 OLMo 2 Furious” (完全开放:训练稳定性配方与两阶段课程编排), 2025. arXiv:2501.00656OLMo 2 是一个完全开放的自回归大语言模型系列,包含 7B、13B 和 32B 规模,公开权重、训练数据、代码与配方,在性能与训练 FLOPs 的 Pareto 前沿上与 Llama 3.1 等开放权重模型持平。
- Biderman et al., “Pythia: A Suite for Analyzing Large Language Models Across Training and Scaling” (带公开检查点与可重建数据加载器顺序的完全开放套件), 2023. arXiv:2304.01373Pythia 是一套包含 16 个大语言模型(70M 至 12B 参数)的模型组,每个模型提供 154 个公开检查点,所有模型按相同数据顺序训练,用于研究训练动态与扩展律。
- Open Source Initiative, “The Open Source AI Definition 1.0” (定义开源 AI 的自由与可修改首选形式), 2024. opensource.orgOSI 定义把开源 AI 视为需要使用、研究、修改和分享四项自由,并要求数据说明、代码与参数以便于修改的首选形式提供。
- White et al., “The Model Openness Framework: Promoting Completeness and Openness for Reproducibility, Transparency, and Usability in Artificial Intelligence” (开放性与完整性的三层框架), 2024. arXiv:2403.13784模型开放框架按照代码、数据、文档和模型组件是否足够完整和开放,对 AI 发布进行分层,以支持复现、透明和复用。
- Longpre et al., “The Data Provenance Initiative: A Large Scale Audit of Dataset Licensing and Attribution in AI” (数据集许可、来源与署名审计), 2023. arXiv:2310.16787Data Provenance Initiative 审计超过 1800 个文本数据集,发现广泛的许可证缺失、许可证错误,以及商业开放数据和闭合数据之间的分化。
- NVIDIA, “Nemotron-4 340B Technical Report” (开放权重,高合成占比对齐数据,发布生成流水线), 2024. arXiv:2406.11704NVIDIA 发布 Nemotron-4 340B 系列开放访问模型,包含基础、指令和奖励模型,对齐阶段超过 98
- Wang et al., “Auxiliary-Loss-Free Load Balancing Strategy for Mixture-of-Experts,” 2024. arXiv:2408.15664Loss-Free Balancing 通过动态更新每个专家的路由偏置来维持混合专家(MoE)模型的负载均衡,消除辅助损失引入的干扰梯度并提升模型性能。
- DeepSeek-AI, “DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model” (多头潜在注意力,低秩 KV 压缩), 2024. arXiv:2405.04434DeepSeek-V2 是一个 236B 混合专家(MoE)语言模型,通过多头潜在注意力(MLA)和 DeepSeekMoE 将 KV 缓存压缩 93.3
- Ainslie et al., “GQA: Training Generalized Multi-Query Transformer Models from Multi-Head Checkpoints” (以接近 MQA 的成本达到接近 MHA 的质量,可从 MHA 续训得到), 2023. arXiv:2305.13245GQA 提出分组查询注意力(GQA),在多头注意力(MHA)与多查询注意力(MQA)之间插值,以接近 MQA 的推理速度达到接近 MHA 的质量,并提供仅用 5
- Hoffmann et al., “Training Compute-Optimal Large Language Models” (计算最优扩展), 2022. arXiv:2203.15556
- Sardana et al., “Beyond Chinchilla-Optimal: Accounting for Inference in Language Model Scaling Laws” (推理感知的过度训练理由), 2024. arXiv:2401.00448
- Yang et al., “Tensor Programs V: Tuning Large Neural Networks via Zero-Shot Hyperparameter Transfer” (超参数迁移:小规模调参,迁移到大规模), 2022. arXiv:2203.03466
- Hu et al., “MiniCPM: Unveiling the Potential of Small Language Models with Scalable Training Strategies” (warmup-stable-decay 调度), 2024. arXiv:2404.06395
- Penedo et al., “The FineWeb Datasets: Decanting the Web for the Finest Text Data at Scale” (Web 规模去重与质量过滤), 2024. arXiv:2406.17557
- Ouyang et al., “Training Language Models to Follow Instructions with Human Feedback” (RLHF 后训练), 2022. arXiv:2203.02155InstructGPT 通过监督微调(SFT)、奖励模型训练和近端策略优化(PPO)对 GPT-3 进行基于人类反馈的强化学习(RLHF),使 1.3B 参数模型的输出优于 175B GPT-3。
- Narayanan et al., “Efficient Large-Scale Language Model Training on GPU Clusters Using Megatron-LM” (GPU 集群上的 3D 并行), 2021. arXiv:2104.04473
- Mohan et al., “CheckFreq: Frequent, Fine-Grained DNN Checkpointing” (频繁的异步检查点), 2021. usenix.org
评论
登录后评论