AI 基建
0%
第十一部分 · 实践与运营 · 第 81 章

选择模型

作者Changkun Ou
阅读时长约 15 分钟

任何技术栈里,第一个落地的决定就是调用哪个模型。它看起来像个质量问题,其实多半不是。稳妥的顺序是先把模型放到从闭源到开源的坐标轴上,读懂许可证究竟允许什么;再在三个排行榜之间交叉验证,不把任何单一榜单当成最终依据;随后跑一套小规模评测来确定选择。选定之后,还要把结果固定下来、接入技术栈,让某个厂商每周一次的小版本更新无法悄悄改变自己的产品。对应的理论背景在 第 73 章第 47 章:前者勾勒开放性这条坐标轴,后者说明为什么一个公布出来的分数,是关于「模型加测量框架」二者合一的论断。

2026-06-22T11:57:21.146276 image/svg+xml Matplotlib v3.10.8, https://matplotlib.org/ 0.0 0.2 0.4 0.6 0.8 1.0 服务成本 0.0 0.2 0.4 0.6 0.8 1.0 任务质量 小模型 廉价前沿 前沿 过度配置
图 81.1. 选模型作为帕累托问题的示意图。最佳选择很少是孤立看最强的模型,而是落在质量、成本、延迟与控制权构成的帕累托前沿上,也就是这样一组选项:不牺牲其中一个指标,就无法改善另一个。理想化位置,非实测。
带日期的快照:引用前先核实

下文每一个模型名称、价格、上下文长度和排名,都是 2026 年年中(2026-07-01) 的快照,并尽可能标注了一手来源。版本每周都在发布,价格在变,排名在相互重叠的置信区间内轮换。请把这里每一个具体数字,都当作一个在投入预算之前需对照所链接一手文档来确认的假设,绝不要当成永恒事实。真正耐久的内容,是这些类别、权衡,以及决策与接线的流程:要记取的是方法。

主坐标轴:租用还是自有

有一条坐标轴几乎能预测模型选择的其余一切,而它不是质量。它问的是:究竟是在一个计量计费的 API 后面租用能力,还是自有权重、自己运行。

前沿托管模型是某个实验室愿意暴露出来的最强通用模型,部署在按 token 计费的 API 后面。向它发送 token,由实验室计费,而权重从不归自己所有。实验室拥有整个服务栈:批处理、KV 缓存、推测解码、自动扩缩容和加速器(第 82 章)。于是只能继承它的延迟分布和速率上限,把这些服务侧优化当作可购买的服务档位来使用(缓存输入定价、批处理与优先级档位),而不必亲自运维它们。

开放权重模型则是那种可以下载训练好的参数、在自己硬件上运行的模型。这一侧自担运维负担,换来的是对成本、延迟、数据驻留以及微调权利的掌控。所选的模型家族,决定了推断服务器(vLLM、SGLang、llama.cpp;见 第 82 章)必须加载什么、需要多少显存、能达到多大吞吐。

这正是全书反复描绘的取舍:租用能力,交出服务栈的掌控权;或者自托管权重,自担运维。到了 2026 年,那道曾让此事成为质量妥协的差距,已大体闭合。最好的开放权重,如今在编码与推理榜单上已逼近闭源前沿模型一两个百分点,这就把「自托管还是调 API」从一种让步,变成了一个真正的架构决策(据 Artificial Analysis 与各开源 LLM 排行榜,截至 2026-06)。

许可证先于基准

对开放权重而言,许可证往往比基准更早决定选择,因为无论分数多高,一份许可证都可能让某个模型在产品里直接出局。三个层级很要紧。

  • 真正开放(Apache-2.0、MIT)。 没有用户上限,没有使用领域限制,没有地域排除条款。截至 2026 年年中,Qwen、DeepSeek、Mistral 当前旗舰、Gemma 4、gpt-oss、GLM 和 OLMo 都在这一档。若可能扩张到几千万用户以上、要在欧盟运营、或者想要零使用领域歧义,就选这一档。
  • 源可得(受限)。 权重可下载,但许可证附加了上限或排除条款。Meta 的 Llama 4 Community License 仅在 7 亿月活以下允许商用,并且对欧盟境内被许可方排除多模态功能,之上还有一份可接受使用政策。这不是 OSI 意义上的开放。在它上面构建之前,先去读真正的 LICENSE
  • 闭源(无权重)。 托管 API 前沿。拿到的是一份合同和一个端点,不是参数。

第二条、与之正交的区分是开放权重对完全开放。多数「开放」模型只发布权重;训练数据和完整配方仍是私有的。一小部分(AI2 的 OLMo)连数据、代码和检查点也一并发布。如果需要可复现、可审计,或从零重训的能力,这个差别就是全部关键,而它与许可证档级互相独立。

耐久的规则是:对任何可能扩张、或要在受监管地区上线的东西,先读许可证,再读排行榜。

玩家一览,带日期与出处

两张表给出 2026 年年中的快照。定价为标准同步调用每百万 token 的输入/输出;批处理档位通常约半价,缓存输入折扣很大。

前沿托管模型

提供方(家族) 许可证 / 接入 最适合 快照备注(截至 2026-07)
OpenAI(GPT-5.x) 闭源 API;亦在 Azure OpenAI,现已上 Amazon Bedrock 编码、广泛的智能体工作、最宽生态 GPT-5.5 旗舰约 $5 / $30,约 1.05M 上下文;pro 变体更高。270K 及以上的提示按溢价计费。按累计消费分档。[official]
Anthropic(Claude) 闭源 API;亦在 Bedrock、Vertex AI、Microsoft Foundry 长程智能体编码、可靠性、安全敏感工作 Opus 4.8 约 $5 / $25,1M 上下文,已 GA;Sonnet 5(2026-06-30 发布)优惠价约 $2 / $10 至 2026-08-31,此后约 $3 / $15,接替 Sonnet 4.6;Haiku 4.5 约 $1 / $5。模型 ID 是固定快照。Fable 5 / Mythos 5 于 2026-06-12 暂停访问,出口指令六月底解除后已恢复(见下文)。[official]
Google(Gemini) 闭源 API(AI Studio / Gemini API)+ Vertex AI 原生多模态(文本、图像、音频、视频、PDF)、GCP 用户 Gemini 3.1 Pro Preview 约 $2 / $12(≤200K),更高额度更贵;在主流厂商中可摄入最宽的模态集合。3.5 正在铺开。上下文:模型卡约 1.05M;部分追踪器称 2M(视为未证实)。[official]
xAI(Grok) 闭源 API(x.ai)、X 集成 成本敏感的长上下文、实时/社交数据 Grok 4.3 约 $1.25 / $2.50,1M 上下文;Grok 4.1 Fast 约 $0.20 / $0.50,最高约 2M 上下文。极具性价比。[aggregator]
DeepSeek 混合:开放权重 + 低价一手 API 最便宜的近前沿质量、成本敏感的批量 一手 API 已换代到 V4:V4-Flash 约 $0.14 / $0.28,V4-Pro 约 $0.435 / $0.87,均为 1M 上下文,缓存输入折扣很大。部分组织对其治理有顾虑;核实政策契合度。[official]
Amazon(Nova) 闭源,经 Amazon Bedrock AWS 原生性价比、定制构建(Nova Forge) 定位性价比,而非榜首质量。Bedrock 同时是 Anthropic、Meta、Mistral、Cohere、OpenAI 的接入层。[aggregator]
Mistral 混合:部分开放权重 + 托管 API;亦在 Bedrock/Vertex/Azure 欧盟选项、多语言、欧盟数据驻留 Mistral Large 3 旗舰。主权定位强;在公开榜单上并非始终处于绝对前沿。[aggregator]
Cohere 闭源 API;亦在 Bedrock/Vertex/Azure 企业 RAG、检索 + 重排、VPC 部署 Command A 负责生成,Embed v4 是常见检索默认。面向企业,而非追逐竞技场排名。[aggregator]

开放权重家族

参数记法对 Mixture-of-Experts(第 9 章)为 总量 / 激活A3B 表示每 token 约 3B 激活参数。

家族(出身) 许可证 最适合 快照备注(截至 2026-07)
Qwen3.5 / 3.6(阿里巴巴) Apache-2.0 最全面的开放家族;智能体编码、视觉、201 种语言 尺寸阶梯 0.8B 到 397B-A17B;带 thinking 开关(开或关分步推理,以延迟换准确率)。Qwen3.6-35B-A3B 为当前中等尺寸开放变体。在笔记本上原型、扩到集群,许可证不变。
DeepSeek-V4 MIT 开放权重前沿的智能体编码 V4-Pro 1.6T/49B(1M 上下文),V4-Flash 284B/13B。三种推理模式。集群级。R2 推理线截至 2026-06 未发布。
Llama 4(Meta) Community License(受限) 超长上下文、成熟生态 Scout 109B/17B(10M 上下文),Maverick 约 400B/17B(1M 上下文)。7 亿月活上限;对欧盟被许可方排除多模态。源可得,非 OSI 开放。
Mistral Large 3 / Small 4(Mistral) Apache-2.0 宽松的欧盟自研;Small 4 融合推理+视觉+编码 Large 3 675B/41B,256K 上下文。Small 4 约 119B/6B,单台中等机器。旗舰转向 Apache-2.0。
Gemma 4(Google) Apache-2.0 小/中型每字节能力最佳;单 GPU E2BE4B26B MoE(激活约 3.8B)、31B 稠密;文本+图像(部分含音频)。从自定义 Gemma 条款转为 Apache-2.0。
gpt-oss(OpenAI) Apache-2.0 单张 80GB GPU(120b)或 16GB 边缘(20b)上的推理 + 工具调用 gpt-oss-120b 117B/5.1B,gpt-oss-20b 21B/3.6B;纯文本。2025-08 发布,非 2026 新品。
Kimi K2.6(Moonshot) Modified-MIT 长程编码、多智能体编排 1T/32B 激活,256K 上下文,原生多模态。K2.7-Code(2026-06-12)为当前编码变体,提升数字来自厂商自报。超大规模部署有署名条款;先读 LICENSE
GLM-5.x(Z.ai) MIT 长程智能体工程 GLM-5.1 约 754B/40B,200K 上下文。GLM-5.2 权重(753B/40B,1M 上下文)已于 2026-06-16 以 MIT 发布,发布时领跑各开放权重榜单。
OLMo 3(Ai2) Apache-2.0(完全开放) 可复现、可审计 7B 与 32B;Base/Think/Instruct。发布数据(Dolma 3)、代码、检查点。罕见的完全开放、近前沿选项。
下层约束:服务成本向上影响模型选择

对开放权重而言,下层的服务层决定上层的模型。Mixture-of-Experts 模型以近稠密的推断成本,换来更高的质量上限,但参数仍必须装进显存,所以一个 1.6T/49B 的模型即便每 token 只激活 49B,也是集群模型。一个 31B 的稠密模型,可能比 122B-A10B 的 MoE 更易服务、更易量化(第 34 章),尽管激活算力相近。先收窄候选清单的,是手上的硬件,而不是基准。

排行榜只收窄候选

排行榜是一个收窄候选的工具,不是裁决。第 47 章 给出的最重要的实务教训是:一个公布出来的分数,是关于「模型加测量框架」二者合一的论断,而不是关于模型本身。 对同一份权重做独立重跑,会因提示模板、系统提示、工具运行框架、采样参数和评分器的不同,而摆动 10 到 20 个百分点。2026 年反复出现的模式是:一个模型在公开、可验证的编码榜上的分数,明显高于同一份权重在留出框架上的分数,而那道差距是框架加上可能的污染,而非模型本身的变化。

所以要读三个榜,而不是一个,并把榜单对准自己的问题。

要问的问题 该读的榜 它无法说明的
「在开放式对话里用户更喜欢哪个?」 LMArena / arena.ai(人类偏好 Elo,一种两两对比评分) 正确性。偏好奖励自信、更长、排版更好的回答;高 Elo 配错误答案是真实存在的失败模式。
「在我的延迟下每美元最佳智能?」 Artificial Analysis(智能指数,标准化框架,含成本与 tokens/秒轴) 那套标准化框架是否匹配自己的提示、工具与采样。
「一个高的公开分是否虚高?」 抗污染榜:FrontierMath、LiveCodeBench、Epoch、Scale SEAL 覆盖广度;这些更新更慢、覆盖任务更少。
「它能跑我的智能体吗?」 可验证的智能体榜:SWE-bench Verified、Terminal-Bench、τ-bench、Aider polyglot、BFCL 单轮知识质量;这些考验的是运行框架(第 52 章)。
「新版本是否退化了?」 已饱和的旧榜(MMLU、HumanEval)仅作下限 前沿排名;榜首集群在这里只是噪声。

三个榜一致是强信号。不一致则恰好点出哪一条轴脆弱。污染的征兆是:一个模型公开集分数与其留出或截止后分数之间的大差距。小差距是可信信号,大差距是危险信号。

何处存争议:最佳、可用、被允许是不同的轴

2026 年年中,文本榜首集群落在相互重叠的置信区间里,且每周轮换,所以任何单一的「第一」论断都是一个档位,不是赢家。更糟的是,排名是必要而非充分条件。最典型的提醒:Anthropic 的 Fable 5 与 Mythos 5 在发布时(2026-06-09)登顶多个榜单,而接入在 2026-06-12 被暂停,遵从一项美国出口管制指令(CNBC、Al Jazeera、Fortune、Anthropic)。这项指令在月底解除:Mythos 5 经 2026-06-26 的政府批准后向获准的美国机构恢复,Fable 5 于 2026-07-01 面向全球恢复(Anthropic、CNBC)。恢复并没有让这个教训过时,反而把它坐实了:一个模型可以在三周内消失又回来,节奏握在别人手里。一个登顶的模型,可能被出口管制、被区域锁定、被限速,或超出预算。要在自己可用、且政策允许的模型里挑选,再在该集合内排名,并给选中的那一个留好固定的回退。

一套决策框架

选型很少是「哪个分最高」。它是在哪里被计费、任务的形态、上下文对成本、治理,以及(对开放权重)手上的硬件这几者的交集。图 81.2 走一遍这些因素影响选择的顺序。

start 选择模型 gov 是否有硬性治理 或主权约束? start->gov sov 欧盟区域、Mistral, 或自托管开放权重 gov->sov 欧盟驻留 / 严格数据 host 租用还是自有? gov->host cloud 已在哪里 被计费? host->cloud 租用(托管 API) hw 硬件预算? host->hw 自有(开放权重) bedrock Bedrock:Claude、Nova, 现含 OpenAI cloud->bedrock AWS azure Azure OpenAI:GPT-5.x cloud->azure Azure vertex Vertex:Gemini、Claude cloud->vertex GCP task 任务形态? cloud->task 云无关 small Gemma 4、Ministral 3、 Qwen3.5 小型、gpt-oss-20b hw->small 笔记本 / 16-24GB mid gpt-oss-120b、Gemma 4 31B、 Qwen3.5-35B-A3B、OLMo 3-Think 32B hw->mid 单张 80GB GPU big DeepSeek-V4-Pro、Kimi K2.6、 Mistral Large 3、GLM-5.2 hw->big 集群 code Claude Opus 4.8 / GPT-5.5 task->code 智能体编码 mm Gemini 3.1 Pro Preview task->mm 重多模态 cheap Grok 4.1 Fast、DeepSeek V4-Flash、 Gemini Flash-Lite、Haiku 4.5 task->cheap 高量低成本 rag Cohere Command A + Embed v4, 之上叠一个前沿模型 task->rag 企业 RAG
图 81.2. 2026 年年中挑选模型的决策顺序。计费所在的云和治理约束,通常比质量更早决定选择。

把它写成经验法则,大致按决定顺序:

  • 先按落脚在哪里挑。 计费所在的云,通常在采购、数据驻留和承诺用量折扣上胜出。重度 AWS 用户走 Bedrock;Azure 走 Azure OpenAI;GCP 走 Vertex AI。
  • 工作负载是智能体编码、长程工具使用,或安全敏感,且看重可靠性和固定、可复现的模型 ID 时,选 Claude(Opus 4.8 / Sonnet 5)
  • 想要最宽的生态与工具,或已在 Azure 上时,选 GPT-5.5
  • 已在 GCP 上,或输入确实是多模态(一个模型里有音频、视频、PDF)时,选 Gemini 3.1 Pro Preview
  • 每 token 价格和超长上下文占主导、且治理允许时,选 Grok 或 DeepSeek
  • 必须掌控成本、延迟、驻留或微调权利(第 84 章)、且手上有硬件时,选一个开放家族(默认 Qwen3.5/3.6)。前沿智能体编码选 DeepSeek-V4 或 GLM-5.2,单 GPU 选 Gemma 4,可复现是硬要求时选 OLMo 3。

长上下文值得单独提醒。它昂贵:OpenAI 对 270K 及以上的提示按溢价计费,Gemini 对超过 200K 的输入价格大致翻倍。能用检索就不要把材料全部塞进窗口(第 86 章);这通常比依赖裸上下文长度更便宜、更可靠。

阈值和越过悬崖后的倍率会改变交叉点:在某个上下文长度之后,把整段材料塞进窗口不再划算,检索一个固定的小切片更便宜。

图 81.3. 同一个回答的两条成本线。直接填满上下文窗口会随上下文长度按每 token 输入价格直线增长,所以提示越长,成本就成比例越高。检索为一个小检索切片付一笔大致固定的成本,再加上它的嵌入与重排开销,随上下文增长几乎持平。交叉点就是这样一个上下文长度:越过它,检索比直接填满窗口更便宜。调高长上下文价格,或调低检索固定成本,交叉点就向左滑,检索会更早占优。
图 81.4. 本章的决策框架,可以一步步走。回答每一个分支,路径就通向一份候选名单;点「start over」可换一条路再走。这些推荐是本书自己的、截至 2026 年的快照,是方向性的指引,而非定论。示意性。
import numpy as np
import matplotlib.pyplot as plt
base = 2.0 / 1e6           # 悬崖以下每个输入 token 的美元单价
threshold = 200_000        # token 数;价格拐点在此
mult = 2.0                 # 越过悬崖的 token 边际成本高出这么多
retrieved = 8_000          # 改用检索时固定的小窗口
n = np.linspace(0, 600_000, 400)
over = np.maximum(n - threshold, 0)
stuff = base * (np.minimum(n, threshold) + over * mult)  # 分档计价,非线性平坦
retrieve = np.full_like(n, base * retrieved)             # 检索成本是平的
plt.plot(n / 1e3, stuff, label="塞满窗口")
plt.plot(n / 1e3, retrieve, "--", label=f"检索 {retrieved // 1000}K")
plt.axvline(threshold / 1e3, color="gray", ls=":", label="价格悬崖")
plt.xlabel("相关 token 数(千)"); plt.ylabel("每次调用成本(美元)")
plt.legend(); plt.title("长上下文悬崖 vs 检索"); plt.show()
print(f"在 400K token: 塞满窗口=${base*(threshold+200_000*mult):.3f}, "
      f"检索=${base*retrieved:.3f}")

一个合理的默认,以及为什么

截至 2026 年年中,对一支构建智能体与 检索增强生成(RAG) 功能、且未锁定特定云的典型产品团队:

  • 托管默认:Anthropic Claude。 Sonnet 5 作日常主力:它于 2026-06-30 发布,接替 Sonnet 4.6,智能体表现接近 Opus,优惠价 $2 / $10;遇到最难的智能体与编码步骤再升级到 Opus 4.8。两者都带固定模型 ID,并在四大接入层上延续了这个家族过硬的智能体编码记录;不过一个上线才一天的默认,仍要先过自己的评测门,才能替换掉固定的 4.6。注意上文争议框里的协调结论:Fable 5 与 Mythos 5 登顶榜单,因出口指令消失,三周后才回来,所以默认要押在能可靠调用的模型上,并留好固定的回退。榜上最佳,不等于可以调用。
  • 强力备选: GPT-5.5 用于最宽生态或 Azure;Gemini 3.1 Pro Preview 用于 GCP 或多模态。
  • 自托管默认:Qwen3.5/3.6 家族(Apache-2.0),2026 年最全面的真正开放谱系,前沿智能体编码配 DeepSeek-V4 或 GLM-5.2,单 GPU 配 Gemma 4,需要完整可复现时配 OLMo 3。

不要把单一厂商写死。在前面放一个网关(gateway),也就是模型调用的路由与策略层,以便按任务路由和故障切换,并每季度重估默认;前几名之间的差距很小,版本不断更替。第 88 章 对比了各个网关选项,也包括作者自己的 Lux,在那里它是一个已披露的示范案例,而非中立之选。这些默认只是一种起步姿态,不是裁决。裁决出自自己的评测。

固定并评测:最终决定的那一步

公开榜把候选收窄到三四个。最后能挑出赢家的,是自己的离线评测,因为只有它匹配自己的分布、提示、工具和验收门槛。

两条纪律让这套做法落地。把每个模型 ID 固定到配置里的一个快照,绝不用「latest」,这样厂商的小版本就无法悄悄改变行为。把评测集当作仓库里一份带版本的契约,像测试套件一样:换模型是对它的一个 diff,改提示是对它的一个 diff,CI 在任何升级前先跑它。用真实流量构建它(50 到 200 条就够起步),尽量用可验证的评分器打分(精确匹配、单元测试),只在不得已时才用 LLM 裁判(第 50 章),并始终把成本和延迟与准确率并列报告,绝不只报准确率。被记录的生产失败,成为下个季度的评测条目。

# eval.yaml  (versioned in-repo; CI gate on every model or prompt change)
dataset: ./evals/support_v7.jsonl    # private, from real traffic, versioned
candidates:                          # shortlist from the public boards
  - anthropic/claude-opus-4-8        # pinned snapshot IDs, never "latest"
  - openai/gpt-5.5
  - google/gemini-3.1-pro-preview
graders:
  - type: exact_match                # verifiable wherever possible
  - type: unit_test                  # for code-shaped outputs
  - type: llm_judge                  # sparingly; pin the judge + rubric version
    judge_model: pinned-strong-model
    rubric: ./evals/rubric_v3.md
report:
  axes: [accuracy, cost_per_task, p95_latency]   # never accuracy alone
  ci: bootstrap_95                   # report intervals; a single number lies
gate:
  block_merge_if: accuracy_drop > 2pct OR p95_latency_regression > 15pct

接入技术栈

应用永远不该直接对接厂商的原始 SDK。它对接一个网关,由网关持有密钥、强制每个团队的预算与速率上限、归一化请求形态,并在提供方之间故障切换(第 88 章)。对闭源 API,没有需要自己运维的服务层,所以网关就是控制点;对开放权重,网关坐在自己的推理服务器前面,而后者暴露同一套 OpenAI 兼容 API,所以智能体代码在两者之间无需改动。图 81.5 展示了这个接缝。

app 应用 / 智能体 gw LLM 网关 密钥、预算、路由、回退 app->gw tools 工具 / MCP 服务器 app->tools hosted 托管 API OpenAI / Anthropic / Gemini / ... gw->hosted selfhost 自托管服务器 vLLM / SGLang 开放权重模型 gw->selfhost obs 可观测性 token、延迟、成本、评测 gw->obs ret 检索 嵌入 + 向量库 ret->app eval 固定的评测门(CI) eval->gw 批准一次模型升级
图 81.5. 模型选择插入的位置。应用只对接网关;固定的模型 ID 和评测门坐在排行榜与生产之间。

一份与提供方无关的路由配置,把按任务的选择和回退链写明白,并守住长上下文的价格悬崖:

# gateway routing (illustrative; every model is a pinned snapshot ID)
default_model: anthropic/claude-sonnet-5
routes:
  - match: { task: hard_coding }      # escalate the gnarly agentic steps
    model: anthropic/claude-opus-4-8
  - match: { task: multimodal }       # audio / video / pdf in one model
    model: google/gemini-3.1-pro-preview
  - match: { task: bulk_cheap }       # high-volume, cost-capped
    model: deepseek/deepseek-v4-flash
fallbacks:
  anthropic/claude-opus-4-8: [openai/gpt-5.5, google/gemini-3.1-pro-preview]
limits:
  long_context_guard: 200000          # warn before the >200K price cliff

模型选择最后落在三条轴上。能力是排行榜衡量、自己的评测确认的东西。效率是每任务成本与延迟,这就是为什么任何排名离开了旁边的价格与速度轴,都毫无意义。信任是许可证、治理姿态和可用性保证:Fable 5 三周的停摆提醒我们,一个无法可靠且合法调用的模型,对使用方而言根本没有能力。在三者上一并挑选,固定结果,让自己的评测、而非排行榜,作出最终选择。

延伸阅读

一手来源优先。

  • Anthropic, “Models overview” (Opus 4.8、Sonnet 4.6、Haiku 4.5;ID、上下文、定价), n.d.. platform.claude.com
    Anthropic Claude API 模型概览页面列出了可用的大语言模型(claude-fable-5、claude-opus-4-8、claude-sonnet-4-6、claude-haiku-4-5),并提供各平台 API ID、上下文窗口及迁移指南。
  • Anthropic, “Anthropic newsroom” (Opus 4.8 于 2026-05-28;Fable 5 / Mythos 5 于 2026-06-09;2026-06-12 暂停、2026-06-30 恢复;Sonnet 5 于 2026-06-30), n.d.. anthropic.com
    Anthropic 新闻室是一个新闻索引页,汇集了 Anthropic 的产品发布、政策声明和合作公告,包括 Claude 模型更新等公司动态。
  • Anthropic, “Introducing Claude Sonnet 5” (2026-06-30;优惠价 $2 / $10 至 2026-08-31,此后 $3 / $15), 2026. anthropic.com
  • Anthropic, “An update on Fable 5 and Mythos 5 access” (2026-06-12 暂停,六月底恢复), 2026. anthropic.com
  • OpenAI, “Introducing GPT-5.5,” n.d.. openai.com
  • OpenAI, “API pricing,” n.d.. openai.com
  • Google, “Gemini API pricing,” n.d.. ai.google.dev
    Google 官方 Gemini 开发者 API 定价页面,列出各 Gemini 模型的输入、输出及前缀缓存每词元价格。
  • Google, “Gemini API changelog,” n.d.. ai.google.dev
    Gemini API 更新日志是 Google 官方发布说明页面,追踪 Gemini API 的版本更新、新模型发布与功能变更。
  • Mistral AI, “Mistral 3” (Large 3、Ministral 3、转向 Apache-2.0), n.d.. mistral.ai
    Mistral 3 是一个以 Apache 2.0 许可发布的模型家族,包含具有 41B 激活参数和 675B 总参数的稀疏混合专家模型 Mistral Large 3,以及面向边缘部署、支持多模态与多语言的 Ministral 3 密集模型系列(3B、8B、14B)。
  • Google, “Gemma 4 model card” (Apache-2.0、尺寸), n.d.. ai.google.dev
    Gemma 4 是 Google DeepMind 发布的开放权重多模态模型系列,提供 Dense 与混合专家(MoE)架构,规模从 E2B 到 31B,支持文本、图像与音频输入,上下文窗口最长达 256K 词元。
  • Qwen, “Qwen,” n.d.. huggingface.co
    Qwen 的 Hugging Face 组织主页是阿里云发布 Qwen 系列大语言模型(LLM)和大型多模态模型的官方发布中心。
  • Qwen, “Qwen blog,” n.d.. qwen.ai
    Qwen 博客是阿里巴巴发布 Qwen 系列大语言模型的官方页面,涵盖 Qwen3、QwQ 及多模态变体的模型公告、能力介绍与更新说明。
  • DeepSeek-AI, “DeepSeek-V4-Pro,” n.d.. huggingface.co
    DeepSeek-V4-Pro 是一个 1.6T 参数的混合专家(MoE)大语言模型(激活参数 49B),支持 100 万词元上下文,其 Max 推理模式在编程和推理基准上达到开源最优水平。
  • DeepSeek, “Models & Pricing” (一手 API:V4-Flash $0.14 / $0.28,V4-Pro $0.435 / $0.87,均 1M 上下文), n.d.. api-docs.deepseek.com
  • Z.ai, “GLM-5.2” (权重,MIT,753B/40B,1M 上下文;2026-06-16 发布), 2026. huggingface.co
  • Willison, “GLM-5.2 is probably the most powerful text-only open weights LLM” (独立评述;Artificial Analysis 开放权重榜首), 2026. simonwillison.net
  • MarkTechPost, “Moonshot AI releases Kimi K2.7-Code” (2026-06-12;基准均为厂商自报), 2026. marktechpost.com
  • Allen Institute for AI, “OLMo 3” (完全开放:权重、数据、代码), n.d.. allenai.org
    OLMo 3 是 Ai2 推出的完全开放大语言模型系列(7B 与 32B),端到端公开数据、代码与训练决策,以推动透明的开源 AI 发展。
  • DataCamp, “Llama 4 license and MAU terms” (交叉核对的报道), n.d.. datacamp.com
  • LMArena, “LMArena / Arena leaderboard” (人类偏好 Elo), n.d.. arena.ai
    LMArena 排行榜通过匿名盲测中众包人类成对比较投票得出的 Elo 分数,对大语言模型(LLM)进行排名。
  • Artificial Analysis, “Artificial Analysis Intelligence Index methodology” (Index v4.1、标准化框架、成本与速度), n.d.. artificialanalysis.ai
    Artificial Analysis Intelligence Index 是一个综合基准,整合了智能体、编程、科学推理和通用任务等 9 项评测,用于比较大语言模型(LLM)的综合能力。
  • Epoch AI, “Epoch AI benchmarks” (FrontierMath、GPQA Diamond、Epoch Capabilities Index), n.d.. epoch.ai
    Epoch AI 基准数据库汇集内部评测与外部来源的 AI 模型成绩,追踪各基准随时间的能力趋势。
  • SWE-bench, “SWE-bench” (Verified、Lite、Multilingual、Multimodal), n.d.. swebench.com
    SWE-bench 是一个基准测试与官方排行榜,用于评估大语言模型(LLM)解决真实 GitHub 软件工程问题的能力,涵盖 Verified、Multilingual、Multimodal、Lite 等多个变体。
  • LiveCodeBench, “LiveCodeBench” (按日期标注、抗污染), n.d.. livecodebench.github.io
    LiveCodeBench 是一个持续更新、无污染的代码基准排行榜,对大语言模型(LLM)在编程任务上进行整体评测。
  • Scale AI, “Scale SEAL leaderboards” (私有、留出), n.d.. labs.scale.com
    Scale SEAL 是一组专家策划的私有排行榜,使用留出集对大语言模型和 AI 智能体在编程、推理、安全性、多语言及智能体任务上进行综合评测。
  • CNBC, “Anthropic disables access to Fable 5 and Mythos 5 to comply with government directive,” 2026. cnbc.com
    Anthropic 为遵守美国政府出口管制指令,停用了 Fable 5 和 Mythos 5 模型的访问权限。
  • Al Jazeera, “US orders Anthropic to disable AI models for all foreign nationals,” 2026. aljazeera.com
    半岛电视台新闻报道:美国政府发布出口管制指令,要求 Anthropic 对所有外国国民暂停提供 Fable 5 和 Mythos 5 模型的访问。
  • Fortune, “Anthropic disables Fable and Mythos over export controls and national-security threat,” 2026. fortune.com
    Anthropic 在美国政府以 Fable 5 越狱漏洞为由对外国用户实施出口管制指令后,禁用了其 Fable 和 Mythos 大语言模型。
  • CNBC, “Anthropic says Trump admin has lifted export controls on Claude Fable 5 and Mythos 5” (2026-06-30 管制解除;Mythos 5 向获准美国机构恢复,Fable 5 于 2026-07-01 全球恢复), 2026. cnbc.com

评论

登录后评论