选择模型
任何技术栈里,第一个落地的决定就是调用哪个模型。它看起来像个质量问题,其实多半不是。稳妥的顺序是先把模型放到从闭源到开源的坐标轴上,读懂许可证究竟允许什么;再在三个排行榜之间交叉验证,不把任何单一榜单当成最终依据;随后跑一套小规模评测来确定选择。选定之后,还要把结果固定下来、接入技术栈,让某个厂商每周一次的小版本更新无法悄悄改变自己的产品。对应的理论背景在 第 73 章 和 第 47 章:前者勾勒开放性这条坐标轴,后者说明为什么一个公布出来的分数,是关于「模型加测量框架」二者合一的论断。
下文每一个模型名称、价格、上下文长度和排名,都是 2026 年年中(2026-07-01) 的快照,并尽可能标注了一手来源。版本每周都在发布,价格在变,排名在相互重叠的置信区间内轮换。请把这里每一个具体数字,都当作一个在投入预算之前需对照所链接一手文档来确认的假设,绝不要当成永恒事实。真正耐久的内容,是这些类别、权衡,以及决策与接线的流程:要记取的是方法。
主坐标轴:租用还是自有
有一条坐标轴几乎能预测模型选择的其余一切,而它不是质量。它问的是:究竟是在一个计量计费的 API 后面租用能力,还是自有权重、自己运行。
前沿托管模型是某个实验室愿意暴露出来的最强通用模型,部署在按 token 计费的 API 后面。向它发送 token,由实验室计费,而权重从不归自己所有。实验室拥有整个服务栈:批处理、KV 缓存、推测解码、自动扩缩容和加速器(第 82 章)。于是只能继承它的延迟分布和速率上限,把这些服务侧优化当作可购买的服务档位来使用(缓存输入定价、批处理与优先级档位),而不必亲自运维它们。
开放权重模型则是那种可以下载训练好的参数、在自己硬件上运行的模型。这一侧自担运维负担,换来的是对成本、延迟、数据驻留以及微调权利的掌控。所选的模型家族,决定了推断服务器(vLLM、SGLang、llama.cpp;见 第 82 章)必须加载什么、需要多少显存、能达到多大吞吐。
这正是全书反复描绘的取舍:租用能力,交出服务栈的掌控权;或者自托管权重,自担运维。到了 2026 年,那道曾让此事成为质量妥协的差距,已大体闭合。最好的开放权重,如今在编码与推理榜单上已逼近闭源前沿模型一两个百分点,这就把「自托管还是调 API」从一种让步,变成了一个真正的架构决策(据 Artificial Analysis 与各开源 LLM 排行榜,截至 2026-06)。
许可证先于基准
对开放权重而言,许可证往往比基准更早决定选择,因为无论分数多高,一份许可证都可能让某个模型在产品里直接出局。三个层级很要紧。
- 真正开放(Apache-2.0、MIT)。 没有用户上限,没有使用领域限制,没有地域排除条款。截至 2026 年年中,Qwen、DeepSeek、Mistral 当前旗舰、Gemma 4、gpt-oss、GLM 和 OLMo 都在这一档。若可能扩张到几千万用户以上、要在欧盟运营、或者想要零使用领域歧义,就选这一档。
- 源可得(受限)。 权重可下载,但许可证附加了上限或排除条款。Meta 的 Llama 4 Community License 仅在 7 亿月活以下允许商用,并且对欧盟境内被许可方排除多模态功能,之上还有一份可接受使用政策。这不是 OSI 意义上的开放。在它上面构建之前,先去读真正的
LICENSE。 - 闭源(无权重)。 托管 API 前沿。拿到的是一份合同和一个端点,不是参数。
第二条、与之正交的区分是开放权重对完全开放。多数「开放」模型只发布权重;训练数据和完整配方仍是私有的。一小部分(AI2 的 OLMo)连数据、代码和检查点也一并发布。如果需要可复现、可审计,或从零重训的能力,这个差别就是全部关键,而它与许可证档级互相独立。
耐久的规则是:对任何可能扩张、或要在受监管地区上线的东西,先读许可证,再读排行榜。
玩家一览,带日期与出处
两张表给出 2026 年年中的快照。定价为标准同步调用每百万 token 的输入/输出;批处理档位通常约半价,缓存输入折扣很大。
前沿托管模型
| 提供方(家族) | 许可证 / 接入 | 最适合 | 快照备注(截至 2026-07) |
|---|---|---|---|
| OpenAI(GPT-5.x) | 闭源 API;亦在 Azure OpenAI,现已上 Amazon Bedrock | 编码、广泛的智能体工作、最宽生态 | GPT-5.5 旗舰约 $5 / $30,约 1.05M 上下文;pro 变体更高。270K 及以上的提示按溢价计费。按累计消费分档。[official] |
| Anthropic(Claude) | 闭源 API;亦在 Bedrock、Vertex AI、Microsoft Foundry | 长程智能体编码、可靠性、安全敏感工作 | Opus 4.8 约 $5 / $25,1M 上下文,已 GA;Sonnet 5(2026-06-30 发布)优惠价约 $2 / $10 至 2026-08-31,此后约 $3 / $15,接替 Sonnet 4.6;Haiku 4.5 约 $1 / $5。模型 ID 是固定快照。Fable 5 / Mythos 5 于 2026-06-12 暂停访问,出口指令六月底解除后已恢复(见下文)。[official] |
| Google(Gemini) | 闭源 API(AI Studio / Gemini API)+ Vertex AI | 原生多模态(文本、图像、音频、视频、PDF)、GCP 用户 | Gemini 3.1 Pro Preview 约 $2 / $12(≤200K),更高额度更贵;在主流厂商中可摄入最宽的模态集合。3.5 正在铺开。上下文:模型卡约 1.05M;部分追踪器称 2M(视为未证实)。[official] |
| xAI(Grok) | 闭源 API(x.ai)、X 集成 | 成本敏感的长上下文、实时/社交数据 | Grok 4.3 约 $1.25 / $2.50,1M 上下文;Grok 4.1 Fast 约 $0.20 / $0.50,最高约 2M 上下文。极具性价比。[aggregator] |
| DeepSeek | 混合:开放权重 + 低价一手 API | 最便宜的近前沿质量、成本敏感的批量 | 一手 API 已换代到 V4:V4-Flash 约 $0.14 / $0.28,V4-Pro 约 $0.435 / $0.87,均为 1M 上下文,缓存输入折扣很大。部分组织对其治理有顾虑;核实政策契合度。[official] |
| Amazon(Nova) | 闭源,经 Amazon Bedrock | AWS 原生性价比、定制构建(Nova Forge) | 定位性价比,而非榜首质量。Bedrock 同时是 Anthropic、Meta、Mistral、Cohere、OpenAI 的接入层。[aggregator] |
| Mistral | 混合:部分开放权重 + 托管 API;亦在 Bedrock/Vertex/Azure | 欧盟选项、多语言、欧盟数据驻留 | Mistral Large 3 旗舰。主权定位强;在公开榜单上并非始终处于绝对前沿。[aggregator] |
| Cohere | 闭源 API;亦在 Bedrock/Vertex/Azure | 企业 RAG、检索 + 重排、VPC 部署 | Command A 负责生成,Embed v4 是常见检索默认。面向企业,而非追逐竞技场排名。[aggregator] |
开放权重家族
参数记法对 Mixture-of-Experts(第 9 章)为 总量 / 激活;A3B 表示每 token 约 3B 激活参数。
| 家族(出身) | 许可证 | 最适合 | 快照备注(截至 2026-07) |
|---|---|---|---|
| Qwen3.5 / 3.6(阿里巴巴) | Apache-2.0 | 最全面的开放家族;智能体编码、视觉、201 种语言 | 尺寸阶梯 0.8B 到 397B-A17B;带 thinking 开关(开或关分步推理,以延迟换准确率)。Qwen3.6-35B-A3B 为当前中等尺寸开放变体。在笔记本上原型、扩到集群,许可证不变。 |
| DeepSeek-V4 | MIT | 开放权重前沿的智能体编码 | V4-Pro 1.6T/49B(1M 上下文),V4-Flash 284B/13B。三种推理模式。集群级。R2 推理线截至 2026-06 未发布。 |
| Llama 4(Meta) | Community License(受限) | 超长上下文、成熟生态 | Scout 109B/17B(10M 上下文),Maverick 约 400B/17B(1M 上下文)。7 亿月活上限;对欧盟被许可方排除多模态。源可得,非 OSI 开放。 |
| Mistral Large 3 / Small 4(Mistral) | Apache-2.0 | 宽松的欧盟自研;Small 4 融合推理+视觉+编码 | Large 3 675B/41B,256K 上下文。Small 4 约 119B/6B,单台中等机器。旗舰转向 Apache-2.0。 |
| Gemma 4(Google) | Apache-2.0 | 小/中型每字节能力最佳;单 GPU | E2B、E4B、26B MoE(激活约 3.8B)、31B 稠密;文本+图像(部分含音频)。从自定义 Gemma 条款转为 Apache-2.0。 |
| gpt-oss(OpenAI) | Apache-2.0 | 单张 80GB GPU(120b)或 16GB 边缘(20b)上的推理 + 工具调用 | gpt-oss-120b 117B/5.1B,gpt-oss-20b 21B/3.6B;纯文本。2025-08 发布,非 2026 新品。 |
| Kimi K2.6(Moonshot) | Modified-MIT | 长程编码、多智能体编排 | 1T/32B 激活,256K 上下文,原生多模态。K2.7-Code(2026-06-12)为当前编码变体,提升数字来自厂商自报。超大规模部署有署名条款;先读 LICENSE。 |
| GLM-5.x(Z.ai) | MIT | 长程智能体工程 | GLM-5.1 约 754B/40B,200K 上下文。GLM-5.2 权重(753B/40B,1M 上下文)已于 2026-06-16 以 MIT 发布,发布时领跑各开放权重榜单。 |
| OLMo 3(Ai2) | Apache-2.0(完全开放) | 可复现、可审计 | 7B 与 32B;Base/Think/Instruct。发布数据(Dolma 3)、代码、检查点。罕见的完全开放、近前沿选项。 |
对开放权重而言,下层的服务层决定上层的模型。Mixture-of-Experts 模型以近稠密的推断成本,换来更高的质量上限,但总参数仍必须装进显存,所以一个 1.6T/49B 的模型即便每 token 只激活 49B,也是集群模型。一个 31B 的稠密模型,可能比 122B-A10B 的 MoE 更易服务、更易量化(第 34 章),尽管激活算力相近。先收窄候选清单的,是手上的硬件,而不是基准。
排行榜只收窄候选
排行榜是一个收窄候选的工具,不是裁决。第 47 章 给出的最重要的实务教训是:一个公布出来的分数,是关于「模型加测量框架」二者合一的论断,而不是关于模型本身。 对同一份权重做独立重跑,会因提示模板、系统提示、工具运行框架、采样参数和评分器的不同,而摆动 10 到 20 个百分点。2026 年反复出现的模式是:一个模型在公开、可验证的编码榜上的分数,明显高于同一份权重在留出框架上的分数,而那道差距是框架加上可能的污染,而非模型本身的变化。
所以要读三个榜,而不是一个,并把榜单对准自己的问题。
| 要问的问题 | 该读的榜 | 它无法说明的 |
|---|---|---|
| 「在开放式对话里用户更喜欢哪个?」 | LMArena / arena.ai(人类偏好 Elo,一种两两对比评分) | 正确性。偏好奖励自信、更长、排版更好的回答;高 Elo 配错误答案是真实存在的失败模式。 |
| 「在我的延迟下每美元最佳智能?」 | Artificial Analysis(智能指数,标准化框架,含成本与 tokens/秒轴) | 那套标准化框架是否匹配自己的提示、工具与采样。 |
| 「一个高的公开分是否虚高?」 | 抗污染榜:FrontierMath、LiveCodeBench、Epoch、Scale SEAL | 覆盖广度;这些更新更慢、覆盖任务更少。 |
| 「它能跑我的智能体吗?」 | 可验证的智能体榜:SWE-bench Verified、Terminal-Bench、τ-bench、Aider polyglot、BFCL | 单轮知识质量;这些考验的是运行框架(第 52 章)。 |
| 「新版本是否退化了?」 | 已饱和的旧榜(MMLU、HumanEval)仅作下限 | 前沿排名;榜首集群在这里只是噪声。 |
三个榜一致是强信号。不一致则恰好点出哪一条轴脆弱。污染的征兆是:一个模型公开集分数与其留出或截止后分数之间的大差距。小差距是可信信号,大差距是危险信号。
2026 年年中,文本榜首集群落在相互重叠的置信区间里,且每周轮换,所以任何单一的「第一」论断都是一个档位,不是赢家。更糟的是,排名是必要而非充分条件。最典型的提醒:Anthropic 的 Fable 5 与 Mythos 5 在发布时(2026-06-09)登顶多个榜单,而接入在 2026-06-12 被暂停,遵从一项美国出口管制指令(CNBC、Al Jazeera、Fortune、Anthropic)。这项指令在月底解除:Mythos 5 经 2026-06-26 的政府批准后向获准的美国机构恢复,Fable 5 于 2026-07-01 面向全球恢复(Anthropic、CNBC)。恢复并没有让这个教训过时,反而把它坐实了:一个模型可以在三周内消失又回来,节奏握在别人手里。一个登顶的模型,可能被出口管制、被区域锁定、被限速,或超出预算。要在自己可用、且政策允许的模型里挑选,再在该集合内排名,并给选中的那一个留好固定的回退。
一套决策框架
选型很少是「哪个分最高」。它是在哪里被计费、任务的形态、上下文对成本、治理,以及(对开放权重)手上的硬件这几者的交集。图 81.2 走一遍这些因素影响选择的顺序。
把它写成经验法则,大致按决定顺序:
- 先按落脚在哪里挑。 计费所在的云,通常在采购、数据驻留和承诺用量折扣上胜出。重度 AWS 用户走 Bedrock;Azure 走 Azure OpenAI;GCP 走 Vertex AI。
- 当工作负载是智能体编码、长程工具使用,或安全敏感,且看重可靠性和固定、可复现的模型 ID 时,选 Claude(Opus 4.8 / Sonnet 5)。
- 当想要最宽的生态与工具,或已在 Azure 上时,选 GPT-5.5。
- 当已在 GCP 上,或输入确实是多模态(一个模型里有音频、视频、PDF)时,选 Gemini 3.1 Pro Preview。
- 当每 token 价格和超长上下文占主导、且治理允许时,选 Grok 或 DeepSeek。
- 当必须掌控成本、延迟、驻留或微调权利(第 84 章)、且手上有硬件时,选一个开放家族(默认 Qwen3.5/3.6)。前沿智能体编码选 DeepSeek-V4 或 GLM-5.2,单 GPU 选 Gemma 4,可复现是硬要求时选 OLMo 3。
长上下文值得单独提醒。它昂贵:OpenAI 对 270K 及以上的提示按溢价计费,Gemini 对超过 200K 的输入价格大致翻倍。能用检索就不要把材料全部塞进窗口(第 86 章);这通常比依赖裸上下文长度更便宜、更可靠。
阈值和越过悬崖后的倍率会改变交叉点:在某个上下文长度之后,把整段材料塞进窗口不再划算,检索一个固定的小切片更便宜。
import numpy as np
import matplotlib.pyplot as plt
base = 2.0 / 1e6 # 悬崖以下每个输入 token 的美元单价
threshold = 200_000 # token 数;价格拐点在此
mult = 2.0 # 越过悬崖的 token 边际成本高出这么多
retrieved = 8_000 # 改用检索时固定的小窗口
n = np.linspace(0, 600_000, 400)
over = np.maximum(n - threshold, 0)
stuff = base * (np.minimum(n, threshold) + over * mult) # 分档计价,非线性平坦
retrieve = np.full_like(n, base * retrieved) # 检索成本是平的
plt.plot(n / 1e3, stuff, label="塞满窗口")
plt.plot(n / 1e3, retrieve, "--", label=f"检索 {retrieved // 1000}K")
plt.axvline(threshold / 1e3, color="gray", ls=":", label="价格悬崖")
plt.xlabel("相关 token 数(千)"); plt.ylabel("每次调用成本(美元)")
plt.legend(); plt.title("长上下文悬崖 vs 检索"); plt.show()
print(f"在 400K token: 塞满窗口=${base*(threshold+200_000*mult):.3f}, "
f"检索=${base*retrieved:.3f}")
一个合理的默认,以及为什么
截至 2026 年年中,对一支构建智能体与 检索增强生成(RAG) 功能、且未锁定特定云的典型产品团队:
- 托管默认:Anthropic Claude。 Sonnet 5 作日常主力:它于 2026-06-30 发布,接替 Sonnet 4.6,智能体表现接近 Opus,优惠价 $2 / $10;遇到最难的智能体与编码步骤再升级到 Opus 4.8。两者都带固定模型 ID,并在四大接入层上延续了这个家族过硬的智能体编码记录;不过一个上线才一天的默认,仍要先过自己的评测门,才能替换掉固定的 4.6。注意上文争议框里的协调结论:Fable 5 与 Mythos 5 登顶榜单,因出口指令消失,三周后才回来,所以默认要押在能可靠调用的模型上,并留好固定的回退。榜上最佳,不等于可以调用。
- 强力备选: GPT-5.5 用于最宽生态或 Azure;Gemini 3.1 Pro Preview 用于 GCP 或多模态。
- 自托管默认:Qwen3.5/3.6 家族(Apache-2.0),2026 年最全面的真正开放谱系,前沿智能体编码配 DeepSeek-V4 或 GLM-5.2,单 GPU 配 Gemma 4,需要完整可复现时配 OLMo 3。
不要把单一厂商写死。在前面放一个网关(gateway),也就是模型调用的路由与策略层,以便按任务路由和故障切换,并每季度重估默认;前几名之间的差距很小,版本不断更替。第 88 章 对比了各个网关选项,也包括作者自己的 Lux,在那里它是一个已披露的示范案例,而非中立之选。这些默认只是一种起步姿态,不是裁决。裁决出自自己的评测。
固定并评测:最终决定的那一步
公开榜把候选收窄到三四个。最后能挑出赢家的,是自己的离线评测,因为只有它匹配自己的分布、提示、工具和验收门槛。
两条纪律让这套做法落地。把每个模型 ID 固定到配置里的一个快照,绝不用「latest」,这样厂商的小版本就无法悄悄改变行为。把评测集当作仓库里一份带版本的契约,像测试套件一样:换模型是对它的一个 diff,改提示是对它的一个 diff,CI 在任何升级前先跑它。用真实流量构建它(50 到 200 条就够起步),尽量用可验证的评分器打分(精确匹配、单元测试),只在不得已时才用 LLM 裁判(第 50 章),并始终把成本和延迟与准确率并列报告,绝不只报准确率。被记录的生产失败,成为下个季度的评测条目。
# eval.yaml (versioned in-repo; CI gate on every model or prompt change)
dataset: ./evals/support_v7.jsonl # private, from real traffic, versioned
candidates: # shortlist from the public boards
- anthropic/claude-opus-4-8 # pinned snapshot IDs, never "latest"
- openai/gpt-5.5
- google/gemini-3.1-pro-preview
graders:
- type: exact_match # verifiable wherever possible
- type: unit_test # for code-shaped outputs
- type: llm_judge # sparingly; pin the judge + rubric version
judge_model: pinned-strong-model
rubric: ./evals/rubric_v3.md
report:
axes: [accuracy, cost_per_task, p95_latency] # never accuracy alone
ci: bootstrap_95 # report intervals; a single number lies
gate:
block_merge_if: accuracy_drop > 2pct OR p95_latency_regression > 15pct
接入技术栈
应用永远不该直接对接厂商的原始 SDK。它对接一个网关,由网关持有密钥、强制每个团队的预算与速率上限、归一化请求形态,并在提供方之间故障切换(第 88 章)。对闭源 API,没有需要自己运维的服务层,所以网关就是控制点;对开放权重,网关坐在自己的推理服务器前面,而后者暴露同一套 OpenAI 兼容 API,所以智能体代码在两者之间无需改动。图 81.5 展示了这个接缝。
一份与提供方无关的路由配置,把按任务的选择和回退链写明白,并守住长上下文的价格悬崖:
# gateway routing (illustrative; every model is a pinned snapshot ID)
default_model: anthropic/claude-sonnet-5
routes:
- match: { task: hard_coding } # escalate the gnarly agentic steps
model: anthropic/claude-opus-4-8
- match: { task: multimodal } # audio / video / pdf in one model
model: google/gemini-3.1-pro-preview
- match: { task: bulk_cheap } # high-volume, cost-capped
model: deepseek/deepseek-v4-flash
fallbacks:
anthropic/claude-opus-4-8: [openai/gpt-5.5, google/gemini-3.1-pro-preview]
limits:
long_context_guard: 200000 # warn before the >200K price cliff
模型选择最后落在三条轴上。能力是排行榜衡量、自己的评测确认的东西。效率是每任务成本与延迟,这就是为什么任何排名离开了旁边的价格与速度轴,都毫无意义。信任是许可证、治理姿态和可用性保证:Fable 5 三周的停摆提醒我们,一个无法可靠且合法调用的模型,对使用方而言根本没有能力。在三者上一并挑选,固定结果,让自己的评测、而非排行榜,作出最终选择。
延伸阅读
一手来源优先。
- Anthropic, “Models overview” (Opus 4.8、Sonnet 4.6、Haiku 4.5;ID、上下文、定价), n.d.. platform.claude.comAnthropic Claude API 模型概览页面列出了可用的大语言模型(claude-fable-5、claude-opus-4-8、claude-sonnet-4-6、claude-haiku-4-5),并提供各平台 API ID、上下文窗口及迁移指南。
- Anthropic, “Anthropic newsroom” (Opus 4.8 于 2026-05-28;Fable 5 / Mythos 5 于 2026-06-09;2026-06-12 暂停、2026-06-30 恢复;Sonnet 5 于 2026-06-30), n.d.. anthropic.comAnthropic 新闻室是一个新闻索引页,汇集了 Anthropic 的产品发布、政策声明和合作公告,包括 Claude 模型更新等公司动态。
- Anthropic, “Introducing Claude Sonnet 5” (2026-06-30;优惠价 $2 / $10 至 2026-08-31,此后 $3 / $15), 2026. anthropic.com
- Anthropic, “An update on Fable 5 and Mythos 5 access” (2026-06-12 暂停,六月底恢复), 2026. anthropic.com
- OpenAI, “Introducing GPT-5.5,” n.d.. openai.com
- OpenAI, “API pricing,” n.d.. openai.com
- Google, “Gemini API pricing,” n.d.. ai.google.devGoogle 官方 Gemini 开发者 API 定价页面,列出各 Gemini 模型的输入、输出及前缀缓存每词元价格。
- Google, “Gemini API changelog,” n.d.. ai.google.devGemini API 更新日志是 Google 官方发布说明页面,追踪 Gemini API 的版本更新、新模型发布与功能变更。
- Mistral AI, “Mistral 3” (Large 3、Ministral 3、转向 Apache-2.0), n.d.. mistral.aiMistral 3 是一个以 Apache 2.0 许可发布的模型家族,包含具有 41B 激活参数和 675B 总参数的稀疏混合专家模型 Mistral Large 3,以及面向边缘部署、支持多模态与多语言的 Ministral 3 密集模型系列(3B、8B、14B)。
- Google, “Gemma 4 model card” (Apache-2.0、尺寸), n.d.. ai.google.devGemma 4 是 Google DeepMind 发布的开放权重多模态模型系列,提供 Dense 与混合专家(MoE)架构,规模从 E2B 到 31B,支持文本、图像与音频输入,上下文窗口最长达 256K 词元。
- Qwen, “Qwen,” n.d.. huggingface.coQwen 的 Hugging Face 组织主页是阿里云发布 Qwen 系列大语言模型(LLM)和大型多模态模型的官方发布中心。
- Qwen, “Qwen blog,” n.d.. qwen.aiQwen 博客是阿里巴巴发布 Qwen 系列大语言模型的官方页面,涵盖 Qwen3、QwQ 及多模态变体的模型公告、能力介绍与更新说明。
- DeepSeek-AI, “DeepSeek-V4-Pro,” n.d.. huggingface.coDeepSeek-V4-Pro 是一个 1.6T 参数的混合专家(MoE)大语言模型(激活参数 49B),支持 100 万词元上下文,其 Max 推理模式在编程和推理基准上达到开源最优水平。
- DeepSeek, “Models & Pricing” (一手 API:V4-Flash $0.14 / $0.28,V4-Pro $0.435 / $0.87,均 1M 上下文), n.d.. api-docs.deepseek.com
- Z.ai, “GLM-5.2” (权重,MIT,753B/40B,1M 上下文;2026-06-16 发布), 2026. huggingface.co
- Willison, “GLM-5.2 is probably the most powerful text-only open weights LLM” (独立评述;Artificial Analysis 开放权重榜首), 2026. simonwillison.net
- MarkTechPost, “Moonshot AI releases Kimi K2.7-Code” (2026-06-12;基准均为厂商自报), 2026. marktechpost.com
- Allen Institute for AI, “OLMo 3” (完全开放:权重、数据、代码), n.d.. allenai.orgOLMo 3 是 Ai2 推出的完全开放大语言模型系列(7B 与 32B),端到端公开数据、代码与训练决策,以推动透明的开源 AI 发展。
- DataCamp, “Llama 4 license and MAU terms” (交叉核对的报道), n.d.. datacamp.com
- LMArena, “LMArena / Arena leaderboard” (人类偏好 Elo), n.d.. arena.aiLMArena 排行榜通过匿名盲测中众包人类成对比较投票得出的 Elo 分数,对大语言模型(LLM)进行排名。
- Artificial Analysis, “Artificial Analysis Intelligence Index methodology” (Index v4.1、标准化框架、成本与速度), n.d.. artificialanalysis.aiArtificial Analysis Intelligence Index 是一个综合基准,整合了智能体、编程、科学推理和通用任务等 9 项评测,用于比较大语言模型(LLM)的综合能力。
- Epoch AI, “Epoch AI benchmarks” (FrontierMath、GPQA Diamond、Epoch Capabilities Index), n.d.. epoch.aiEpoch AI 基准数据库汇集内部评测与外部来源的 AI 模型成绩,追踪各基准随时间的能力趋势。
- SWE-bench, “SWE-bench” (Verified、Lite、Multilingual、Multimodal), n.d.. swebench.comSWE-bench 是一个基准测试与官方排行榜,用于评估大语言模型(LLM)解决真实 GitHub 软件工程问题的能力,涵盖 Verified、Multilingual、Multimodal、Lite 等多个变体。
- LiveCodeBench, “LiveCodeBench” (按日期标注、抗污染), n.d.. livecodebench.github.ioLiveCodeBench 是一个持续更新、无污染的代码基准排行榜,对大语言模型(LLM)在编程任务上进行整体评测。
- Scale AI, “Scale SEAL leaderboards” (私有、留出), n.d.. labs.scale.comScale SEAL 是一组专家策划的私有排行榜,使用留出集对大语言模型和 AI 智能体在编程、推理、安全性、多语言及智能体任务上进行综合评测。
- CNBC, “Anthropic disables access to Fable 5 and Mythos 5 to comply with government directive,” 2026. cnbc.comAnthropic 为遵守美国政府出口管制指令,停用了 Fable 5 和 Mythos 5 模型的访问权限。
- Al Jazeera, “US orders Anthropic to disable AI models for all foreign nationals,” 2026. aljazeera.com半岛电视台新闻报道:美国政府发布出口管制指令,要求 Anthropic 对所有外国国民暂停提供 Fable 5 和 Mythos 5 模型的访问。
- Fortune, “Anthropic disables Fable and Mythos over export controls and national-security threat,” 2026. fortune.comAnthropic 在美国政府以 Fable 5 越狱漏洞为由对外国用户实施出口管制指令后,禁用了其 Fable 和 Mythos 大语言模型。
- CNBC, “Anthropic says Trump admin has lifted export controls on Claude Fable 5 and Mythos 5” (2026-06-30 管制解除;Mythos 5 向获准美国机构恢复,Fable 5 于 2026-07-01 全球恢复), 2026. cnbc.com
评论
登录后评论