插图:tuput
中文
小米的MiMo-V2.6-Pro以46分在Artificial Analysis指数的开放权重模型中领先,排在智谱Z.ai的GLM-5.3和月之暗面Moonshot的Kimi K3之前。Anthropic的Claude Opus 5.5得58分。DeepSeek自己的报告说,它落后美国前沿3到6个月,而美国政府的测试中心说约为8个月。
2026年10月8日,在Artificial Analysis的智能指数(Intelligence Index)上排名最高的中国模型是小米的MiMo-V2.6-Pro,得46分,总排名第18。Anthropic的Claude Opus 5.5以58分领先同一张榜单,OpenAI的GPT-6 Astra和谷歌的Gemini 4 Argon得53分。据Trending Topics介绍,该指数把编程、智能体、知识工作和科学方面的十项评测合成一个分数。
有四个来源尝试把这段差距换算成月数,它们的答案从2个月到8个月不等。它们用的测试不同,拿来当标尺的美国模型也不同,这是它们意见不一的主要原因。
各实验室自己公布的最新发布数据
这些都是混合专家(mixture-of-experts)模型。每个token会被分派给一小组专门的子网络,因此「激活」参数量,即每个token实际用到的那部分可调数值,远小于总量。token是一个词或词的片段。
| 模型 | 总参数量 / 激活参数量 | 上下文窗口 | 许可证 |
|---|---|---|---|
| DeepSeek V4-Pro | 1.6万亿 / 490亿 | 100万token | MIT |
| DeepSeek V4.1 Flash | 5520亿 / 160亿 | 100万token | MIT |
| 月之暗面 Kimi K3 | 2.8万亿 / 1040亿 | 100万token | Kimi K3 License |
| 阿里巴巴 Qwen3.8-2.4T-A95B | 2.4万亿 / 950亿 | 262,144 token,可扩展到1,010,000 | Qwen3.8-Max License |
| 智谱Z.ai GLM-5.3 | 7530亿 / 400亿 | 100万token | GLM-5.3 License |
| 小米 MiMo-V2.6-Pro | 1.0万亿 / 420亿 | 100万token | MIT |
DeepSeek V4技术报告于2026年4月26日提交到arXiv,描述的是一个预览版本。报告说,V4-Pro预训练用了33万亿token,较小的V4-Flash用了32万亿token。报告称,在100万token的上下文下,V4-Pro所需的单token计算量是DeepSeek此前V3.2的27%,所需的内存缓存是其10%。V4.1 Flash和MiMo两行的数据来自Artificial Analysis的表格和Arena的许可证标签。
Kimi K3的模型卡给出了896个专家中选16个的布局,但没有给出训练token数,也没有说明训练硬件。Qwen开放的检查点只支持文本,其模型卡说思考模式无法关闭。托管版的Qwen3.8-Max增加了图像输入,并默认支持100万token。GLM-5.3沿用了GLM-5.2的基础模型,Z.ai的模型卡说,提升来自后训练,也就是用反馈对已完成的模型做调整的阶段。
这些模型卡上的基准分数都是各实验室自己公布的。DeepSeek的模型卡给出V4-Pro-Max在编程测试SWE-bench Verified上的得分为80.6。NIST的CAISI在同一项测试上测得74,并把差异归因于系统提示词、脚手架和token预算。
外部测试者测到了什么
Artificial Analysis在其指数的4.3.2版本上,列出的开放权重得分如下:MiMo-V2.6-Pro为46,GLM-5.3为45,Kimi K3为44,GLM-5.3-Flash为42,DeepSeek V4.1 Flash为39,Qwen3.8 27B(一个270亿参数的模型)为34,MiniMax-M3为29。Trending Topics报道完整的Qwen3.8 2.4T为39.9。Artificial Analysis表格上最好的美国开放模型是Thinking Machines的Inkling,得25分,以及英伟达的Nemotron 3 Ultra,得23分。
法国Mistral的Mistral Large 4预览版得38.4分,在开放模型中将排第八,tuput在Mistral Large 4那篇文章中报道过。成本差别很大。Trending Topics给出MiMo-V2.6-Pro每个指数任务为0.13美元,GLM-5.3、Kimi K3和Qwen3.8则各约2美元。
在Arena的文本排行榜上,Kimi K3(max)排第16位,得分1488,而谷歌Gemini 4 Argon为1525(Arena将其标为初步结果),Claude Opus 5.5为1507。MiMo-V2.6-Pro排第26,GLM-5.3排第27,DeepSeek V4.1 Flash排第39。在tuput读到的Artificial Analysis开放权重表格中,没有一个由IndiaAI使命出资的印度模型。该计划的预算、GPU和获得资助的开发者,见IndiaAI使命那篇文章。
开放权重,以及许可证的要求
「开放权重」指任何人都可以下载训练好的数值,而使用条款则因实验室而异。DeepSeek和小米使用MIT许可证,几乎没有什么条件。Trending Topics报道,Artificial Analysis把GLM-5.3、Kimi K3和大号的Qwen3.8归为商业使用受限,不过tuput读到的许可证文本设定的限制要窄一些。
Kimi K3的许可证要求,经营托管模型业务、任意12个月内收入超过2000万美元的公司,必须与月之暗面另行签订协议。月活用户超过1亿,或月收入达到2000万美元的产品,必须在界面上显示「Kimi K3」。内部使用不受限。
Qwen3.8-Max的许可证有同样的显示规则,并把另行授权的门槛设为:经营托管模型或AI工作助手业务的企业,12个月内收入5000万美元。Z.ai的GLM-5.3许可证允许商业使用,只有合并收入超过100亿美元的托管模型企业才需要经过Z.ai的安全审查。
训练成本的说法,以及它们没说的
最常被引用的数字是DeepSeek-V3的557.6万美元。V3论文是这样得出的:278.8万个H800 GPU小时,按每小时2美元的假定租价计算。论文明确说,这个总数只包括正式的训练运行,不包括此前的研究和消融实验,即用来选择架构、算法和数据的小规模测试。
V4报告给出了token数,但在tuput检索的文本中,没有美元成本,也没有GPU小时总数。Kimi K3的模型卡没有给出token数,也没有给出成本。
各实验室说自己用的是哪种芯片
DeepSeek的报告说,它的融合专家通信内核在英伟达GPU和华为昇腾NPU上都得到了验证,通用推理加速1.50到1.73倍,在强化学习推演这类对延迟敏感的工作上最高加速1.96倍。报告没有说训练这个模型用的是哪种芯片。
ChinaTalk的Irene Zhang、Aqib Zakaria和Jordan Schneider在4月27日写道,V4「仍然是在英伟达芯片上训练的」,这是他们对证据的解读,不是DeepSeek的说法。同一篇文章引用了DeepSeek发布公告中的一条脚注:「由于高端算力受限,V4-Pro的服务吞吐量目前有限。」文章还补充说,DeepSeek预计,一旦华为昇腾950超节点在2026年下半年大批量出货,Pro的价格会下降。
GLM-5.3的模型卡说,通过vLLM-Ascend、xLLM和SGLang支持在昇腾上部署,没有给出训练硬件。Kimi K3的模型卡说,它的部分评测是在英伟达H20 GPU上运行的。
在美国一侧,The Next Web 8月19日援引《金融时报》报道,字节跳动和腾讯各自收到了约1万块英伟达H200芯片。北京已要求企业把它们放在大陆之外,货物经由香港运送。据The Next Web说,7月,商务部副部长杰弗里·凯斯勒(Jeffrey Kessler)向国会表示,到货的「很少」。受限服务器被转移的问题,见tuput关于司法部就运往中国的服务器提起的起诉的报道。
对差距的四种估计
DeepSeek的报告说,V4-Pro-Max在标准推理测试上胜过GPT-5.2和Gemini-3.0-Pro,但略逊于GPT-5.4和Gemini-3.1-Pro。它据此认为,自己落后前沿大约3到6个月。
NIST的人工智能标准与创新中心(CAISI)在4月测试了V4 Pro,并于5月1日发布结论:其能力落后前沿约8个月。在CAISI的九项基准上,包括两项未向公众公开的,V4 Pro的表现与约8个月前发布的GPT-5相近。在ARC-AGI-2的半私有集上,它得46%,GPT-5.5为79%。CAISI说,它给出的落后月数来自一个近似能力的统计模型,而不是直接测量。
Nathan Lambert在9月21日写道,中国的开放权重模型大约落后美国封闭前沿2到5个月,这篇文章是由为国会简报会准备的证词扩写而成。他说,美国的开放模型落后OpenAI和Anthropic 6到9个月。他估计,蒸馏,即用另一个模型的输出来训练模型,使中国的差距缩小了1到2个月。
Epoch AI的Jack Edwards和Luke Emberson在5月29日报告说,自2026年1月以来,能力最强的开放权重模型在Epoch能力指数上平均落后封闭前沿四个月,按更严格的测试则是六个月,平均差距为8个指数点。这指的是一般的开放模型,不只是中国的。Epoch补充说,开放模型在私有基准上的得分往往更差,它的估计可能低估了真实差距。
资料来源与延伸阅读
- arXiv: DeepSeek-V4, Towards Highly Efficient Million-Token Context Intelligence (technical report, submitted 26 April 2026)
- Hugging Face: DeepSeek-V4-Pro model card
- arXiv: DeepSeek-V3 Technical Report
- Hugging Face: Kimi K3 model card (Moonshot AI)
- Hugging Face: Kimi K3 licence text
- Hugging Face: Qwen3.8-2.4T-A95B model card (Alibaba)
- Hugging Face: Qwen3.8-Max licence text
- Hugging Face: GLM-5.3 model card (Z.ai)
- Hugging Face: GLM-5.3 licence text
- Artificial Analysis: top open-weights models
- Artificial Analysis: leaderboard of all models by Intelligence Index
- Trending Topics: Mistral Large 4 on Artificial Analysis, Eighth Among Open Models (6 October 2026)
- Arena: text leaderboard
- NIST CAISI: Evaluation of DeepSeek V4 Pro (1 May 2026)
- Epoch AI: Open models lag state-of-the-art closed models by 4 months (29 May 2026)
- Interconnects: The current balance of power in open models (Nathan Lambert, 21 September 2026)
- ChinaTalk: DeepSeek V4 (27 April 2026)
- The Next Web: Nvidia's H200 finally reaches Chinese buyers (19 August 2026)
本文在 AI 工具协助下研究与撰写,并经编辑核实。仅供一般参考与讨论,不构成专业建议。请参阅我们的编辑准则与免责声明。发现错误?告诉我们。
喜欢这篇吗?下一篇也别错过。
每次一篇好文章,直接送到你的邮箱。绝无垃圾邮件,随时可退订。