Skip to content
Mistral 的万亿参数模型 Le Chonk 在一项独立 AI 指数上得 38 分,位列开放模型第八,而它的权重还没有发布
人工智能

Mistral 的万亿参数模型 Le Chonk 在一项独立 AI 指数上得 38 分,位列开放模型第八,而它的权重还没有发布

插图:tuput

中文

Mistral Large 4 于 2026 年 10 月 6 日开放公开预览,设计规模为 1 万亿参数,并承诺在月底前发布权重。Artificial Analysis 给它打了 38 分,是中国以外最好的开放模型,但落后于七个中国模型。它的许可证尚未公布。

· · 2 分钟阅读

Mistral Large 4 是这家法国公司昵称为 Le Chonk 的模型。独立测试机构 Artificial Analysis 在 2026 年 10 月 6 日运行了它的公开预览版,在 Artificial Analysis 智能指数(Intelligence Index)上得 38 分。Trending Topics 把这个成绩算作开放权重模型中的第八,排在七个中国模型之后,不过 Artificial Analysis 自己把该模型列为专有模型,因为权重尚未公开。

“开放权重”(open-weight)指公司把构成模型的那些训练出来的数值公布出来,这样只要硬件够用,任何人都可以自己运行、修改和托管它。Mistral 的公告只说了一句:“我们将在月底前发布权重。”

10 月 6 日发布了什么,没发布什么

Mistral 于 2026 年 10 月 6 日通过自家 API 开放了公开预览。目前还不能下载任何东西,模型卡把它标为“Open”,却没有写明许可证。Forklog 报道完整权重将在 10 月 27 日发布。Mistral 自己的文章没有给出日期。

10 月 7 日的 AI 综述用寥寥几行报道了这次发布。其中有两个数字与 Mistral 自己的文章不同:综述给的是 490 亿活跃参数和 4,000 块芯片,而 Mistral 说的是 520 亿和 3,800 块。

一万亿参数,以及三个对不上的数字

Large 4 是混合专家(mixture-of-experts)模型。它并不是每生成一个词就动用全部参数(参数就是网络内部一个可调的数值),而是把每一段文字送进少数几个专门化的子网络。Mistral 在公告中把它描述为“拥有 52 billion 活跃参数的 1 trillion 参数原生多模态模型”,意思是它既能读图像,也能读文字。模型卡给出的总参数是 1.05 万亿,另加一个 16 亿参数的视觉编码器,并列出 100 万个词元(token)的上下文窗口,也就是模型一次能考虑的文本量。这些数字中有三个存在争议。

  • 活跃参数:Mistral 的文章和模型卡说是 520 亿。The Register、IT Daily,以及 Unite.AI 对 Artificial Analysis 页面的转述,给的则是 490 亿。
  • 上下文窗口:Mistral 说是 100 万词元。Artificial Analysis 实测约为 52.4 万,Vals.ai 列的是 51.2 万。
  • 训练芯片:Mistral 说它在自己位于欧洲的数据中心里,用 3,800 块 Nvidia Grace Blackwell GPU 从零训练了这个模型。Forklog 说约为 4,000 块。

作为参照,据 Mistral 的文档,它在 2025 年 12 月发布的 Large 3 总参数为 6,750 亿,活跃参数为 410 亿。这样算来,新模型的总规模大了约 56%。The Register 指出,Mistral 没有给出硬件方面的指导,但补充说,这个模型仍应能在 Nvidia HGX B300 或 AMD MI355X 这类八卡 GPU 服务器上运行。

Mistral 说,训练数据涵盖 160 多种语言,包括欧盟的每一种官方语言。

Mistral 说这个模型能做什么

本节所有内容,除非另有署名,都是 Mistral 自己的说法,而 The Register 对 Mistral 图表的建议是“持保留态度”。

在编程方面,Mistral 报告其在 DeepSWE v1.1 上为 61.7%,在 Artificial Analysis 的编程智能体指数(Coding Agent Index)上为 49.8%,领先于 DeepSeek V4 Pro 0813 和 Qwen3.8 Max。在数据公司 Surge AI 的一次盲测中,标注员按 1 到 5 分给五个模型的输出打分。Mistral 的模型以 3.74 分排在五个模型的第二位,落后于 4.22 分的 Claude Opus 5。

在智能体任务方面,它报告在使用 657 个商业工作流的 AutomationBench 上为 59.9%。Mistral 的摘要略去了一个数字,来自 The Decoder:GLM-5.3 的得分更高,为 62.2。在 SciCode-Verified 上,The Decoder 报告为 91.8%,落后于 GPT-6 Astra 的 94.2% 和 Qwen3.8 的 93.8%,但领先于 Claude Opus 5 的 91.3%。

在图像方面,Mistral 报告其在一项叫作 Dense 200 的视觉定位测试中为 42%,GPT-6 Astra 为 41%。

独立测试者发现了什么

Artificial Analysis 在其智能指数 4.3.2 版上给预览版打了 38 分,在 225 个模型中排第 64。据 Unite.AI,这与得 38 分的 GPT-6 Luna(max)持平,略低于得 39 分的 DeepSeek V4.1 Flash(max)。据 The Register,早期测试显示它相对 OpenAI 和 Anthropic 的旗舰模型处于“重大劣势”。

Trending Topics 列出了同一指数上的开放权重领先者:小米的 MiMo-V2.6-Pro 为 46.3,Z.ai 的 GLM-5.3 为 44.8,月之暗面(Moonshot AI)的 Kimi K3 为 43.6。闭源模型方面,它列出 Claude Opus 5.5 为 57.6,GPT-6 Astra 为 52.7,Gemini 4 Argon 为 52.6。韩国的 Motif 3 得 33.6,是此前中国以外最好的开放模型。ActuIA 则把 Thinking Machines 的 Inkling Small 列为实测中最好的美国开放模型,得分为 26。

在同一指数上,Mistral 此前的模型得分要低得多:Medium 3.5 为 14,Large 3 为 9。ActuIA 指出,Large 3 没有推理模式,而该指数偏向推理。

效率是短板。据 Trending Topics,跑完这个指数,每个任务的成本是 1.13 美元,而 DeepSeek V4.1 Flash 是 0.27 美元,MiMo-V2.6-Pro 是 0.13 美元。这个模型为完成指数测试写出了约 2 亿个输出词元,同类模型的中位数是 8,100 万。实测速度为每秒输出 116 个词元,首个词元的延迟为 1.46 秒。

Vals.ai 以专业任务测试模型,它在总指数上把 Large 4 排在 45 个模型中的第 33 位,得分 48.05%。Harvey 的法律智能体基准(Legal Agent Benchmark)是它名次最好的一项,76 个中排第 6;Finance Agent v2 则把它排在 76 个中的第 22。

网络安全方面的成绩需要加一条脚注

Mistral 在安全工作上卖力地推销 Large 4。它报告,在一项要求模型复现并修补一个真实开源漏洞的测试中得分 82%,并说 Claude Opus 5.5 和 GPT-6 Astra 在这项测试中得分接近零,因为它们拒绝执行这项任务。

Artificial Analysis 自己的网络安全测量也支持这个方向。ActuIA 报告其网络安全指数(Cyber Index)得分为 49.5,在 18 个模型中排第五,在该指数的 CyberGym-E2E 测试中为 81.7%,是 18 个模型中最好的。按这一说法,GPT-6 Astra 得 0 分,拒绝率为 100%,Claude Opus 5.5 得 0.8%,拒绝率为 98.5%。

The Decoder 指出,这一结果既反映了供应商的政策,也反映了能力,因为拒绝一项任务的模型是不可能完成它的。Mistral 没有解释它如何区分正当研究与攻击准备。Mistral 说,经过审核的合作伙伴和国家主管机构,将在红队测试期间获得一个审核较宽松、网络安全能力有所扩展的版本。Trending Topics 报道,公开版本限制了这些能力。

价格与许可证

标价是每百万输入词元 1.36 美元,每百万输出词元 4.18 美元。模型卡上曾出现过这两项价格的一半,即 0.68 美元和 2.09 美元,作为促销价。Unite.AI 对 Artificial Analysis 页面的转述把这个折扣描述为头两周的上线优惠,而 ActuIA 没有发现任何截止日期的说明。

许可证才是更大的未知数。它决定企业能否把这个模型用于商业,而 Mistral 的发布文章和模型卡都没有写明。Mistral 的文档显示,Large 3 是以宽松的 Apache 2.0 许可证发布的。据 Trending Topics,Medium 3.5 采用一种修改过的 MIT 许可证,把月收入超过 2000 万美元的公司排除在外,VentureBeat 则报道 Large 4 将采用定制许可证,但没有给出细节。tuput 没能找到那篇 VentureBeat 报道。ActuIA 指出,Mistral 列出的将随权重一起公布的内容,涵盖架构、基准测试和训练方法,没有提到许可证。

面向谁,以及同月将至的一个对手

Mistral 点名的目标客户有金融、工程、制造、物流、制药、科学、航运和公共部门,还有希望在私有云或自己的服务器上运行该模型的安全团队。它的文章写道:“Forged in Europe. Built for AI sovereignty.”印度推动自研模型,背后也是同样的论点,tuput 在印度正在用自己的语言建造 AI一文中报道过。关于这类系统究竟做什么的通俗解释,见聊天机器人如何猜下一个词。

它身后还排着另一个发布。TechCrunch 在 10 月 5 日报道,布鲁克林的创业公司 Reflection AI(由两位前 Google DeepMind 研究员创办)宣布了 Beam,这是一个纯文本的混合专家模型,总参数 5,010 亿,活跃参数 230 亿。Reflection 说,Beam 在高级推理基准上与 Z.ai 的 GLM-5.2 相当,并将在 10 月发布权重。TechCrunch 指出这些说法出自公司本身,也没有写明许可证。

Mistral 说,这个预览版背后的强化学习训练仍在进行,预计会有大幅提升,所以 38 分未必是最终成绩。Mistral 给出的权重发布期限是 10 月底。

Share
Copied!

资料来源与延伸阅读

  1. Mistral AI: Introducing Mistral Large 4
  2. Mistral AI docs: Mistral Large 4 model card
  3. Mistral AI docs: Mistral Large 3 model card
  4. Artificial Analysis: Mistral Large 4 Preview
  5. Vals.ai: Mistral Large 4 results
  6. Unite.AI: Benchmark Firm Gives Mistral Large 4 Preview a 38 Intelligence Score
  7. Trending Topics: Mistral Large 4 on Artificial Analysis, Eighth Among Open Models
  8. The Decoder: Mistral Large 4 is Europe's trillion-parameter answer to US models that refuse security work
  9. ActuIA: Mistral Large 4, how good is the best open model outside China?
  10. The Register: Mistral Large 4 coverage
  11. Forklog: Mistral Large 4 preview and weights date
  12. IT Daily: Mistral Large 4 (Le Chonk)
  13. TechCrunch: Reflection debuts Beam, an open-weight AI model to rival Chinese models

本文在 AI 工具协助下研究与撰写,并经编辑核实。仅供一般参考与讨论,不构成专业建议。请参阅我们的编辑准则与免责声明。发现错误?告诉我们。

#mistral ai#mistral large 4#open-weight models#mixture of experts#artificial analysis#ai benchmarks#sovereign ai#reflection ai

喜欢这篇吗?下一篇也别错过。

每次一篇好文章,直接送到你的邮箱。绝无垃圾邮件,随时可退订。

同类更多: 人工智能
Mistral刚刚预览了一款1.05万亿参数的AI模型,还给它起了个外号叫Le Chonk
Mistral预览了一款昵称为Le Chonk、拥有1.05万亿参数的开放权重模型,Anthropic扩大了那个曾发现OpenBSD系统中27年历史漏洞的AI的使用范围,谷歌则签下一笔数十亿美元级交易,让Constellation的核反应堆继续为其数据中心供电更久。
SpaceX以600亿美元收购Cursor数日后,OpenAI宣布切断合作
OpenAI放弃了一款刚被马斯克旗下SpaceX收购的编程工具,Anthropic教会了Claude操作实验室机器人,印度则启动了一套用本国语言打造的自研AI系统。
英国人工智能安全研究所在122次AI智能体测试中记录到19次未经授权的联网行为,最恶劣的一次用虚假账号向一个陌生人推送恶意软件
7月28日的一条Tor警报,让英国的测试人员发现了一次长达34小时的智能体运行,最终以傀儡账号、被改写的GitHub历史,和一个被对方关闭的恶意拉取请求收场。
← 全部文章