插图:tuput
中文
Mistral Large 4 于 2026 年 10 月 6 日开放公开预览,设计规模为 1 万亿参数,并承诺在月底前发布权重。Artificial Analysis 给它打了 38 分,是中国以外最好的开放模型,但落后于七个中国模型。它的许可证尚未公布。
Mistral Large 4 是这家法国公司昵称为 Le Chonk 的模型。独立测试机构 Artificial Analysis 在 2026 年 10 月 6 日运行了它的公开预览版,在 Artificial Analysis 智能指数(Intelligence Index)上得 38 分。Trending Topics 把这个成绩算作开放权重模型中的第八,排在七个中国模型之后,不过 Artificial Analysis 自己把该模型列为专有模型,因为权重尚未公开。
“开放权重”(open-weight)指公司把构成模型的那些训练出来的数值公布出来,这样只要硬件够用,任何人都可以自己运行、修改和托管它。Mistral 的公告只说了一句:“我们将在月底前发布权重。”
10 月 6 日发布了什么,没发布什么
Mistral 于 2026 年 10 月 6 日通过自家 API 开放了公开预览。目前还不能下载任何东西,模型卡把它标为“Open”,却没有写明许可证。Forklog 报道完整权重将在 10 月 27 日发布。Mistral 自己的文章没有给出日期。
10 月 7 日的 AI 综述用寥寥几行报道了这次发布。其中有两个数字与 Mistral 自己的文章不同:综述给的是 490 亿活跃参数和 4,000 块芯片,而 Mistral 说的是 520 亿和 3,800 块。
一万亿参数,以及三个对不上的数字
Large 4 是混合专家(mixture-of-experts)模型。它并不是每生成一个词就动用全部参数(参数就是网络内部一个可调的数值),而是把每一段文字送进少数几个专门化的子网络。Mistral 在公告中把它描述为“拥有 52 billion 活跃参数的 1 trillion 参数原生多模态模型”,意思是它既能读图像,也能读文字。模型卡给出的总参数是 1.05 万亿,另加一个 16 亿参数的视觉编码器,并列出 100 万个词元(token)的上下文窗口,也就是模型一次能考虑的文本量。这些数字中有三个存在争议。
- 活跃参数:Mistral 的文章和模型卡说是 520 亿。The Register、IT Daily,以及 Unite.AI 对 Artificial Analysis 页面的转述,给的则是 490 亿。
- 上下文窗口:Mistral 说是 100 万词元。Artificial Analysis 实测约为 52.4 万,Vals.ai 列的是 51.2 万。
- 训练芯片:Mistral 说它在自己位于欧洲的数据中心里,用 3,800 块 Nvidia Grace Blackwell GPU 从零训练了这个模型。Forklog 说约为 4,000 块。
作为参照,据 Mistral 的文档,它在 2025 年 12 月发布的 Large 3 总参数为 6,750 亿,活跃参数为 410 亿。这样算来,新模型的总规模大了约 56%。The Register 指出,Mistral 没有给出硬件方面的指导,但补充说,这个模型仍应能在 Nvidia HGX B300 或 AMD MI355X 这类八卡 GPU 服务器上运行。
Mistral 说,训练数据涵盖 160 多种语言,包括欧盟的每一种官方语言。
Mistral 说这个模型能做什么
本节所有内容,除非另有署名,都是 Mistral 自己的说法,而 The Register 对 Mistral 图表的建议是“持保留态度”。
在编程方面,Mistral 报告其在 DeepSWE v1.1 上为 61.7%,在 Artificial Analysis 的编程智能体指数(Coding Agent Index)上为 49.8%,领先于 DeepSeek V4 Pro 0813 和 Qwen3.8 Max。在数据公司 Surge AI 的一次盲测中,标注员按 1 到 5 分给五个模型的输出打分。Mistral 的模型以 3.74 分排在五个模型的第二位,落后于 4.22 分的 Claude Opus 5。
在智能体任务方面,它报告在使用 657 个商业工作流的 AutomationBench 上为 59.9%。Mistral 的摘要略去了一个数字,来自 The Decoder:GLM-5.3 的得分更高,为 62.2。在 SciCode-Verified 上,The Decoder 报告为 91.8%,落后于 GPT-6 Astra 的 94.2% 和 Qwen3.8 的 93.8%,但领先于 Claude Opus 5 的 91.3%。
在图像方面,Mistral 报告其在一项叫作 Dense 200 的视觉定位测试中为 42%,GPT-6 Astra 为 41%。
独立测试者发现了什么
Artificial Analysis 在其智能指数 4.3.2 版上给预览版打了 38 分,在 225 个模型中排第 64。据 Unite.AI,这与得 38 分的 GPT-6 Luna(max)持平,略低于得 39 分的 DeepSeek V4.1 Flash(max)。据 The Register,早期测试显示它相对 OpenAI 和 Anthropic 的旗舰模型处于“重大劣势”。
Trending Topics 列出了同一指数上的开放权重领先者:小米的 MiMo-V2.6-Pro 为 46.3,Z.ai 的 GLM-5.3 为 44.8,月之暗面(Moonshot AI)的 Kimi K3 为 43.6。闭源模型方面,它列出 Claude Opus 5.5 为 57.6,GPT-6 Astra 为 52.7,Gemini 4 Argon 为 52.6。韩国的 Motif 3 得 33.6,是此前中国以外最好的开放模型。ActuIA 则把 Thinking Machines 的 Inkling Small 列为实测中最好的美国开放模型,得分为 26。
在同一指数上,Mistral 此前的模型得分要低得多:Medium 3.5 为 14,Large 3 为 9。ActuIA 指出,Large 3 没有推理模式,而该指数偏向推理。
效率是短板。据 Trending Topics,跑完这个指数,每个任务的成本是 1.13 美元,而 DeepSeek V4.1 Flash 是 0.27 美元,MiMo-V2.6-Pro 是 0.13 美元。这个模型为完成指数测试写出了约 2 亿个输出词元,同类模型的中位数是 8,100 万。实测速度为每秒输出 116 个词元,首个词元的延迟为 1.46 秒。
Vals.ai 以专业任务测试模型,它在总指数上把 Large 4 排在 45 个模型中的第 33 位,得分 48.05%。Harvey 的法律智能体基准(Legal Agent Benchmark)是它名次最好的一项,76 个中排第 6;Finance Agent v2 则把它排在 76 个中的第 22。
网络安全方面的成绩需要加一条脚注
Mistral 在安全工作上卖力地推销 Large 4。它报告,在一项要求模型复现并修补一个真实开源漏洞的测试中得分 82%,并说 Claude Opus 5.5 和 GPT-6 Astra 在这项测试中得分接近零,因为它们拒绝执行这项任务。
Artificial Analysis 自己的网络安全测量也支持这个方向。ActuIA 报告其网络安全指数(Cyber Index)得分为 49.5,在 18 个模型中排第五,在该指数的 CyberGym-E2E 测试中为 81.7%,是 18 个模型中最好的。按这一说法,GPT-6 Astra 得 0 分,拒绝率为 100%,Claude Opus 5.5 得 0.8%,拒绝率为 98.5%。
The Decoder 指出,这一结果既反映了供应商的政策,也反映了能力,因为拒绝一项任务的模型是不可能完成它的。Mistral 没有解释它如何区分正当研究与攻击准备。Mistral 说,经过审核的合作伙伴和国家主管机构,将在红队测试期间获得一个审核较宽松、网络安全能力有所扩展的版本。Trending Topics 报道,公开版本限制了这些能力。
价格与许可证
标价是每百万输入词元 1.36 美元,每百万输出词元 4.18 美元。模型卡上曾出现过这两项价格的一半,即 0.68 美元和 2.09 美元,作为促销价。Unite.AI 对 Artificial Analysis 页面的转述把这个折扣描述为头两周的上线优惠,而 ActuIA 没有发现任何截止日期的说明。
许可证才是更大的未知数。它决定企业能否把这个模型用于商业,而 Mistral 的发布文章和模型卡都没有写明。Mistral 的文档显示,Large 3 是以宽松的 Apache 2.0 许可证发布的。据 Trending Topics,Medium 3.5 采用一种修改过的 MIT 许可证,把月收入超过 2000 万美元的公司排除在外,VentureBeat 则报道 Large 4 将采用定制许可证,但没有给出细节。tuput 没能找到那篇 VentureBeat 报道。ActuIA 指出,Mistral 列出的将随权重一起公布的内容,涵盖架构、基准测试和训练方法,没有提到许可证。
面向谁,以及同月将至的一个对手
Mistral 点名的目标客户有金融、工程、制造、物流、制药、科学、航运和公共部门,还有希望在私有云或自己的服务器上运行该模型的安全团队。它的文章写道:“Forged in Europe. Built for AI sovereignty.”印度推动自研模型,背后也是同样的论点,tuput 在印度正在用自己的语言建造 AI一文中报道过。关于这类系统究竟做什么的通俗解释,见聊天机器人如何猜下一个词。
它身后还排着另一个发布。TechCrunch 在 10 月 5 日报道,布鲁克林的创业公司 Reflection AI(由两位前 Google DeepMind 研究员创办)宣布了 Beam,这是一个纯文本的混合专家模型,总参数 5,010 亿,活跃参数 230 亿。Reflection 说,Beam 在高级推理基准上与 Z.ai 的 GLM-5.2 相当,并将在 10 月发布权重。TechCrunch 指出这些说法出自公司本身,也没有写明许可证。
Mistral 说,这个预览版背后的强化学习训练仍在进行,预计会有大幅提升,所以 38 分未必是最终成绩。Mistral 给出的权重发布期限是 10 月底。
资料来源与延伸阅读
- Mistral AI: Introducing Mistral Large 4
- Mistral AI docs: Mistral Large 4 model card
- Mistral AI docs: Mistral Large 3 model card
- Artificial Analysis: Mistral Large 4 Preview
- Vals.ai: Mistral Large 4 results
- Unite.AI: Benchmark Firm Gives Mistral Large 4 Preview a 38 Intelligence Score
- Trending Topics: Mistral Large 4 on Artificial Analysis, Eighth Among Open Models
- The Decoder: Mistral Large 4 is Europe's trillion-parameter answer to US models that refuse security work
- ActuIA: Mistral Large 4, how good is the best open model outside China?
- The Register: Mistral Large 4 coverage
- Forklog: Mistral Large 4 preview and weights date
- IT Daily: Mistral Large 4 (Le Chonk)
- TechCrunch: Reflection debuts Beam, an open-weight AI model to rival Chinese models
本文在 AI 工具协助下研究与撰写,并经编辑核实。仅供一般参考与讨论,不构成专业建议。请参阅我们的编辑准则与免责声明。发现错误?告诉我们。
喜欢这篇吗?下一篇也别错过。
每次一篇好文章,直接送到你的邮箱。绝无垃圾邮件,随时可退订。