模型和价格
10 月 6 日,Mistral AI 发布 Mistral Large 4 公开预览。它是总参数 1 万亿、每次激活 490 亿的混合专家模型,同一个模型兼具指令和推理模式,原生支持文本加图像输入,覆盖 160 多种语言,包括欧盟全部官方语言。官方称它在 Mistral 位于欧洲的自有数据中心,用 3800 块英伟达 Grace Blackwell GPU 从零训练。
预览 API 已经可以在 Mistral Studio 试用,价格是每百万 token 输入 1.36 美元、输出 4.18 美元。权重「月底前发布」,但许可证还没写明。Mistral 科学副总裁 Pierre Stock 对 TechCrunch 表示,在此之前会与可信合作方一起,确保开放的权重能用于防御,而不是恶意攻击。
成绩:网络安全突出,终端任务偏弱
官方最突出的是网络安全:在 Artificial Analysis 网络安全指数中「复现一个真实开源漏洞再把它修好」的测试上,它拿到 82%,Mistral 称这是所有模型最高;在 40 道安全竞赛题组成的 Cybench 上解出 93%。官方同时指出,Claude Opus 5.5 和 GPT-6 Astra 在同一测试上接近零分,原因是拒绝执行任务,所以这项更多反映安全策略差异,而不是能力高低。
通用 agent 任务上它并不领先。DeepSWE v1.1 是 61.7%,而 Google 9 月底公布的 Gemini 4 Argon 为 77.9%、Opus 5.5 为 74.2%;Terminal-Bench 4 只有 28.3%,同一基准上 Argon 和 Opus 5.5 分别是 57.4% 和 66.4%。Mistral 自己的人工编程评测里,它得分 3.74,低于 Claude Opus 5 的 4.22,略高于 Kimi K3 的 3.59。
影响判断
如果月底真以宽松许可放出权重,这会是欧洲公司首个万亿级开放权重模型,对需要本地部署、数据不出欧盟的企业有现实吸引力,价格也明显低于美国闭源旗舰。但从官方数据看,它的强项集中在网络安全、自动化和多语言,复杂终端与代码 agent 任务仍落后一档。所有数字都是厂商自测,安全类成绩的对比口径尤其要看清。