法国AI公司Mistral在10月6日扔出一颗重磅炸弹:Mistral Large 4(绰号”Le Chonk”)公开预览版上线。这是一款总参数1.05万亿、每Token激活49B的原生多模态MoE模型。API当天可用,开放权重承诺10月底放出,媒体披露的日期是10月27日。
欧洲AI第一次拿出万亿参数级模型。这场仗怎么打,账本值得拆开算。
参数堆到万亿,激活只有49B
Mistral Large 4采用细粒度混合专家架构。路由器为每个Token只挑选约5%的权重参与计算,1万亿参数的模型跑出49B模型的单Token成本。视觉侧配了一个1.6B的编码器,支持图文输入、文本输出。
训练是真正烧钱的部分。Mistral在自家欧洲数据中心投入约3800块NVIDIA Grace Blackwell GPU,从零训练约两个月。这次发布是30亿欧元D轮融资后的第一个成果,VentureBeat称该轮估后估值约240亿美元,是欧洲科技史上最大规模股权融资。
上下文窗口方面有个分歧:Mistral官方文档标100万Token,第三方评测机构Artificial Analysis和Vals.ai都记为512K。在Mistral澄清之前,开发者按512K做规划更稳妥。
跑分出炉:欧美开源第一,离中国顶尖还有距离
独立评测机构Artificial Analysis给出的智能指数是38分。这个数字让Mistral Large 4成为西方开源模型中的最高分,比NVIDIA Nemotron 3 Ultra(23分)、OpenAI gpt-oss-120b(12分)领先一大截。
问题是另一侧的榜单。中国开源模型排在前面:小米MiMo-V2.6-Pro拿46.3分,智谱GLM-5.3约45分,月之暗面Kimi K3约44分,阿里Qwen3.8也有40分。Mistral Large 4在全部开源模型中只排第八,与GLM-5.3、Kimi K3有6到8分的差距。
Mistral官方报的编码成绩是DeepSWE v1.1拿下61.7%。VentureBeat对照了DeepSWE实时排行榜,GLM-5.3和Kimi K3在各自的最佳配置下约69%,GPT-6 Astra、Gemini 3.8 Flash、Claude Opus 5约74%。61.7%属于有竞争力,谈不上领先。
第三方Vals.ai给的分更低:Vals指数48.05%,44个模型里排第32。亮点在法律领域,Harvey法律Agent基准15.83%,75个模型中排第六、开源模型第一。
网络安全才是真正的牌
Mistral把宝押在网络安全上。在一个”复现并修补真实开源漏洞”的测试中,Mistral Large 4得分82%,官方称Claude Opus 5.5和GPT-6 Astra接近零分,原因是它们拒绝执行这类任务。Cybench基准上它解决了93%的挑战。
这是一步险棋。闭源厂商在生物、网络等高危能力上普遍收紧限制,Mistral反着来,向通过审核的安全伙伴、政府机构提供放宽审核、扩展网络能力的版本。Mistral同时声称,自家模型对恶意网络提示词的拒绝率高于其他任何开源模型。这两个说法要等权重开放、独立测试后才能验证。
价格贵,话还密
定价单上写的是输入每百万Token 1.36美元、输出4.18美元。文档页面目前显示半价0.68美元和2.09美元,评论者说促销期约两周。
真正的坑在成本效率。Artificial Analysis跑指数时,Mistral Large 4输出了2亿Token,中位数模型只输出8100万。话多直接推高单任务成本:每个指数任务约1.13美元,DeepSeek V4.1 Flash只要0.27美元。速度倒不慢,输出约116 Token每秒。
10月27日才是关键节点
Mistral的发布声明写得清楚:欧洲全栈自研,从Mistral云基础设施部署,覆盖全部欧盟官方语言在内的160多种语言。这套”主权AI”叙事对欧洲政府和企业客户有吸引力,监管合规是刚需。
对开发者来说,眼下该做三件事:在自家任务上先跑预览版API,别信厂商图表;等10月27日权重放出,重点读许可条款——VentureBeat透露将是自定义Mistral许可,条款宽严决定它能走多远;RL训练还在进行中,官方称无饱和迹象,最终检查点可能比预览版强不少。
欧美开源模型和中国的差距从”追不上”缩到”差6分”,这个变化本身比任何单款模型都重要。10月底权重落地,答案自见分晓。
苏公网安备32010502011527号
发表回复