万亿参数军备竞赛2026:Kimi K3、Qwen3.8-Max、Grok 4.7同台开火,开发者到底该押注谁

2026年8月,大模型赛道出现一个清晰信号:参数规模正式跨入万亿时代。

月之暗面把Kimi K3顶到2.8万亿参数,阿里通义千问Qwen3.8-Max压到2.4万亿,马斯克旗下xAI的Grok 4.7冲到2.1万亿。三家在一个月内接连亮剑,把”谁更大”这个问题推到了新量级。

参数数字背后,是一场关于开发者生态、API定价、开源策略的全面较量。这篇文章拆解三家产品的真实表现,帮你看清该把赌注压在哪一边。

Kimi K3:2.8万亿参数的开源赌注

月之暗面在8月兑现了承诺,把Kimi K3的权重开源。2.8万亿参数,是目前开源社区里规模最大的模型之一。

K3支持100万token上下文窗口,具备多模态理解、Tool Calling能力,定位是长程编程、知识工作、深度推理。开发者可以去platform.kimi.com申请API权限,把`kimi-k3`接进自己的工具链。

本地部署的门槛相当高。官方推荐方案需要数百万甚至上千万元级的数据中心投入。社区里也有人在现有硬件上跑出约20 tok/s的单流推理速度,证明2.8万亿参数模型并非只能存在于少数大型数据中心。一端是官方推荐的重资产部署,另一端是开发者基于现有硬件不断尝试的社区方案,这两条路径并存,正是开放权重生态的价值所在。

月之暗面同期完成35亿美元融资,估值达到500亿美元,并正在筹备港股上市。用最大规模的开源模型建立社区影响力,用巨额融资支撑长期运营,这套打法相当激进。

Qwen3.8-Max:2.4万亿参数的编程猛将

阿里在8月3日发布Qwen3.8-Max,总参数2.4万亿,激活参数950亿,采用稀疏MoE架构与混合注意力机制。支持1M token上下文和128K最大输出,原生集成视觉理解。

跑分数据相当亮眼。PaperBench录得93.0分的新高,IFBench 82.8分,GPQA Diamond 92.6%,SWE-bench Pro 67.7%,Terminal-Bench 2.1 86.6分,OSWorld-Verified 86.1。在Arena综合榜单上仅次于Claude系列,CodeArena全球第四,VisionArena全球第二。

和Claude Fable 5的直接对比里,部分指标Qwen3.8-Max确实领先——PaperBench 93.0对88.8,IFBench 82.8对63.5。TextArena综合排名仍在Anthropic系列之后。专业软件工程问题解决能力上,Fable 5在SWE-bench Pro上保持领先。

API定价方面,OpenRouter上Qwen3.8-Max标价每百万token输入2.00美元、输出6.00美元,缓存读取0.25美元。Requesty等平台提供10%折扣后能做到1.80/5.40。8月12日,阿里把底座权重Qwen3.8-2.4T-A95B以Qwen3.8-Max License开源,BF16格式约4800GB,给本地部署留出了空间。

Grok 4.7:xAI的高频迭代打法

马斯克旗下的xAI在8月连续发布两款模型。Grok 4.6于8月7日发布,2万亿参数规模。Grok 4.7紧随其后,2.1万亿参数规模。从4.6到4.7增加了1000亿参数,说明训练基础设施上的投入仍在加速。

API定价上,Grok 4.6每百万token输入2.50美元、输出10.00美元,上下文窗口128K。xAI同期开源了Grok Build工具链,上线9天即在GitHub上获得超过2万star。

这套打法越来越像早期的OpenAI——用高频迭代和开源社区影响力建立声量,再逐步商业化。

价格差距大到能改变选型决策

把主流模型API定价摆在一起,趋势一目了然。GPT-5.6 Sol每百万token输入15美元、输出60美元。Claude Sonnet 5降价后3美元/15美元。DeepSeek V4 Flash只要0.50元/2.00元人民币。GLM-5.2是1.00元/4.00元。Qwen3.8-Max标价2.00元/8.00元。Kimi K3是2.00元/8.00元。

中国模型的API定价普遍是美国同类产品的1/5到1/10。这个价格差距已经大到足以改变企业的技术选型决策。除非你的场景对模型质量有极致要求,否则没有理由不认真考虑中国模型。

Anthropic的激进降价、OpenAI的三变体差异化定价(Sol/Terra/Luna),本质上都是在回应开源模型的价格冲击。闭源模型如果不能在质量上拉开足够大的差距,就必须在价格上让步。

中国开源模型的全球化时刻

OpenRouter的7月全球月度排行榜上,前六名全部是中国模型:小米Mi-Mo-V2.5、DeepSeek V4 Flash、腾讯Hy3、MiniMax M3、智谱GLM-5.2、DeepSeek V4 Pro。这个阵容放在一年前不可想象。

更宏观的数据是,中国开源模型的全球下载量占比已达到41%,首次超过美国。这个数字说明中国AI的竞争力已经不再局限于国内市场,而是在全球范围内被开发者和企业真实地选择和使用。

从”国产替代”到”全球选择”,这个转变的速度比大多数人预期的要快得多。

参数量和实际能力的相关性正在减弱

Kimi K3的2.8万亿、Qwen3.8-Max的2.4万亿、Grok 4.7的2.1万亿——参数规模确实进入了万亿时代。但参数量和实际能力之间的相关性正在减弱。

模型效率,也就是每参数性能,才是下一个竞争焦点。稀疏MoE架构让2.4万亿参数的Qwen3.8-Max只激活950亿,就是为了在规模和效率之间找平衡。Kimi K3的2.8万亿参数在本地部署上面临200万元起的硬件门槛,说明盲目堆参数的边际收益在递减。

对开发者和企业来说,这大概是有史以来选择最多、价格最低、能力最强的AI时代。不要只看排行榜,要看你的场景需要什么。不要只看价格,要看生态和工作流的适配度。万亿参数是军备竞赛的噱头,真正决定胜负的是谁能把参数变成开发者的生产力。


评论

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注

苏ICP备2025163703号-2   警徽苏公网安备32010502011527号