2026年7月16日,月之暗面发布了Kimi K3——2.8万亿参数、100万token上下文、原生视觉理解,外加Agent Swarm并行架构。这个模型上线48小时内就把自家算力挤爆了,官方被迫暂停新用户订阅。数据看着吓人,但实际用起来到底行不行?这篇测评把实测结果摊开讲。
参数规模意味着什么
Kimi K3超越了DeepSeek-V4-Pro的1.6万亿参数,成为目前全球参数量最大的开源权重模型。参数多不等于能力强,这点所有人都知道。但K3的架构设计有几个值得关注的点:KDA混合线性注意力机制、注意力残差技术,以及原生多模态支持。这些技术选择的共同目标只有一个——拉长上下文窗口的同时压住推理成本。
100万token的上下文窗口是什么概念?一次塞进三体三部曲体量的文本,模型还能在对话全程保持对先前内容的精确记忆。对于法律合同审查、长篇代码库分析这种场景,窗口长度直接决定能不能用。
Agent Swarm:从单兵作战到集群协作
K3最大的技术看点是Agent Swarm。传统AI模型执行复杂任务靠单线程顺序推进,一个步骤卡住,后面全等。Agent Swarm换了个思路:主Agent分析任务结构后拆成多个子任务,每个子任务交给独立的子Agent并行处理,最后主Agent汇总输出。
月之暗面公布的数据是K3 Swarm最多支持300个子Agent同时工作,单次任务可执行超过4000次工具调用。相比单Agent顺序执行,任务完成速度提升约4.5倍。
实际测试中,这个架构在可拆分任务上效果显著。比如“调研全球前十芯片公司的最新财报并生成对比分析报告”,主Agent会把十家公司分给十个子Agent同时搜索,每个子Agent独立提取财务数据,最后主Agent汇总对比。顺序执行可能要20分钟,Swarm模式下5分钟出结果。
但Swarm不是万能的。子Agent的结果质量不均匀,100个子Agent里总有几个方向跑偏。最终输出质量取决于主Agent的汇总和过滤能力。简单任务用Swarm反而慢——主Agent拆分和分配本身就要花时间,不如直接走Instant模式。
编程能力:SWE Marathon拿第一
在编程评测中,K3的表现相当硬核。SWE Marathon(超长时序持续开发)和Program Bench(软件逆向)两项测试均拿下第一。Terminal Bench 2.1得分88.3,接近GPT-5.6 Sol。FrontierSWE(高难度软件工程任务)得分81.2,仅次于Claude Fable 5。
实测代码生成场景,K3能根据需求描述生成完整项目代码,自动识别并修复bug,解释复杂代码逻辑。在GPU kernel优化测试中,K3与Fable 5表现接近,明显超过Opus 4.8和GPT-5.5。
游戏开发是个有趣的测试场景。海外开发者@He1s_Sammy用完全相同的提示词让K3、GPT-5.6 Sol和Fable 5分别生成3D横版格斗游戏。K3一次生成就可运行,玩法核心抓得准,内容节奏自然。GPT-5.6 Sol和Fable 5生成的游戏节奏普遍过快,体验不如K3。
知识工作与多模态
BrowseComp(网页深度调研)得分91.2,Automation Bench(办公自动化)和SpreadsheetBench 2(Excel财务建模)均排名第一。在月之暗面内部的Knowledge Work Bench测试中,K3在通用推理、深度文档分析和金融专项三类任务中的表现均超过GPT-5.5和Claude Opus 4.8。
多模态方面,K3支持原生视觉理解。实测文档分析场景,给它一份50页的PDF财报,K3能准确提取关键数据并生成摘要表格。视觉编程方面,静态页面生成质量不错,但拖曳排序、实时图表这种动态交互,生成的代码还无法直接投入生产。
三个不可忽视的局限
月之暗面在官方博客中坦诚列出了三个局限:K3对历史思考内容敏感,中途切换模型会导致输出质量明显下降;训练偏向长程高难任务,面对简单日常问题容易替代用户做决定;与Fable 5和GPT-5.6 Sol相比,用户体验仍有差距。
这些局限在实际使用中确实存在。K3倾向于“过度主动”,简单问答场景下可能给出你不需要的冗长分析。256K上下文虽然大,但每次调用的token消耗也跟着上去了,控制输入长度很重要。
谁该用K3,谁不该用
K3适合处理难事:长程编程、深度研究、复杂文档分析、多步骤自动化任务。月之暗面的定价策略也验证了这一点——K3面向的是专业用户和企业场景,不是日常闲聊。
如果你只是日常问答、简单文案写作,K3属于大材小用。不仅贵,还可能因为“过于主动”的输出风格让你困惑。
K3的完整权重已于7月27日开放下载。对于开发者来说,这意味着可以本地部署、自由微调。2.8万亿参数的开源模型,这个门槛本身就在推动整个AI行业往前走一步。
发表回复