2026年9月2日,Meta Superintelligence Labs放出新模型Muse Spark 1.3。这是该系列四个月内的第四个版本。定位清晰:给长时间运行的智能体工作流和编程任务用。
Meta这次没有吹参数规模,也没有卷排行榜总分。官方公布的三个核心变化都指向一个方向——让Agent更省、更稳、更懂分寸。
三个值得注意的官方数据
官方口径的改进集中在三点。
第一,模型学会了在指令模糊时主动反问。执行不可逆操作之前,它会先向用户确认。卡住的时候,它会求助。听起来简单,对Agent落地却是硬指标。
第二,效率数据亮眼。对比1.2版本,Muse Spark 1.3在内部评测中少用约20%的工具调用,Token消耗减少约25%。任务规划、上下文利用、执行路径,三条线都在省。
第三,长上下文检索基准MRCR两个区间分别拿到98.5和98.1分。上下文窗口1M Token,API价格为主模型每百万Token输入1.25美元、缓存输入0.15美元、输出4.25美元。
这个价格什么水平?横向对比,GPT-6 Astra百万Token定价10美元,Gemini 3.8 Flash走低价路线。Muse Spark 1.3卡在中间,靠Token用量下降摊薄实际成本。
基准表现:偏科的优等生
第三方汇总的评测结果如下。
DeepSWE(编程智能体基准)得分75.40,排名1/35。Terminal-Bench 2.1(终端任务)得分88.80,排名2/49。SimpleBench得分81.80,排名4/92。
对手是谁?DeepSWE上,Muse Spark 1.3的75.4高于GPT-5.6 Sol的73.0,也高于Opus 5的74.0。
Meta自己跑了9项智能体测试,拿下5项第一,全部进入前二。唯一没进前二的项是Agent IF Index,得分57.8,排第三,落后于GPT-5.6 Sol和Opus 5。
OSWorld 2.0(计算机操作)上,max档66.9,xhigh档57.2。对比GPT-6 Astra在OSWorld的72.6%,Muse Spark 1.3还有差距。
结论很清楚:终端任务和编程是强项,通用智能体能力还差一口气。
效率才是真卖点
为什么20%工具调用减少和25% Token节省重要?
跑过长任务的人都懂。Agent干活的成本大头不在单次推理,在循环。一个复杂编程任务跑几十轮,每轮都要调用工具、读取上下文。Token账单滚雪球一样涨。
Meta工程师的逻辑是:模型效率高一点,实际使用成本就降一截。省25%的Token,等于变相打七五折。对重度Agent用户,这比API牌价下降更实在。
与两个背景事件对照
看两条同期新闻,能更好理解Meta的处境。
一条是SpaceX在6月16日宣布以600亿美元全股票收购Cursor开发商Anysphere。马斯克把AI编程第一名工具直接纳入SpaceX/xAI体系。AI编程赛道的入口争夺已经白热化。
另一条是OpenAI和Anthropic的Agent模型节奏。GPT-6 Astra在OSWorld登顶,Opus 5在DeepSWE紧咬。Meta在四个月里发了四个版本,明显在用迭代速度换市场。
Muse Spark 1.3在全球模型榜单排到第六。编码能力超过GPT-5.6 Sol,整体依然没追上OpenAI和Anthropic。这个判断来自第三方,比较客观。
谁该用这个模型
三类用户值得关注。
写代码为主的开发者。DeepSWE第一、终端任务第二,编程场景是它的主场。1M上下文塞下一个大型项目没问题。
跑批量Agent任务的团队。Token省25%,规模化部署后是笔可观的账。缓存输入0.15美元的价格对重复场景友好。
预算敏感的重度用户。输入1.25美元的价格只有GPT-6 Astra的八分之一。配合效率提升,成本优势明显。
需要顶级通用智能体能力的场景,建议再等等。OSWorld的差距说明,复杂计算机操作还得看第一梯队。
写在最后
Muse Spark 1.3证明了一件事:模型竞争进入效率阶段。堆参数、刷榜的时代在退潮,省Token、稳执行、懂分寸的模型开始值钱。
对开发者,这是好事。模型越省,Agent越敢放开了跑。
四个月四个版本。下一发,看Meta怎么补OSWorld的短板。
苏公网安备32010502011527号
发表回复