三天四发:GPT-6 Astra压轴登场,2026年9月超级发布周改写大模型牌局

9月1日到3日,72小时。Anthropic、Google、Meta、OpenAI四家公司连开四场发布会,Claude Fable 5.1、Gemini 3.8 Flash、Muse Spark 1.3、GPT-6 Astra接连落地。业内称之为今年密度最高的”超级发布周”。

把四场发布并排看,关键词高度重合:Agent、编程、计算机操作。聊天体验无人提及。大模型的主战场,已经从”谁更能聊”换成了”谁能把活干完”。

GPT-6 Astra:性能炸场,安全上锁

9月3日压轴登场的GPT-6 Astra,是OpenAI史上最大规模的模型推送。首日即接入微软全家桶:Copilot、Copilot Studio、GitHub Copilot、Microsoft Foundry,Azure同步正式可用。

训练规模上,黄仁勋公开确认,Astra由超过10万张NVIDIA Grace Blackwell NVL72芯片集群训练完成,下一批40万张GPU已经在路上。

跑分层面,ARC-AGI 3从上一代的7.8%飙到99.9%,HLE-Verified得分54.9%,OSWorld 2.0达到72.6%。Perplexity评测显示,Astra在WANDR基准上得分0.682,比Fable 5.1高出13.5%,成本降低6.1%。

争议同样巨大。据The Information报道,Astra采用”循环深度”架构:推理在同一层内循环复用,在隐藏状态中完成计算。安全专家担心,可见的思维链可能不再忠实于实际计算过程,模型可以在内部完成复杂优化后,输出一个看起来无害的解释。Fortune把这种风险称为”信号损失”。

更刺眼的是ExploitBench满分。Astra发现了两个此前未知的零日漏洞,完成浏览器沙箱逃逸和操作系统提权。OpenAI随即宣布能力分层开放:最锋利的那一层,锁起来。其首席科学家甚至发文称AI已形成人类无法完全理解的”异星心智”,呼吁行业自愿减速。

Anthropic:缓存降价75%,总账反而更贵

9月1日凌晨2点,Anthropic突袭发布Fable 5.1与Mythos 5.1,定位”最先进的编程和知识工作模型”。Terminal-Bench v2.1得分91.4%,SciCode 62.0%。长周期Agent任务是主打——扛住一个持续数小时的完整项目,成了新的产品标准。

定价玩了一手明降暗升。缓存读取从每百万token 1美元降到0.25美元,降幅75%。但Fable 5.1为了深度思考,输出token数量是前代的1.7倍,单次复杂任务总成本反而上涨20%。开发者真正要算的账,是推理深度与token消耗的取舍。

资本层面,Anthropic的IPO招股书预计9月下旬公开,市场估值最高约2万亿美元,累计锁定14.8GW算力。

Google与Meta:追赶者的两种打法

Gemini 3.8 Flash走快节奏,3周一个迭代。这次用强化学习补编程短板,在Google内部编程工具JetSki的对比测试中,工程师评价高于Anthropic的Opus模型。定价每百万token输入0.75美元、输出3.75美元。Cyber版本单独拉出,自动漏洞挖掘成功率突破70%。

Meta的Muse Spark 1.3走性价比:输出价格约0.2美元每百万token,比Claude Opus 5便宜125倍,Artificial Analysis指数62分超过Gemini 3.8的59分。开源承诺再度跳票——扎克伯格说权重”即将到来”,实际承诺开源的却是1.2版本,无日期无许可证。

一个方向

四场发布拼在一起,共识清晰:会聊天是基础设施,能干活才是卖点。自己读代码库、自己改文件、自己跑测试、自己操作电脑,模型正从问答机器转向数字员工。

给开发者三点建议:别再用聊天体验评估模型,看它能否独立扛完完整项目;抓住这轮价格窗口,多供应商备份的成本账值得重算;盯紧计算机操作这条线,从给代码到替你操作电脑,是Agent走向执行的关键一步。

能力越强,管控越严。这个新变量会伴随接下来一整年的大模型竞争。


评论

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注

苏ICP备2025163703号-2   警徽苏公网安备32010502011527号