Gemini 4 Argon发布:100万Token输出打五折定价,谷歌员工却在质疑自家跑分

9月30日,Google DeepMind 正式发布 Gemini 4 世代首款旗舰模型 Gemini 4 Argon。距离上一代旗舰 Gemini 3.1 Pro 已经过去七个半月,原定的 Gemini 3.5 Pro 被直接砍掉,谷歌选择跳版发布。

这份成绩单上有三个数字值得记住:单次输出上限从 64K 拉到 100 万 token,行业最高;输入 2 美元、输出 10 美元每百万 token,只有 Claude Opus 5.5 的一半、GPT-6 Astra 的五分之一;知识工作基准 Vals Index 拿下 68.9%,超过 Opus 5.5 的 67.0% 和 GPT-6 Astra 的 63.1%。

知识工作碾压,编程却翻车

Argon 最亮眼的表现集中在专业工作。Harvey 法律 Agent 基准上,Argon 跑出 19.6%,同表的 GPT-6 Astra 只有 5.4%、Claude Fable 5.1 为 6.7%、Opus 5.5 仅 3.8%,Argon 一项超过三家总和。AutomationBench 拿下 51.3%,GraphWalks 长上下文测试 256K 到 1M 档 F1 达 84.2%。

编程侧则喜忧参半。Argon 在 DeepSWE v1.1 拿下 77.9% 排第一,可 FrontierSWE v2 只有 55.0%,落后 GPT-6 Astra 的 65.5%;Terminal-bench 4.0 为 57.4%,明显输给 Opus 5.5 的 66.4%。

更大的争议来自谷歌内部。Bloomberg 援引知情人士报道称,Argon 的基准分数很好看,员工在实际编码工作中却频频遇到困难,前端设计任务尤为吃力。有专家用”benchmaxing”来形容这种状况:模型围绕基准调优,真实场景表现掉队。Quantum 前CEO兼AI投资人 Llion Jones 也公开质疑,跑分与真实能力之间的鸿沟正在拉大。

100万Token输出解决什么问题

此前旗舰模型的输出上限普遍卡在 64K token,代码迁移、全库重构这类长任务经常被截断成多段,Agent 需要反复续写拼接。Argon 把上限提到 100 万 token,一次任务可以完整交付几万行级别的结果,官方称专为大跨度多步工作流设计。

价格是另一张牌。算一笔账:100 万输入加 20 万输出的任务,Argon 花 4 美元,Opus 5.5 花 8 美元,GPT-6 Astra 花 20 美元。缓存输入定价 0.10 美元,享受 95% 折扣。谷歌明确这是”介绍价”,后续会调整,高开低走的降价空间已经埋好。

首发只给安全防御者

发布节奏同样罕见。第一批用户只有 Fairwind Program 里的可信网络安全防御团队,部分版本甚至关闭安全护栏用于攻防演练;付费 API 客户和 Google AI Ultra 订阅者排第二批,企业与个人消费者更晚,官方均未给出日期。

安全能力是 Argon 的重点卖点。CWE-bench v1 网络安全基准拿下 68.0%,与 GPT-6 Astra 并列第一,官方称它是目前对抗间接提示注入最有韧性的模型,部署了思维链监控、沙箱加固和对齐缓解机制。模型可以自主识别并修补关键软件漏洞,这显然是对近期多起 AI Agent 被攻击事件的回应。

开发者现在该做什么

想第一时间接入 Argon 的团队,可以提前建好付费 Gemini API 项目,第二批开放当天即可动手。长输出场景——代码迁移、批量重构、超长文档生成——值得列为选型观察项,100 万 token 输出是真实的生产力变量。

需要提醒的是,目前所有跑分都来自谷歌官方 methodology 页面,第三方复测尚未出现,员工实测的负面反馈又摆在明面上。选型前先拿自己的真实任务跑一轮,比盯着榜单做决定靠谱得多。

普通用户暂时用不上 Argon,现阶段想体验谷歌最新模型,仍然只有 Gemini 3.8 Flash 一个选项。旗舰模型从发布到全量开放还要多久,谷歌没有说,定价战倒是已经替它把态度摆明了。


评论

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注

苏ICP备2025163703号-2   警徽苏公网安备32010502011527号