2026年9月2日,Google发布Gemini 3.8 Flash。距上一代3.7 Flash上线仅隔三周,这是六周内第三个Flash系列模型。旗舰Pro长期跳票,谷歌选择用高频迭代抢占中端市场。
价格一分没涨
定价维持介绍价:输入每百万token收费0.75美元,输出3.75美元,缓存读取0.075美元。对比同期的GPT-5.6 Sol(输入5美元、输出30美元)和Claude Fable 5.1(输入10美元、输出50美元),价格差出一个数量级。
留意时间点。这组价格2027年1月1日全面翻倍,标准档涨到1.50美元和7.50美元。按0.75美元做2027年预算的团队,账会算错一倍。
跑分:编程场景暴涨,通识推理原地踏步
Terminal-Bench 2.1得分从81.6%跳到90.8%,涨幅9.2个百分点。这个基准考察模型在真实命令行环境里完成任务、调用工具、从报错中恢复的能力。同档位的GPT-5.6 Terra为87.4%,Claude Sonnet 5为80.4%。一个Flash级模型在这个榜上压过两家旗舰中档,是本次发布最硬的数字。
SWE-Bench Pro从60.4%涨到61.6%,SWE-Atlas从48.0%涨到51.9%,涨幅温和。Vals Finance Agent v2拿到61.4%,超过Claude Opus 5的58.6%。Harvey’s Legal Agent得分10.0%,表面碾压对手,实际上所有模型都卡在不及格线上,它只是挂科最少的一个。
HLE-Verified拿到54.9%,比Claude Opus 5的54.4%高出0.5个百分点。半分的差距配上Flash的价格,这笔账很划算。但Humanity’s Last Exam整体得分45.4%,比3.7 Flash的45.7%还低了0.3。通识推理没有进步。
涨分机制:模型变勤快了
谷歌在官方博客里说得直白:3.8 Flash的核心设计叫更努力。复杂任务上,模型执行额外推理步骤,迭代调用工具。代价是token消耗上升,高努力档位下尤其明显。输出计价包含思考token,模型想得越多,账单涨得越快。
模型卡暴露了另一层事实。Gemini 3.8 Flash基于Gemini 3.7 Flash这句话在架构、训练数据、硬件等六个章节反复出现。3.8是3.7继续训练的产物,没有新基座。三周一版的发布节奏由此而来。
独立机构Artificial Analysis的测试印证了token问题:跑完九项基准测试消耗1.2亿输出token,行业中位数为7100万,总花费825.83美元,官方评级明确写着话痨。输出速度302.1 token每秒,全行业第三。快是真的快,话多也是真的多。
谷歌在文档里给出少见的建议:追求计算效率的开发者继续用3.7 Flash,它仍然完整支持。厂商主动劝用户留着旧款,这个信号要认真对待。
Antigravity默认切换
3.8 Flash已成为Google Antigravity编程智能体的默认模型,AI Studio、Android Studio同步可用。谷歌的演示案例:一条循环提示词生成完整可玩的DOS风格Google Maps,含地点、路线和街景。开发者用一句构建交互式看板的指令,模型就能自己迭代到跑通为止。
同场发布的还有3.8 Flash Cyber,网络安全特化版。在覆盖20种编程语言的内部漏洞基准上成功率超过70%,CWE-Bench补丁通过率47.2%,与最强旗舰的47.8%几乎持平。该版本只向Fairwind Program认证的可信防御者开放,普通开发者碰不到。
怎么选
三个判断标准。任务以命令行操作、仓库级代码修改、多步骤工具调用为主,3.8 Flash是目前性价比最高的选择,直接切换。任务以开放式推理为主,本次升级几乎没带来收益,留在3.7 Flash能省下可观的token开销。要做2027年预算,现在就按翻倍后的价格测算。
六周三发的节奏说明一件事:中端模型市场已经进入消耗战。谷歌用0.75美元的价格锚点逼对手跟进,OpenAI和Anthropic的高端定价空间正在被压缩。对开发者来说,旗舰级编程能力降到白菜价,上车窗口就在眼前。
苏公网安备32010502011527号
发表回复