DeepSeek-V4.1-Flash实测账本:0.75美元跑赢自家旗舰,编程智能体成本重算

9月10日,DeepSeek发布V4.1-Flash。这个挂着Flash名号的模型干了一件反常的事:跑分压过自家旗舰V4 Pro,价格只有零头。官方文档给出结论——V4.1-Flash在性能、成本、速度、总耗时四个维度全面超越V4 Pro。9月14日起,所有deepseek-v4-pro请求自动路由到V4.1-Flash,按Flash价格计费。

旗舰退役,小模型接盘,这一幕值得开发者细看。

552B参数的Flash,架构先动了刀

V4.1-Flash是首个基于Causal Encoder-Decoder(CED)因果编码器-解码器架构的模型。40层Transformer切成两半:20层因果编码器负责读,20层解码器负责写。

拆分带来关键变化:预填充阶段每token激活80亿参数,解码阶段激活160亿。读输入用小算力,写输出用大算力,正好对上编程智能体的负载特征——Agent反复读同一份仓库、同一套工具定义,读的量远超写的量。

配套三件套:压缩稀疏注意力CSA2、分层稀疏索引、FP4 KV缓存。全局KV缓存被压到每token 890字节,约为V4-Flash的四分之一;持久化缓存存储需求降到约八分之一,缓存寿命保底72小时。

代价同样明显。骨干参数从284B涨到552B,涨幅94%。Hacker News上有人质疑:552B的模型还能叫Flash吗?本地部署门槛大幅抬高,官方建议大规模部署方备好2000块GPU加存储集群再谈。

跑分:赢在SWE,输在长程终端任务

DeepSeek自家跑分表中,V4.1-Flash在DeepSWE v1.1拿到74.2,压过Claude Opus 5的74.0和GPT-5.6 Sol的73.0。Terminal-Bench 2.1拿到90.6,CyberGym拿到88.1,GPQA Diamond拿到90.9,Codeforces rating达到3471。

短板也写在同一张表里。Terminal-Bench 3.0上Opus 5以43.3对30.0领先;4.0版本差距拉到51.8对31.2。GPQA Diamond和SEC-Bench Pro两项,GPT-5.6 Sol保持领先。

日常SWE任务和短程终端操作,V4.1-Flash具备旗舰级竞争力;长程复杂终端任务,差距仍然明显。

价格:缓存命中才是真杀招

标价已经够低:谷峰时段每百万token输入0.30美元、输出1.20美元;谷时减半,合计0.75美元。

真正的杀招在缓存命中价:谷时每百万token仅0.003美元。对比缓存读取成本——GPT-5.6 Sol为0.40美元,Claude Opus 5为0.50美元,Kimi K3为0.30美元。

算一笔账:编程智能体持有50万token复用前缀,100次请求产生5000万缓存输入token。V4.1-Flash谷时只要0.15美元,Kimi K3要15美元,GPT-5.6 Sol要20美元,Claude Opus 5要25美元。百倍量级的差距。

VentureBeat 7月调研170家百人以上企业,只有47%严格追踪AI算力成本。多数团队的缓存开销还是一笔糊涂账。

effort档位:藏在跑分背后的杠杆

官方跑分全部在reasoning_effort=100下测出。effort从25提到100,DeepSWE v1.1从66.0%涨到74.2%,代价是输出token消耗约2.5倍。官方数据显示,effort设在60到80之间,用不到一半的token预算即可恢复绝大部分精度;从80推到100,轨迹长度增加1.6到1.8倍,增益很小。

调用方式示例:

“`python

from openai import OpenAI

client = OpenAI(

api_key=”YOUR_KEY”,

base_url=”https://api.deepseek.com”

)

resp = client.chat.completions.create(

model=”deepseek-v4.1-flash”,

messages=[{“role”: “user”, “content”: “重构这段代码并补上测试”}],

extra_body={“reasoning_effort”: 75}

)

“`

成本敏感的Agent,high档(effort=75)大概率是更优工作点。

迁移提醒

V4-Flash与V4-Flash-Vision-Exp已退役,旧标识符暂时路由到V4.1-Flash。新模型原生支持Responses API格式,针对Codex做了适配,WorkBuddy(含CodeBuddy)和OpenCode已全面支持。

Hacker News的另一条批评值得记下:生产环境里更换标识符背后的模型,即便标称更好更便宜,也可能让精心调过的提示词失效。迁移之前,回归测试必须重跑一遍。

Reuters同期报道,DeepSeek已聘请中信证券筹备科创板上市,新一轮融资估值最高5000亿元人民币。价格战的底气,连着商业化的野心。

给开发者一句实话:别再拿标称单价选模型。算清楚缓存命中率、effort档位、每完成任务的净成本,再决定V4.1-Flash进不进主力阵容。890字节的KV缓存摆在那里,重度输入的智能体负载,值得试一把。


评论

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注

苏ICP备2025163703号-2   警徽苏公网安备32010502011527号