DeepSeek-V4把百万Token成本砍到27%:CSA+HCA混合注意力,才是大模型价格战的真底牌

百万Token上下文正在从发布会参数变成日常默认配置。DeepSeek-V4系列做到了1M上下文官方标配,同时给出了一组让同行坐不住的数字:在1M上下文下,V4-Pro的单token推理FLOPs仅为DeepSeek-V3.2的27%,KV Cache降到10%。

一份改变价格体系的架构答卷

先看这次发布的两个模型。DeepSeek-V4-Pro是1.6T总参数、49B激活参数的MoE模型,定位高能力版本。DeepSeek-V4-Flash是284B总参数、13B激活参数,定位高效率版本,其效率指标更激进:单token推理FLOPs降到V3.2的10%,KV Cache只剩7%。

两个模型的最大输出都支持384K token。这意味着整部剧本、全套法律卷宗、一个大型代码仓库,可以一次性塞进模型,而不需要切块、检索、拼接。

官方API定价同样值得细看。V4-Pro缓存命中输入0.025元/百万token,缓存未命中3元/百万token,输出6元/百万token。V4-Flash更便宜,缓存命中输入低至0.02元/百万token。长上下文的边际成本被压到了”能日常开”的程度,这件事在一年前还做不到。

CSA+HCA:两层压缩,各管一段

长上下文贵在哪里?标准Transformer的attention计算量随上下文长度快速增长,KV Cache同步膨胀。上下文拉到1M,这两项开销会一起爆炸。很多模型号称支持长上下文,实际用起来要么速度崩塌,要么账单吓人。

DeepSeek-V4的解法是混合注意力架构,由两个互补的模块组成。

CSA(Compressed Sparse Attention)走”先压缩、再稀疏选择”路线。以V4-Pro为例,压缩率m=4,每4个token先压成1个compressed KV。随后用DeepSeek Sparse Attention做选择,每个query只保留1024个compressed KV block参与主注意力。另拼一段128 token的sliding window,保住最近邻细节。

这里有个容易被忽略的设计:选择器没有用昂贵的全精度selector,而是采用lightning indexer。它先把query压到低秩latent,再给历史compressed KV打分,只保留top-k。模型在1M token上不需要”全看一遍再决定看谁”,而是在一个便宜的索引空间里先粗筛。

HCA(Heavily Compressed Attention)比CSA更狠。压缩率m’=128,128个token压成1个。它不做稀疏选择,而是在重压缩后的KV上继续做dense attention。

两个模块交替使用:CSA让模型保留”挑重点看”的能力,HCA让模型在极低KV成本下处理很长的历史。这正是V4能把1M做成默认能力的核心。按报告口径估算,与常见的BF16 GQA8长上下文基线相比,V4系列在1M上下文下的KV Cache大约只剩2%的量级。

四个防”变糊”的细节

压缩注意力最容易出的毛病是精度损失。技术报告里四个补救设计值得单独说。

RMSNorm on query/KV,在core attention前对query和compressed KV做额外归一化,防止attention logit爆炸。Partial RoPE,只对最后64维施加位置编码,并对输出做逆向位置修正,保住相对位置信息。Sliding Window Branch给压缩体系补一个高保真”近场观察窗”。Attention Sink为每个head引入可学习sink logit,避免部分head在长上下文下被迫摊平注意力。

KV存储本身也做了混合格式:RoPE维度保留BF16,非RoPE维度转FP8,体积再砍近一半。lightning indexer的相关打分路径进一步用FP4。

MoE与mHC:便宜的另一半故事

DeepSeekMoE路线继续沿用。V4-Pro有61层,所有Transformer block的FFN都是MoE结构。每层1个shared expert加384个routed experts,每个token只激活6个。前3层用Hash routing,后面交给可学习路由。

总参数决定能力上限,激活参数决定每个token的边际成本。1.6T的容量,49B的账单,这笔账就这么算。

训练侧还有两项关键改动。mHC(Manifold-Constrained Hyper-Connections)把残差映射矩阵约束在双随机矩阵流形里,谱范数上界限制在1,深层网络的信号传播不会失控。Muon优化器在大多数模块上替掉AdamW,换更快收敛和更稳训练;embedding、prediction head、RMSNorm等模块继续保留AdamW。

万亿参数训练里最贵的从来不是理论FLOPs,而是loss spike导致的回滚和反复试错。mHC和Muon压的就是这部分账。

对开发者和行业意味着什么

对开发者,1M上下文加低价API直接改变了应用设计空间。RAG的分块检索策略可以简化,Agent的多轮工具调用不再需要激进的上下文压缩,长文档分析可以从”摘要再摘要”变成”整读”。磁盘级context caching把重复prefill变成廉价的缓存命中,shared prefix场景的成本进一步下降。

对行业,这组数字宣告长上下文竞争进入新阶段。拼”窗口长度指标”的时代结束了,下一轮比拼的是百万token场景下的单位效率。开源权重加激进定价的组合拳,会给闭源旗舰的定价体系持续施压。

V4-Pro 1.6T全量部署需要22块H100 80GB(FP8量化),单机不现实,必须多机张量加专家并行。生产场景大多用V4-Flash。目前生态主要靠vLLM-Ascend与SGLang支撑,工程团队选型时要留意。

价格战的本质是架构战

DeepSeek-V4便宜,原因不在于赔本赚吆喝。模型结构、训练稳定性、并行内核、缓存系统、后训练范式,一路往下,把真正烧钱的项逐个削掉。CSA+HCA砍掉attention FLOPs和KV Cache,混合KV格式和磁盘缓存压缩长前缀服务成本,FP4 QAT再削部署显存和带宽。

大模型的价格战表面看是市场行为,底层全是架构和工程的硬账。下一次看到某家厂商宣布降价,先去看它的注意力机制和缓存设计,答案多半藏在那里。

(数据来源:DeepSeek-V4技术报告、DeepSeek官方API文档)


评论

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注

苏ICP备2025163703号-2   警徽苏公网安备32010502011527号