铭鸿体育资讯网

DeepSeek V4.1 Flash把旗舰替了,降价背后是一场架构革命 9月8日内测,9月10日正式发布。9月14日起,所有deepseek-v4-pro请求自动路由到V4.1 Flash,按Flash价格计费。 不是并行,是替换。 入门款把旗舰替了,这种操作在大模型行业很少见。 真正狠的

DeepSeek V4.1 Flash把旗舰替了,降价背后是一场架构革命

9月8日内测,9月10日正式发布。9月14日起,所有deepseek-v4-pro请求自动路由到V4.1 Flash,按Flash价格计费。

不是并行,是替换。

入门款把旗舰替了,这种操作在大模型行业很少见。

真正狠的不是降价,是架构

V4.1 Flash用了因果编码器与解码器非对称架构。总参数552B的MoE,输入阶段只激活8B,输出阶段激活16B。

说人话就是:读东西时省力气,写东西时用力。

传统Decoder-only架构从头到尾一个算力档位。读一千页书和写一句话,用的是同一套参数、同一条流水线,不划算。

DeepSeek把读和写拆开。读的时候轻量编码,写的时候重型解码。成本自然下来。

这不是微调,不是蒸馏,不是量化,是从根上改架构。

KV Cache压缩才是底牌

每token的KV Cache从3514字节压到890字节。HBM需求降到上一代四分之一,SSD需求降到八分之一。

大模型推理最贵的不是算力,是显存。长上下文场景,KV Cache比模型本身还吃显存。以前一兆上下文,光KV Cache就能吃掉几百G。

现在压到四分之一,一张卡能搞定以前几张卡的活。省下的硬件、电费、机房成本,才是降价底气。

缓存命中的输入价格从0.05元降到0.02元每百万token,闲时降幅60%。输出从4.5元降到4元。闲时是高峰价一半。

官方给的数据,Agent场景综合成本下降约75%。反复读长文档、频繁调用工具的场景,省得更明显。

抢的就是Agent

Flash第一次原生支持视觉理解,一兆上下文,最大输出384K。

重点是Agent。

DeepSWE v1.1拿了74.2分,超过Opus 5的74.0。Terminal Bench 2.1拿了90.6分,七个模型里排第一。

一个测写代码,一个测终端操作,都是Agent核心战场。

Agent的特点:读得多,写得少。一个Agent跑起来,90%的token是输入上下文,输出只占一小部分。非对称架构刚好踩中痛点。

腾讯的WorkBuddy、CodeBuddy、OpenCode已经全量接入。腾讯是DeepSeek最大外部投资方,首轮投了约一百亿。资本和产品联动很快。

降价背后的IPO逻辑

今年6月,DeepSeek完成超500亿融资,投前估值约5000亿。据传已委托中信证券筹备科创板IPO。

降价抢量,IPO做数据,这条逻辑不难看懂。

但别想简单了。不是为了上市才降价,而是大模型成本曲线下降太快,快到可以用价格战清场。

别人降价是割肉,它降价是正常出货,还能赚。这才是可怕的地方。

泼盆冷水

V4.1 Flash在GPQA Diamond这类硬核推理上,仍不如GPT-5.6 Sol和Claude Opus 5。

顶级推理能力,差距还在。Flash赢在性价比和Agent场景,不是绝对智商。

但市面上90%的应用,要的不是绝对智商,是够用还便宜。尤其Agent这种吃token量的场景,成本差几倍,商业模型就是成立和不成立的区别。

当入门款把旗舰按在地上摩擦,其他厂商接下来怎么出牌?

跟着降价,亏血本。硬扛不降,丢市场。

国内大模型格局会不会因为这次发布彻底洗牌?评论区聊聊。