V4.1 Flash模型HBM需求降至1/4,SSD降至1/8,利润率超90%。DeepSeek发布V4.1 Flash模型,通过底层架构自主创新实现降本增效内生闭环。该模型采用非对称CED架构,输入端仅激活8B参数,输出端激活16B参数,将HBMKV Cache需求压缩至前代1/4,SSD需求降至1/8,直接将推理利润率推高至90%以上。同时,其闲时缓存命中输入价格低至0.02元/百万Token,原生支持100万Token上下文。此工程优化扭转了市场对国产大模型依赖价格战和海外黑盒蒸馏的担忧,使行业竞争全面转向底层架构效率战。极低调用成本击穿了复杂Agent任务的经济底线,将引爆Agent应用规模化落地,推动AI产业链利润分配向应用端和推理算力端倾斜,迎来业绩兑现右侧拐点。寒武纪/海光信息/中科曙光(算力硬件厂商,受益于推理基建扩容与设备采购),首都在线/东阳光(智算租赁厂商,受益于高频推理并发与需求传导),腾讯控股/智谱/宏景科技(模型与应用端,受益于成本骤降引爆应用规模落地)
V4.1 Flash模型HBM需求降至1/4,SSD降至 1/8,利润率超90%。 DeepSeek发布V4.1 Flash模型,通过底层架构自主创新实现降本增效内生闭环。该模型采用非对称CED架构,输入端仅激活8B参数,输出端激活16B参数,将HBMKV Cache需求压缩至前代1/4,SSD需求降至1/8,直接将推理利润率推高至90%以上。同时,其
阅读:0
点赞:0