01AI Hot(卡兹克)DeepSeek 发布 V4.1-Flash:新型 Causal Encoder-Decoder 架构
DeepSeek 正式推出 V4.1-Flash 模型,采用全新的 Causal Encoder-Decoder 架构,并原生集成视觉理解能力,是该新架构家族中体量最小的成员。模型总参数规模为 552B 的混合专家架构(MoE),输入处理阶段激活 8B 参数、输出生成阶段激活 16B 参数,相比此前架构在每 token 计算与路由效率上做了重新分配。工程层面,V4.1-Flash 把 KV cache 显存占用压缩到上一代的 1/4,并把 KV cache 的 SSD 存储需求降至 1/8,使长上下文推理对硬件门槛明显下降;同步上线的 API 定价也相应下调。从产业意义看,这是 DeepSeek 在架构层面的一次较大改动而非局部优化:Causal Encoder-Decoder 兼顾了自回归生成的因果性与编码器侧的并行理解,叠加原生视觉通路后,多模态输入不再依赖外挂视觉塔;KV cache 的压缩与 API 降价则把高并发、长上下文场景的部署与调用成本显著拉低,对依赖大上下文窗口的应用开发者以及追求性价比的多模态产品具有直接吸引力。
原文 ↗