DeepSeek 发布开源模型 DeepSeek-V4.1-Flash,优化编码智能体 prefill 效率
DeepSeek-V4.1-Flash: more efficient prefill for coding agents
DeepSeek 本周在 HuggingFace 开源 DeepSeek-V4.1-Flash 权重,模型总参数 552B,prefill 激活 8B、decode 激活 16B,支持 1M token 上下文和文本加图像输入,已上线 Baseten Model APIs。
文章解释了 CED 架构如何把 prefill 降到 8B 激活参数并压缩 KV cache,读者能理解它为何更适配编码智能体的高 prefill 负载。
本周,DeepSeek 在 HuggingFace 上发布了 DeepSeek-V4.1-Flash 的开放权重,该模型已经在 Baseten Model APIs 上可用(Loops 支持即将推出)。关键规格包括:
总计 552B 参数
预填充阶段激活 8B 参数,解码阶段激活 16B
1M token 上下文窗口
多模态输入(文本 + 图像),文本输出
“flash”这一命名最初由 Google 的 Gemini 系列推广开来,用于描述更轻量、更便宜的模型,其设计目标是在性能上接近更大的模型。V4.1-Flash 是 DeepSeek 今年发布的第三个开放权重 flash 版本,与 Z.ai 和阿里巴巴近期的产品一道,表明模型实验室正在为编码智能体工作负载提供更高智能、更低价格的方案。
对比 DeepSeek 模型:旧版与新版
DeepSeek V4.1-Flash 在文本和多模态能力上均展现出相较 V4-Flash 和 V4-Pro 模型的改进。
在编码和智能体基准测试中,V4.1-Flash 以约三分之一的总参数量击败了 V4-Pro。提升最大的是长时程智能体任务,实现了两位数增长,而单次命令行任务的提升则较为温和。这些提升是真实的,但 Automation-Bench 上 54.8 的得分意味着它大约有一半的复杂工作流会失败。在智能体流水线中仍需保留人工介入。
摘自 HuggingFace DeepSeek-ai/DeepSeek-V4.1-Flash 模型卡
*所有列出的基准测试满分均为 100。
V4.1-Flash 是 DeepSeek 首个原生支持图像输入的非实验性模型,此前该能力仅限于 V4-Flash-Vision-Exp。这一代的视觉推理也有所提升,尤其是在图表解读和基于图像的逻辑推理方面,如果你要输入截图、仪表盘或 UI 原型图,这些能力会很有用。不过,ZeroBench 得分仍未达到 50,在这一水平下,对于任何重要事项,你仍然需要人工审核基于图像的推理结果。
摘自 HuggingFace DeepSeek-ai/DeepSeek-V4-Flash-Vision-Exp 模型卡
*所有列出的基准测试满分均为 100。
DeepSeek 已在其平台上退役 V4-Flash 模型,现在将其流量路由至 V4.1-Flash。V4-Pro 的流量也将从 9 月 14 日起重新路由。如果你正在运行任何 DeepSeek V4 模型,请升级到 V4.1-Flash。如果你正在使用其他实验室的大型通用模型,并希望获得更强、更高效的编码和智能体性能,它也值得一看。
非对称激活参数以实现更高效的计算利用
DeepSeek-V4.1-Flash 是唯一采用因果编码器-解码器(CED)架构的同等规模模型。
模型计算中的两个关键步骤是:
预填充:读取输入
解码:生成输出
其他 MoE 模型在预填充和解码步骤中激活相同数量的参数。CED 将 V4.1-Flash 的 40 层拆分为 20 层因果编码器和 20 层解码器,解码器的 KV 缓存直接从编码器的输出投影而来。这意味着预填充只需运行编码器,每个 token 激活 8B 参数,而解码则运行完整模型,激活 16B。
其思路是生成输出比读取输入更难,因此计算资源优先分配给 decode 而非 prefill。作为对比,V4-Flash 在 prefill 和 decode 时都激活 13B,因此 V4.1-Flash 用更重的 decode(16B)换来了更轻的 prefill(8B)。
✕
CED 通过在编码器处停止并在解码期间复用投影后的 KV 缓存,减少了 prefill 计算量。
这一设置提升了编码智能体的成本效率,因为智能体循环生成的 prefill token 远多于 decode token。此外,由于解码器的键值状态是从编码器输出投影而来,而非在每一层独立计算,CED 有助于实现小得多的 KV 缓存,从而降低缓存成本。
通过 KV 缓存改进进一步节省
据 DeepSeek 称,V4.1-Flash 的全局 KV 缓存所需内存仅为 V4-Flash 的四分之一。CED 架构通过从编码器输出投影解码器的 KV 缓存而非独立计算,对此有所贡献。它还与另外两项技术协同,进一步缩减 KV 缓存。
压缩稀疏注意力 2:在注意力层之间共享键值条目
FP4 KV 缓存:以更低精度存储键值条目。
✕
DeepSeek-V4.1-Flash 的全局 KV 缓存每个 token 所需内存更少。
摘自 Introducing DeepSeek-V4.1-Flash: smarter, faster, more efficient.
每个 token 占用更少内存意味着缓存中能容纳更多上下文,从而提高命中率。当提示词的前缀已被缓存时,模型会跳过对这些 token 的注意力重算,缩短首 token 时间并提升每块 GPU 的吞吐量。编码智能体受益最大,因为智能体循环在每一步都会重新发送大体相同的上下文。要在生产环境中捕获这种复用,取决于请求如何在 GPU 之间路由,而这正是服务栈发挥作用的地方。
DeepSeek-V4.1-Flash 的生产推理
Baseten Inference Stack 通过 NVIDIA Dynamo 和 KV 缓存感知路由来处理这种路由,将每个请求导向已持有其前缀的副本,而不是哪个副本空闲就发给哪个。
✕
“KV 感知路由将请求发送到已缓存相关上下文的副本,通过避免冗余的 prefill 计算来节省时间。”
所有这些都运行在 Baseten Model APIs 背后,DeepSeek-V4.1-Flash 现已可用。可在我们的 Model Library 中试用,或联系我们,如果你的团队需要预留容量,可以洽谈专属部署。
来源:Baseten 工程博客(网页) · baseten.co