DeepSeek 开源 DSpark 投机解码框架,加速 DeepSeek-V4 生成速度 60–85%
DeepSeek Releases DSpark, a Speculative Decoding Framework That Accelerates DeepSeek-V4 Per-User Generation 60–85% Over MTP-1
DeepSeek 发布 DSpark 投机解码框架并开源检查点与训练代码。该框架不是新模型,而是在 DeepSeek-V4 权重上附加草稿模块,通过半自回归生成(并行骨干 + 轻量级顺序头)实现无损加速。生产环境下,DeepSeek-V4-Flash 和 V4-Pro 每用户生成速度较 MTP-1 基线分别提升 60–85% 和 57–78%。离线测试中,接受长度比 Eagle3 高 26–31%,比 DFlash 高 16–18%。配套 DeepSpec 训练代码库采用 MIT 许可证。
DeepSeek 开源的这个投机解码框架让 V4 生成提速 60% 以上,关键在于不换模型就能加速,对用 API 做产品的人是立即可用的性能提升。代码和权重都给了,值得一试。
DeepSeek 发布了 DSpark,这是一个投机解码框架,附带开源 checkpoint 和训练代码。它是一项服务优化,而非新模型。这些 checkpoint DeepSeek-V4-Pro-DSpark 和 DeepSeek-V4-Flash-DSpark 复用了现有的 V4 权重,并附加了一个 draft 模块。
DeepSeek 研究团队还 开源了 DeepSpec,这是一个采用 MIT 许可证的代码库,用于训练和评估投机解码的 draft 模型。这项工作针对一个问题:在繁忙的生产服务中实现更快的大模型推理。
TL;DR
- DSpark 将并行 draft 主干与一个极小的串行 head 配对,以减少后缀衰减。
- 一个置信度 head 和负载感知调度器会在 GPU 空闲时验证更多 token,繁忙时验证更少。
- 离线情况下,接受长度相比 Eagle3 提升 26–31%,相比 DFlash 提升 16–18%。
- 在 DeepSeek-V4 的生产环境中,每用户生成速度比 MTP-1 基线快 60–85%。
- 输出保持无损,且 checkpoint 和 DeepSpec 训练代码均已开源。
什么是 DSpark?
投机解码将生成过程拆分为两个角色。一个小型草稿模型提出一个 token 块。完整的目标模型随后在一次前向传播中验证该块。
拒绝采样接受最长的有效前缀,并追加一个奖励 token。由于该规则精确保持了目标分布,因此不存在质量损失。DSpark 保留了这一保证。它改变的是 token 的草拟方式以及被验证的 token 数量。
它所优化的延迟数学
每 token 延迟遵循论文中的一个公式:L = (Tdraft + Tverify) / τ。其中 τ 是每个周期接受的 token 数量。加速仅来自三个杠杆。
你可以草拟得更快,从而降低 Tdraft。你可以草拟得更好,从而提高 τ。或者你可以更智能地验证,减少浪费的 Tverify。DSpark 同时拉动这三个杠杆。
工作原理:半自回归生成
早期的草拟器被迫做出权衡。像 Eagle3 这样的自回归草拟器将每个 token 建立在前序 token 的条件之上。这带来了较高的接受率,但草拟成本随块大小增长。
像 DFlash 这样的并行草拟器在一次传播中生成整个块。草拟成本保持低廉,但每个位置都忽略其相邻位置。其结果是“多模态碰撞”以及沿后缀的接受率迅速衰减。
DSpark 将起草拆分为两个阶段。一个重量级的并行主干(在他们的设置中为 DFlash)为每个位置生成基础 logits。随后,一个轻量级的顺序头在采样每个 token 之前加入一个依赖前缀的偏置。
默认的顺序头是一个马尔可夫头。它只关注紧邻的前一个 token。低秩分解(秩为 256)使其保持低成本,即使面对大词表也是如此。
一旦第一个位置采样出“of”,该头就会提升“course”并抑制“problem”。一个可选的 RNN 头会追踪整个块的完整前缀。它只带来边际收益,因此马尔可夫头作为默认方案发布。
收益会逐个位置地显现出来。DSpark 继承了并行主干的高首 token 准确率。随后顺序头在块的深处仍能保持稳定的接受率。
训练会冻结目标模型,并复用其嵌入向量和输出头。全变差损失是关键项。最小化该距离可直接最大化草稿的接受率。
工作原理:置信度调度的验证
更多的草稿 token 并不总是意味着更快的速度。在高负载下,验证那些将被拒绝的 token 会浪费批处理容量。DSpark 增加了两个部分来解决这个问题。
一个置信度头为每个草稿位置输出一个分数。该分数估计在给定已接受前驱的情况下,该 token 通过验证的概率。它由解析的每步接受率进行监督。
原始神经置信度通常过度自信。因此,研究团队应用了顺序温度缩放(Sequential Temperature Scaling),这是一个事后校准步骤。它将期望校准误差从 3–8% 降至约 1%。
随后,一个硬件感知的前缀调度器会为每个请求设定验证长度。它使用一条在启动时一次性测量得到的吞吐量曲线画像 SPS(B)。当 GPU 空闲时,它验证更多 token。当 GPU 繁忙时,它验证更少 token。
调度器使用一种提前停止规则来保持无损。附录部分给出了一个反例,说明为什么朴素的全局搜索会泄露信息。
指标
离线测试涵盖数学、代码和日常聊天。目标模型包括 Qwen3-4B、8B、14B 和 Gemma4-12B。DSpark 在每个领域的接受长度上都优于两个基线。
与 Eagle3 相比,在三种 Qwen3 规模上,宏平均接受长度分别提升 30.9%、26.7% 和 30.0%。与 DFlash 相比,增益分别为 16.3%、18.4% 和 18.3%。一个 2 层的 DSpark 甚至能击败一个 5 层的 DFlash。
顺序头的额外开销很小。将草稿长度从 4 扩展到 16,每轮延迟仅增加 0.2–1.3%。作为回报,接受长度最多提升 30%。
生产环境结果来自真实流量下的 DeepSeek-V4-Flash 和 V4-Pro。基线是 MTP-1,即此前的单 token 设置。在吞吐量匹配的情况下,Flash 上每用户速度提升 60–85%,Pro 上提升 57–78%。实际交付的配置是 DSpark-5,即带有 Markov 头的五 token 草稿块。
| 草稿器 | 草稿风格 | 块成本 | 后缀接受率 | 验证长度 |
|---|---|---|---|---|
| Eagle3 | 自回归 | 随块大小增长 | 高且稳定 | 固定 |
| DFlash | 并行 | 近乎恒定 | 快速衰减 | 固定(完整块) |
| MTP-1 | 单 token(MTP) | 低 | — | 静态 2 个 token |
| DSpark | 并行 + 顺序头 | 近乎恒定 | 高且稳定 | 动态、负载感知 |
用例与示例
结构化工作负载从更长的验证中获益最多。在代码生成中,接受率天然就很高。调度器可以验证较长的前缀而几乎不产生浪费,因此编码智能体能更快地流式输出结果。
开放式聊天则表现不同。一次置信度阈值扫描将聊天接受率从 45.7% 提升到了 95.7%。置信度头会标记出不确定的后缀 token,以便将其剪除。
数学推理介于两者之间。在同一次扫描中,其接受率从 76.9% 上升到了 92.5%。冗长的逐步推理轨迹受益于稳定的深层块接受率。
高并发服务是其标志性场景。在中等负载下,调度器每个请求大约运行 4–6 个已验证 token。随着并发量上升,它会削减该预算以保护吞吐量。
立即试用
DeepSpec 分三个阶段运行:数据准备、训练,然后是评估。配置用于选择算法和目标模型。评估会在九个数据集上对训练好的草稿检查点进行基准测试。
# Install dependencies
python -m pip install -r requirements.txt
# Train a DSpark draft against a Qwen3-4B target.
# The algorithm and target are chosen by the config, e.g.
# config/dspark/dspark_qwen3_4b.py
bash scripts/train/train.sh
# Evaluate the trained draft across the 9 benchmark datasets.
# Set in the eval config:
# target_name_or_path = Qwen/Qwen3-4B
# draft_name_or_path = ~/checkpoints/deepspec/dspark_block8_qwen3_4b/step_latest
bash scripts/eval/eval.sh默认配置假定使用一个配备 8 块 GPU 的节点。若数量更少,请减少 CUDA_VISIBLE_DEVICES。请注意,目标缓存可能很大,在 Qwen3-4B 设置下接近 38 TB。
对于生产检查点,草稿模块会挂载到现有的 V4 权重上。Hugging Face 模型卡在 inference 文件夹中包含了一个最简推理示例。无需重新训练目标模型。
下方的交互式演示展示了该机制。选择一个草稿模型、一个领域和一个 GPU 负载水平。实时观察草稿块、置信度分数以及调度器的验证预算变化。这些数字仅作示意,是根据论文所报告的行为建模得出的。
来源:MarkTechPost(RSS) · marktechpost.com