蚂蚁 inclusionAI:HuggingFace 新模型·· 2026-08-09精选AI 评分60
inclusionAI 发布 Ling-3.0-flash 的 DSpark 投机解码模型 Ling3-DSpark
inclusionAI/Ling-3.0-flash-dspark
AI 导读
inclusionAI 推出 Ling3-DSpark,一个为 Ling-3.0-flash 设计的 DSpark 投机解码模型,参数量 1.36B,通过置信度头动态选择草稿 token 数量。在 GSM8K 等九项基准上平均接受长度为 5.29,其中 GSM8K 达 6.40。模型经 SpecForge 训练,可通过 SGLang 部署。
推荐理由
该模型把投机解码的接受长度按工作负载分开报告,数学与代码任务明显高于对话类,部署时可据此对不同场景的加速收益有更实际预期。
正文 · AI 翻译
Ling3-DSpark
面向 Ling3 的 DSpark 推测器。DSpark 在 DFlash 的基础上扩展了目标模型辅助特征,以及一个能够动态选择草稿 token 数量的置信度头。该模型使用 SpecForge 训练,并通过 SGLang 提供服务。
模型规格
- 目标模型:Ling-3.0-flash
- 草稿参数量:1,363,707,905(1.36B)
- 草稿权重 dtype:BF16
- 隐藏维度:2,560
- Transformer 层数:5 个全注意力层
- 注意力:MHA,32 个查询头与 32 个键/值头
- 目标辅助特征层:1、11、23、29、35
- 置信度头:vanilla Markov 头,rank 256
- DSpark 块大小:8 个草稿 token(验证宽度 9,包含目标奖励 token)
- 最大位置嵌入:262,144
接受长度
接受长度是指每个投机验证步骤中被接受的 token 平均数量,包括目标奖励 token。
| 工作负载 | 接受长度 |
|---|---|
| GSM8K | 6.40 |
| MATH-500 | 6.29 |
| AIME 2025 | 5.56 |
| HumanEval | 6.57 |
| MBPP | 6.34 |
| LiveCodeBench | 5.33 |
| MT-Bench | 3.92 |
| Alpaca | 3.51 |
| Arena-Hard-v2 | 3.72 |
九个工作负载均值的宏观平均值为 5.29。
使用 SGLang 进行服务
使用支持 DSPARK 的 SGLang 版本。将模型路径和张量并行大小替换为适合你部署的值:
sglang serve \
--trust-remote-code \
--model-path <LING3_MODEL_PATH> \
--tp-size <TP_SIZE> \
--speculative-algorithm DSPARK \
--speculative-draft-model-path <LING3_DSPARK_MODEL_PATH> \
......
1B params
来源:蚂蚁 inclusionAI:HuggingFace 新模型 · huggingface.co