Fireworks AI 发布 Ember-1:基于 Kimi K3 的后训练模型,推理 Token 减少约 40%
Fireworks AI Releases Ember-1: A Post-Trained Kimi K3 That Uses About 40% Fewer Tokens
Fireworks AI 推出 Ember-1,这是基于 Moonshot AI 开源权重 Kimi K3 进行后训练的专用模型。该模型通过优化内部推理过程,在保持任务准确率的同时将生成的推理 Token 减少了约 40%。与单纯降低推理努力程度不同,Ember-1 保留了有用的自我反思并削减了冗余循环。基准测试显示,其在 Terminal Bench 2.1 和 DeepSWE 1.1 上表现优于 K3 Max,且在生产环境 A/B 测试中实现了显著的成本节约。目前仅通过 Fireworks Serverless API 以研究预览形式提供,未开放权重。
Fireworks AI 发布了 Ember-1,这是 Fireworks Research 通过对 Moonshot AI 的开源权重模型 Kimi K3 进行后训练而构建的专用模型。Ember-1 学会了在保持任务准确率的同时生成更短的推理轨迹。这与在推理时降低推理努力程度设置不同。根据 Fireworks 发布博文,Ember-1 以约减少 40% 的 token 实现了 Kimi K3 的质量。
它可以部署吗?可以,但只能通过 Fireworks 无服务器 API 以 Research Preview 的形式使用。Fireworks 尚未发布 Ember-1 的权重、训练代码或确切的训练算法,因此目前无法自行托管。
问题所在:推理模型思考过度
Fireworks 团队报告称,像 Kimi K3 这样的推理模型有时会将超过 90% 的生成 token 用于内部推理。这种成本在多轮智能体工作负载中会不断累积。每一轮都会将先前的推理重新回传给模型。上下文随轮数大致呈二次方增长。早期轮次的长轨迹会在之后的每次调用中被重新读取,并重新计费。
Fireworks 团队解释了客户如何希望以更低的成本获得 K3 的编码能力。调低 K3 的推理努力程度并不能解决问题。较低的推理努力设置牺牲了太多质量。因此,团队转而训练模型更高效地推理。
Fireworks Research 如何构建 Ember-1
K3 的推理并非全是浪费。其中一些是有用的自我反思,例如重新审视某个假设或对反馈做出反应。Ember-1 保留了这种行为,同时削减了冗余推理和无效循环。
训练数据集涵盖数学、编码、指令遵循、对话、搜索、工具使用和软件工程。它既包括独立问题,也包括扩展的多步交互。任务和环境反馈指导同策略规划与学习。Fireworks 团队进行了 50 多次训练实验和 200 多次评估。他们还开发了新的训练算法,但尚未公开发表。所有训练均在 Fireworks Serverless Training 上运行。Fireworks 表示其使用的是自有数据,未使用客户数据。
基准测试结果
Fireworks 在三个推理努力水平上将 Ember-1 与 Kimi K3 进行了比较。成本使用公开的 Kimi K3 API 定价计算。这些是 Fireworks 自己发布的评估结果。
| 基准测试 | N | K3 Low | K3 High | K3 Max | Ember-1 | Ember-1 对比 K3 Max(成本) |
|---|---|---|---|---|---|---|
| Terminal Bench 2.1 | 89 | 76.4% | 77.6% | 80.9% | 82.0% | -51.9% / -23.1 USD |
| SWE-bench Verified | 500 | 80.4% | 86.0% | 93.2% | 92.2% | -15.5% / -68.1 USD |
| SWE-Interact | 75 | 6.7% | 13.3% | 21.3% | 20.0% | -32.5% / -60.8 USD |
| DeepSWE 1.1 | 113 | 55.8% | 62.8% | 66.4% | 75.2% | -23.7% / -126.9 USD |
| τ-2 Bench Airline | 50 | 64% | 64% | 64% | 66% | -5.9% / -0.3 USD |
Ember-1 在 Terminal Bench 2.1 和 DeepSWE 1.1 上领先 K3 Max。在 SWE-bench Verified 和 SWE-Interact 上略微落后。在七项基准测试和两个客户的生产流量中,Fireworks 表示 K3 的推理被缩短了 35% 到 50%,且没有牺牲准确率。
在 Doximity 的 Bedside Bench(一套由医生验证的 500 个临床案例)上,Ember-1 树立了新的每任务成本帕累托前沿。该结果来自 Fireworks 新的 Specialized Intelligence Index。
生产环境 A/B 测试结果
Fireworks 在生产编码工作负载上,与 2 家客户进行了实时 A/B 测试。在质量相当的情况下,双方都看到每个任务使用的 token 减少了约 35%。在公布的运行中,每个任务的输出 token 从 49.3K 降至 29.9K。推理 token 下降了 71.3%,总 token 下降了 39%。任务得分基本没有变化:Ember-1 为 0.753,而 K3 为 0.751。平均步骤数从 23.8 降至 21.4。一家客户现在已在生产环境中运行 Ember-1。
在 Fireworks 上,Ember-1 的每 token 成本与 Kimi K3 相同:每 100 万 token 输入 $3.00、缓存输入 $0.30、输出 $15.00。节省完全来自生成更少的 token。按该输出费率计算,A/B 数据折算下来,每个任务的输出成本约为 $0.74 对 $0.45(我们的计算,仅输出)。
交互式讲解
关键要点
- Ember-1 是经过后训练的 Kimi K3,用更少的 token 进行推理,而不是以更低的投入运行。
- Fireworks 报告称,在其各项评估中准确率保持稳定,同时 token 减少约 40%。
- 在生产 A/B 测试中,每个任务的输出从 49.3K token 降至 29.9K token,得分为 0.753 对 0.751。
- 它在 Terminal Bench 2.1(82.0%)和 DeepSWE 1.1(75.2%)上击败 K3 Max,但在 SWE-bench Verified(92.2%)上落后。
- 仅提供 API 的研究预览版,采用 K3 定价;权重和训练代码未发布。
查看 技术细节。所有功劳归于该项目的研究人员。另外,欢迎在 Twitter 上关注我们,别忘了加入我们的 150k+ ML SubReddit 并订阅 我们的 Newsletter。等等!你在 Telegram 上吗? 现在你也可以在 Telegram 上加入我们。
需要与我们合作推广你的 GitHub Repo 或 Hugging Face 页面或产品发布或网络研讨会等? 联系我们
文章 Fireworks AI Releases Ember-1: A Post-Trained Kimi K3 That Uses About 40% Fewer Tokens 首次出现在 MarkTechPost。
来源:MarkTechPost(RSS) · marktechpost.com