跳到正文
北京时间
原文
MarkTechPost(RSS)· Asif Razzaq·· 1 天前精选AI 评分78

Fireworks AI 发布 Ember-1:基于 Kimi K3 的后训练模型,推理 Token 减少约 40%

Fireworks AI Releases Ember-1: A Post-Trained Kimi K3 That Uses About 40% Fewer Tokens

AI 导读

Fireworks AI 推出 Ember-1,这是基于 Moonshot AI 开源权重 Kimi K3 进行后训练的专用模型。该模型通过优化内部推理过程,在保持任务准确率的同时将生成的推理 Token 减少了约 40%。与单纯降低推理努力程度不同,Ember-1 保留了有用的自我反思并削减了冗余循环。基准测试显示,其在 Terminal Bench 2.1 和 DeepSWE 1.1 上表现优于 K3 Max,且在生产环境 A/B 测试中实现了显著的成本节约。目前仅通过 Fireworks Serverless API 以研究预览形式提供,未开放权重。

正文 · AI 翻译

Fireworks AI 发布了 Ember-1,这是 Fireworks Research 通过对 Moonshot AI 的开源权重模型 Kimi K3 进行后训练而构建的专用模型。Ember-1 学会了在保持任务准确率的同时生成更短的推理轨迹。这与在推理时降低推理努力程度设置不同。根据 Fireworks 发布博文,Ember-1 以约减少 40% 的 token 实现了 Kimi K3 的质量。

它可以部署吗?可以,但只能通过 Fireworks 无服务器 API 以 Research Preview 的形式使用。Fireworks 尚未发布 Ember-1 的权重、训练代码或确切的训练算法,因此目前无法自行托管。

问题所在:推理模型思考过度

Fireworks 团队报告称,像 Kimi K3 这样的推理模型有时会将超过 90% 的生成 token 用于内部推理。这种成本在多轮智能体工作负载中会不断累积。每一轮都会将先前的推理重新回传给模型。上下文随轮数大致呈二次方增长。早期轮次的长轨迹会在之后的每次调用中被重新读取,并重新计费。

Fireworks 团队解释了客户如何希望以更低的成本获得 K3 的编码能力。调低 K3 的推理努力程度并不能解决问题。较低的推理努力设置牺牲了太多质量。因此,团队转而训练模型更高效地推理。

Fireworks Research 如何构建 Ember-1

K3 的推理并非全是浪费。其中一些是有用的自我反思,例如重新审视某个假设或对反馈做出反应。Ember-1 保留了这种行为,同时削减了冗余推理和无效循环。

训练数据集涵盖数学、编码、指令遵循、对话、搜索、工具使用和软件工程。它既包括独立问题,也包括扩展的多步交互。任务和环境反馈指导同策略规划与学习。Fireworks 团队进行了 50 多次训练实验和 200 多次评估。他们还开发了新的训练算法,但尚未公开发表。所有训练均在 Fireworks Serverless Training 上运行。Fireworks 表示其使用的是自有数据,未使用客户数据。

基准测试结果

Fireworks 在三个推理努力水平上将 Ember-1 与 Kimi K3 进行了比较。成本使用公开的 Kimi K3 API 定价计算。这些是 Fireworks 自己发布的评估结果。

基准测试NK3 LowK3 HighK3 MaxEmber-1Ember-1 对比 K3 Max(成本)
Terminal Bench 2.18976.4%77.6%80.9%82.0%-51.9% / -23.1 USD
SWE-bench Verified50080.4%86.0%93.2%92.2%-15.5% / -68.1 USD
SWE-Interact756.7%13.3%21.3%20.0%-32.5% / -60.8 USD
DeepSWE 1.111355.8%62.8%66.4%75.2%-23.7% / -126.9 USD
τ-2 Bench Airline5064%64%64%66%-5.9% / -0.3 USD

Ember-1 在 Terminal Bench 2.1 和 DeepSWE 1.1 上领先 K3 Max。在 SWE-bench Verified 和 SWE-Interact 上略微落后。在七项基准测试和两个客户的生产流量中,Fireworks 表示 K3 的推理被缩短了 35% 到 50%,且没有牺牲准确率。

在 Doximity 的 Bedside Bench(一套由医生验证的 500 个临床案例)上,Ember-1 树立了新的每任务成本帕累托前沿。该结果来自 Fireworks 新的 Specialized Intelligence Index。

生产环境 A/B 测试结果

Fireworks 在生产编码工作负载上,与 2 家客户进行了实时 A/B 测试。在质量相当的情况下,双方都看到每个任务使用的 token 减少了约 35%。在公布的运行中,每个任务的输出 token 从 49.3K 降至 29.9K。推理 token 下降了 71.3%,总 token 下降了 39%。任务得分基本没有变化:Ember-1 为 0.753,而 K3 为 0.751。平均步骤数从 23.8 降至 21.4。一家客户现在已在生产环境中运行 Ember-1。

在 Fireworks 上,Ember-1 的每 token 成本与 Kimi K3 相同:每 100 万 token 输入 $3.00、缓存输入 $0.30、输出 $15.00。节省完全来自生成更少的 token。按该输出费率计算,A/B 数据折算下来,每个任务的输出成本约为 $0.74 对 $0.45(我们的计算,仅输出)。

交互式讲解

关键要点

  • Ember-1 是经过后训练的 Kimi K3,用更少的 token 进行推理,而不是以更低的投入运行。
  • Fireworks 报告称,在其各项评估中准确率保持稳定,同时 token 减少约 40%。
  • 在生产 A/B 测试中,每个任务的输出从 49.3K token 降至 29.9K token,得分为 0.753 对 0.751。
  • 它在 Terminal Bench 2.1(82.0%)和 DeepSWE 1.1(75.2%)上击败 K3 Max,但在 SWE-bench Verified(92.2%)上落后。
  • 仅提供 API 的研究预览版,采用 K3 定价;权重和训练代码未发布。

查看 技术细节。所有功劳归于该项目的研究人员。另外,欢迎在 Twitter 上关注我们,别忘了加入我们的 150k+ ML SubReddit 并订阅 我们的 Newsletter。等等!你在 Telegram 上吗? 现在你也可以在 Telegram 上加入我们。

需要与我们合作推广你的 GitHub Repo 或 Hugging Face 页面或产品发布或网络研讨会等? 联系我们

文章 Fireworks AI Releases Ember-1: A Post-Trained Kimi K3 That Uses About 40% Fewer Tokens 首次出现在 MarkTechPost。

来源:MarkTechPost(RSS) · marktechpost.com