Inception Labs 发布扩散模型 Mercury Edit 2,专注代码 next-edit 预测
Introducing Mercury Edit 2
Inception Labs 发布 Mercury Edit 2,一个专为 next-edit 预测构建的扩散 LLM(dLLM),基于近期编辑和代码库上下文预测下一步修改,并行生成 token 以降低延迟。
官方给出了 KTO 偏好对齐带来的接受率和展示率变化及定价,可帮助开发者评估扩散模型做 next-edit 的实际收益。
今天我们推出 Mercury Edit 2:一款专为现代开发工作流中对延迟最敏感的环节——下一次编辑预测——而打造的扩散 LLM(dLLM)。该模型升级了我们此前的下一次编辑模型,并补充了我们现有的自动补全端点。
Mercury Edit 2 利用你最近的编辑和代码库上下文,预测你接下来会修改什么。由于 Mercury Edit 2 使用扩散并行生成 token,预测到达的速度快到仿佛是你自己思维的一部分。只需按 Tab 即可接受。
我们如何训练模型
为了训练这个模型,我们精心整理了一个高质量数据集,涵盖广泛的语言和场景中的编辑。这些示例教会了我们的模型如何将编辑历史和代码库上下文解读为有针对性的下一次编辑建议。虽然功能强大,但我们发现该模型在编辑频率和长度上可能过于激进,从而分散用户的注意力。
为了解决这个问题,我们通过记录模型收到的明确反馈(接受还是拒绝一次编辑)来收集高质量的人类偏好数据集。利用这个数据集,我们采用一种名为 KTO 的非配对强化学习方法,使我们的模型与人类偏好对齐。我们发现这一步对于提升模型的实用性非常重要。
结果很明确。我们新模型的编辑被接受的频率提高了 48%,凸显了这一改进的价值。它展示的编辑也更具选择性,提高了 27%,从而带来更有针对性、更少干扰的编辑。

我们如何对比

下一次编辑建议必须既高质量又快速。为了衡量质量,我们在三个开源基准(Instinct、Fill-in-the-middle (FIM) 和 Next-edit Prediction (NEP))以及一个内部下一次编辑基准上对我们的模型进行了评测。FIM 通过针对修改后的代码运行测试用例来验证编辑。其他三个基准使用 LLM-as-a-judge,根据所提议编辑与人工编写的金标准答案之间的相似度来判断正确性。这套基准涵盖了各种编辑场景,例如行补全、变量重命名、重构、功能实现等等。我们最终的质量衡量标准是这四者的平均值。我们通过测量一组代表性请求的端到端延迟来评测速度。为了对比,我们还评测了若干自定义下一次编辑模型和速度优化的前沿模型。我们发现,Mercury Edit 2 在质量和速度上都优于其他方案。

开始使用
“我们构建 Zed 的编辑预测系统时采用了提供商无关的设计,因为开发者应该选择适合自己的方案。Mercury Edit 2 带来了一种基于扩散的方法——这是一种生成编辑预测的显著不同方式,我们很高兴能与其他提供商一起提供它。”
Max Brunsfeld,Zed 联合创始人
Mercury Edit 2 现已在 Inception Platform 上线。
Mercury Edit 2 的定价为每 100 万输入 token 0.25 美元,每 100 万输出 token 0.75 美元,缓存输入为每 100 万 token 0.025 美元。在 Inception API Platform 上创建的每个新账户都会自动获得 1000 万个免费 token。
此外,Zed 用户可以使用此 API key 解锁 1 个月的 Mercury Edit 2 编辑建议免费使用:sk_ae471146ea60fc117c131b574b00ba96。
正在构建开发者工具并希望集成 Mercury Edit 2?请通过 hello@inceptionlabs.ai 联系我们。加入我们的 Discord,获取支持、反馈以及抢先体验后续新功能。
来源:Inception Labs:Blog(网页) · inceptionlabs.ai