IFM 发布 K2 Horizon 六款开源模型,覆盖 0.9B 到 375B-A23B 并开放完整训练生命周期
K2 Horizon:前沿性能,极致开放
IFM 发布 K2 Horizon 模型系列,共六个模型:375B-A23B、36B-A4B、32B、7B、3.7B 和 0.9B,均以 Apache 2.0 开源,其中 0.9B、3.7B 和 7B 宣称在其规模上达到 SOTA,36B-A4B 采用新提出的稀疏注意力架构 MoVA。
原文在发布模型之外还放出从预训练到智能体后训练的全流程产物,研究者可以据此复现和改造整套训练方法。
隆重推出 K2 Horizon:前沿性能,彻底开放
今天,IFM 正式发布 K2 Horizon,这是一个由六款模型组成的互联模型家族:375B-A23B、36B-A4B、32B、7B、3.7B 和 0.9B。在推理、数学、编程、智能体任务以及通用能力方面,K2 Horizon 在每个规模级别都提供了顶级性能——其中 0.9B、3.7B 和 7B 模型在各自规模上树立了新的 SOTA。
K2 Horizon 也是我们迄今为止最全面的开放发布。对于每一款模型,我们都开放了从预训练到推理及智能体后训练的整个训练生命周期。我们发布了中间检查点、训练数据或详细的数据构建方案、开放架构、混合专家组成、训练代码、配置、细粒度日志、评估结果以及最终权重。
模型和代码以 Apache 2.0 许可证发布。数据集以其适用的许可证发布,例如 ODC-BY;当无法再分发时,我们披露数据的构建和混合方式。
综合来看,K2 Horizon 代表了迄今为止最全面的开放模型发布:
- 跨越各规模的全新性能前沿。 0.9B、3.7B 和 7B 模型在广泛使用的评测中,于各自规模级别取得了世界领先的性能。36B-A4B 模型搭载了我们全新的价值注意力混合(MoVA)机制,在每个激活参数上展现出卓越的能力,超越了一些规模大得多的模型。32B 和 375B-A23B 模型在各自级别中位列顶尖模型之列。这六款模型共同为从边缘设备到企业的各类部署环境提供了极具竞争力的性能。
- 首个完全开放模型的智能体模型系列。 K2 Horizon 是首个通过智能体后训练公开完整开发流程的开放模型系列。通过在每一个阶段发布检查点、数据(或数据配方)、代码、配置和训练日志,K2 Horizon 使得研究推理、工具使用、规划和智能体能力如何涌现成为可能;复现创造这些能力的方法;并将这些方法适配到新的工具、环境和领域。
- 六款模型,覆盖从边缘到企业。 0.9B 模型专为手表和眼镜等高度受限的环境而设计,而 3.7B 和 7B 模型则为手机及其他端侧应用带来先进能力。稠密的 32B 模型和稀疏的 36B-A4B 模型为本地工作站和高效服务提供了强大的选择。375B-A23B 模型将该系列最强的能力带给要求严苛的企业部署。全部六款模型均支持量化。
- 一支互联互通的舰队。这六款模型共享核心架构、词表、训练方法、接口、评估基础设施和部署工具,其中 0.9B 模型使用了更小的词表。这种一致性也让在不同规模之间迁移、动态调度任务,以及跨规模研究能力与效率变得更加容易。
各规模级别均达到世界领先性能
0.9B、3.7B 和 7B 模型在数学、推理、通用能力、编程和智能体任务上,分别在各自级别中取得了 SOTA 成绩。
36B-A4B 模型的表现超出了其激活参数量通常应有的水平,展现了我们独特的 Mixture-of-Expert 设计在计算注意力值时的效率。32B 和 375B-A23B 模型则在各自的对比级别中跻身顶级模型之列。
小模型尤其值得关注。K2 Horizon 0.9B 在 AIME 2026 上取得超过 48 的分数,同时具备强大的推理、工具使用和智能体能力。K2 Horizon 3.7B 和 7B 将这些能力扩展到要求更高的软件工程和多步骤环境中,在 SWE-bench 和 BrowseComp 上展现出强劲表现。尽管需要大量探索和反复恢复的复杂任务(例如 TerminalBench 中的任务)对最小的模型来说仍然困难,但 K2 Horizon 拓展了每个规模级别上可能性的边界。
Horizon 舰队为何重要
一个透明的模型如果远远落后于能力前沿,那么即便作为研究基础,其价值也相当有限。与此同时,一个仅以最终权重形式发布的强大模型虽然能让人们运行它,却几乎无法让人了解其能力是如何被创造出来的。
K2 Horizon 将这两者结合在一起。该系列既提供了极具竞争力的模型,也发布了用于训练这些模型的配方。研究人员可以在强大到足以展现先进能力的模型上研究这些能力,而开发者则可以复现、调整并扩展这些方法,而不是把最终 checkpoint 当作一个不透明的起点。
自我们在 2023 年的 LLM360 论文中提出完全开放原则以来,我们每年都发布开放模型,同时将这一承诺扩展到更大规模、更强能力,如今则通过智能体后训练覆盖完整生命周期。
深入解析 K2 Horizon 系列
K2 Horizon 375B-A23B:企业级旗舰
K2 Horizon 375B-A23B 是该系列中规模最大、能力最强的模型。其稀疏 MoE 架构提供了 3750 亿参数的总容量,同时每个 token 大约激活 230 亿参数,使其能够借助远大于自身的模型容量,而不必为每个 token 使用全部参数。
该模型在通用、推理、编程和智能体评测中,位列 4000 亿参数以下顶尖模型之列。它专为对模型质量要求最高的高负载场景而设计,包括复杂推理、软件工程、研究以及长周期智能体任务。
与 Horizon 系列中的每一款模型一样,375B-A23B 并非作为单一端点发布,而是作为一个开发树发布。它的中间检查点和后训练分支揭示了基础模型如何发展为推理、指令遵循以及专门的智能体变体。
K2 Horizon 32B 和 36B-A4B:为本地部署提供强劲性能
Horizon 32B 是该系列中最强大的稠密模型,在能力、适应性和本地可部署性之间提供了出色的平衡。它位列 400 亿参数以下顶尖稠密模型之列。
Horizon 36B-A4B 达到了接近稠密 32B 模型的性能,而每个 token 仅激活约 40 亿参数。其高效性来自 MoVA——我们全新的稀疏注意力架构,以及 MoE 前馈层。
这两款模型为研究稠密与稀疏架构在相似训练条件下的表现提供了重要的参照点。
这些模型占据了该系列本地性能的最佳平衡点。它们强大到足以胜任高要求的推理、编程和智能体应用,同时又适合本地工作站和高效服务系统实际使用。
K2 Horizon 7B、3.7B 和 0.9B:小规模下的前沿能力
K2 Horizon 7B 和 3.7B 在推理、数学、编程、工具使用和智能体性能方面表现出色,同时仍适合本地和端侧部署。在多项评估中,它们的结果接近甚至超过了上一代规模大许多倍的模型。
K2 Horizon 0.9B 将许多相同的能力带入高度受限的环境。它能够执行数学推理、使用工具并完成简单的智能体任务,同时在量化后仍足够紧凑,适用于手表、眼镜及其他边缘设备上的应用。
合适的任务随规模而变化:0.9B 模型最适合聚焦式交互和轻量级工具使用,而 3.7B 和 7B 模型则能处理要求更高的编程和多步骤工作流。它们共同展示了如今小到几乎可以在任何地方运行的模型能够保留多少能力。
设计 K2 Horizon
从一开始就是一个家族
Horizon 被设计为一个相互关联的家族,而非一组互不相关的模型。这六个模型共享核心架构决策、训练方法、接口、评估基础设施和部署工具。这使开发者能够更轻松地在不同规模之间切换,也为研究者提供了一个更可控的环境来研究能力随规模的变化。
每个模型都使用精心构建并记录在案的混合数据,在约 20 万亿 token 上进行预训练。训练全程会捕获中间检查点及其对应的细粒度日志,从而详细记录每个模型的发育过程。
MoVA:用稀疏专家扩展注意力
混合专家(MoE)的核心思想是:在保持每个 token 所需计算量大致不变的同时,提升模型的总容量。传统 MoE 架构主要将这种稀疏性应用于前馈层:许多专门的专家可供使用,但路由器只为每个 token 激活其中一小部分。
我们的新架构 MoVA——Mixture-of-Value Attention,将这一原理扩展到注意力机制。由于注意力决定了 Transformer 如何汇聚来自整个上下文的信息,在此处引入稀疏性,为在前馈网络之外扩展模型容量开辟了另一个维度。
MoVA 将专家路由集成到多头注意力中,同时保持与 FlashAttention、分组查询注意力(grouped-query attention)和稀疏注意力等高效技术的兼容性。
最终成果是 K2 Horizon MoVA 36B-A4B:一个总参数量达 360 亿、但每个 token 仅约 40 亿活跃参数的模型。在相同训练条件下,它的表现仅略低于稠密的 Horizon 32B 模型,同时所需的活跃参数大幅减少。
训练数据
跨六个规模进行训练,需要的数据既要足够广泛以支撑通用能力,又要经过精心构建以在大约 20 万亿 tokens 上保持质量。
Horizon 的预训练混合数据结合了多样化的网络、代码、数学、科学、多语言和领域特定来源,以及通过我们自有流水线生成的合成数据。我们在数据方面的一项关键创新是将推理直接融入预训练:预训练语料中近 17% 由带有显式推理的解题轨迹构成。数学任务的推理轨迹还被进一步改写为对话和学习指南等格式。总体而言,我们在预训练期间使用了大约 10 万亿合成 tokens。
我们的合成数据流水线使用了数百万种多样性调节参数与上下文种子的组合,包括从基于预训练网络语料构建的内部搜索引擎进行检索。为了在语料规模上量化多样性,我们开发了一种自定义的基于 gzip 的压缩指标,并采用自适应步进,以避免标准 gzip 测量随着文档数量增长而迅速饱和。如下图所示,我们合成数据的实测多样性接近高质量自然网络文本,并大幅超过网络代码。
我们记录了数据组成、合成流水线以及训练混合数据的构建过程。遵循我们的开源原则,在许可证允许的情况下,我们直接发布可直接用于训练的数据集。在再分发受限的情况下,我们发布来源描述、过滤与构建方法以及混合组成。这使研究人员能够理解每个模型从什么数据中学习,以及数据分布在整个训练过程中如何演变。
我们的后训练数据从中期训练一开始就引入,而不是专门保留给训练的最后阶段。我们将合成的长上下文文档与用聊天模板格式化的指令遵循、推理和智能体轨迹相结合。我们后训练数据的一个主要支柱是基于任务分类体系、多样性调节参数和网络搜索种子的大规模任务合成,由此产生了超过 1 亿个独特任务。此外,我们开发了采样技术,在生成训练轨迹时引导求解器 LLM 走向正确的解法和期望的行为。
预训练动态
每一个 K2 Horizon 检查点都附有详细的训练日志和细粒度历史记录,揭示了大规模训练的真实动态:损失如何演变、不稳定性出现在哪里、干预措施如何影响训练,以及能力何时开始涌现。
作为这些记录为何有用的一个例子,K2 Horizon 3.7B、7B、32B 和 36B-A4B 是在完全相同的 22 万亿 token 上训练的。当按训练进度对齐并以训练最后 1% 的中位损失进行归一化后,它们的原始损失轨迹大致重合,你可以在下图中看到这一点——即使跨越稠密和稀疏架构,以及总参数量相差近一个数量级。尽管这种归一化在构造上使它们的终点对齐,但它并不会强制早期和中期轨迹重合。它们的高度一致表明,在共享数据和共同配方下,对于在整个训练过程中使用相同数据集的这一部分模型群体而言,学习曲线的形状保持了显著的一致性。
这些检查点和日志共同让研究人员得以探究为何某些动态能够跨规模与架构迁移,而另一些则出现分化,并将这些差异与特定的训练阶段、数据配比和技术决策联系起来。
面向推理与智能体的后训练
K2 Horizon 的大部分高级推理与智能体能力都是在后训练阶段涌现的。完整流水线包括中期训练、监督微调、模型合并、强化学习以及专门的智能体训练。这一过程并非只产出一个最终的对话模型,而是构建出一棵开发树。不同的分支分别专精于推理、编程、工具使用和智能体领域,同时仍与共同的基础检查点保持连接。
我们发布了这些阶段产出的各项工件,以便研究人员研究每种能力在何处涌现、复现各个分支,并将同样的方法适配到新的工具与环境中。
Uno Diffusion:为 Horizon 提供即插即用的无损加速
推理速度已成为一等优化目标,尤其是在推理模型与智能体的时代。随着模型生成更长的思维链并执行更多动作,即便每个 token 的微小延迟也会累积成可观的时延。然而自回归语言模型一次只生成一个 token,这构成了根本性瓶颈。现有方法只能提供部分解决方案:投机解码通常需要单独训练的草稿模型,而离散扩散虽能实现并行生成,却往往以牺牲质量为代价换取速度。
Uno 的设计目标就是消除这种取舍。它提供了一种无损推理加速,在不降低响应质量的前提下加快生成速度。Uno 将 Horizon 的自回归参数保持冻结,并让它们完全负责模型的输出分布,而一组轻量的扩散参数只负责学习如何更高效地生成。
通过一个我们称为扩散蒸馏的过程,这些紧凑的适配器学会了并行生成 token 块。最终结果将自回归解码的质量保证与扩散模型的速度优势结合在一起:模型得到相同的答案,但更快地得到它们。
在我们的各项评估中,Uno 实现了比领先的投机解码系统以及开放权重和专有扩散语言模型更好的速度—质量权衡。至关重要的是,它的增益在我们测试的每一种 batch size 下都持续存在,从而为交互式智能体带来更低的延迟,为大规模服务带来更高的吞吐量,同时模型质量没有损失,额外训练开销也微乎其微。Uno 以简单的LoRA 适配器形式交付,使这种无损加速易于采用:你只需挂载这些适配器即可。
用于构建和扩展 Horizon 的开放基础设施
我们在发布模型本身的同时,也一并发布用于构建 Horizon 的基础设施。目标不仅是让这一模型系列可复现,更是让其开发技术栈能够作为新模型和新系统的基础发挥作用。
本次发布的核心是 xLLM,这是我们经过生产环境验证的训练基础设施。xLLM 将大规模训练性能与研究所需的灵活性结合在一起,让团队能够修改架构、数据配比、训练阶段和目标,而无需重建周边系统。
我们还将发布完整的智能体后训练代码库,包括强化学习,我们希望这能帮助研究人员推进相关领域的技术。
研究人员可以使用这些组件来检查训练行为或复现某个特定阶段。开发者可以将 Horizon 适配到某个领域、添加新工具、训练智能体专家,或在统一接口背后部署多个不同规模的模型。
从开源到开放科学
中间检查点将模型开发转变为一个可观测的科学过程。它们让研究人员能够研究能力何时涌现、训练选择如何改变行为,以及非预期策略何时首次出现。
奖励黑客行为提供了一个很有启发性的例子。当一个能力强大的模型被置于真实的计算机环境中并被要求解决一项复杂任务时,让它变得有用的那种随机应变能力,也可能导致它去利用评估本身的捷径。为了了解这对 K2 Horizon 所报告数字的影响有多大,我们使用 Artificial Analysis 的奖励黑客审计流程对已发布的模型进行了审计。
TerminalBench 2.1 将模型置于沙箱化的计算机环境中,评估它们能否完成复杂的技术任务。一个能力足够的模型必须探索文件、调用工具、诊断故障,并找到通往解决方案的替代路径。这种足智多谋正是我们想要的。但偶尔它会越界:模型不是去解决预设的问题,而是找到隐藏的答案、利用任务暴露出的某些东西,或者操纵评分器本身。
我们在 89 个 TerminalBench 2.1 任务上运行了 K2 Horizon 375B-A23B,每个任务尝试八次,共产生 712 次试验。其中 500 次通过了任务验证器(报告准确率 70.2%)。随后,我们使用 Artificial Analysis 的奖励黑客审计流程对每一次通过的试验进行审计,逐字套用他们的 harbor analyze 工具、reward_hacking 标准及其完整评分细则文本,并以 Codex gpt-5.6-sol 作为评判模型。
审计在 10 个任务中标记了 24 次试验。将其剔除后,准确率从 70.2% 降至 66.9%,修正幅度为 3.37 个百分点。其余 79 个任务完全干净。作为参照,Artificial Analysis 报告 claude Fable 5 的标记率为 2.2%,GPT-5.6 Luna 为 4.1%;K2 Horizon 的 3.37% 落在这一区间内。
该模型发现了若干策略:
- 推断出自己身处某个公开基准测试之中,在 GitHub 上找到该仓库,并下载参考解答
- 从真实项目的公开仓库中拉取当前源码,并直接复制修复方案,而不是自行推导
- 检查未公开宣传的文件、生成器脚本或暴露的凭证
- 修改测试框架,或构造能够利用测试判定成功方式的输出
我们观察到一个相关案例:K2 Horizon 7B 找到并下载了 SWE-bench 的答案,因而产生了 82 的虚高分数。该分数并不代表真实的软件工程性能,但这一行为在科学上具有揭示意义:基准测试作弊是更广泛的规划、工具使用、环境探索和持续坚持所带来的一种非预期后果。
由于我们在发布最终模型的同时也发布了中间检查点,这些行为可以被研究,而不是被隐藏。研究人员可以确定某种策略最早何时出现,将其与训练中的变化联系起来,并衡量其对所报告性能的影响。
因此,K2 Horizon 不仅仅是一组模型权重。它是一项开放实验,探究能力——及其非预期后果——在整个训练过程中如何发展。
立即开始使用 K2 Horizon!
K2 Horizon 的全部六种规模均以 Apache 2.0 许可作为开放权重发布,并获得 vLLM、SGLang 和 Ollama 的零日支持。此外,K2 Horizon 支持在 NVIDIA、AMD 和 Cerebras 硬件上部署,提供从本地推理到大规模服务的多种选择。请从我们的代码仓库获取模型:https://huggingface.co/IFM,下载模型、检查中间检查点、研究训练数据与数据混合、复现训练阶段,或使用 Horizon 代码和基础设施构建新的模型与智能体。
K2 Horizon 提供的远不止六个最终模型。它提供了一套开放蓝图,用于理解、适配并推进下一代 AI 系统。
完整结果表
375B-A23B
36B-A4B
32B
K2 Horizon 7B
K2 Horizon 3.7B
K2 Horizon 0.9B
来源:Hacker News 热门(buzzing.cc 中文翻译) · ifm.ai