跳到正文
北京时间
原文
Moonshot AI:Kimi Blog· Kimi·· 2026-07-14精选AI 评分81

Kimi K3 发布:2.8T 参数开源模型,具备原生视觉与百万 token 上下文窗口

Kimi K3

AI 导读

月之暗面发布 Kimi K3,一个 2.8T 参数的开源模型,采用 Kimi Delta Attention 和 Attention Residuals 架构,支持原生视觉能力与 100 万 token 上下文窗口。

推荐理由

首个开源 3T 级模型,架构上有 KDA 和 AttnRes 创新,在超长程编码和知识工作上比肩闭源。权重两周后放出,所有做 agent 的都该盯紧。

正文 · AI 翻译
Kimi K3 hero visual

今天,我们推出 Kimi K3——我们迄今能力最强的模型。Kimi K3 是一个 2.8T 参数模型,基于我们的 Kimi Delta Attention 和 Attention Residuals 构建,具备原生视觉能力和 100 万 token 上下文窗口。它是全球首个开放的 3T 级模型,专为长时程编程、知识工作和推理等前沿智能场景而设计。

尽管其整体性能仍落后于最强大的闭源模型 Claude Fable 5 和 GPT 5.6 Sol,但 Kimi K3 在我们的评测套件中展现出前沿级表现,持续优于其他受测模型。

Kimi K3 benchmark comparison
Kimi K3 benchmark comparison
Kimi K3 showcase
Kimi K3 showcase

Kimi K3 即日起在 Kimi.com、Kimi Work、Kimi Code 以及 Kimi API 上线。发布时,Kimi K3 将默认使用最高思考强度,低强度和高强度模式将在后续更新中推出。我们目前正与推理合作伙伴和开源维护者密切合作,对齐技术细节,确保在整个生态系统中可靠地推出。完整模型权重将于 2026 年 7 月 27 日前发布。有关架构、训练和评测的更多细节将随 Kimi K3 技术报告一同发布。

开放的 3T 级模型

Kimi K3 是首个达到 2.8 万亿参数的开放模型。它标志着 Kimi 在扩展前沿上持续发力的最新一步:在过去十二个月中的九个月里,Kimi 模型一直设定着开放模型规模的上限。

Kimi K3 基于 Kimi Delta Attention(KDA)和 Attention Residuals(AttnRes)构建,这两项架构更新旨在改进信息在序列长度和模型深度上的流动方式。我们还扩大了 Mixture of Experts(MoE)的稀疏度,配合 Stable LatentMoE 框架,有效激活 896 个专家中的 16 个。结合精炼的训练和数据配方,这些结构性改动相比 Kimi K2 在整体扩展效率上带来约 2.5 倍的提升,使模型能够更有效地将算力转化为智能。

编程

Kimi K3 具备强大的长时程编程能力。在极少人工监督的情况下,它能够持续进行长时间的工程会话、浏览庞大的代码仓库,并编排终端工具。

Kimi K3 在融合软件工程与视觉推理的任务中同样表现出色——它利用截图和视觉信息来优化游戏开发、前端和 CAD。

以下案例展示了 Kimi K3 的编程能力如何转化为开放式软件创作与科学研究。

内核优化

我们测试了各模型优化 GPU 内核的能力。每个模型在完全相同的沙箱中独立工作,最多有 24 小时对四项任务进行性能分析、重写和基准测试,这些任务涵盖 AttnRes、KDA,以及一个在 NVIDIA Hopper GPU 和另一家厂商的 GPGPU 上运行的 512 头维度 MLA 内核。Kimi K3 的表现与 Fable 5(带 fallback)不相上下,并大幅优于 Opus 4.8、GPT 5.6 Sol 和 GPT 5.5。

Claude Fable 5 由第三方进行评估,其结果可能包含回退行为。在大多数模型中,部分轨迹包含一些小的、可接受的精度捷径,这些捷径仍处于我们的数值容差范围内。GPGPU 指用于图形渲染之外计算的通用 GPU。

在 Kimi K3 开发的后期阶段,一个早期版本的 Kimi K3 承担了团队大部分的 kernel 优化工作。

GPU 编译器开发

我们进一步测试了 Kimi K3 能否从零构建一个 GPU 编程系统。Kimi K3 开发了 MiniTriton,这是一个紧凑的类 Triton 编译器,在 MLIR 之上拥有自己的 tile 级 IR 层、优化 pass 以及 PTX 代码生成流水线。在受支持的 roofline 基准测试中,MiniTriton 的性能与 Triton 和 torch.compile 相当甚至更优——在某些工作负载上超越了 Triton。除了微基准测试之外,MiniTriton 还能维持端到端的 nanoGPT 训练并保持稳定收敛,损失曲线与参考值紧密贴合,仅有轻微偏差——从而在真实工作负载上验证了整条流水线。这些结果表明,Kimi K3 能够构建一个连贯的端到端编译器——从 DSL 前端、IR pass 到 PTX 代码生成和运行时——而非孤立的 kernel;其从零实现的 Tensor Core 路径已经能与 Triton 经过大量优化的技术栈相媲美。

MiniTriton CUDA-core roofline on NVIDIA L20

游戏开发与数字创作

Kimi K3 融合了强大的 3D 推理、编程与视觉能力,可将概念、图像和视频转化为完全可玩的交互体验。Kimi K3 通过代码与实时截图之间的无缝迭代,实现了真正的“视觉在环”——即时查看并优化输出。

芯片设计

作为早期的概念验证,Kimi K3 设计了一款芯片,用于运行基于其自身架构构建的 nano 模型。在一次为期 48 小时的自主运行中,K3 使用开源 EDA 工具,基于 Nangate 45nm 工艺库,完成了该芯片的构建、优化与验证。在 4 mm² 的面积内,该芯片在 100 MHz 下完成时序收敛,并在仿真中持续实现超过 8,700 tokens/s 的解码吞吐量,集成了 1.46M 个标准单元、0.277 MB 的 SRAM,以及一个带融合反量化的 INT4 MAC 阵列。一款由模型构建、为模型服务的芯片,体现了 K3 的长时程智能体能力。

科研编程

Kimi K3 打通了科学文献与可执行代码之间的桥梁,能够自主实现、验证并分析复杂的计算科研工作流。

在一个案例中,Kimi K3 用约两小时完成了通常需要一位经验丰富的研究人员花费一到两周才能完成的工作。为复现计算天体物理学中的 I–Love–Q 普适关系,它审阅并交叉验证了 20 多篇论文,实现了完整的数值流水线,评估了 300 多个状态方程,发现了已发表公式中的不一致之处,生成了 3,000 多行 Python 代码,并制作了一个交互式 HTML 仪表板用于探索结果。

知识工作

Kimi K3 将端到端知识工作推向了新高度。除了公开基准测试之外,Kimi K3(max)在我们内部评测中也展现出持续稳定的提升,这些评测源自真实用户-智能体工作流中反复出现的模式与挑战。在多个面向生产环境的差异化工作流中呈现出的这些一致优势,反映出 Kimi K3 的智能体知识工作能力得到了全面提升。

Internal Knowledge Work Bench

交互式可视化研究

以下是 Kimi K3 在 Kimi Work 中于金融咨询和科学研究领域所能产出的一些示例:

案例 1:交互式 42 年 AI ASIC 行业研究网站

一份可深入探索的交互式研究报告:42 年 ASIC 行业发展历程,经由 120+ 轮递归自我改进生成。Kimi K3 将证据转化为定制图表、动画示意图和交互式可视化叙事。它通过 2.8k+ 次网络搜索/抓取和 1.1k+ 次终端数据拉取获取数据,覆盖 11k+ 页内容,横跨 87 份季度报告和 99 份原始 PDF。

案例 2:聚变行业研究

一份咨询风格的行业报告,配有交互式可视化——包括时间线、漏斗图、范围条形图、甘特图以及出版级幻灯片。

案例 3:GWTC-5 引力波分析

使用 20 多个并发子智能体对 391 个引力波事件进行分析,产出 7 张科学可视化图、2 张表格,以及基于 10 多篇论文的文献综述。

Kimi K3 还特别擅长生成信息图风格的演示文稿,例如下方展示的完全可编辑的热力图和年度报告:

小组件与仪表盘

在 Kimi Work 中,我们推出两项新功能——小组件(Widgets)与仪表盘(Dashboard),让与 Kimi K3 的交互更加可视化、更具持续性。小组件让你可以直接在对话中生成可交互组件,并可连接本地数据或外部插件以实现持续更新。仪表盘则把你最关注的小组件汇聚到一个持久化、个性化的视图中,围绕某个主题、项目或目标进行组织。

视频编辑

Kimi K3 在动态设计、动画和视频编辑方面表现出色,因为其原生多模态架构能够在同一个模型中理解文本、图像和视频。

在一个示例中,K3 制作了一段 3Blue1Brown 风格的动态图形解说视频,讲解其自身架构,将技术概念转化为动画图表和转场。

在另一个示例中,Kimi K3 从 56 个源片段剪辑出了自己的预告视频,完成了片段筛选、运动匹配剪辑、帧级精准节拍同步、音频处理以及多轮修改。这样一条高密度短视频,通常需要一位有经验的剪辑师花费一到两个工作日,新手则需要三到五天。

架构与基础设施

Kimi K3 构建于 Kimi Delta Attention(KDA)与 Attention Residuals(AttnRes)之上。KDA 为扩展注意力提供了高效的基础,而 AttnRes 则跨深度有选择地检索表示,而非对其进行均匀累积。二者共同构成了这一模型的架构主干,该模型的设计目标是在远超万亿参数规模的情况下依然具备良好的扩展性。

Kimi K3 采用 Stable LatentMoE,有效激活 896 个专家中的 16 个。在这一稀疏度水平下,路由与优化成为首要挑战。Quantile Balancing 直接从路由分数的分位数推导专家分配,消除了启发式更新和一个敏感的均衡超参数;而 Per-Head Muon 则对 Muon 进行了扩展,通过独立优化各个注意力头,在大规模下实现更具适应性的学习。Sigmoid Tanh Unit(SiTU)与 Gated MLA 分别改进了激活控制和注意力选择性。这些进展共同支撑了在 2.8 万亿参数规模下稳定而高效的训练。

Kimi K3 从 SFT 阶段起就应用了量化感知训练,采用 MXFP4 权重与 MXFP8 激活,以实现广泛的硬件兼容性。为防止在大规模专家并行下专家负载不均衡导致吞吐量下降,我们引入了一种完全均衡的专家并行训练方法,具有静态形状,且关键路径上无需主机同步。由于推理效率同样受益于更大的高带宽通信域,我们建议在配备 64 个或更多加速器的超节点配置上部署 Kimi K3。最后,由于 KDA 对传统前缀缓存提出了新的挑战,我们已向 vLLM 社区贡献了相应的实现,将随模型一同发布。借助带预填充缓存的 KDA,尽管 Kimi K3 规模庞大且上下文很长,我们仍能以极具竞争力的 token 价格提供服务。

更多技术细节将在我们即将发布的报告中提供。

可用性

  • Kimi K3 Agents:从你的移动应用商店下载或更新至最新版 Kimi 应用,支持 iOS、Android 和 HarmonyOS,或访问 kimi.com。
  • 使用 Kimi K3 工作:下载最新的 Kimi Work 桌面应用,版本 3.1.0 或更高,支持 Windows 和 Apple silicon Mac。
  • 使用 Kimi K3 编程:在终端中运行 Kimi Code,并使用 /model 命令选择 Kimi K3。
  • 使用 Kimi API 构建:访问 Kimi API 平台并选择 kimi-k3。定价为缓存命中输入 $0.30/MTok,缓存未命中输入 $3.00/MTok,输出 $15.00/MTok。依托 Mooncake 的分离式推理架构,官方 Kimi API 在编码工作负载中实现了超过 90% 的缓存命中率。
  • 将 Kimi 引入你的组织:Kimi Enterprise 提供企业级数据隐私与成员管理,个人账户与组织账户完全分离。访问定价页面并选择“Get Kimi Enterprise”即可为你的团队订阅。

完整基准测试表

脚注

下文报告的所有 Kimi K3 结果均在推理强度设为 'max'、temperature = 1.0 且 top-p = 1.0 的条件下获得。根据基准测试的不同,每个模型在三种智能体测试框架之一——Kimi Code、Claude Code 或 Codex——下进行评估,具体如下文注释所述。

编码基准测试

  1. DeepSWE。 Kimi K3 使用 Kimi Code 测试框架进行评估。GLM-5.2 的分数取自 GLM-5.2 发布博客(https://z.ai/blog/glm-5.2);其余所有分数均来自官方 DeepSWE 排行榜(https://deepswe.datacurve.ai/),在该排行榜下 Kimi K3 使用 mini-SWE-agent 测试框架取得 67.3 分。我们报告的是 DeepSWE v1.1 任务。
  2. Terminal-Bench 2.1。Kimi K3 使用 Kimi Code harness 进行评估。对于所有其他模型,我们报告各 harness 中的最佳得分:GLM-5.2 使用 Claude Code(https://z.ai/blog/glm-5.2);Claude Opus 4.8 和 Claude Fable 5 使用 Terminus 2(https://artificialanalysis.ai/evaluations/terminalbench-v2-1);GPT 5.5 和 GPT 5.6 Sol 使用 Codex(https://openai.com/index/previewing-gpt-5-6-sol/)。
  3. Program Bench。Kimi K3 使用 Kimi Code harness 进行评估。GLM-5.2 的得分来自 https://z.ai/blog/glm-5.2;所有其他得分来自 https://www.vals.ai/benchmarks/programbench。
  4. SWE Marathon。Kimi K3、Claude Opus 4.8 和 Claude Fable 5 使用 Claude Code harness 进行评估;GPT-5.6 Sol 使用 Codex harness 进行评估。GLM-5.2 的得分来自 https://z.ai/blog/glm-5.2。我们的评估基于官方 v1.1 任务的 H20 校准分支(https://www.swe-marathon.org/):GPU 任务的 Docker 镜像、性能门槛和参考 oracle 已针对 H20 重新校准,而正确性和反作弊验证器保持不变。此外,Claude Fable 5 在我们的评估中有 35% 的任务触发了 fallback,这可能对其测得的性能产生了负面影响。
  5. FrontierSWE。 Kimi K3 使用 Kimi Code harness 进行评估,GPT-5.6 Sol 使用 Codex harness 进行评估;所有其他结果均来自 https://www.frontierswe.com/。Dominance 分数使用官方评估脚本从原始分数重新计算,数据截至 2026 年 7 月 16 日。
  6. PostTrain Bench。 GLM-5.2、GPT-5.5 和 Claude Opus 4.8 的分数采用官方 PostTrainBench(https://posttrainbench.com/)的结果。Kimi K3、Claude Fable 5 和 GPT-5.6 Sol 使用官方 Harbor 实现以最大推理强度进行评估,在 H20 GPU(而非官方设置中的 H100)上取三次运行的平均值——Kimi K3 和 Claude Fable 5 使用 Claude Code harness,GPT-5.6 Sol 使用 Codex harness。
  7. MLS Bench Lite。 Kimi K3 使用 Kimi Code harness 进行评估;GLM-5.2 和 Claude 系列模型使用 Claude Code harness;GPT-5.5 和 GPT-5.6 Sol 使用 Codex harness。
  8. KCB 2.0。 Kimi K3 同时使用 Kimi Code 和 Claude Code harness 进行评估;GLM-5.2、Claude Opus 4.8 和 Claude Fable 5 使用 Claude Code harness;GPT-5.5 和 GPT-5.6 Sol 使用 Codex harness。所有模型均以最大推理强度进行评估,但 GPT-5.5 除外,它使用"xhigh"设置。我们还注意到,在这个内部基准测试中,10% 的任务触发了 GPT-5.6 Sol 的网络安全防护。

生产力与智能体基准测试

  1. 对于 OfficeQA Pro,每个测试用例都会向智能体提供整个 PDF 语料库,所有 PDF 均以图像形式呈现,不提供任何机器可读文本。
  2. OfficeQA Pro 和 SpreadsheetBench 2. Kimi K3、GLM-5.2、Claude Opus 4.8 和 Claude Fable 5 使用 Claude Code harness 进行评估;GPT 5.5 和 GPT 5.6 Sol 使用 Codex harness 进行评估。
  3. MCP Atlas. 所有模型均在 500 任务的公开子集上评估,限制为 100 轮,使用 Gemini 3.1 Pro 作为评判模型。
  4. AutomationBench. 所有模型均在 600 任务的公开子集上评估,其他方面均遵循官方 GitHub 设置。
  5. BrowseComp. 我们采用 Claude 模型卡中使用的上下文压缩策略,在 300K tokens 时触发。当以 1M-token 上下文窗口且无上下文管理进行评估时,Kimi K3 取得 90.4 的分数。Claude Fable 5、Claude Opus 4.8、GPT 5.6 Sol 和 GPT 5.5 的结果引自 https://www.anthropic.com/news/claude-fable-5-mythos-5 和 https://openai.com/index/gpt-5-6/。
  6. GDPval-AA、AA-Briefcase 和 APEX-Agents 的分数引自 https://artificialanalysis.ai/。

多模态基准

  1. 除 ZeroBench 遵循官方设置并运行五次外,所有多模态分数均为三次运行的平均值。MMMU-Pro 按照官方协议进行评估,保留原始输入顺序,并将图像置于文本输入之前。
  2. PerceptionBench。 PerceptionBench(https://www.kimi.com/blog/perception-bench)是一个专注于原子级视觉感知能力的基准测试。

局限性

  1. 对思考历史的敏感性。 K3 是在保留思考历史模式下训练的。如果智能体框架未能按要求回传全部历史思考内容,或者将另一个模型正在进行的会话切换至 K3,生成质量可能会变得极不稳定。我们建议使用经过兼容性验证的框架,例如 Kimi Code,并避免在会话中途切换至 K3。
  2. 过度主动。 K3 的训练特别强调长周期、高难度任务。因此,当它在任务执行过程中遇到小问题或用户意图不明确时,可能会代表用户做出意料之外的决策。如果你的应用要求智能体在明确界定的边界内运行,并避免过度即兴发挥,请在系统提示词或 AGENTS.md 中对 K3 施加更明确的行为约束。
  3. 尽管 K3 整体上是一个极具竞争力的模型,但与 Claude Fable 5 和 GPT 5.6 Sol 相比,它在用户体验方面仍存在明显差距。

来源:Moonshot AI:Kimi Blog · kimi.com