Kimi K3:开源权重模型的升级
Kimi K3: The open-weights escalation
月之暗面于7月16日发布旗舰模型Kimi K3,该模型为2.8T参数的MoE架构,将于7月27日开源权重。K3在Vals AI指数排名第二,在Artificial Analysis智能指数排名第三(仅落后于Claude Fable和GPT-5.6 Sol Max且价格更低),并在Frontend Code Arena排名第一,是迄今最强的开源权重模型。
Kimi K3 的开源权重发布让中国实验室的追赶节奏从传闻变成了可见的图表,Nathan Lambert 结合自己对中国团队的访问和政策解读,把效率优势、开源博弈和地缘风险串在了一起,是理解当下竞争格局的一篇必要阅读。
对 AI 生态系统的全球性影响。
7 月 16 日星期四,Moonshot AI 发布了他们最新的旗舰模型 Kimi K3。K3 是一个 2.8T 参数的 MoE 模型,其权重将于 7 月 27 日发布。本文的大部分内容是对生态现状的反思,前提是 Moonshot 兑现其权重发布日期的承诺。这是一种更为极端的均衡观点,而如果实际情况是中国拥有同样强大但闭源的模型(即 K3 从未发布),那么许多结论最终会落在中间地带。
关键事实是,无论是开源与闭源之间,还是美国与中国之间的模型性能差距,都已从此前争议不断的 6-9 个月缩短到了更短的时间,比如 3-5 个月。
从发布材料来看,K3 显然是一个真正的前沿模型。这将是自 DeepSeek R1 以来开源模型距离前沿最近的一次。DeepSeek R1 则是另一番情形。那是一家中国实验室极其迅速地转向推理模型,并比许多美国公司更快地发布了一款。Kimi K3 则是一个中国实验室在已知领域——数据、算法、架构、工具、环境等——推进规模化的范例。
Kimi K3 在 Vals AI 指数上位列总榜第 2,在 Artificial Analysis 的 Intelligence Index 上位列总榜第 3(仅落后于 Claude Fable 和 GPT-5.6 Sol Max,同时价格更低),在 Frontend Code Arena 中位列总榜第 1,以及更多令人印象深刻的结果。月之暗面(Moonshot AI)正以远远更少的资源,与 Anthropic 和 OpenAI 正面交锋。
它显然是有史以来发布的最强开源模型。看这个模型就应该清楚,如果说来自美国闭源前沿模型的对抗性蒸馏有所贡献,那至多也只是相对较小的程度。那些关注了蒸馏恐慌、并得出错误结论——认为中国 AI 实验室只是靠窃取知识产权才做出好模型——的 AI 观察者们,将会迎来一次觉醒:中国公司极其擅长构建模型,其方式与美国领先公司如出一辙。月之暗面(Moonshot AI)正在解决许多 OpenAI 或 Anthropic 的人也在解决的相同问题。我确信还会有更多关于蒸馏的讨论,以及压力,但现在的证据已经表明,中国公司能够做到的远不止快速跟随。
在我的中国之行中见到了 Kimi 核心团队的一些成员,我清楚地感受到他们拥有非凡的文化,有人会说是气场,以及在 GPU 受限的环境中自由表达这种文化的能力。在构建模型很大程度上是一场规模竞赛的领域,构建一个好模型的能力在很大程度上仍然取决于个人的执行力、动力和表达。拜访过他们之后,这个结果就没那么令人意外了。我拜访过许多 AI 公司,很少有公司能让你像这样立刻感受到他们的文化。
与此同时,中国的 AI 采用趋势比美国起步更晚。因此,尽管所有中国实验室的算力都远少于美国的同行,但其中更多的算力无疑可以用于训练。当我开玩笑说 OpenAI 一位普通研究员能拥有多少算力——比如几千台 H100 等效机器——时,Kimi 的研究人员都震惊了。构建 Kimi 模型的组织架构和方法无疑反映了这一点,但如果没有大量内部信息,很难厘清这具体是什么样子。
关于峰值模型性能的现状大致如下:
Anthropic – Claude Fable 5
OpenAI – GPT 5.6 Sol
Moonshot AI – Kimi K3(开放权重*)
SpaceXAI – Grok 4.5
智谱(Z.ai)– GLM 5.2(开放权重)
Meta – Muse Spark 1.1
DeepMind – Gemini Flash 3.5
阿里巴巴 – Qwen 3.7 Max(撰稿时已宣布 3.8,同样将开放权重)
看到 DeepMind 以及其他一些美国巨头排在如此靠后的位置,令人惊讶。从很多方面来说,xAI 团队值得更多认可。下方是 Artificial Analysis 的可视化总结:
这次发布以及其他近期事件,使开放模型与闭源模型之间力量平衡最可能的走向发生了重大转变。我将逐一展开分析。
从很多方面来看,这感觉像是一个新时代的开端。这个时代竞争更加激烈,但随着我们在全球范围内部署极其强大的技术,对协调的需求也大大增加。
1. 中国重新承诺投入开源 AI——展现出对近期风险的不同解读
许多人是在相对近期才开始关注中国 AI 领域的,因此他们可能得出这样的结论:公开释放模型是他们的核心战略。事实上,我认为大多数实验室的核心战略都更接近 Anthropic 或 OpenAI——打造尽可能最强的智能。在关注并与中国实验室接触多年之后,我认为对他们最初转向公开释放模型的最佳解释是务实。他们需要公开释放模型,以获得采用、关注和反馈(尤其是在高价值的湾区市场)。
长期以来,中国在这方面的政策非常有限,几乎没有阐明开源 AI 的角色,以及什么可以成为“国家层面的战略”。据我所知,此前没有任何高层领导人公开评论过开源 AI。这一局面也在本周发生了变化:习近平在世界人工智能大会(WAIC)上发表了主旨演讲,非常直接地将中国 AI 生态的未来押注于开源与全球扩散。这一对现状的承诺,与迄今为止最强的开放权重模型发布发生在同一周,在现代 AI 的早期历史中留下了清晰的印记。
这一表态出现的时期,正值人们为中国 AI 产业讨论了许多潜在的前进路径——它们会继续保持开放吗?它们能在规模扩展上跟上美国实验室吗?中国是否存在一个不断增长的营收市场?围绕这些问题,关注点一直集中在中国对风险的容忍度、这些公司的变现能力,以及任何与之密切相关的、可能促使公司停止公开发布其最强模型的原因。
将习近平的承诺在时间上与一个非常强大的模型联系在一起,中国实际上已经就其在发布开放权重模型方面的风险容忍度做出了隐含表态。就目前而言,这可以被解读为中国体制内对诸如强大网络安全能力(或生物危害)等议题所感知风险的判断。
最简单的解释是,中国政府肯定在密切关注这些模型带来的潜在风险——其技术审视范围很可能比美国政府的“氛围式监管”更广——并且如果评估出风险,就会采取行动。而更直白的解释是,他们并不认为当前的前沿模型具有实质性风险。
与此同时,中国的经济决策者认为,推动 AI 的采用是件好事,这样他们就能在后期从这一产业中获利——在扩大分发规模之后(正如中国近代在汽车、太阳能、先进制造业以及许多领域所做的那样)。
在美国 AI 媒体经历了数月围绕 Claude Mythos 模型的炒作与恐慌渲染之后,这些情况可能显得有些令人震惊。这种意外应当成为极好的现实校准——对于我们在美国最常听到的那些关于 AI 的叙事,世界并不存在一致的共识。
2. 开放模型是前沿实验室的经济阿喀琉斯之踵
许多引导 AI 讨论的叙事者,都有明确的动机去压低最优秀的开放 AI 模型所被认为具备的能力。Dean Ball——他个人支持开放模型,但如今在 OpenAI 工作——发表了一篇引发广泛评论的帖子,其中包含一些关于 Kimi 的思考,他在其中就开放模型说了以下这番话。理解这一表述很重要,因为它聚焦了开放模型在 AI 建设经济层面所扮演的角色。Dean 说:1
开放权重模型本质上是减速主义的,而我不断惊讶地看到,所谓的“加速主义者”竟对开放权重模型如此兴奋。
解释为什么开放权重模型是一种减速主义形式,对于理解即将到来的世界秩序至关重要。他说得对。
对前沿实验室而言,开放模型在经济上是一种减速主义,这会拖慢 AI 的净投资和资本开支推进。原因在于,强大的开放权重 AI 模型会大幅压缩闭源实验室的利润空间。这带来两个效应。第一,AI 实验室可用于再投资于未来模型的利润变少。第二,市场会认为这些公司的终值更低,因此它们未来的融资轮次将受到掣肘。这两者叠加会拖慢通往最具变革性 AI 模型的时间线,但我并不认为这些效应强到足以阻止 OpenAI 和 Anthropic 成为全球市值最高的几家公司之一。
在我看来,这些对社会而言是净收益。开放权重模型是加速主义式的,它通过降低达到某一性能水平的智能的准入门槛,推动了AI 在经济中的扩散。开放模型还鼓励定制化。问题在于,这种扩散本质上远比前沿 AI 实验室的产品要慢,后者销售的是开发者直接使用的工具。开放模型的潜力在于,几乎每一家企业都能用它们来打造特定领域的智能体。这种经济层面的扩散需要极其漫长的时间!我曾把这一现象描述为开放权重模型的起步要慢得多,但潜在的指数增长可能更大。问题在于,如果闭源模型在原始能力上领先太多,这种定制化的能力就可能变得毫无意义。
在我看来,AI 实验室中扩散程度提高与权力集中度下降的组合,对 AI 转型是非常积极的。它给了我们更多时间去解决新能力带来的难题,也让更多利益相关方能够影响这段进程——任何一家公司都极有可能在安全控制世界上最重要的技术方面遇到问题。
当然,在这个世界里,最好的模型仍然由美国公司制造,这对我很重要,因为这能让美国掌控这项技术的走向及其价值观。我也预期情况会如此,因为美国拥有更大的资本市场,愿意投资 AI(并且利润份额也在不断增长),但这并非理所当然。
3. 中国的效率优势
Kimi 的发布博客中有一些技术细节,印证了正是这类改进在持续带来我们能感受到的模型提升。这里选一个来说:
Kimi K3 构建于 Kimi Delta Attention(KDA)和 Attention Residuals(AttnRes)之上,这两项架构更新旨在改善信息在序列长度和模型深度上的流动方式。我们还扩大了 Mixture of Experts(MoE)的稀疏度,配合 Stable LatentMoE 框架,实际激活 896 个专家中的 16 个。再加上精炼的训练和数据配方,这些结构性变化相比 Kimi K2 带来了约 2.5× 的整体扩展效率提升,使模型能够更有效地将算力转化为智能。
训练效率确实会不断累积。它们将为模型带来持续且惊人的进步。
顺带一提,追踪这一特定创新在生态系统中传播的路径是一个有趣的例子。Kimi Delta Attention(KDA)是在 Kimi Linear 论文中提出的,它类似于用于 Olmo Hybrid 的 Gated DeltaNet(那是我在 Ai2 期间参与的最后一个 Olmo 模型)。Qwen 的最新模型转向了一种相关架构,近期的 Nemotron 模型同样是混合架构(但仍更接近 Mamba 而非 Gated DeltaNet)。看到这类新架构思路——它们由学术界大力推动——如此迅速地转化为前沿规模的模型,实在令人惊叹。Gated Delta Networks 于 2024 年底提出,建立在 Mamba 的思路之上。到 2026 年年中,它们已经进入了前沿模型。
我选择聚焦这个例子,部分原因是 Kimi 团队为模型之间的创新给出了一个很酷的数字,但主要是为了给关于中国资源效率的更广泛讨论留出空间。
越来越明显的是,中国的实验室在资本效率上要高得多。在一个由规模定律主导、智能与有效资本(用于购买算力、数据和人才)成正比的世界里,这或许是你的 AI 产业所能拥有的最大优势。对此有许多可能的解释,比如中国研究人员的薪酬更低,同时在 LLM 研究难题上更为高效,但我们大概永远无法得到如此具体的理由。
自从我写完关于中国的笔记以来,我听到越来越多关于中国正在兴起的数据产业的消息(远远落后于 Anthropic 在数据上动辄数十亿美元的预算),以及中国实验室能够获取到可观的训练算力(通过规避出口管制)。中国公司并不拥有同样的推理需求(直到最近情况才有所变化,月之暗面(Kimi)不得不暂停新订阅以应对其 K3 模型的访问需求——而 API 仍然在线),因此它们更多的算力可以用于训练。这些领域严重影响着关于这些实验室能力的判断是否属实,但我们对此的测量手段非常有限。
实际情况是,这些中国实验室筹集的资金比美国 AI 生态系统中任何一个细分领域都要少好几个数量级。最直接的对比对象是 OpenAI 和 Anthropic,它们的公开模型略胜一筹。其他公司,如 Google 和 Meta,拥有商业史上最大的现金流,但在模型构建方面却落后了。至于美国的新兴实验室,竞争格局更加激烈——Thinking Machines 最近发布了他们的首个模型Inkling,它表现强劲,但不在 Kimi K3 的同一级别。
这些拥有更多资源的美国公司仍有可能追赶上来,但你需要认真权衡我们所拥有的模型质量公开测量数据,而不是诉诸希望——希望往往反映的是一种偏见。如果中国实验室确实拥有潜在优势,它们可以继续利用这一优势来构建比所有竞争对手都更强大的模型!许多结果是可能的,而 K3 应该会提高大多数人对中国能够在不久的将来凭借更高效的训练努力直接引领 AI 能力的概率——即使这并非你预测中最可能的结果。
资本效率的一大贡献因素很可能在于方法本身:美国实验室投入大量精力,以戏剧性的大跨步推动前沿,而中国实验室更专注于追赶——这种追赶成本更低。正如在知识蒸馏中,学生模型通常能超越教师模型(并不限于中国实验室那种对抗性蒸馏),一种“努力追赶”而非“发明下一个范式”的方法,可能带来更强的模型。
4. 一个不断壮大的前沿开放模型生态
Kimi K3 发布后的那个周末,在撰写本文并广泛讨论这些事件时,阿里巴巴宣布即将推出一个 2.4 万亿参数的 Qwen 3.8 模型,并开放权重。历史上,阿里巴巴一直将其最大的模型通过云业务以仅 API 的形式提供,因此这是又一次重大的氛围转变,为开放模型经济的下一篇章打开了大门。即便该模型在基准测试上落后于 Kimi K3,它也表明中国公司可能不仅是在维持其开放模型策略的现状,而是在进一步加码。
如果这个 Qwen 3.8 模型很快发布,也就是在下一个 Gemini 模型之前,它可能会把 Google 推到拥有最聪明模型的实验室排行榜第 8 位——而中国在这份榜单上一直在攀升。还有其他传闻称,很快会有更多强大的中国模型出现,其中 DeepSeek V4 预计将脱离其“预览”版本。
5. 前沿开放权重政策漫长故事的刚刚开始
我认为,如果 Claude Mythos 今天作为开放权重模型发布,负面后果会相对较小。这是一个多少有些难以坚持的观点,因为我们的公开网络安全评估非常有限,而且生态系统十分复杂(也因为我很信任 Anthropic 的许多人)。但我仍然坚持这一看法。相关风险被过度夸大了。
问题在于,对于最强的 AI 模型来说,情况不会总是如此。远比现在强大的模型正在到来——随之而来的是更大的风险——因此,让最好的模型以受控、封闭的方式、在类似开放权重模型出现之前数月就能被获取,是一种极其安全的均衡状态。
用户能够高度控制的开放权重模型总会不断涌现——你无法有效禁止数字产品,尤其是来自恶意行为者的产品——因为 AI 训练被证明在全球范围内的可获取性,比许多分析师预期的持续时间更长。
尽管如此,在我写下这些文字时,美国政府仍在不断试探更多旨在限制开放权重模型的措施。最新一则来自Axios:
幕后消息:一位接近政府的消息人士告诉 Axios,美国商务部去年曾考虑将多家中国 AI 实验室列入其“实体清单”,这将实际上在没有许可证的情况下切断美国对其的获取。
该消息人士称,美国国家安全局和白宫国家网络主任办公室去年也曾考虑就中国 AI 实验室的威胁发布一份公告,实际上是在劝阻美国公司使用其技术。
知情人士补充说,白宫曾考虑颁布一项行政命令,规定美国公司只有在能够保证安全、并在安全被突破时承担责任的前提下,才能托管中国模型。
另一位接近政府的知情人士表示,商务部去年夏天还在政府内部传阅了规则草案,利用其权限来保障国内供应链安全,以针对中国的开源模型。
这将使美国陷入一种非常不对称的状态:美国最好的模型在网络安全任务上设有防护栏,但全球行为者却可以获取优秀的中国开放权重模型来探测我们的防御。这只是众多例子之一,说明禁止开放权重模型不仅损害 AI 的自由市场,还会在短期内让整个生态更不安全。还有其他非常糟糕的后果,比如减缓 AI 应用和 AI 研究的扩散,正如我上文所讨论的。
这些平衡极难维持,尤其是在 AI 工具加速模型进步的背景下,但维持开放与闭源之间的这种现状非常重要。拥有一款在能力上真正独处前沿的模型——比如 Mythos 发布时那样——同时又开放权重,会随着我们步入未知的能力领域而带来严重风险。模型将进步得非常快,衡量它们的总体能力也越来越难。
我们于是陷入了一个试图在开放模型问题上走钢丝的世界。不希望如此强大的东西在瞬间扩散到全球,这是合理的;但与此同时,模型的制造者有动机去夸大其能力,而它们的竞争对手则有动机去夸大其风险。归根结底,这一切都取决于审慎的度量,以及社会对各类风险向量进行主动加固。
这列载着政策辩论、模型发布和喧嚣反应的失控列车,从今天起只会继续向前。自去年 12 月 Claude Opus 4.5 发布、把我们带上智能体之路以来,我们一直身处一列快速进步的列车之上,AI 应当如何演进的种种关键构想都在此接受检验。在这里做出正确决策的关键,是独立于那些财务利益最庞大的公司之外的评估能力。因此,当我们迈入AI 治理的 AGI 时代时,所需的众多行动之一,就是一种“曲速行动”式的做法:扶持国家能力(以及其他独立行为者),使其能够准确评估模型,并研究新兴风险。
结论:警钟已经敲响
开放权重模型通过加速能力的扩散,使 AI 的益处与潜在危害都出现了大规模升级。就目前而言,前沿语言模型的危害一面在很大程度上仍是假设性的,但这种情况不会永远持续下去。
让开放权重模型略微落后于闭源前沿,是我们缓解风险的自然缓冲。关键在于,我们必须共同行动,在潜在危害出现时加以缓解,而无论开放权重模型是落后3个月、6个月还是9个月,那仍然是非常短的时间线。如果我们对开放权重模型施以重手监管,我怀疑世界上许多人会被麻痹,以为我们不再需要行动。我们所做的不过是稍微推迟了不可避免之事——开放模型终将跨越所有关键能力门槛,无论合法与否。
理解并受益于这种开放与闭源之间的共舞,必须是 AI 社区在未来数年里跨越所有权力与影响力部门的集体行动。
Kimi K3 是一个分水岭时刻,因为前沿开放权重模型如今已成为现实。许多关于开放权重模型风险究竟落在何处的假设将得到检验——我怀疑它会比许多人预期的更窄,而 AI 的许多风险仍将由闭源且“更安全”的 API 扩散。对这些风险的评估将随着 AI 加速融入我们的经济而不断演变。我们无法只要其一而不要其二,而我们将继续两者兼得。
正因如此,2025 年成为开放模型开始被更认真对待的一年——尤其是当中国以如此明显的领先优势跃居前列之时——人们意识到这不会是一个单极世界,不会只由美国的闭源 AI 实验室决定发展轨迹。2026 年则是此前讨论过的、由真正前沿的开放权重模型所带来的潜在风险与加速成为现实的一年。
回复中有很大一部分是针对第四条要点的,该条将开放模型的必然结果比作 AI 共产主义,我认为这没有说到点子上。具体来说,使用“共产主义”一词却未加解释,引发了大部分反弹。
来源:Nathan Lambert:Interconnects(RSS) · interconnects.ai