跳到正文
北京时间

Kimi / 月之暗面

月之暗面 Kimi 系列模型与产品动态:K 系列开源模型、长上下文技术与产品演进的追踪。

55条精选相关主题通义千问 QwenDeepSeekMiniMax

最新精选

第 1–20 条 · 共 55 条
9月24日周四
  1. OpenRouter:Announcements(RSS)77

    OpenRouter 解析 Kimi K3:开源权重与许可证条款,以及如何调用

    OpenRouter 撰文说明 Kimi K3 是开放权重而非开源模型,Moonshot AI 以自定义 Kimi K3 License 在 Hugging Face 发布 moonshotai/Kimi-K3。

    推荐理由:原文逐条拆解 Kimi K3 许可证的授权与规模化门槛,并给出 OpenRouter 调用参数和各家定价,读者可据此决定自部署还是走 API。

  2. Modal 官方工程博客(RSS)62

    Modal 详解如何以万亿 token 规模服务 Kimi K2.6 编码 Agent 推理

    Modal 分享为编码 Agent 提供万亿参数模型 Kimi K2.6 推理服务的优化实践,优化后单副本每用户性能提升 2.8x、副本整体吞吐提升 5.6x,单个服务日处理数千亿 token。

    推荐理由:原文以一线实践拆解编码 Agent 推理优化的完整路径,读者可以迁移其瓶颈定位与 KV 缓存路由方法。

9月22日周二
  1. Kimi.ai69

    Kimi 发布新的 Kimi Browser Extension,前身为 Kimi WebBridge。用户可在浏览器侧边栏与 Kimi 对话,让它导航网页、填写表单并完成任务;对重复性任务,可录制一次操作步骤保存为 skill,下次由 Kimi 接手执行。产品现已在 kimi.com/products/kimi-browser-extension 和 Chrome Web Store 上线。

    推荐理由:官方原文给出了产品入口、侧边栏能力和把重复操作存为 skill 的做法,读者可据此评估是否纳入自己的浏览器工作流。

9月21日周一
  1. 公众号:月之暗面(Kimi)71

    Kimi 发布 Kimi Code Desktop 1.0,macOS 与 Windows 版同步上线

    Kimi(月之暗面)发布 Kimi Code Desktop 1.0,作为 Kimi Code 官方桌面客户端,macOS(Apple 与 Intel 芯片)和 Windows 版同步上线,下载地址为 kimi.com/code。

    推荐理由:官方发布 Kimi Code Desktop 1.0,覆盖安装方式、Agent 模式与开发工作流细节,读者可了解它相对 CLI 的界面与协作变化。

8月3日周一
  1. Kimi.ai70

    使用 Kimi Work 制作幻灯片 - 教程 #1。 Kimi Slides 处理整个幻灯片制作流程: - 清晰的结构与研究,由 Kimi K3 驱动 - 连贯的设计,包括精美的图表和 SmartArts - 可编辑并可直接下载 欢迎在评论区告诉我们你还想看什么内容!

    推荐理由:教程展示了如何用 Kimi Slides 一站式完成幻灯片的结构、设计和下载,对需要快速产出演示文档的 Kimi 用户有直接可用性,但完整效果仍取决于实际模板和内容质量。

8月1日周六
  1. Together AI 研究与产品博客(RSS)82

    Kimi K3 开发者完全指南:Together AI 上的 1M 上下文、推理档位与工具调用

    Together AI 发布 Kimi K3 开发者指南。K3 是月之暗面(Moonshot AI)2.8 万亿参数的开放权重模型,首个 3 万亿参数级的开源模型,Together 直接与 Moonshot 团队合作提供服务。

    推荐理由:指南给出 KDA、Stable LatentMoE 架构要点和 API 用法、缓存与计费细节,开发者可据此判断如何在 Together 上落地这个模型。

7月29日周三
  1. Hacker News 热门(buzzing.cc 中文翻译)76

    在 M1 Max 上运行 2.8T 参数的 Kimi K3:Deltafin 项目实现 0.0687 token/s 推理

    Deltafin 项目成功在 64 GB M1 Max 上运行了 2.8T 参数的 MoE 模型 Kimi K3,当前中位推理速度为 0.0687 token/s(14.6 秒/token)。完整安装需约 1.7 TB 本地磁盘,流式模式仅需 215 GB 但推理速度降至 3 分钟以上/token。项目提供 OpenAI 兼容 API 服务器,支持聊天和代码补全,但建议客户端超时设为小时级别。

    推荐理由:这是个在 M1 Max 上跑 2.8T MoE 的工程 hack,把不可能变成可能,虽然慢得只有聊天室节奏,但玩法足够硬核,玩硬件的看完会想开 issue 贡献数据。

  2. Together AI 研究与产品博客(RSS)65

    Together AI 与月之暗面达成战略合作,原生托管 Kimi K3 及后续开源模型

    Together AI 宣布与 Moonshot AI 达成战略合作,成为其模型发布平台,Kimi K3 已上线并可零日访问,未来 Moonshot 每个开源权重模型都将在 Together 首发。

    推荐理由:作者作为合作方说明 K3 的架构要点和托管选项,读者可据此评估开源前沿模型在生产环境的可用路径。

7月28日周二
  1. Hacker News 热门(buzzing.cc 中文翻译)76

    Kimi Linear:一种表现力强且高效的注意力架构

    月之暗面推出 Kimi Linear,一种混合线性注意力架构,首次在短上下文、长上下文和强化学习场景下全面超越全注意力机制。其 3B 激活参数模型在所有评估任务上显著优于全 MLA,同时将 KV cache 使用量降低最多 75%,并在 1M 上下文下实现最高 6 倍解码吞吐量。月之暗面已开源 KDA 内核、vLLM 实现及模型权重。

    推荐理由:Kimi Linear首次在公平对比中证明了线性注意力可以全面超越full attention,KV缓存降低75%,解码吞吐量提升6倍,所有做长上下文和RL团队的必读论文。

  2. 公众号:月之暗面(Kimi)85

    Kimi K3 开放日:模型权重、技术报告和关键 Infra 技术同步开放

    月之暗面发布 2.8 万亿参数的混合专家模型 Kimi K3,支持原生视觉理解和 100 万 token 上下文窗口。其规模化效率较 Kimi K2.5 提升 2.5 倍,并同步开源模型权重、技术报告及 MoonEP、FlashKDA、AgentEnv 三项 Infra 技术。

    推荐理由:Kimi K3 的完全开放是一个明确信号,月之暗面把最核心的模型权重和技术细节全部公开,国内开发者从此有了媲美国际顶尖开源的底座。虽然部署门槛不低,但开放本身推动了生态发展。

  3. Kimi.ai73

    Kimi.ai 发布 PerceptionBench,一个从当前前沿模型在 42 个基准上的失败模式中归纳出的视觉感知基准。该基准将视觉感知拆解为 10 种原子能力,并构建了 3000 道验证题,每道题只考察单一感知能力,无需推理或外部知识。

    推荐理由:从模型失败中反向定义原子感知,把视觉感知从推理里拆出来很聪明,开源数据和方法对做视觉评测的产品人很有参考价值。

7月27日周一
  1. 公众号:月之暗面(Kimi)81

    Kimi K3 开放日:模型权重、技术报告和关键 Infra 技术同步开放

    Kimi 发布 K3 模型权重与技术报告,并开源 MoonEP、FlashKDA 和 AgentEnv 三项关键 Infra 技术。K3 是 2.8 万亿参数的 MoE 模型,支持原生视觉与 100 万 token 上下文,参数规模约为 K2.5 的 3 倍,规模化效率提升 2.5 倍。

    推荐理由:权重开源伴随技术报告公开训练细节,为研究机构直接复现和改造千亿级MoE模型提供了完整路径,也降低企业自部署门槛。

  2. Kimi.ai69

    我们与 kvcache-ai 合作开源了 AgentENV。 AgentENV 是一个用于大规模运行智能体环境的分布式系统。其组件为 Kimi K3 的智能体强化学习训练提供支持,具备快速快照、恢复和分支功能,适用于大规模并行智能体工作流。 在 GitHub 上探索:http://github.com/kvcache-ai/AgentEnv

    推荐理由:月之暗面开源了自家训练Kimi K3用的智能体环境,带快照和分叉,做agent训练的人可以直接上手抄作业,比看论文实在。

  3. Modal 官方工程博客(RSS)78

    Moonshot 发布 2.8T 参数开源多模态模型 Kimi K3,Modal 实现发布当天 460 tokens/s 推理

    Moonshot 发布 Kimi K3,总参数 2.8T、每 token 激活 16/896 专家,支持 1M token 上下文窗口和原生视觉。Modal 与 Moonshot、vLLM 合作提供 Day 0 支持,通过定制的 DFlash 投机解码模型将智能体负载交互速度从 100 提升到 460 tokens/s,吞吐从 800k 提升到 1.5M TPM/GPU。

    推荐理由:Modal 作为发布当天的托管方,给出了 K3 架构细节与推理加速数据,读者可据此评估运行这级开源模型的工程门槛。

  4. vLLM 官方博客(RSS)75

    vLLM 发布 Kimi K3 Day-0 支持:2.8T 混合 MoE 的部署指南与性能数据

    vLLM 官方宣布 Day-0 支持 Kimi K3,这是一个 2.8 万亿参数的 MoE 模型(每 token 激活 896 专家中的 16 个),基于 Kimi Delta Attention 与 Attention Residuals,支持 1M token 上下文窗口和原生视觉。

    推荐理由:vLLM 团队亲述 Day-0 支持 Kimi K3 的工程细节与部署配方,读者可以据此判断混合线性注意力模型在实际服务中的可行路径。

7月26日周日
7月24日周五
  1. The Decoder:AI News(RSS)73

    Kimi K3 在网络安全漏洞利用测试中大幅落后美国前沿模型,知识蒸馏或为原因

    英国AI安全研究所与美国AI标准与创新中心联合评估显示,月之暗面的Kimi K3在ExploitBench基准上得分32.2%,远低于美国领先模型的76.2%,但优于智谱GLM-5.2的24.4%。

    推荐理由:英美安全机构的联合评测把蒸馏嫌疑拽到了台面上,Kimi K3 的漏洞利用能力仅为美国前沿模型四成,安全评估不能只看通用基准,开源模型的安全面具该摘了。