跳到正文
北京时间

模型发布

新模型的发布、开源与迭代:大模型厂商的旗舰更新、开源权重放出、性能与价格变化的第一时间记录。

710条精选相关主题产品更新论文研究开源生态

最新精选

第 301–320 条 · 共 710 条
6月16日周二
  1. SiliconFlow65

    硅基流动上线月之暗面Kimi K2.7 Code模型。基于K2.6改进,专注编码与智能体任务。32B激活/1T总参,VLM多模态,支持交错思考与多步工具调用。相比K2.6,推理token使用减少30%,减少过度思考;长程编码任务指令遵循和完成率提升。性能接近GPT5.5与Opus 4.8。价格:缓存输入0.19/输入0.94/输出4.00每百万token。

    推荐理由:K2.7 Code 在编码上逼近 GPT-5.5 和 Opus 4.8,同时推理 token 用量降低 30%,对追求前沿编码能力又在意成本的技术团队是个实用选择,硅基流动上的定价也给了明确预期。

  2. 🚨 AI News | TestingCatalog75

    Cartesia 推出 Sonic 3.5 和 Ink 2 两个模型,作为单一实时语音栈,分别负责文本转语音和语音转文本。Ink 2 在 Artificial Analysis 的流式语音转文字排行榜上排名第一。Sonic 3.5 在实时文本转语音中位列榜首,首音频延迟约 82ms。Cartesia 成为目前唯一同时拥有 #1 听与说模型的提供商。

    引用Karan Goel@krandiash

    我们发布了 Sonic-3.5 和 Ink-2,这是目前可用于你的语音代理的排名第一的文本转语音和语音转文本流式模型。 新架构为速度和质量开辟了新前沿。 我们现在是唯一一家同时拥有说话和聆听排名第一模型的提供商。

    推荐理由:Cartesia 同时发布实时语音合成和识别两个模型的迭代版,双双登顶第三方基准,80ms 首音频延迟让语音代理的交互感接近真人,做实时语音应用的开发者可以重点看一下。

  3. 公众号:通义实验室(千问)75

    Qwen-Robot 发布:通义实验室用三模型打通大模型到物理世界

    通义实验室发布 Qwen-Robot 套件,以 Qwen-RobotNav、Qwen-RobotManip、Qwen-RobotWorld 三个模型分别覆盖导航、操作与世界预测,统一采用语言优先接口。

    推荐理由:将视觉语言模型与物理行动对齐,统一跨本体表示和数据协同,为具身智能规模化提供了一种可行路径。

  4. Qwen:Blog Retrieval(API)72

    Qwen-RobotManip:对齐解锁机器人操作基础模型的规模化能力

    Qwen-RobotManip 是通义千问基于 Qwen-VL 的视觉-语言-动作(VLA)基础模型,引入覆盖表示、运动和行为三维度的统一对齐框架。仅使用开源机器人数据集和人演示视频,构建约 38,100 小时预训练语料,涵盖 15 种机器人形态。在 LIBERO-Plus 达 91.4%,RoboTwin-C2R Hard 达 69.4%,RoboCasa365 Composite-Unseen 达 14.9%,EBench 达 45.6%,RoboTwin-IF 达 72.0%,并在 RoboChallenge Table30 v1 generalist track 夺冠。模型采用 80 维状态-动作表示、人-机器人数据合成管道(1,933 小时第一人称视频转 24,808 小时数据)及上下文策略适配。

    推荐理由:Qwen 这次发布的机器人模型,用统一对齐框架把跨实体数据规模化训练跑通了,OOD 泛化大幅领先,做具身智能的值得认真看一下。

  5. Qwen:Blog Retrieval(API)72

    Qwen-RobotWorld:具身智能体的无界世界

    Qwen-RobotWorld以语言为统一动作接口,采用双流Multimodal Diffusion Transformer(MMDiT)架构,将Qwen2.5-VL作为动作编码器。在4个基准测试中取得顶尖成绩,统一20余种机器人形态,基于860万跨场景训练对和1300多项操作技能。语言接口标准化500多种动作类别,支持操作、自动驾驶、室内导航的联合训练。还支持Scene2Robot人类到机器人转移及2–4路多视角几何一致视频生成。

    推荐理由:具身智能的世界模型长期受限于单一形态,Qwen-RobotWorld用语言统一动作接口,把操作、驾驶、导航合训,多视角几何一致性和人类演示迁移是过去一年最扎实的落地信号,做机器人的别错过。

  6. Qwen:Blog Retrieval(API)73

    Qwen-Robot Suite:面向物理世界智能的基础模型套件

    Qwen 发布三款基础模型——Qwen-RobotNav、Qwen-RobotManip 和 Qwen-RobotWorld。Nav 通过可控观测协议统一指令跟随、点/物体目标导航、目标追踪和自动驾驶五类任务,在 VLN-CE RxR 上达 76.5% SR,HM3Dv2 物体目标导航(仅 RGB)75.6% SR,EVT-Bench 追踪率 90.0%,NAVSIM 91.4 PDMS。Manip 利用规范状态-动作空间对超 38,100 小时异构开源机器人数据进行跨本体训练。World 通过自然语言动作接口协同训练 20 余种本体,预测操控、驾驶和导航的物理未来。三者共同将通用智能转化为物理行动。

    推荐理由:Qwen把导航、操作和世界模型打包成机器人基础套件,用统一语言接口串起来,这是具身智能从单点突破走向系统化的信号,虽然离真实世界还有距离,但方向很清晰。

  7. 公众号:蚂蚁百灵(Ling)79

    蚂蚁百灵发布 Ling & Ring 2.6 技术报告

    蚂蚁百灵发布 Ling & Ring 2.6 技术报告,系统公开 Ling-2.6-flash、Ling-2.6-1T 和 Ring-2.6-1T 的架构、预训练、后训练及 Agent 强化学习细节。三款模型采用 Hybrid Linear Attention 架构,将 Lightning Attention 与 MLA 以 7:1 比例结合。Ling-2.6-flash 在 4×H20 硬件上解码速度达 340 tokens/s,Ling-2.6-1T 在 Artificial Analysis Intelligence Index 上 token efficiency 较前代提升约 4 倍。Ring-2.6-1T high 在 PinchBench 得 87.60,ClawEval 得 63.82。三款模型均已开源。

    推荐理由:蚂蚁百灵2.6技术报告首次公开Hybrid Linear Attention与KPop Agent RL细节,开源模型在OpenClaw登顶,把万亿模型从聊天拉到真实工作流,做Agent应用的值得细读。

  8. 公众号:蚂蚁百灵(Ling)77

    蚂蚁百灵发布 Ling & Ring 2.6 技术报告

    蚂蚁百灵发布 Ling & Ring 2.6 技术报告,公开 2.6 系列在架构、预训练、后训练及 Agent 强化学习等细节。该系列采用 Lightning Attention 与 MLA 以 7:1 比例结合的混合线性注意力架构,预训练处理约 9.6T tokens,上下文扩展至 256K。

    推荐理由:报告系统公开了万亿参数模型在架构迁移、Agent RL和推理基础设施上的完整技术链路,为设计高性能Agent系统提供了可复现的工程方案。

  9. IT之家(RSS)70

    成本砍半,字节跳动推出 Seedance 2.0 Mini 视频生成模型

    字节跳动火山引擎旗下火山方舟体验中心于 6 月 15 日上线 Seedance 2.0 Mini 视频生成模型,计划近期开放 API。该模型比 Seedance 2.0 Fast 快 2 倍,输出质量相当。图生视频定价 0.023 元/千 tokens,视频生视频 0.014 元/千 tokens,720P 规格下单秒生成成本约 0.5 元,较 Seedance 2.0 标准版降低约一半。模型面向电商内容生产、营销素材批量生成、UGC 创作及特效玩法等高频率、大规模视频生成场景。

    推荐理由:Seedance 2.0 Mini 把视频生成成本压到 0.5 元/秒,比标准版便宜一半,对做大批量电商素材和 UGC 的团队是个实际信号,值得等 API 开放后看实测。

  10. LMSYS:Blog(Chatbot Arena 团队)67

    下一代投机解码:DFlash 与 Spec V2

    Z Lab、Modal 与 SGLang 团队联合发布 DFlash 投机解码模型和 SGLang 的默认 Spec V2 引擎。DFlash 采用块扩散+KV 注入并行生成整块 draft token,在 Qwen 3.5 397B-A17B(BF16)的 HumanEval 数据集上、并发 1 时吞吐量达到基线的 4.3

    推荐理由:DFlash 用并行起草和 KV 注入实现了实测 4.3 倍吞吐,再加上 SGLang Spec V2 引擎优化,推理加速不再是纸上谈兵。做 LLM 部署和推理服务的人,可以直接用这个组合试试。

6月15日周一
  1. 公众号:月之暗面(Kimi)62

    Kimi K2.7 Code 高速版上线:输出速度约 5-6 倍,API 定价为普通版 2 倍

    Kimi K2.7 Code 高速版已上线,与普通版为同一模型,输出速度约 5-6 倍,常规编程场景下约 180 Token/s,短上下文可达 260 Token/s,API 定价为普通版的 2 倍。

    推荐理由:代码生成延迟是编程模型体验的关键短板,180 token/s 的高输出速度使长上下文任务中的等待感显著缩短,而 2 倍定价并没有让成本增速高于效率提升。

  2. Hacker News 热门(buzzing.cc 中文翻译)72

    里约热内卢市政府 AI 模型 Rio3.5 在基准测试中击败 Qwen3.7

    里约热内卢市政府开发的 AI 模型 Rio3.5,在近期基准测试中超越了 Qwen3.7。该消息源自 Hacker News 上的一篇帖子,指出 Rio3.5 在多项评测中表现优于 Qwen3.7。目前尚未公开具体的测试细节或基准名称。

    推荐理由:一个市政府 IT 部门训练的模型在基准测试中击败了 Qwen3.7,这让人重新审视谁在参与前沿模型竞争。如果结果可复现,可能是今年最意外的黑马。

6月13日周六
  1. 公众号:智谱(GLM)70

    智谱 GLM-5.2 全量开放,支持 1M 上下文且下周开源

    GLM-5.2 是智谱迄今能力最强的开源模型,支持真正可用的 1M 上下文,在长程任务中继续保持领先,并被智谱称为最强的国产 Coding 模型。今晚 5:21 起面向 GLM Coding Plan 全量用户开放(覆盖 Lite、Pro、Max、团队版)。API 将于下周上线,模型下周正式开源,遵循 MIT 协议。

    推荐理由:智谱把最强大模型全量开放且开源,这事本身就在打脸那些收回权限的闭源模型,做中文编码的开发者可以认真看看。

  2. 公众号:智谱(GLM)70

    GLM-5.2 全量开放:智谱最强开源模型支持 1M 上下文

    智谱发布迄今能力最强的开源模型 GLM-5.2,支持真正可用的 1M 上下文,并在长程任务中继续保持领先,同时也是其最强的国产 Coding 模型。今晚 5:21,GLM-5.2 将面向 GLM Coding Plan 全量用户开放,覆盖 Lite / Pro / Max / 团队版。GLM-5.2 API 将于下周上线,模型下周正式开源,遵循 MIT 协议。

    推荐理由:GLM-5.2 的 MIT 开源意味着企业可无授权顾虑地基此构建编码工具,若长程能力兑现,可能重塑国产代码助手的成本边界。

  3. 蚂蚁 inclusionAI:HuggingFace 新模型62

    inclusionAI 发布 VISTA-4B GUI 定位视觉语言模型

    VISTA-4B 是基于 Qwen3.5-4B 骨干的 GUI 定位模型,输入截图与自然语言指令,输出归一化 0-1000 坐标。训练采用视图一致 GRPO 和自验证交叉视图锚定。在 GUI 定位基准上,SSPro 得分 64.2(相比 GRPO-4B 提升 2.0),SSV2 得分 93.8(下降 0.4),OSWorld-G 得分 61.2(提升 1.3),OSWorld-G-R 得分 69.7(提升 0.5)。模型已开源在 HuggingFace,推荐使用提示词并返回 [x,y] 格式坐标。

    推荐理由:蚂蚁 inclusionAI 开源了一款 GUI 定位模型,基于 Qwen3.5 微调,在接地基准上小幅提升,关键是提供了自验证训练方法,做桌面自动化的可以直接下载用。

  4. 蚂蚁 inclusionAI:HuggingFace 新模型71

    inclusionAI/VISTA-9B:基于VISTA训练的GUI定位视觉语言模型

    VISTA-9B是基于Qwen3.5 9B骨干训练的GUI定位模型,输入截图与自然语言指令,输出0-1000归一化坐标。采用VISTA(视图一致自验证)方法,含view-consistent GRPO与self-verified cross-view anchoring。在SSPro、SSV2、OSWorld-G、OSWorld-G-R上分别取得69.2、95.8、68.1、75.5分,超越Qwen3.5-9B与GRPO-9B基线。模型已开源,可通过HuggingFace加载使用。

    推荐理由:蚂蚁 inclusionAI 的 VISTA-9B 专攻 GUI 定位,把截图和指令直接变成点击坐标,做界面自动化的开发者可以直接拿来用。训练中的视角一致性约束有点新意,但基准提升不大,更像个实干范本。

  5. HuggingFace Daily Papers(社区热门论文)77

    Ling-2.6与Ring-2.6技术报告:高效即时的万亿参数智能体智能

    Ling-2.6优化即时响应与输出token能力,Ring-2.6针对深度推理和复杂智能体工作流。基于Ling-2.0通过架构迁移预训练和大规模后训练升级。架构引入融合Lightning Attention与MLA的混合线性注意力设计,提升长上下文训练与解码效率。通过进化思维链、语言单元策略优化、双向偏好对齐和最短正确响应蒸馏优化token效率。提出KPop强化学习框架支持Ring-2.6-1T在环境交互数据上稳定训练,通过异步调度提升编码、搜索、工具使用和工作流执行的训练效率。2.6系列全部检查点已开源。

    推荐理由:万亿参数开源 Agent 模型,一个走即时响应,一个专攻复杂推理,对于做工具调用和自动化工作流的团队是能立刻上手的重要弹药。

  6. MiniMax (official)82

    MiniMax M3 发布,具备前沿编码与智能体能力,原生图像视频输入和计算机使用,1M-token 上下文。核心采用 MSA 稀疏注意力:每个 query 评分 128-token KV 块,仅对 top 块做注意力。vLLM 当日即支持 M3,包括专用 MSA prefill/decode 核、前缀缓存与分块 prefill、BF16 和 MXFP8 检查点、Hopper 与 Blackwell 的 MoE 后端,并在 NVIDIA 与 AMD 硬件上验证。同时支持原生多模态输入、工具调用、推理解析和思考模式控制等智能体工作负载。

    引用vLLM@vllm_project

    🎉 恭喜 @MiniMax_AI 发布 MiniMax M3!前沿的编程与智能体能力、原生图像和视频输入、计算机使用,以及 100 万 token 上下文窗口,全部集成在一个开放模型中。 M3 的核心是 MSA,一种全新的稀疏注意力架构:它不再对完整的 KV 缓存进行密集注意力计算,而是让每个查询对 128 token 的 KV 块打分,并仅对得分最高的块运行注意力。这正是让 100 万 token 上下文变得可实际服务的关键。 M3 在 vLLM 中实现首日支持,并已在 NVIDIA 和 AMD 硬件上验证: ✨ 带专用 prefill 和 decode 内核的 MSA 稀疏注意力 ✨ 支持前缀缓存和分块 prefill 的 100 万 token 上下文服务 ✨ BF16 和 MXFP8 检查点,同时为 Hopper 和 Blackwell 提供 MoE 后端 ✨ 原生多模态输入(图像 + 视频) ✨ 面向智能体工作负载的工具调用、推理解析和思考模式控制 这样的首日支持是真正的团队协作成果。感谢 @MiniMax_AI、@NVIDIAAI、@AIatAMD 和 @inferact 的团队,以及 vLLM 社区让这一切成为可能。🙏 深入了解实现细节、内核工作和部署方案: 🔗 https://vllm.ai/blog/2026-06-12-minimax-m3-vllm

    推荐理由:M3把1M上下文从‘理论上能做’变成了‘今天就能部署’,MSA稀疏注意力是关键,开源社区和推理框架的深度合作值得关注。

6月12日周五
  1. Kimi.ai70

    Kimi 发布并开源最新代码模型 Kimi-K2.7-Code。相比 K2.6,其在 Kimi Code Bench v2 上提升 +21.8%,Program Bench 提升 +11.0%,MLS Bench Lite 提升 +31.5%。推理效率改进,推理 token 使用量降低 30%,长时编码任务中指令遵循和端到端成功率均提升。6x 高速模式即将推出,即日起可通过 Kimi API 和 Kimi Code 使用。

    推荐理由:月之暗面这次把编码模型做到 K2.7 还直接开源,Bench 提升不小,关键是把「想太多」的毛病治了,推理 token 省了三成,做 coding agent 的可以立刻换上试试。

  2. Zyphra Research(网页)71

    Zyphra 发布开源实时语音克隆模型 ZONOS2

    Zyphra 发布 Apache 2.0 许可的实时 TTS 模型 ZONOS2,采用 8B 总参数、900M 激活参数的 MoE 架构,主打高保真零样本语音克隆,权重已上线 Hugging Face。

    推荐理由:原文给出架构、训练数据和评测细节,读者可以了解这个开源实时 TTS 模型在音色保真与生成稳定性之间的取舍。