跳到正文
北京时间

模型发布

新模型的发布、开源与迭代:大模型厂商的旗舰更新、开源权重放出、性能与价格变化的第一时间记录。

710条精选相关主题产品更新论文研究开源生态

最新精选

第 361–380 条 · 共 710 条
6月4日周四
  1. Hacker News 热门(buzzing.cc 中文翻译)78

    Gemma 4 12B:一种统一的、无需编码器的多模态模型

    Gemma 4 12B 是 Google 发布的一款统一架构、无需独立视觉编码器的多模态大语言模型(LLM)。该模型直接处理图像与文本输入,无需传统视觉编码器,简化了多模态推理流程。基于 12B 参数规模,Gemma 4 12B 面向开发者工具生态开放。目前其具体 benchmark 分数、上下文窗口、价格及开源/API 可用性等细节尚未披露。

    推荐理由:我觉得Gemma 4 12B最大的变化不是参数大小,而是第一次在开源模型里把多模态直接交给LLM主干处理,没有单独的视觉编码器,这意味着本地多模态应用的延迟和内存占用都会大幅下降,对于在笔记本上做Agent的开发者,这是一个必试的版本。

  2. Google Developers Blog(RSS)78

    Gemma 4 12B:开发者指南

    Gemma 4 12B 是一款密集多模态模型,专为消费级设备上的高性能本地 AI 执行而设计。其采用新颖的无编码器架构,绕过传统视觉和音频编码器,将多模态数据直接输入大语言模型主干。

    推荐理由:Google 把多模态模型直接塞进消费级设备,靠的不再是缩水而是架构层面的创新。12B 放在本地跑,这次玩法变了。

6月3日周三
  1. SenseTime73

    商汤(SenseTime)开源SenseNova U1模型,宣称实现“看、思考、创作”一体——从一张普通运动鞋图片直接生成营销视觉效果。该模型代表了架构上的范式转变。用户可通过SenseNova Studio、HuggingFace和GitHub尝试使用。

    推荐理由:商汤把理解、推理、创作塞进一个模型,而且直接开源,做视觉营销的可以不用再拼凑工具链了。

  2. MiniMax (official)80

    MiniMax-M3 在 @ValsAI 排名中位列第六 新的开源权重 SOTA 🚀

    引用Vals AI@ValsAI

    MiniMax 刚刚发布了 MiniMax-M3,这是他们的首个多模态模型。它是 Vals Index 和 Vals Multimodal Index 上新的开放权重 SOTA,总体排名第 #6。

    推荐理由:MiniMax 闷声干大事,第一个多模态模型就拿下 open-weight SOTA 和总榜第 6,做多模态应用的可以蹲一下权重。

  3. The Verge:AI(RSS)78

    微软首款高级推理AI模型MAI-Thinking-1发布

    微软在Build 2026上发布了其首款高级推理AI模型MAI-Thinking-1。该模型被定位为“中等规模”,能在“关键”软件工程基准测试中达到领先模型的水平。微软称其完全从头使用干净数据进行训练,未涉及从第三方模型进行知识蒸馏。这标志着微软在自研AI模型上迈出重要一步,此前其主要依赖OpenAI。近期两家公司已重新协商合作协议,关系有所松绑。

    推荐理由:微软自己从头训练的推理模型,不用任何第三方蒸馏数据,这可能是微软系 Agent 和 Copilot 底座更换的信号,值得盯着看。

  4. Google DeepMind:Blog(RSS)80

    Google DeepMind 发布 Gemma 4 12B:统一的无编码器多模态模型

    Gemma 4 12B 是 Google DeepMind 最新推出的中等规模多模态模型,采用无编码器统一架构,原生支持音频输入。其基准测试性能接近 26B MoE 模型,但内存占用不到一半,仅需 16GB 显存或统一内存即可在消费级笔记本上本地运行。模型内置多 token 预测(MTP)drafter 以降低延迟,基于 Apache 2.0 开源许可发布,已累计超过 1.5 亿次下载。

    推荐理由:统一无编码器架构让 12B 模型在消费级笔记本上跑出接近 26B 的多模态 Agent 体验,开源 + Apache 2.0,本地部署门槛又压低了。

6月2日周二
  1. Microsoft AI:官方博客(网页)63

    Microsoft 发布 MAI-Image-2.5,登 Arena 图像编辑榜第 2

    Microsoft Superintelligence 团队发布 MAI-Image-2.5 和 MAI-Image-2.5-Flash 两款图像模型,MAI-Image-2.5 在 Arena 图像编辑榜排第 2(超过 Nano Banana 2),文本生成图像排第 3,比 MAI-Image-2 总分提升 75 分。

    推荐理由:官方给出 Arena 排名、编辑能力细节和 Foundry 定价,开发者可据此评估其在生产图像工作流中的性价比。

  2. Hugging Face:Blog(RSS)73

    Holo3.1:快速本地计算机使用智能体

    Holo3.1 是基于 Qwen 模型家族的计算机使用智能体系列,旨在提升在桌面、网页和移动环境中的鲁棒性。新模型提供 0.8B、4B、9B 和 35B-A3B 四种尺寸,并首次发布量化检查点,包括 FP8、Q4 GGUF 和 NVFP4,以优化本地推理。在 AndroidWorld 基准测试中,35B-A3B 模型得分从 67% 提升至 79.3%。在 DGX Spark 上,NVFP4 量化相比 BF16 实现 1.74 倍 token 吞吐量提升,并将平均步骤时间从 6.8 秒缩短至 3.3 秒。模型支持函数调用协议,可在第三方智能体框架中部署。

    推荐理由:Holo3.1 把计算机使用代理从桌面扩展到了移动端,还首次放出了量化版,让本地运行真正快了起来。想做 GUI 自动化的开发者可以立刻跑起来了。

  3. 蚂蚁 inclusionAI:HuggingFace 新模型61

    蚂蚁 inclusionAI 开源万亿参数 MoE 基座模型 Ling-2.6-1T-base

    Ling-2.6-1T-base 是蚂蚁 inclusionAI 开源的万亿参数 MoE 基座模型(总参约 1T,激活 63B)。它由 Ling-2.0-1T-base 升级而来,采用 Lightning Attention 与 MLA 以 7:1 混合的线性注意力架构,经约 9.6T token 的迁移预训练、持续预训练和中训练,上下文窗口从 4K 分阶段扩展至 256K。在 MMLU(86.82)、SimpleQA、LongBenchv2(43.54)等基准上超越前代。该模型仅供研究(继续预训练、微调、蒸馏等),不直接提供对话功能。

    推荐理由:Ling-2.6 用混合线性注意力把万亿 MoE 基座模型的上下文能力推到了 256K,对于研究长上下文和 MoE 的团队是个有价值的基座,但它是未对齐的预训练模型,不能直接当对话助手用。

  4. Microsoft AI:官方博客(网页)75

    Microsoft 发布七款新 MAI 模型并推出 Frontier Tuning 微调方案

    微软 MAI 团队发布七款新 MAI 模型,将通过 OpenRouter、Fireworks、Baseten 向开发者开放,并首次允许开发者自行调整模型权重。官方称基于强化学习环境(RLEs)的 Microsoft Frontier Tuning 可让模型学习企业自身工作流,其针对 Excel 微调的 MAI 模型可匹敌 GPT 5.4 且效率最高提升 10 倍。

    推荐理由:微软官方发布七款新 MAI 模型,并给出 Frontier Tuning 微调方案与具体效率数字,读者可据此评估其对企业和开发者工作流的影响。

  5. Microsoft AI:官方博客(网页)61

    Microsoft 发布 MAI-Code-1-Flash 编码模型,基准全面超越 Claude Haiku 4.5

    Microsoft 发布编码模型 MAI-Code-1-Flash,直接用生产环境 GitHub Copilot harness 训练,主打真实开发工作流而非仅优化基准。

    推荐理由:官方说明了用生产环境 Copilot harness 训练和评测的思路,并给出与 Claude Haiku 4.5 的基准对比数据,可据此评估其在真实编码工作流中的价值。

  6. SenseTime73

    感谢使用我们的模型来创建这些复杂的图表和图表。 看到具有挑战性的信息被转化为清晰、准确和可读的视觉效果真是太棒了。这就是我们的目标。😄

    引用The AI Colony@TheAIColony

    SenseNova U1 刚刚发布了一个信息图专用版本,在 IGenBench Q-ACC 上提升 +18.2 可不是舍入误差。 这意味着该模型真正理解了哪些信息需要放在哪里。 真正的进步:http://huggingface.co/sensenova/SenseNova-U1-8B-MoT-Infographic

    推荐理由:SenseNova U1 这波信息图特化不是刷分,+18.2 Q-ACC 证明模型真的懂了排版,做汇报、做图表的可以直接上 Hugging Face 扒下来用。

  7. MiniMax (official)81

    M3 on Cloudflare AI Gateway, day one ⚡ 前沿编码能力,1M 上下文,原生多模态,现在一次 fetch 即可调用。 是时候构建些东西了。 🦞

    引用Cloudflare Developers@CloudflareDev

    来自 @MiniMax_AI 的 M3 现已在 Cloudflare AI Gateway 上线: - 首个推动 SOTA 编码前沿的开放模型 - 1M 上下文与原生多模态理解 - 首周内,上下文 ≤ 512K 的请求享受 50% 折扣 今天就通过 AI Gateway 试用吧! https://developers.cloudflare.com/ai/models/minimax/m3/

    推荐理由:MiniMax的M3把开源编码模型拉到新高度,1M上下文加原生多模态是惊喜,上线首周5折,值得跑一下看是不是真能干翻闭源。

  8. xAI:News(网页)78

    xAI发布Composer 2.5

    xAI的最新编程模型Composer 2.5现已在Grok Build中可用,用户可通过`/models`菜单选择使用。这是一款快速、先进的模型,擅长处理长时间运行的任务和复杂指令。该模型面向SuperGrok和X Premium+用户开放。

    推荐理由:xAI 的 Composer 2.5 主攻长任务和复杂指令,如果你在用 Grok 搭 Agent,这模型值得切过去试试,可能比之前的编码模型更稳。

  9. 公众号:通义实验室(千问)64

    Qwen3.7-Plus 多模态智能体模型发布

    Qwen3.7-Plus 深度融合视觉与语言,实现“看、想、写、做、验”端到端闭环,在 12 项核心基准测试中表现提升。实测中,基于该模型的智能体连续运行超 11 小时,自动完成英语学习 APP 开发,生成代码超 10000 行、触发调用超 1000 次;复刻 macOS Stocks 应用并通过 10 项功能验证。支持图像/视频转 SVG、视觉驱动网页设计及浏览器自动化。已在阿里云百炼上线,提供 OpenAI 兼容 API 与 Anthropic 协议。

    推荐理由:Qwen3.7-Plus 把视觉智能体推到了‘能看、能想、能动手’的端到端闭环,从写代码到操作浏览器一条龙,做自动化 Agent 的团队可以直接拿来用。

  10. Qwen:Blog Retrieval(API)81

    Qwen3.7-Plus:多模态智能体模型发布

    阿里云通义千问推出 Qwen3.7-Plus,基于 Qwen3.7 文本骨干,增强视觉语言能力,保留编码、工具使用和生产工作流的智能体能力。它支持感知现实场景、读取并操作 GUI、从视觉参考编写代码、端到端导航手机应用、基于网络知识回答视觉问题,融合 GUI 与 CLI 交互,跨 Claude Code、OpenClaw、Qwen Code 等框架泛化。在 Terminal Bench 2.0-Terminus 得分 70.3,SWE-Verified 77.7,QwenWorldBench 62.1,GPQA Diamond 90.3,MMLU-Pro 88.5。通过阿里云 Model Studio API 提供。

    推荐理由:Qwen3.7-Plus 把视觉感知、GUI 操作和编码能力整合进同一个 agent 模型,在 ScreenSpot 和浏览器操作上的提升很实在,做自动化的开发者值得上手试试。

  11. Hacker News 热门(buzzing.cc 中文翻译)75

    英伟达 Cosmos 3

    英伟达发布了 Cosmos 3,这是一个用于物理 AI 推理的世界和行动模型。该信息来源于英伟达开发者博客,发布日期为 2026 年 6 月 1 日。

    推荐理由:Cosmos 3 把物理推理、世界生成和行动生成塞进一个开源模型,从机器人到自动驾驶都能用,英伟达这次是真的想定义物理 AI 的训练范式。

  12. Hugging Face:Blog(RSS)71

    JetBrains 发布 Mellum2:12B 参数混合专家模型

    Mellum2 是 JetBrains 从头训练的 12B 参数混合专家(MoE)模型,专注于自然语言与代码。每个 token 仅激活 2.5B 参数,推理速度可达同类模型的 2 倍以上,适合高吞吐、低延迟场景。该模型支持路由、RAG、摘要、子智能体及私有部署,以 Apache 2.0 许可证开源。在代码生成、推理、科学和数学基准测试中,Mellum2 与同等规模的开放模型竞争力相当。

    推荐理由:JetBrains 开源了 Mellum2,一个激活参数仅 2.5B 的 12B MoE 模型,专为代码和问答管道设计的快模型。做实时 RAG 或子代理时,终于不用硬扛大模型了。

6月1日周一
  1. SenseTime67

    大多数AI模型在生成图表时存在数值错误(如负值显示为正)、柱状图位置偏移、元素关系混乱等问题。SenseNova-U1-8B-MoT-Infographic(SenseNova-U1)专为解决此类图表生成问题而设计,能够生成准确的图表,并支持实时调整设计和布局。项目在Hugging Face提供了模型,并在GitHub展示了效果案例。

    推荐理由:大部分AI生成的图表都有标注错误或比例失调,商汤这个模型专攻信息图准确性,对常做图表的产品人和分析师来说值得一试。