跳到正文
北京时间

模型发布

新模型的发布、开源与迭代:大模型厂商的旗舰更新、开源权重放出、性能与价格变化的第一时间记录。

710条精选相关主题产品更新论文研究开源生态

最新精选

第 201–220 条 · 共 710 条
7月15日周三
  1. 公众号:通义实验室(千问)73

    阿里发布 Qwen-Audio-3.0-Realtime,在 Artificial Analysis 语音推理子项中综合排名第一

    阿里通义实验室发布实时语音交互模型 Qwen-Audio-3.0-Realtime,在 Artificial Analysis 的 Speech Reasoning 子项中综合排名第一,超越 OpenAI GPT-Realtime-2。

    推荐理由:我觉得Qwen-Audio-3.0-Realtime把情感表达和背景降噪结合得很好,加上工具调用,语音交互终于从聊天走向任务执行,有API可以直接上手,推荐语音产品经理试试。

  2. 公众号:通义实验室(千问)78

    Qwen-Audio-3.0-Realtime 如何让语音交互“懂倾听,更聪明”?

    阿里语音交互模型 Fun-Realtime-AudioChat 全面升级并更名为 Qwen-Audio-3.0-Realtime,支持根据语境动态调整语气与情感、音色克隆,并内置多模态双工控制模型,实现声纹级背景过滤。

    推荐理由:把文本推理能力蒸馏到语音模型同时保留毫秒级响应,这种架构为需要复杂决策的语音智能体提供了可行路径。

  3. Together AI 研究与产品博客(RSS)76

    Thinking Machines Lab 发布多模态 MoE 模型 Inkling,Together AI 提供 Day 0 推理服务

    Thinking Machines Lab 发布多模态 MoE 模型 Inkling,Together AI 于发布当日在其 Serverless 平台提供访问,支持 1M 上下文窗口和 OpenAI 兼容 API。

    推荐理由:原文来自提供推理服务的合作方,给出了 Inkling 的架构细节、参数规格和初步评测,读者可据此了解新模型的技术取向与可用入口。

  4. Hacker News 热门(buzzing.cc 中文翻译)76

    Bonsai 27B:首款可在手机上运行的27B级多模态模型

    Bonsai 27B 基于 Qwen3.6 27B,提供三元(1.71 有效比特/权重,5.9 GB)和 1-bit(1.125 有效比特/权重,3.9 GB)两个变体,后者首次将 27B 级模型装入 iPhone 17 Pro。模型支持多步推理、结构化工具调用、视觉任务和计算机使用智能体循环,拥有 262K token 上下文窗口,支持推测解码加速。在 15 项基准测试中,三元变体保留全精度基线 95% 的性能,1-bit 变体保留 90%,数学和编码能力几乎无损。采用 Apache 2.0 许可证开源。

    推荐理由:1-bit 量化把 27B 模型压到 4GB,首次能在 iPhone 上跑,agent 循环零边际成本,做端侧产品的该坐不住了。

  5. Google Developers Blog(RSS)58

    Google 在 I/O Connect India 展示由 Tensor SoC 和 TPU 驱动的 Pixel 10 端侧 AI 未来

    在 Google I/O Connect India 上,Google 展示了由定制 Tensor SoC 和 TPU 驱动的 Pixel 10 系列所支持的 100% 私有端侧 AI 未来。活动首次推出轻量级 Gemma 4 E2B 模型,该模型原生运行于设备端,可实现完全离线的多模态功能,包括 AI 聊天、实时图像识别和个人智能体任务。开发者即日起可通过新发布的 Tensor SDK beta 及其配套开源资源,开始构建这些安全的边缘应用。

    推荐理由:我觉得这是端侧 AI 从实验到落地的信号,Gemma 4 E2B 的离线能力搭配新 SDK,让完全本地的多模态应用不再是期货,做移动隐私 AI 的开发者该上手试试了。

7月14日周二
  1. Google AI:DEV 作者专属(RSS)68

    DiffusionGemma 发布:文本扩散模型实现 4 倍加速推理

    Google 发布实验性开源模型 DiffusionGemma,采用文本扩散技术并行生成 256 token 块,推理速度最高提升 4 倍。该 26B MoE 模型仅激活 3.8B 参数,量化后适配 18GB VRAM 消费级 GPU,在单张 H100 上达 1000+ tokens/s。

    推荐理由:Google把扩散模型首次做进大语言模型,生文速度提升4倍,还开源了权重。虽然实验性质量打折,但本地实时交互的开发者终于有个新选项可以玩了。

  2. SenseTime74

    商汤发布并完全开源 SenseNova-Vision-7B-MoT,一个统一处理检测、OCR、GUI、深度与法线估计、分割、多视图等主要视觉任务的模型。该模型支持通过自然语言定义新的视觉任务变体,跨传统任务边界重组视觉能力。开源内容包括模型权重及 SenseNova-Vision Corpus(含 5000 万示例子集及复现剩余公开数据的完整工具包)。

    推荐理由:商汤把检测、OCR、深度估计等多个视觉任务塞进一个7B模型,还贴心地开源了数据集和复现工具,做视觉理解或GUI agents的团队可以直接拿它当基座,不是又一个刷榜的轻量版。

  3. HuggingFace Daily Papers(社区热门论文)74

    Boogu-Image-0.1 发布:开源统一多模态理解与生成模型,训练成本仅约 40 万美元

    Boogu-Image-0.1 系列开源统一多模态理解与生成模型发布,包含 Base、Turbo、Edit 和 Edit-Turbo 四个变体,支持高质量文生图、快速推理、指令编辑及中英双语文本渲染。

    推荐理由:开源多模态模型终于有一个能打闭源系统的了,40万美元训练成本刷到接近GPT-Image-2的水平,想自己部署图像生成和编辑产品的开发者可以认真看看。

7月13日周一
  1. The Decoder:AI News(RSS)70

    德国AI协会发布开源模型Soofi S,在英语和德语基准测试中领先

    德国AI协会协调的研究联盟发布开源大语言模型Soofi S 30B-A3B。该模型总参数量316亿,每个token仅激活约32亿参数,采用Mamba-2与标准注意力层混合的MoE架构。模型完全在德国电信慕尼黑工业AI云上训练,训练数据中德语占比从第一阶段的7.2%提升至第二阶段的15.3%。在基准测试中,Soofi S在所有完全开源模型中取得英语和德语综合最高分,超越OLMo 3 32B和Apertus 70B。在HumanEval上得分73.8%,MBPP得分70.2,德语版MBPP得分84.2。上下文窗口支持最高100万token,在4万token长度下,生成吞吐量约为同规模稠密模型的8倍。模型权重已开源。

    推荐理由:德国联盟用 Mamba-Transformer 混合架构做出一个 30B 开源模型,德语基准横扫,长上下文推理吞吐八倍于同级密集模型,想做德语 AI 的可以认真看了。

  2. 公众号:腾讯混元76

    腾讯混元发布 HyOCR-1.5:端到端 OCR 大模型全栈开源,推理提速 6.37 倍

    腾讯混元发布 HyOCR-1.5,这是端到端 OCR 大模型领域首个将训练、推理、模型权重完整开源的专家模型。仅 1B 参数,覆盖 8 种以上 text-centric 任务。引入 DFlash 投机解码框架,在 Transformers 下实现 6.37× 加速,vLLM 下 2.14× 加速,端到端推理达每页 1.408s。支持 4K 分辨率与 128K 上下文窗口,通过 Agentic Data Flow 扩展低资源 OCR(331 种语言)、古文字识别与多图问答能力。在 OmniDocBench v1.6 上以 94.74 分居端到端第一。

    推荐理由:我觉得这是近期最实在的OCR开源,1B参数覆盖多任务、推理加速6倍,还支持llama.cpp本地部署,做文档解析的同学可以直接上车。

7月12日周日
  1. Sam Altman68

    OpenAI 发布 GPT-5.6 系列在医疗领域的评估结果。最小变体 GPT-5.6 Luna 在最低推理强度下即超越最高推理强度的 GPT-5.5,且成本低 25 倍;最大变体 GPT-5.6 Sol 树立新标杆。在涵盖患者端与临床端的多样化任务中,专科医生被要求以无限时间和网络访问权限撰写回答,随后由其他医生盲评。评估基于准确性、沟通、完整性、指令遵循及健康决策帮助性五个维度,共 20000 次评分。结果显示,所有 GPT-5.6 模型表现均显著优于医生,且医生发现 GPT-5.6 回答中的缺陷少于医生自己撰写的回答。

    引用Karan Singhal@thekaransinghal

    ♥️ GPT-5.6 是健康领域的一大进步,无论是在前沿性能还是在成本方面。 这些模型推动了每美元性能的前沿,将最佳的健康智能带给所有人。最小的变体 GPT-5.6 Luna,在最低推理努力下评估,其表现超过了在最高推理努力下的 GPT-5.5——尽管成本低 25 倍。最大的变体 GPT-5.6 Sol,在成本方面树立了新的高标准。 另一个特别酷的结果:医生在 GPT-5.6 的回答中发现的缺陷比医生撰写的回答更少。 我们收集了近期 OpenAI 模型仍然难以处理的各种任务,涵盖面向患者和面向临床医生的用例。我们请与专科匹配的医生在无限时间和网络访问的条件下为这些任务撰写回答。然后我们请其他医生在不知道来源的情况下并排比较回答。医生被要求从五个维度评论改进空间:准确性、沟通、完整性、指令遵循和健康决策帮助性。然后我们报告了在总共 20,000 次维度评分中,各来源回答在所有维度上被评为完美的比例。GPT-5.6 Sol 表现最强,尽管所有 GPT-5.6 模型的表现都显著优于医生。

    推荐理由:GPT-5.6 在医疗任务上被医生评价比真人医生缺陷更少, 这是AI辅助诊断的分水岭, 产品人和医疗从业者值得看具体数据。

7月11日周六
  1. MarkTechPost(RSS)74

    蚂蚁集团 Robbyant 发布 LingBot-VA 2.0,首个原生具身基础模型

    蚂蚁集团旗下具身智能团队 Robbyant 发布 LingBot-VA 2.0,首个原生具身基础模型。该模型采用因果 DiT 架构,视频专家约 13.0B 参数(约 1.9B 激活),训练规模约 15.3B 参数,推理时每 token 约 2.5B 激活。模型引入多块预测(MCP)实现 2.3 倍训练加速,并通过前瞻推理将推理延迟降至 142 ms/chunk。在 RoboTwin 2.0 的 50 个任务上,干净与随机演示数据平均成功率分别达 93.8% 和 93.4%。

    推荐理由:具身智能领域第一个从零预训练的因果视频-动作模型,将世界状态和动作统一在一个隐空间,异步推理优化到 225Hz,做机器人的值得仔细研究。

  2. Greg Brockman71

    GPT-5.6 用于健康智能,团队一直专注于这方面的改进: 整个产品线中,我们以更低成本提供更强性能:GPT-5.6 Luna 在最高推理设置下性能优于 GPT-5.5,而成本降低 25 倍。 这些进步共同提升了质量,同时让全球更多人能够使用先进模型。

    引用OpenAI@OpenAI

    GPT-5.6 是健康智能领域向前迈出的重要一步。 在整个产品线中,我们以更低的成本实现了更强的性能:GPT-5.6 Luna 在其最高推理设置下的表现优于 GPT-5.5,而成本却降低了 25 倍。 这些进步共同提升了质量,同时让全球更多人能够使用先进的模型。

    推荐理由:GPT-5.6 主打健康智能,虽然还没实测,但 25 倍的降本让高级推理不再是实验室专属,做医疗应用的可以提前评估切换成本了。

  3. HuggingFace Daily Papers(社区热门论文)70

    GigaChat Audio:支持120分钟输入的时间感知音频大语言模型

    GigaChat Audio 是一种时间感知的音频大语言模型,支持长达120分钟的输入,并能生成带有明确时间戳的问答、片段描述和摘要。该模型通过将周期性时间标记与连续音频 token 交错,并利用级联合成数据管道进行大规模训练,在短时和长时基准上均实现了强时间定位精度。研究团队已开源模型权重及超过1万小时的时序数据集。

    推荐理由:首个大规模时间感知音频LLM开源,把长音频问答的时间定位做到可验证,且附带完整数据集和消融分析,做语音产品的该认真看一下。

  4. OpenAI73

    GPT-5.6 是健康智能领域的一大进步。 在整个产品线中,我们以更低成本提供更强性能:GPT-5.6 Luna 在最高推理设置下性能优于 GPT-5.5,而成本降低 25 倍。 这些进步共同提升了质量,同时让全球更多人能够使用先进模型。

    推荐理由:GPT-5.6把性价比直接拉了个数量级,做健康AI的团队该重新算账了。但官方只扔了一句话,实际能力等实测再鼓掌。

7月10日周五
  1. 公众号:龙猫LongCat(美团)74

    美团 LongCat-2.0 正式开源,同步开放国产卡推理代码

    美团万亿参数大模型 LongCat-2.0 正式开源,总参数 1.6T,平均激活约 48B,专为真实 Agentic Coding 任务设计。模型引入 LongCat 稀疏注意力机制与 N-gram Embedding,提升长上下文处理效率与 Token 级表示能力。LongCat-2.0 是业界首个在五万卡国产算力集群上完成推理的万亿参数模型,从模型架构、芯片适配到部署策略进行深度协同优化,支持百万上下文高效推理。开源同步提供 BF16、FP8、INT8 等多精度版本及针对国产算力极致优化的推理代码。

    推荐理由:国产算力跑万亿模型的第一份完整开源答卷,代码、芯片适配细节全公开,做国产大模型落地的直接抄作业。