

推荐理由:将一个 30B 模型以 Apache 2.0 许可完全开源并针对本地智能体优化,为需要离线运行或数据不出设备的 Agent 应用提供了更轻量的选择。
新模型的发布、开源与迭代:大模型厂商的旗舰更新、开源权重放出、性能与价格变化的第一时间记录。


推荐理由:将一个 30B 模型以 Apache 2.0 许可完全开源并针对本地智能体优化,为需要离线运行或数据不出设备的 Agent 应用提供了更轻量的选择。
NVIDIA 发布开源端到端全双工语音对话模型 NemotronLabs VoiceChat 11B,在统一网络中完成流式语音理解与生成,实测轮换延迟 448 毫秒。该模型为首个支持对话中工具调用的开源全双工模型,通过独立输出通道及预置“保持”话术避免 API 执行期间冷场。权重与容器已公开,但仅限研究用途,需单张 80 GB 显存 GPU,目前无托管 API。
推荐理由:端到端语音模型消除级联延迟,而工具调用侧通道和保留消息设计在不中断对话的前提下补齐了API等待期,让实时语音智能体更容易工程化。
Meta 的 Muse Glimmer 30B 稠密模型已在 Fireworks 上提供 serverless 和按需部署,主打多轮工具调用与失败恢复等常驻 Agent 场景。
推荐理由:原文给出了架构细节、Agent 基准对比和推荐运行配置,读者可以据此评估这款 30B 开源模型是否适合自己的多轮工具调用工作流。
inclusionAI 推出 Ling3-DSpark,一个为 Ling-3.0-flash 设计的 DSpark 投机解码模型,参数量 1.36B,通过置信度头动态选择草稿 token 数量。在 GSM8K 等九项基准上平均接受长度为 5.29,其中 GSM8K 达 6.40。模型经 SpecForge 训练,可通过 SGLang 部署。
推荐理由:该模型把投机解码的接受长度按工作负载分开报告,数学与代码任务明显高于对话类,部署时可据此对不同场景的加速收益有更实际预期。
蚂蚁百灵正式开源新一代原生混合推理模型 Ling-3.0-flash,采用 124B 总参数、5.1B 激活参数的 MoE 架构,并提供 FP8、FP4、INT4 等多个版本。
推荐理由:提供FP4/INT4量化版本并验证单机推理,让数据敏感、预算有限的团队也能本地运行千亿参数模型,将大模型能力从云端拉回到可控环境。
谷歌 DeepMind 联合多家机构推出 WeatherNext Cyclones 气旋预测模型,在路径、强度和风场结构预测精度上达到业界领先。该模型将有效预报时长从 2 天延长至 3 天,平均提前 24 小时,预测量级约相当于 10 年气象进展。
推荐理由:将气旋预报时效提前24小时并开源全套模型权重,气象机构可据此提升预警窗口,影响紧急预案规划。
ChatGPT 推出改进版 GPT-5.6 Sol,提升准确性与一致性,同时扩大免费用户访问权限。免费用户还可无限次使用 GPT-5.6 Luna 进行日常对话。
推荐理由:这次更新把 Sol 的准确度和一致性提升后开放给免费用户,同时 Luna 的无限日常聊天让非付费用户也能稳定使用基础能力,减少了因模型切换造成的体验落差。
NVIDIA 发布 Cosmos 3,一个基于混合 Transformer 架构的开放物理 AI 基础全模态模型,整合视觉推理、世界生成与动作预测。
推荐理由:介绍 Cosmos 3 作为开放物理 AI 基础模型的架构、基准表现和行业用例,为需要定制世界模型的机器人、自动驾驶和视觉 AI 团队提供了可直接参考的技术路线。
NVIDIA 发布 Alpamayo 2 Super,一款 34B 参数的视觉-语言-动作(VLA)模型,专为自动驾驶长尾事件设计,权重采用 Linux 基金会 OpenMDW-1.1 许可,代码为 Apache 2.0,发布首日即可商用。
推荐理由:轨迹与因果解释同时输出,可接入Halos安全验证,自动驾驶团队据此向监管证明决策合理性,减少黑盒依赖。
字节 Seed 发布 SeedRealtime,用统一架构原生融合音频、视频与文本,实现“边看、边听、边说”的实时交互。相比级联模型,其音视频对话节奏问题减少一半,并已在豆包 App 全量上线,率先实现音视频全双工技术的规模化落地。
推荐理由:SeedRealtime 将音视频感知与表达统一到同一端到端模型中,级联系统常见的说话节奏问题减少了一半,实时场景中能主动提醒并自然停顿,为全模态智能助手交互提供了新的技术路线。
🔔 Qwen-Image-3.0 现已在 Qwen Cloud 上线! 在 Arena. ai 的文生图竞技场 @arena 中,位列中国模型第 1 名、主流模型第 2 名,现在只需一次 API 调用即可使用。 - 支持高达 4.5k token 的提示词:一次生成报纸、故事板、菜单、试卷 - 文字清晰度低至 10px,细节近乎照片级 - 支持 12 种语言、100+ 种艺术风格,逼真的 UI 模拟 - 生成 + 编辑集于一个模型 💰价格: Qwen-Image-3.0 Pro — 最适合复杂布局、精准文字渲染和商业级视觉,每张图起价 $0.04。 Qwen-Image-3.0 Standard — 适合批量、日常图像生成,每张图起价仅 $0.03。 Qwen-Image-3.0-Pro 与 Standard。从提示词到可直接投产的图像。 👉 在 Qwen Cloud 上试用并获取你的 API key:https://www.qwencloud.com/models/qwen-image-3.0-pro?utm_content=g_20000001188 - 主流模型 = 日均 MaaS API 调用量超过 10 万的模型系列 #QwenCloud #Qwen
推荐理由:生成与编辑合并在单一模型内,多语言长文本排版的门槛和每次调用成本都明显降低。
推荐理由:联合训练的统一架构下,视频生成与图像、音频共享基础能力,跨模态创作的结果可能更连贯,改变了单独优化各模态的传统思路。
推荐理由:把推理和图像生成整合进单一模型流,信息图模式和逐步教程展示了从推理到可视化的直接路径,为需要图文连贯输出的应用提供了可探索的开源方案。
NVIDIA Alpamayo 2 Super 现已开放商用,基于 Cosmos 3 Super Reasoner 构建,采用强化学习后训练,支持轨迹预测、因果链推理、元动作、自动标注及视觉问答等多任务输出。
推荐理由:开放商业许可与可解释推理输出结合,自动驾驶团队能直接审查模型决策链,为安全验证提供透明度,降低从研发到商用部署的转换成本。
Mistral 发布 3B 开源权重多模态安全分类器 Shieldstral,以 Apache 2.0 协议开放下载。它把内容审核建模为政策自适应问答任务,推理时用自然语言问题传入政策即可返回校准的安全分数,无需重训练,统一覆盖文本、图像及 prompt-response 对的审核、拒答检测和毒性检测。
推荐理由:原文给出了把内容审核改为推理时自适应问答的方法、数据构建思路和基准表现,适合想自建安全审核方案的开发者参考。
腾讯混元发布新一代语音识别模型 Hy ASR 3.0 preview,基于大语言模型 Hy3 与 MoE 架构,融合高精度识别与语义理解。其在开源评测集中中文普通话 WER 3.34%、英语 WER 2.62%、粤语 WER 3.12%,并支持上下文纠错、热词注入及高噪耳语等场景。该模型已上线腾讯云 API,元宝 App 首发并免费开放。
推荐理由:将 LLM 语义理解融入语音识别,上下文纠错和热词注入降低了专业场景的接入成本,元宝已集成可体验。
UEmbed 是一种仅解码器的多模态嵌入模型,可在单次因果前向传播中同时生成稀疏词级和稠密表示,通过可学习特殊 token 与词汇表分区突破单 token 信息瓶颈。
推荐理由:UEmbed 让一个解码器模型同时输出稀疏与稠密多模态嵌入,稀疏模式精度接近稠密且原生适配倒排索引,对兼顾效率和精度的检索系统,省去了维护多套模型的开销。
微软研究院发布开源框架 Orchard,旨在解决智能体(Agent)研究中的基础设施瓶颈。核心组件 Orchard Env 提供可复用的 Kubernetes 环境服务,支持在 Codex、OpenClaw 等真实部署环境中直接训练和评估智能体。项目发布了针对软件工程、网页导航和个人助手的三个训练配方及数据。其中,仅约 30 亿活跃参数的 Orchard-SWE 模型在 SWE-bench Verified 基准上达到 69.7%(结合价值模型重排序可达 73.0%),性能接近参数量大 10 倍的前沿系统,展示了小模型在复杂现实任务中的潜力。
推荐理由:微软开源了完整的智能体训练与评估基础设施,并证明了小参数模型通过特定训练策略可在高难度代码修复基准上逼近前沿大模型,对降低 Agent 研发门槛有重要参考价值。
Liquid AI 发布 LFM2.5-2.6B,一个可完全在设备端运行的 2.6B 参数智能体模型,预训练约 34T tokens,词表扩展至 128K,Base 和 post-trained 权重已在 Hugging Face 开放。
推荐理由:原文给出了训练流程、基准对比和 CPU/GPU 吞吐数字,读者可以据此评估端侧智能体部署的可行性与取舍。
商汤推出 SenseNova U1.5-Lite-Preview,一个基于 NEO-Unify 架构的轻量级原生统一多模态模型,仅 8B-MoT 参数即可达到商业闭源模型的生成与编辑质量。
推荐理由:8B 参数的小模型在生成和编辑上接近闭源水平,有望降低轻量化多模态应用的门槛,但预览版功能可能尚不完整。