跳到正文
北京时间

模型发布

新模型的发布、开源与迭代:大模型厂商的旗舰更新、开源权重放出、性能与价格变化的第一时间记录。

710条精选相关主题产品更新论文研究开源生态

最新精选

第 121–140 条 · 共 710 条
8月10日周一
  1. AI at Meta58

    推出 Muse Glimmer,一款开放权重、300 亿参数的模型,专为本地、常驻运行的智能体工作流优化。 与同尺寸领先模型相比,Muse Glimmer 在关键智能体用例和基准测试中表现出色,并设计为完全在消费级硬件(如 Mac 或配备高性能 GPU 的 PC)上运行。 秉承我们长期分享基础 AI 研究的传统,我们以宽松的 Apache 2.0 许可证发布模型权重。

    推荐理由:将一个 30B 模型以 Apache 2.0 许可完全开源并针对本地智能体优化,为需要离线运行或数据不出设备的 Agent 应用提供了更轻量的选择。

  2. MarkTechPost(RSS)75

    NVIDIA 发布 NemotronLabs VoiceChat 11B:开源全双工语音模型,支持约 450 毫秒轮换与实时工具调用

    NVIDIA 发布开源端到端全双工语音对话模型 NemotronLabs VoiceChat 11B,在统一网络中完成流式语音理解与生成,实测轮换延迟 448 毫秒。该模型为首个支持对话中工具调用的开源全双工模型,通过独立输出通道及预置“保持”话术避免 API 执行期间冷场。权重与容器已公开,但仅限研究用途,需单张 80 GB 显存 GPU,目前无托管 API。

    推荐理由:端到端语音模型消除级联延迟,而工具调用侧通道和保留消息设计在不中断对话的前提下补齐了API等待期,让实时语音智能体更容易工程化。

  3. Fireworks AI(网页)69

    Meta Muse Glimmer 30B 上线 Fireworks,面向常驻 Agent 场景

    Meta 的 Muse Glimmer 30B 稠密模型已在 Fireworks 上提供 serverless 和按需部署,主打多轮工具调用与失败恢复等常驻 Agent 场景。

    推荐理由:原文给出了架构细节、Agent 基准对比和推荐运行配置,读者可以据此评估这款 30B 开源模型是否适合自己的多轮工具调用工作流。

8月9日周日
  1. 蚂蚁 inclusionAI:HuggingFace 新模型60

    inclusionAI 发布 Ling-3.0-flash 的 DSpark 投机解码模型 Ling3-DSpark

    inclusionAI 推出 Ling3-DSpark,一个为 Ling-3.0-flash 设计的 DSpark 投机解码模型,参数量 1.36B,通过置信度头动态选择草稿 token 数量。在 GSM8K 等九项基准上平均接受长度为 5.29,其中 GSM8K 达 6.40。模型经 SpecForge 训练,可通过 SGLang 部署。

    推荐理由:该模型把投机解码的接受长度按工作负载分开报告,数学与代码任务明显高于对话类,部署时可据此对不同场景的加速收益有更实际预期。

8月7日周五
  1. 公众号:蚂蚁百灵(Ling)75

    蚂蚁百灵开源 Ling-3.0-flash:124B 总参数 MoE 模型,支持 API、单机与高性能三种部署

    蚂蚁百灵正式开源新一代原生混合推理模型 Ling-3.0-flash,采用 124B 总参数、5.1B 激活参数的 MoE 架构,并提供 FP8、FP4、INT4 等多个版本。

    推荐理由:提供FP4/INT4量化版本并验证单机推理,让数据敏感、预算有限的团队也能本地运行千亿参数模型,将大模型能力从云端拉回到可控环境。

  2. IT之家(RSS)71

    谷歌推出 WeatherNext 气旋模型,AI 高精度预报飓风平均提前 24 小时

    谷歌 DeepMind 联合多家机构推出 WeatherNext Cyclones 气旋预测模型,在路径、强度和风场结构预测精度上达到业界领先。该模型将有效预报时长从 2 天延长至 3 天,平均提前 24 小时,预测量级约相当于 10 年气象进展。

    推荐理由:将气旋预报时效提前24小时并开源全套模型权重,气象机构可据此提升预警窗口,影响紧急预案规划。

  3. OpenAI:官网动态(RSS · 排除企业/客户案例)53

    ChatGPT 推出改进版 GPT-5.6 Sol,并扩大免费用户访问权限

    ChatGPT 推出改进版 GPT-5.6 Sol,提升准确性与一致性,同时扩大免费用户访问权限。免费用户还可无限次使用 GPT-5.6 Luna 进行日常对话。

    推荐理由:这次更新把 Sol 的准确度和一致性提升后开放给免费用户,同时 Luna 的无限日常聊天让非付费用户也能稳定使用基础能力,减少了因模型切换造成的体验落差。

8月6日周四
  1. NVIDIA Blog(RSS)71

    NVIDIA Cosmos 3:开放世界模型如何推动物理 AI 前沿

    NVIDIA 发布 Cosmos 3,一个基于混合 Transformer 架构的开放物理 AI 基础全模态模型,整合视觉推理、世界生成与动作预测。

    推荐理由:介绍 Cosmos 3 作为开放物理 AI 基础模型的架构、基准表现和行业用例,为需要定制世界模型的机器人、自动驾驶和视觉 AI 团队提供了可直接参考的技术路线。

8月5日周三
  1. MarkTechPost(RSS)79

    NVIDIA 发布 Alpamayo 2 Super:面向 Robotaxi 与自动驾驶的 34B 开源视觉-语言-动作模型

    NVIDIA 发布 Alpamayo 2 Super,一款 34B 参数的视觉-语言-动作(VLA)模型,专为自动驾驶长尾事件设计,权重采用 Linux 基金会 OpenMDW-1.1 许可,代码为 Apache 2.0,发布首日即可商用。

    推荐理由:轨迹与因果解释同时输出,可接入Halos安全验证,自动驾驶团队据此向监管证明决策合理性,减少黑盒依赖。

  2. 字节 Seed:Research Feed(网页内嵌数据)78

    字节 Seed 发布 SeedRealtime 音视频全双工大模型,走向全模态自然交互

    字节 Seed 发布 SeedRealtime,用统一架构原生融合音频、视频与文本,实现“边看、边听、边说”的实时交互。相比级联模型,其音视频对话节奏问题减少一半,并已在豆包 App 全量上线,率先实现音视频全双工技术的规模化落地。

    推荐理由:SeedRealtime 将音视频感知与表达统一到同一端到端模型中,级联系统常见的说话节奏问题减少了一半,实时场景中能主动提醒并自然停顿,为全模态智能助手交互提供了新的技术路线。

  3. Qwen68

    阿里通义千问发布 Qwen-Image-3.0-Pro 与 Standard,现已在 Qwen Cloud 上线。该模型在 Arena 文生图榜单中位列中国模型第一、主流模型第二,支持 4.5k-token 提示词、10px 级文字渲染及 12 种语言。Pro 版起价 $0.04/张,Standard 版起价 $0.03/张。

    引用Qwen Cloud@qwen_cloud

    🔔 Qwen-Image-3.0 现已在 Qwen Cloud 上线! 在 Arena. ai 的文生图竞技场 @arena 中,位列中国模型第 1 名、主流模型第 2 名,现在只需一次 API 调用即可使用。 - 支持高达 4.5k token 的提示词:一次生成报纸、故事板、菜单、试卷 - 文字清晰度低至 10px,细节近乎照片级 - 支持 12 种语言、100+ 种艺术风格,逼真的 UI 模拟 - 生成 + 编辑集于一个模型 💰价格: Qwen-Image-3.0 Pro — 最适合复杂布局、精准文字渲染和商业级视觉,每张图起价 $0.04。 Qwen-Image-3.0 Standard — 适合批量、日常图像生成,每张图起价仅 $0.03。 Qwen-Image-3.0-Pro 与 Standard。从提示词到可直接投产的图像。 👉 在 Qwen Cloud 上试用并获取你的 API key:https://www.qwencloud.com/models/qwen-image-3.0-pro?utm_content=g_20000001188 - 主流模型 = 日均 MaaS API 调用量超过 10 万的模型系列 #QwenCloud #Qwen

    推荐理由:生成与编辑合并在单一模型内,多语言长文本排版的门槛和每次调用成本都明显降低。

  4. OpenRouter66

    @bfl_ai 的 FLUX 3 Video 现已在 OpenRouter 上向所有人开放。 一个统一的视频、音频、图像和动作预测多模态模型家族。严肃、有趣、创意、真实、电影感,随你所需。基于统一架构联合训练。

    推荐理由:联合训练的统一架构下,视频生成与图像、音频共享基础能力,跨模态创作的结果可能更连贯,改变了单独优化各模态的传统思路。

  5. SenseTime67

    商汤发布开源模型 SenseNova U1,可在统一流程中同时进行推理与图像生成。其信息图模式可将单条提示词转为结构化幻灯片,交错模式则逐步生成图文内容,如演示六步画龙教程。模型已上线 SenseNova Studio、HuggingFace 及 GitHub。

    推荐理由:把推理和图像生成整合进单一模型流,信息图模式和逐步教程展示了从推理到可视化的直接路径,为需要图文连贯输出的应用提供了可探索的开源方案。

8月4日周二
  1. NVIDIA Blog(RSS)68

    NVIDIA Alpamayo 2 Super 开放商用,面向 Robotaxi 与自动驾驶的前沿开源模型

    NVIDIA Alpamayo 2 Super 现已开放商用,基于 Cosmos 3 Super Reasoner 构建,采用强化学习后训练,支持轨迹预测、因果链推理、元动作、自动标注及视觉问答等多任务输出。

    推荐理由:开放商业许可与可解释推理输出结合,自动驾驶团队能直接审查模型决策链,为安全验证提供透明度,降低从研发到商用部署的转换成本。

  2. Mistral AI:News(网页)63

    Mistral 开源 3B 多模态安全分类器 Shieldstral,支持推理时自定义政策无需重训

    Mistral 发布 3B 开源权重多模态安全分类器 Shieldstral,以 Apache 2.0 协议开放下载。它把内容审核建模为政策自适应问答任务,推理时用自然语言问题传入政策即可返回校准的安全分数,无需重训练,统一覆盖文本、图像及 prompt-response 对的审核、拒答检测和毒性检测。

    推荐理由:原文给出了把内容审核改为推理时自适应问答的方法、数据构建思路和基准表现,适合想自建安全审核方案的开发者参考。

  3. 公众号:腾讯混元65

    腾讯混元发布 Hy ASR 3.0 preview:真正懂上下文的语音识别

    腾讯混元发布新一代语音识别模型 Hy ASR 3.0 preview,基于大语言模型 Hy3 与 MoE 架构,融合高精度识别与语义理解。其在开源评测集中中文普通话 WER 3.34%、英语 WER 2.62%、粤语 WER 3.12%,并支持上下文纠错、热词注入及高噪耳语等场景。该模型已上线腾讯云 API,元宝 App 首发并免费开放。

    推荐理由:将 LLM 语义理解融入语音识别,上下文纠错和热词注入降低了专业场景的接入成本,元宝已集成可体验。

  4. HuggingFace Daily Papers(社区热门论文)74

    UEmbed:统一稀疏与稠密的多模态嵌入模型

    UEmbed 是一种仅解码器的多模态嵌入模型,可在单次因果前向传播中同时生成稀疏词级和稠密表示,通过可学习特殊 token 与词汇表分区突破单 token 信息瓶颈。

    推荐理由:UEmbed 让一个解码器模型同时输出稀疏与稠密多模态嵌入,稀疏模式精度接近稠密且原生适配倒排索引,对兼顾效率和精度的检索系统,省去了维护多套模型的开销。

  5. Microsoft Research 博客(RSS)82

    微软开源 Orchard 框架:30亿参数小模型在 SWE-bench 达 73%

    微软研究院发布开源框架 Orchard,旨在解决智能体(Agent)研究中的基础设施瓶颈。核心组件 Orchard Env 提供可复用的 Kubernetes 环境服务,支持在 Codex、OpenClaw 等真实部署环境中直接训练和评估智能体。项目发布了针对软件工程、网页导航和个人助手的三个训练配方及数据。其中,仅约 30 亿活跃参数的 Orchard-SWE 模型在 SWE-bench Verified 基准上达到 69.7%(结合价值模型重排序可达 73.0%),性能接近参数量大 10 倍的前沿系统,展示了小模型在复杂现实任务中的潜力。

    推荐理由:微软开源了完整的智能体训练与评估基础设施,并证明了小参数模型通过特定训练策略可在高难度代码修复基准上逼近前沿大模型,对降低 Agent 研发门槛有重要参考价值。

  6. Liquid AI 模型与工程博客(网页)70

    Liquid AI 发布端侧智能体模型 LFM2.5-2.6B

    Liquid AI 发布 LFM2.5-2.6B,一个可完全在设备端运行的 2.6B 参数智能体模型,预训练约 34T tokens,词表扩展至 128K,Base 和 post-trained 权重已在 Hugging Face 开放。

    推荐理由:原文给出了训练流程、基准对比和 CPU/GPU 吞吐数字,读者可以据此评估端侧智能体部署的可行性与取舍。

8月3日周一