跳到正文
北京时间

模型发布

新模型的发布、开源与迭代:大模型厂商的旗舰更新、开源权重放出、性能与价格变化的第一时间记录。

710条精选相关主题产品更新论文研究开源生态

最新精选

第 541–560 条 · 共 710 条
4月15日周三
  1. 字节 Seed:Research Papers(网页内嵌数据)66

    字节 Seed 发布 Seedance 2.0 音视频联合生成模型

    字节 Seed 发布原生多模态音视频生成模型 Seedance 2.0,2026 年 2 月初在中国正式上线,采用统一架构支持文本、图像、音频、视频四种输入模态。

    推荐理由:官方技术报告梳理了 Seedance 2.0 的统一架构、多模态输入上限与分辨率规格,读者可对照前代看能力变化。

4月14日周二
  1. Google DeepMind:Blog(RSS)68

    Gemini Robotics-ER 1.6:通过增强具身推理赋能真实世界机器人任务

    Gemini Robotics-ER 1.6 正式发布,通过增强具身推理能力为真实世界机器人任务提供底层支持。该版本重点升级空间推理与多视角理解功能,使自主机器人能够更精准地解析三维环境、理解物体间空间关系,并在复杂场景中实现高效决策与操作执行,显著提升机器人在物理世界中的感知与交互性能。

    推荐理由:Gemini Robotics-ER 1.6 在机器人推理上迈了一大步,仪器读取和多视角成功检测是真需求,尤其是波士顿动力集成后,做具身智能的团队值得第一时间测试。

4月9日周四
  1. Hugging Face:Blog(RSS)60

    Waypoint-1.5:为消费级GPU打造的高保真交互世界模型

    Wayve发布Waypoint-1.5模型,用于生成高保真可交互虚拟世界。该模型经优化后能在消费级GPU(如RTX 4090)上高效运行,降低硬件门槛,支持实时交互与动态场景生成,适用于自动驾驶模拟、游戏开发等领域,推动AI技术民主化。

    推荐理由:Waypoint 1.5 把实时生成世界从 demo 变成了消费级 GPU 上能跑的东西,360p 版的兼容性让游戏本也能玩。高保真不是重点,实时响应和本地运行才是,做互动内容的值得关注。

4月8日周三
  1. 公众号:智谱(GLM)62

    GLM-5.1开源:一个独立工作8小时的模型

    智谱推出开源模型GLM-5.1,支持独立工作长达8小时。模型可直接部署使用,无需人工频繁干预,适用于长周期自动化任务场景。

    推荐理由:智谱把 GLM-5.1 开源,并且主打 8 小时独立工作,这个定位切中了 agent 场景下长任务执行的痛点,想做自动化流程的可以跑起来试试。

  2. Tomer Tunguz 博客(VC 分析)61

    Mythos 横空出世

    Anthropic 发布迄今最大的 Claude Mythos 模型,参数量达 10 万亿,为此前前沿模型的六倍。该模型在测试中发现了一处存在 27 年的操作系统漏洞和一处 16 年历史的视频软件缺陷,而传统工具曾对此检查过 500 万次均未发现。这些安全能力并非专门训练所得,而是代码、推理和自主性提升后涌现的副产品。Mythos 目前按 ASL-3 安全标准仅向 40 余家组织开放访问,这种排他性将重塑行业格局——拥有访问权的企业获得结构性安全优势,软件防护标准被重新定义,工程预算也将从开发转向深度加固。

    推荐理由:Claude Mythos 的漏洞发现能力是意外的副产物,这让安全变成了准入壁垒,没有访问权的公司软件将默认多孔。

4月7日周二
  1. Cognition 模型 / Devin 博客(网页)65

    Cognition 发布软件工程智能体模型 SWE-1.6,上线 Windsurf

    Cognition 发布面向软件工程智能体的新模型 SWE-1.6,已在 Windsurf 全面开放,未来 3 个月免费。模型在 SWE-Bench Pro 上与 SWE-1.6 Preview 表现相当,同时显著减少过度思考、循环推理和依赖终端等行为,更多使用并行工具调用;训练中引入长度惩罚,响应长度增长更慢且任务解决率保持稳定。

    推荐理由:官方说明了用长度惩罚等训练手段改善模型 UX 的具体做法和效果,对关注智能体行为质量的人有可参考的细节。

4月4日周六
  1. Nathan Lambert:Interconnects(RSS)

    Gemma 4 与开放模型成功之道

    Gemma 4 的发布揭示了开放模型成功的真正标准。文章指出,决定模型成败的关键并非基准测试分数(benchmark scores),而是其他因素。当前 AI 领域过度关注 leaderboard 排名,但高分数不等于实际应用价值与社区采用率。真正的成功取决于模型解决真实场景需求的能力、开发者友好度以及生态建设,而非单纯的技术指标领先。这一观点挑战了以 benchmark 为导向的行业评估范式。

    推荐理由:开源模型成败不只看榜单分数,Hugging Face 大佬揭秘真实胜负手

4月3日周五
  1. Artificial Analysis

    Google DeepMind推出Gemma 4系列四款多模态开源模型,支持文本、图像及视频输入。31B(密集架构)与26B A4B(MoE架构)拥有256k上下文窗口,可在单张H100运行;另两款较小模型支持128k上下文。GPQA Diamond测试中,Gemma 4 31B(Reasoning)获85.7%,仅次于Qwen3.5 27B,但输出token仅约1.2M,效率更优;26B A4B(Reasoning)得分79.2%,超越gpt-oss-120B。

    推荐理由:Google发布多模态开源模型Gemma 4,单卡H100可跑且科学推理能力突出

  2. Sundar Pichai

    Gemma 4 开源模型发布,提供 31B dense、26B MoE 及有效 2B/4B 四种尺寸,分别针对性能、低延迟和边缘设备优化。Google DeepMind 称其为同尺寸最佳开源模型,强调单位参数量智能密度极高。

    引用Demis Hassabis@demishassabis

    很高兴推出 Gemma 4:这是目前各自尺寸下全球最优秀的开放模型。提供 4 种尺寸,可根据你的具体任务进行微调:31B 密集模型带来出色的原始性能,26B MoE 实现低延迟,还有高效的 2B 和 4B 模型适用于边缘设备——祝开发愉快!https://t.co/Sjbe3ph8xr

    推荐理由:Google发布Gemma 4开源模型,4种尺寸覆盖从云端到端侧全场景

4月2日周四
  1. Microsoft AI:官方博客(网页)66

    Microsoft AI 发布 MAI-Transcribe-1、MAI-Voice-1 与 MAI-Image-2 三款模型,上线 Microsoft Foundry

    Microsoft AI 宣布发布 MAI-Transcribe-1、MAI-Voice-1 和 MAI-Image-2 三款模型,即日起所有开发者可在 Microsoft Foundry 和 MAI Playground 使用。

    推荐理由:官方同时给出三款模型的定价和 FLEURS 基准对比数据,开发者可以直接在 Foundry 上手评估适用性。

  2. Google Developers Blog(RSS)81

    通过 Gemma 4 将先进的智能体能力引入边缘

    Google DeepMind 发布了 Gemma 4 系列开源模型,旨在直接在设备端实现多步骤规划和自主智能体工作流。该版本包含用于实验“智能体技能”的 Google AI Edge Gallery,以及为开发者提供显著速度提升和结构化输出的 LiteRT-LM 库。Gemma 4 采用 Apache 2.0 许可,支持超过 140 种语言,并兼容移动设备、台式机及树莓派等多种物联网硬件平台。

    推荐理由:开源 agentic 模型支持端侧运行,开发者可快速构建本地智能应用。

  3. Hugging Face:Blog(RSS)88

    Welcome Gemma 4: 设备端的 Frontier 多模态智能

    Google 正式发布了 Gemma 4,这是一款前沿的多模态人工智能模型,其核心特点是能够在设备端本地运行。该模型通过开源方式发布,旨在推动人工智能技术的进步与民主化。Gemma 4 的“在设备端”能力意味着数据处理可在本地完成,无需持续连接云端,这有望提升响应速度、增强隐私保护并实现离线使用。此举是 Google 通过开源和开放科学来普及人工智能的持续努力的一部分。

    推荐理由:前沿多模态模型开源,设备端可运行,降低AI部署门槛。

4月1日周三
  1. Hugging Face:Blog(RSS)70

    Falcon Perception

    Technology Innovation Institute 在 Hugging Face 平台发布了一篇博客文章,介绍了其 Falcon Perception 系统。该系统是一种先进的感知技术方案,专注于提升机器对复杂环境的理解与交互能力。文章阐述了其核心架构的更新,包括多模态数据融合机制的优化,以及实时处理效率的显著提升。关键性能指标显示,其在标准基准测试中的准确率与响应速度均有突破。

    推荐理由:Falcon 系列新成员,开源多模态模型阵营再添一员,开发者可关注选型

3月31日周二
  1. Hugging Face:Blog(RSS)70

    Granite 4.0 3B Vision:面向企业文档的紧凑型多模态智能

    IBM Granite团队发布了Granite 4.0 3B Vision模型,这是一个专为企业文档处理设计的紧凑型多模态大语言模型。该模型参数为30亿,具备视觉理解能力,能够同时处理文本和图像信息,特别针对报告、表格、图表等企业文档进行优化。其紧凑尺寸旨在降低部署和运行成本,使企业能够在资源受限的环境中高效实现文档智能分析、信息提取和知识管理。模型已在Hugging Face平台发布。

    推荐理由:IBM 推出轻量级多模态模型,企业文档场景可直接落地部署

  2. Artificial Analysis

    KwaiKAT发布非推理代码模型KAT-Coder-Pro V2,在Artificial Analysis Intelligence Index获44分,较V1提升8分,与Claude Sonnet 4.6持平。该模型token效率显著,运行仅需约9M输出token,远低于Claude系列及DeepSeek等推理模型。Agent能力大幅提升,Terminal-Bench Hard得分49%(提升40个百分点),匹配Claude Opus 4.6。成本降至73美元,响应速度达109 token/秒。但在长上下文推理和知识回忆方面较V1有所退步。

    推荐理由:快手发布 KAT-Coder-Pro V2,非推理架构实现 44 分智能指数,Agent 能力跃升 40 个百分点,成本仅为 Claude Sonnet 的 5%。