字节 Seed 发布 Seedance 2.0 音视频联合生成模型
字节 Seed 发布原生多模态音视频生成模型 Seedance 2.0,2026 年 2 月初在中国正式上线,采用统一架构支持文本、图像、音频、视频四种输入模态。
推荐理由:官方技术报告梳理了 Seedance 2.0 的统一架构、多模态输入上限与分辨率规格,读者可对照前代看能力变化。
新模型的发布、开源与迭代:大模型厂商的旗舰更新、开源权重放出、性能与价格变化的第一时间记录。
字节 Seed 发布原生多模态音视频生成模型 Seedance 2.0,2026 年 2 月初在中国正式上线,采用统一架构支持文本、图像、音频、视频四种输入模态。
推荐理由:官方技术报告梳理了 Seedance 2.0 的统一架构、多模态输入上限与分辨率规格,读者可对照前代看能力变化。
Gemini Robotics-ER 1.6 正式发布,通过增强具身推理能力为真实世界机器人任务提供底层支持。该版本重点升级空间推理与多视角理解功能,使自主机器人能够更精准地解析三维环境、理解物体间空间关系,并在复杂场景中实现高效决策与操作执行,显著提升机器人在物理世界中的感知与交互性能。
推荐理由:Gemini Robotics-ER 1.6 在机器人推理上迈了一大步,仪器读取和多视角成功检测是真需求,尤其是波士顿动力集成后,做具身智能的团队值得第一时间测试。
Wayve发布Waypoint-1.5模型,用于生成高保真可交互虚拟世界。该模型经优化后能在消费级GPU(如RTX 4090)上高效运行,降低硬件门槛,支持实时交互与动态场景生成,适用于自动驾驶模拟、游戏开发等领域,推动AI技术民主化。
推荐理由:Waypoint 1.5 把实时生成世界从 demo 变成了消费级 GPU 上能跑的东西,360p 版的兼容性让游戏本也能玩。高保真不是重点,实时响应和本地运行才是,做互动内容的值得关注。
智谱推出开源模型GLM-5.1,支持独立工作长达8小时。模型可直接部署使用,无需人工频繁干预,适用于长周期自动化任务场景。
推荐理由:智谱把 GLM-5.1 开源,并且主打 8 小时独立工作,这个定位切中了 agent 场景下长任务执行的痛点,想做自动化流程的可以跑起来试试。
推荐理由:智谱 GLM 5.1 把长程任务记忆和自进化作为新能力,这比单纯编码提升更值得关注,做 agent 的团队可以认真评估它在持续任务上的表现。
Anthropic 发布迄今最大的 Claude Mythos 模型,参数量达 10 万亿,为此前前沿模型的六倍。该模型在测试中发现了一处存在 27 年的操作系统漏洞和一处 16 年历史的视频软件缺陷,而传统工具曾对此检查过 500 万次均未发现。这些安全能力并非专门训练所得,而是代码、推理和自主性提升后涌现的副产品。Mythos 目前按 ASL-3 安全标准仅向 40 余家组织开放访问,这种排他性将重塑行业格局——拥有访问权的企业获得结构性安全优势,软件防护标准被重新定义,工程预算也将从开发转向深度加固。
推荐理由:Claude Mythos 的漏洞发现能力是意外的副产物,这让安全变成了准入壁垒,没有访问权的公司软件将默认多孔。
Cognition 发布面向软件工程智能体的新模型 SWE-1.6,已在 Windsurf 全面开放,未来 3 个月免费。模型在 SWE-Bench Pro 上与 SWE-1.6 Preview 表现相当,同时显著减少过度思考、循环推理和依赖终端等行为,更多使用并行工具调用;训练中引入长度惩罚,响应长度增长更慢且任务解决率保持稳定。
推荐理由:官方说明了用长度惩罚等训练手段改善模型 UX 的具体做法和效果,对关注智能体行为质量的人有可参考的细节。
Gemma 4 的发布揭示了开放模型成功的真正标准。文章指出,决定模型成败的关键并非基准测试分数(benchmark scores),而是其他因素。当前 AI 领域过度关注 leaderboard 排名,但高分数不等于实际应用价值与社区采用率。真正的成功取决于模型解决真实场景需求的能力、开发者友好度以及生态建设,而非单纯的技术指标领先。这一观点挑战了以 benchmark 为导向的行业评估范式。
推荐理由:开源模型成败不只看榜单分数,Hugging Face 大佬揭秘真实胜负手
Gemma 4 在基准测试中性能超越体量 10 倍以上的大模型,图表 x 轴为对数坐标,凸显其极高的参数效率。


推荐理由:Google 开源小模型 Gemma 4 发布,性能超越 10 倍体量级大模型


推荐理由:Google发布多模态开源模型Gemma 4,单卡H100可跑且科学推理能力突出
很高兴推出 Gemma 4:这是目前各自尺寸下全球最优秀的开放模型。提供 4 种尺寸,可根据你的具体任务进行微调:31B 密集模型带来出色的原始性能,26B MoE 实现低延迟,还有高效的 2B 和 4B 模型适用于边缘设备——祝开发愉快!https://t.co/Sjbe3ph8xr
推荐理由:Google发布Gemma 4开源模型,4种尺寸覆盖从云端到端侧全场景
Gemma 4 开源模型发布,提供 4 种尺寸:31B dense 版追求极致性能,26B MoE 版实现低延迟,2B 与 4B 版适配边缘设备,均可针对特定任务微调。


推荐理由:Google 发布 Gemma 4 开源模型,覆盖 2B 至 31B 多尺寸,支持端侧与 MoE 架构
Google 发布 Gemma 4 开源模型系列,采用 Apache 2.0 许可证,支持在本地硬件运行,专为高级推理和 agentic 工作流设计。
推荐理由:Google 开源 Gemma 4 模型,支持本地硬件运行并强化 Agent 与推理能力
推荐理由:Microsoft CEO 亲自发布 MAI 系列三大新模型,覆盖语音转录、合成与图像生成
Microsoft AI 宣布发布 MAI-Transcribe-1、MAI-Voice-1 和 MAI-Image-2 三款模型,即日起所有开发者可在 Microsoft Foundry 和 MAI Playground 使用。
推荐理由:官方同时给出三款模型的定价和 FLEURS 基准对比数据,开发者可以直接在 Foundry 上手评估适用性。
Google DeepMind 发布了 Gemma 4 系列开源模型,旨在直接在设备端实现多步骤规划和自主智能体工作流。该版本包含用于实验“智能体技能”的 Google AI Edge Gallery,以及为开发者提供显著速度提升和结构化输出的 LiteRT-LM 库。Gemma 4 采用 Apache 2.0 许可,支持超过 140 种语言,并兼容移动设备、台式机及树莓派等多种物联网硬件平台。
推荐理由:开源 agentic 模型支持端侧运行,开发者可快速构建本地智能应用。
Google 正式发布了 Gemma 4,这是一款前沿的多模态人工智能模型,其核心特点是能够在设备端本地运行。该模型通过开源方式发布,旨在推动人工智能技术的进步与民主化。Gemma 4 的“在设备端”能力意味着数据处理可在本地完成,无需持续连接云端,这有望提升响应速度、增强隐私保护并实现离线使用。此举是 Google 通过开源和开放科学来普及人工智能的持续努力的一部分。
推荐理由:前沿多模态模型开源,设备端可运行,降低AI部署门槛。
Technology Innovation Institute 在 Hugging Face 平台发布了一篇博客文章,介绍了其 Falcon Perception 系统。该系统是一种先进的感知技术方案,专注于提升机器对复杂环境的理解与交互能力。文章阐述了其核心架构的更新,包括多模态数据融合机制的优化,以及实时处理效率的显著提升。关键性能指标显示,其在标准基准测试中的准确率与响应速度均有突破。
推荐理由:Falcon 系列新成员,开源多模态模型阵营再添一员,开发者可关注选型
IBM Granite团队发布了Granite 4.0 3B Vision模型,这是一个专为企业文档处理设计的紧凑型多模态大语言模型。该模型参数为30亿,具备视觉理解能力,能够同时处理文本和图像信息,特别针对报告、表格、图表等企业文档进行优化。其紧凑尺寸旨在降低部署和运行成本,使企业能够在资源受限的环境中高效实现文档智能分析、信息提取和知识管理。模型已在Hugging Face平台发布。
推荐理由:IBM 推出轻量级多模态模型,企业文档场景可直接落地部署


推荐理由:快手发布 KAT-Coder-Pro V2,非推理架构实现 44 分智能指数,Agent 能力跃升 40 个百分点,成本仅为 Claude Sonnet 的 5%。