跳到正文
北京时间

模型发布

新模型的发布、开源与迭代:大模型厂商的旗舰更新、开源权重放出、性能与价格变化的第一时间记录。

710条精选相关主题产品更新论文研究开源生态

最新精选

第 421–440 条 · 共 710 条
5月22日周五
  1. IT之家(RSS)70

    网易有道“子曰4”多模态模型、语音合成模型全量开源

    网易有道宣布将其“子曰”大模型4.0的多模态模型与语音合成模型面向全球全量开源。其中,多模态模型(27B参数)专注于教育场景,在处理高难度视觉数理问题上达到行业顶尖水平,纯文本中文数理难题准确率为81.4%。该模型通过思维链优化,将输出长度压缩43.2%,有效降低了推理成本。同时开源的语音合成模型支持跨语种音色与情感迁移克隆,3秒内即可完成零样本复制,准确度超97%,并支持包括中、英、日、韩在内的14种语言。

    推荐理由:有道把垂直教育的多模态模型全量开源,27B参数在视觉数理上做到SOTA,还把思维链压缩了43%,推理成本实打实下降,做教育应用的可以拿来做二次开发;TTS的跨语种情感克隆也实用,3秒克隆14种语言。

  2. 公众号:龙猫LongCat(美团)88

    LongCat-Video-Avatar 1.5 正式开源

    美团正式开源 LongCat-Video-Avatar 1.5,在唇形同步、物理合理性、长视频稳定性、多人互动和高效推理上实现全面跃升。该模型采用 DMD 蒸馏将生成步骤压缩至 8 步,推理效率提升约 15 倍,生成 10 秒视频仅需约 1 分钟;Wav2Vec2 升级为 Whisper-large,并引入 GRPO 逐帧偏好对齐优化手部稳定性。

    推荐理由:开源数字人模型首次在多人场景区分、长视频稳定性和推理效率上同时达到商业产品水平,评测透明度高。

  3. 公众号:龙猫LongCat(美团)78

    美团开源 LongCat-Video-Avatar 1.5:数字人视频生成效率提升 15 倍

    美团正式开源 LongCat-Video-Avatar 1.5 数字人视频模型。该版本在唇形同步、物理合理性及长视频稳定性上实现跃升,支持真人、动漫等多类主体及多人互动场景。技术层面,采用 Whisper-large 提取音频特征,引入 GRPO 进行人类偏好对齐以优化手部与动作连续性;推理端通过 DMD 蒸馏将生成步数从 50 压缩至 8,结合共享基础模型加 LoRA 适配器方案,使推理效率提升约 15 倍(10 秒视频仅需约 1 分钟)。评测显示其在自然度与稳定性方面优于部分闭源商业模型。

    推荐理由:头部大厂开源的高性能数字人模型,显著降低商用门槛。其“15 倍提速”与“多场景泛化”能力为开发者提供了极具竞争力的基座,适合关注 AI 视频生成落地与成本优化的读者。

  4. IT之家(RSS)73

    智谱GLM-5.1高速版发布:刷新全球大模型API速度纪录

    5月22日,智谱向部分企业客户推出了旗舰大模型GLM-5.1的高速版API“GLM-5.1-highspeed”。该版本输出速度达400 tokens/s,刷新了全球大模型API速度上限。关键突破在于,它首次在国产大模型中实现了旗舰级能力与低延迟的结合,打破了“高速模型即轻量模型”的传统。该版本由智谱GLM团队与TileRT团队合作,通过系统级优化确保了速度的生产级稳定性,适用于AI编程、实时语音交互等场景。

    推荐理由:智谱把旗舰模型拉到 400 tokens/s,还保持全尺寸能力,不是那种为快阉割的小模型。做实时交互、AI 编程的可以认真看看,延迟敏感场景的选型参数要重写了。

  5. 公众号:智谱(GLM)64

    GLM-5.1高速版发布:400 tokens/s,旗舰级能力跑出全球最快API速度

    智谱面向部分企业客户推出GLM-5.1高速版API“GLM-5.1-highspeed”,输出速度达400 tokens/s,刷新全球大模型厂商API速度上限。该版本首次在国产大模型中实现旗舰级能力与极致低延迟并存,由GLM团队与TileRT团队联合打造,通过AOT静态编排、Tile级微任务及8卡NVL拓扑特化等系统级优化,确保400 TPS为稳定可用的生产级能力。

    推荐理由:在旗舰模型上实现400 tokens/s,打破了高速必为轻量模型的惯例,对编码智能体等实时交互场景提供了不牺牲能力的低延迟方案。

  6. 公众号:智谱(GLM)63

    智谱推出GLM-5.1高速版

    智谱发布GLM-5.1高速版,推理速度达400 tokens/s,在顶尖模型中生成速度最快。

    推荐理由:智谱把GLM-5.1做到了400 tokens/s,虽然发布已半个月,但这是国产模型在推理速度上的新标杆,做实时应用的可以看看。

  7. OpenRouter78

    阿里巴巴通义千问团队的全新Qwen3.7-Max现已登陆OpenRouter。 作为Qwen3.7系列的旗舰模型,专为以智能体为核心的工作场景打造:编程、办公与生产力任务,以及长周期自主执行。在编程和智能体基准测试中较Qwen3.6有显著提升,并支持显式提示缓存以处理重复上下文。

    推荐理由:阿里旗舰迭代,重点转向 agent 和长程任务,这次 benchmark 跳跃不是挤牙膏,做 coding agent 的可以认真试试。

5月21日周四
  1. Qwen82

    Qwen3.7-Max是Qwen系列面向Agent时代推出的最新旗舰模型,旨在为能完成实际任务的智能体提供强大基础。其核心能力包括:可作为端到端编码智能体,处理前端原型与多文件重构;作为可靠的办公助手,通过MCP集成与多智能体编排协同工作;并支持超长时间(超过35小时)的自主运行,执行复杂任务链。该模型兼容Claude Code、OpenClaw等主流开发框架,现已上线阿里云模型工作室与Qwen Studio提供服务。

    推荐理由:Qwen 3.7-Max 的亮点不在榜上分数,而是它瞄准 Agent 场景的连贯执行能力,35 小时不间断跑 kernel 优化,对需要长线任务的开发者是直接可用的探索方向。

  2. Tencent Hy74

    腾讯正式开源Hy-MT2多语言翻译模型,支持33种语言间的无缝互译。其7B与30B-A3B版本在开源模型中达到最先进的翻译性能,超越了许多参数规模大数十倍的模型。更具突破性的是,1.8B轻量级版本性能超越微软等主流商业API,并凭借腾讯AngelSlim 1.25-bit极量化技术,仅需440MB存储空间,即可在主流手机芯片上本地运行,推理速度较前代提升1.5倍,显著降低了高质量AI翻译的部署门槛。

    推荐理由:虽然翻译领域不算最热,腾讯这个1.8B开源模型用1.25位量化直接跑在手机上,效果还超微软商业API,做本地化翻译工具的人值得关注。

5月20日周三
  1. IT之家(RSS)71

    Stability AI 推出音频模型 Stability Audio 3.0,可生成最长 6 分钟专业级歌曲

    Stability AI 推出 Stability Audio 3.0 音频生成模型家族,包含四款不同规格模型,参数从45900万到27亿。小型模型专注设备端运行,可本地生成两分钟以内的音频;中型和大型模型支持创作超过6分20秒的完整音乐,

    推荐理由:Stability Audio 3.0 把AI音乐从几十秒的demo拉到了六分钟的完整歌曲,而且中小模型直接开源,任何一个能跑模型的设备都能玩,音乐创作的门槛继续被踩低。

  2. SenseTime68

    将你的想法转化为激发故事的视觉画面 🧨 [引用 @Adamaestr0_]:大多数AI工具可以写作或生成图像。 但这个能同时做这两件事。 向你介绍 SenseNova U1。 一个能同时思考文本和图像的AI。 这改变了一切 🧵

    引用Adam@Adamaestr0_

    大多数 AI 工具能写作或生成图像。 但这个能同时做这两件事。 隆重介绍 SenseNova U1。 一个能同时用文本和图像思考的 AI。 这将改变一切 🧵

    推荐理由:商汤发了 SenseNova U1,主打文本和图像同时生成的「全模态」,但宣传语太简略,没给任何性能数据或技术细节,暂时看不出是真突破还是常规迭代,先标记关注。

  3. 公众号:通义实验室(千问)62

    Qwen3.7-Max 重新定义 AI Agent 基座

    通义实验室推出 Qwen3.7-Max,定位为重新定义 AI 智能体基座的模型,侧重提升智能体的基础能力与架构。

    推荐理由:Qwen3.7-Max 是通义系列对 Agent 基座的一次关键升级,发布时间虽已过两周,但做 Agent 的开发者仍不能忽略,选型必看。

  4. Qwen:Blog Retrieval(API)79

    Qwen3.7-Max:面向智能体时代的最新专有模型

    通义千问发布 Qwen3.7-Max,专为智能体时代设计。它具备从原型到复杂多文件工程的编码智能体能力,通过 MCP 和多智能体编排实现办公自动化,能自主执行超 1000 步工具调用(如 35 小时全自主内核优化)。兼容 Claude Code、OpenClaw、Qwen Code 等多框架。在多项基准测试中超越 Opus-4.6 Max 等模型:Terminal Bench 2.0 (69.7)、SWE-Verified (80.4)、GPQA Diamond (92.4)、HLE (41.4) 等。现已通过阿里云 Model Studio 提供 API 调用。

    推荐理由:Qwen3.7-Max 把 agent 能力拉到了新高度,35 小时自主内核优化证明长程执行有真实生产力,做 coding agent 的团队该认真测一下。

  5. Hacker News 热门(buzzing.cc 中文翻译)80

    Gemini Omni

    Google DeepMind 于 2026 年 5 月 19 日发布了新一代多模态大模型 Gemini Omni。该模型整合了文本、图像、音频与视频的理解与生成能力,旨在实现更自然的人机交互。在同期 Hacker News 讨论中获得 112 点赞,显示出技术社区对多模态融合趋势的持续关注。这标志着大模型从单模态向全模态感知与响应能力的进一步演进。

    推荐理由:Gemini Omni 把视频编辑变成自然语言对话,多轮编辑和物理理解让它从玩具变成创作工具,做视频的值得一试。

  6. Google Blog:AI(RSS)83

    Gemini 3.5:前沿智能与行动能力相结合

    Google 在 I/O 大会上正式发布了最新的 Gemini 3.5 模型系列。该系列模型将前沿的人工智能能力与执行操作的功能相结合,旨在提供更强的综合性能。作为 Google 最新推出的模型,它代表了其在大模型技术上的最新进展。

    推荐理由:Google 在 I/O 上甩出 Gemini 3.5,这次不只拼多模态,更强调‘行动’,是所有做 Agent 的团队必须对标的新基座。

  7. Google Blog:AI(RSS)89

    I/O 2026: 欢迎来到自主的 Gemini 时代

    Google 在 I/O 2026 大会上宣布 Gemini 进入自主代理时代,新功能使其能够自动执行复杂任务,显著提升用户工作效率。大会展示了 Gemini 如何通过代理操作简化工作流程,实现自动化处理,例如自动管理邮件、安排日程或生成报告,帮助用户从重复性工作中解放出来,专注于创造性任务。这一更新基于先进机器学习模型,强调准确性与效率,标志着 AI 助手向更智能、更自主的方向发展。

    推荐理由:谷歌 I/O 大会上 Sundar Pichai 亲自宣布 agentic Gemini 时代到来,这是把 Gemini 从对话助手升级成真正能自主执行任务的 agent,所有做 AI 应用的接下来都得重新看一遍技术选型。

  8. Noam Shazeer83

    来自 #GoogleIO 现场,我们正在推出 Gemini 3.5 Flash,这是我们最新的模型,为智能体和编码提供前沿性能。我们今天在全球范围内推出,以其他前沿模型 4 倍的速度为现实世界的智能体工作流提供前沿级性能。🧵

    推荐理由:Google IO上发布的Gemini 3.5 Flash,主打Agent和编码,速度四倍于其他前沿模型,直接拉低Agent应用的门槛,做相关开发的可以马上试试。