跳到正文
北京时间

模型发布

新模型的发布、开源与迭代:大模型厂商的旗舰更新、开源权重放出、性能与价格变化的第一时间记录。

710条精选相关主题产品更新论文研究开源生态

最新精选

第 661–680 条 · 共 710 条
8月21日周四
  1. 公众号:DeepSeek(深度求索)63

    DeepSeek-V3.1 发布,迈向 Agent 时代的第一步

    DeepSeek-V3.1 以混合推理模型形式开源,用户可一键切换思考模式,同时 Agent 智能体支持性能得到增强。

    推荐理由:DeepSeek V3.1 不是小修小补,混合推理和 Agent 支持让它从‘对话模型’转向‘行动模型’,开源这一步让 Agent 开发有了新底座。

  2. Cohere 产品与研究博客(网页)61

    Cohere 发布 Command A Reasoning 企业级推理模型

    Cohere 发布 Command A Reasoning,定位企业级推理任务,称在 BFCL-v3(70.3)、tau-bench、m-tau-bench 上优于 gpt-oss-120b、DeepSeek-R1 0528 和 Mistral Magistral Medium。

    推荐理由:官方发布企业推理模型,给出可私有部署的硬件门槛和可控 token 预算,适合关注本地化部署与成本控制的团队参考。

  3. DeepSeek:API 更新日志71

    DeepSeek-V3.1 发布,升级 chat 与 reasoner 双模式

    DeepSeek-V3.1 正式发布,deepseek-chat 与 deepseek-reasoner 分别对应其非思考与思考模式。新模型采用混合推理架构,思考效率较 DeepSeek-R1-0528 更高,并通过 Post-Training 优化提升工具使用与智能体任务表现。

    推荐理由:DeepSeek 把推理和非思考模式合并到一个模型,解决了之前切模型的体验割裂,Agent 能力提升对做工具调用的开发者是直接利好。

8月11日周一
  1. Baichuan AI71

    今天我们推出了 Baichuan-M2,一款医疗增强的推理模型,它在 #HealthBench 基准测试上超越了包括 gpt-oss-120b 在内的所有开源模型。在此试用:https://huggingface.co/baichuan-inc/Baichuan-M2-32B #AIHealth

    推荐理由:百川 M2 是首个明确主打医疗推理的 32B 模型,在 HealthBench 上压过 GPT-OSS,做医疗 AI 应用的可以直接上 HuggingFace 拉下来跑,垂类专精可能比通用巨兽更接地气。

8月7日周四
  1. OpenRouter:Announcements(RSS)68

    GPT-5 已在 OpenRouter 上线

    GPT-5 现已登陆 OpenRouter 平台,具备长上下文能力,专为复杂推理和代码工作流设计。

    推荐理由:GPT-5 是 AI 史上的分水岭,长上下文和推理能力直接催生了一整代 agent 工具,哪怕过了快一年回头看,仍然值得搞清楚它改变了什么。

  2. OpenRouter:Announcements(RSS)68

    GPT-5 现已上线

    OpenRouter 平台已发布 GPT-5,该模型支持长上下文,专为复杂推理与代码工作流构建。

    推荐理由:这是 GPT-5 首次以大上下文和推理能力亮相,1M token 上下文让 code agent 直接从 demo 变成可用,现在看虽是旧闻,但节点意义不减。

  3. Hao AI Lab81

    [Lmgame Bench] 🔥 OpenAI 刚刚发布了两款开放权重的推理模型:gpt-oss-120B(约1170亿参数)和 gpt-oss-20B(约210亿参数),它们是自 GPT-2 以来首批开放权重的 OpenAI 模型。 我们在 Lmgame Bench 中对两者进行了测试,涵盖4款互动游戏: 🧱 推箱子 | 🟦 俄罗斯方块 | 🔢 2048 | 🍬 糖果传奇 以下是它们的排名(满分25分): → gpt-oss-120b → 第12名 → gpt-oss-20b → 第13名

    推荐理由:OpenAI 终于开源了,这是 GPT-2 之后第一次放开权重,120B 和 20B 两个尺寸直接对标 Llama 和 Qwen 的开源生态。虽然游戏 benchmark 排名不算惊艳,但信号本身比分数重要得多,所有基于开源模型做产品的团队都得重新评估选型。

8月6日周三
8月5日周二
  1. Claude Platform:开发者版本说明(RSS)61

    Claude Opus 4.1 发布:性能增强的增量更新

    Anthropic 推出 Claude Opus 4.1,作为 Claude Opus 4 的增量更新,具备增强的能力和性能改进。该版本不允许同时指定 temperature 和 top_p 参数,用户应仅使用其中一个。

    推荐理由:Claude Opus 4.1 是 Opus 4 的增量升级,官方发布无夸张数据,但参数限制这个细节对开发者是实操提醒,用高端模型的团队值得重新评估一下效果。

  2. Hao AI Lab67

    FastVideo团队推出FastWan系列快速视频生成模型。该模型采用名为“稀疏蒸馏”的新训练方法,能将视频去噪速度提升70倍。在单块H200 GPU上,仅需5秒即可生成一段5秒的视频。团队提供了在线演示,并依据Apache-2.0许可证完全开源了模型、代码和数据。

    引用Hao AI Lab@haoailab

    (1/n) 🚀 借助 FastVideo,你现在可以在单块 H200 GPU 上于 5 秒内生成一段 5 秒的视频! 隆重推出 FastWan 系列,这是一个快速视频生成模型家族,通过我们称为“稀疏蒸馏”的全新配方训练而成,可将视频去噪时间加速 70 倍! 🖥️ 在线演示:https://fastwan.fastvideo.org/(感谢 @gmicloud 的支持!) 🔗 博客:https://hao-ai-lab.github.io/blogs/fastvideo_post_training/ 🔓 我们以 Apache-2.0 许可证完全开源我们的模型、代码和数据

    推荐理由:视频生成终于从「等一分钟」进化到「实时出片」,FastWan 用稀疏蒸馏把去噪压了 70 倍,单卡 H200 五秒出五秒视频,做短视频工具和实时交互产品的团队该认真看看这个开源方案。

7月31日周四
  1. LMSYS:Blog(Chatbot Arena 团队)

    智谱发布 GLM-4.5 系列模型并原生支持 SGLang

    智谱发布旗舰模型 GLM-4.5(355B/32B 激活)与 GLM-4.5-Air(106B/12B 激活),含 FP8 量化版本,即日起原生支持 SGLang 框架。采用 MoE 架构与 128k 上下文,在 12 项基准测试中分列第 3 与第 6。GLM-4.5 在 BrowseComp 网页浏览任务中以 26.4% 准确率超越 Claude 4 Opus,工具调用成功率达 90.6%,编程与数学推理能力突出。

    推荐理由:国产大模型Agent与编码能力跻身第一梯队,为开发者提供Claude/GPT之外的高性价比替代方案

7月25日周五
  1. 上海人工智能实验室 InternLM:原创项目67

    上海AI实验室开源 Intern-S2-Preview-397B 与 Intern-S2-Preview-35B 科学多模态模型

    上海人工智能实验室 InternLM 团队发布 Intern-S2-Preview-397B,定位面向科学智能与长程智能体的最强多模态基础模型,通过新的视觉语言预训练范式、20 多个领域的大规模多任务强化学习以及沙盒环境中的智能体强化学习提升通用推理与科学能力。

    推荐理由:官方仓库同时给出 Intern-S2 两档新模型与 S1 系列的架构细节和基准对比,便于读者评估科学场景下的开源选型。

7月11日周五
  1. Moonshot AI:Kimi Blog

    Kimi 发布 K2 模型

    Kimi K2 采用混合专家(MoE)架构,拥有 320 亿激活参数和 1 万亿总参数,在非推理模型的前沿知识、数学和编程任务上达到 SOTA 性能。

    推荐理由:月之暗面发布 Kimi K2,万亿参数 MoE 架构,多基准 SOTA

7月10日周四
  1. Liquid AI 模型与工程博客(网页)66

    Liquid AI 发布端侧基础模型 LFM2,含 0.35B/0.7B/1.2B 三个规格

    Liquid AI 发布新一代基础模型 LFM2,主打端侧部署,在 CPU 上解码与 prefill 速度最高达 Qwen3 的 2 倍,训练效率较上一代提升 3 倍。

    推荐理由:官方发布端侧模型系列,给出与 Qwen3 等同尺寸模型的速度和基准对比数据,适合关注本地部署选型的读者参考。

7月9日周三
  1. xAI:News(网页)

    Grok 4

    xAI 正式发布 Grok 4,新一代大模型在数学推理和代码生成能力上大幅提升,延续实时获取 X 平台信息的特色。该版本支持更长上下文窗口和图像理解,即日起向 X Premium+ 订阅者开放。

    推荐理由:xAI正式发布Grok 4旗舰大模型,重要版本更新值得关注

7月1日周二
  1. OpenRouter:Announcements(RSS)55

    OpenRouter 发布新隐身模型 Cypher Alpha

    OpenRouter 宣布推出 Cypher Alpha,这是一款免费、通用型隐身模型,内置工具调用功能,用户可直接尝试。

    推荐理由:OpenRouter 自家出的免费通用模型,带工具调用,去年夏天发的,现在看只能算个入门级 Agent 玩具,但免费试不亏。

6月24日周二
6月20日周五
  1. OpenMOSS / 复旦NLP / 上海创智 / MOSI(网页)69

    OpenMOSS 开源 MOSS-TTSD-V0 中英双语对话语音生成模型

    OpenMOSS 发布并开源 MOSS-TTSD-V0,支持中英双语对话语音生成、零样本双说话人音色克隆、声音事件控制和长语音生成,模型权重、推理代码和 API 全部开源并支持商用。

    推荐理由:原文给出训练数据规模、Codec 设计和对比结果,读者可据此评估这个开源对话语音模型的可复用价值。

5月29日周四
  1. DeepSeek68

    🚀 DeepSeek-R1-0528 现已发布! 🔹 基准测试性能提升 🔹 前端能力增强 🔹 减少幻觉现象 🔹 支持 JSON 输出与函数调用 ✅ 立即试用:https://chat.deepseek.com/ 🔌 API 使用方式不变 — 文档在此:https://api-docs.deepseek.com/guides/reasoning_model 🔗 开源权重:https://huggingface.co/deepseek-ai/DeepSeek-R1-0528

    推荐理由:DeepSeek-R1 的常规迭代,幻觉降低和 JSON 输出是实用改进,但距离代际跃迁还差得远。开源权重直接可用,做推理链产品的团队值得花半小时跑一下。

  2. 公众号:DeepSeek(深度求索)85

    DeepSeek-R1 更新至 0528 版本,推理能力显著增强

    DeepSeek 发布 R1 模型小版本升级 DeepSeek-R1-0528,在数学、编程与通用逻辑等基准测评中取得当前国内所有模型中首屈一指的成绩,整体表现接近 o3 与 Gemini-2.5-Pro。

    推荐理由:后训练投入增加带来的推理提升幅度,为开源社区提供了可蒸馏的高质量思维链,小模型也能接近大模型表现。