DeepSeek-V3.1 发布,迈向 Agent 时代的第一步
DeepSeek-V3.1 以混合推理模型形式开源,用户可一键切换思考模式,同时 Agent 智能体支持性能得到增强。
推荐理由:DeepSeek V3.1 不是小修小补,混合推理和 Agent 支持让它从‘对话模型’转向‘行动模型’,开源这一步让 Agent 开发有了新底座。
新模型的发布、开源与迭代:大模型厂商的旗舰更新、开源权重放出、性能与价格变化的第一时间记录。
DeepSeek-V3.1 以混合推理模型形式开源,用户可一键切换思考模式,同时 Agent 智能体支持性能得到增强。
推荐理由:DeepSeek V3.1 不是小修小补,混合推理和 Agent 支持让它从‘对话模型’转向‘行动模型’,开源这一步让 Agent 开发有了新底座。
Cohere 发布 Command A Reasoning,定位企业级推理任务,称在 BFCL-v3(70.3)、tau-bench、m-tau-bench 上优于 gpt-oss-120b、DeepSeek-R1 0528 和 Mistral Magistral Medium。
推荐理由:官方发布企业推理模型,给出可私有部署的硬件门槛和可控 token 预算,适合关注本地化部署与成本控制的团队参考。
DeepSeek-V3.1 正式发布,deepseek-chat 与 deepseek-reasoner 分别对应其非思考与思考模式。新模型采用混合推理架构,思考效率较 DeepSeek-R1-0528 更高,并通过 Post-Training 优化提升工具使用与智能体任务表现。
推荐理由:DeepSeek 把推理和非思考模式合并到一个模型,解决了之前切模型的体验割裂,Agent 能力提升对做工具调用的开发者是直接利好。
推荐理由:百川 M2 是首个明确主打医疗推理的 32B 模型,在 HealthBench 上压过 GPT-OSS,做医疗 AI 应用的可以直接上 HuggingFace 拉下来跑,垂类专精可能比通用巨兽更接地气。
GPT-5 现已登陆 OpenRouter 平台,具备长上下文能力,专为复杂推理和代码工作流设计。
推荐理由:GPT-5 是 AI 史上的分水岭,长上下文和推理能力直接催生了一整代 agent 工具,哪怕过了快一年回头看,仍然值得搞清楚它改变了什么。
OpenRouter 平台已发布 GPT-5,该模型支持长上下文,专为复杂推理与代码工作流构建。
推荐理由:这是 GPT-5 首次以大上下文和推理能力亮相,1M token 上下文让 code agent 直接从 demo 变成可用,现在看虽是旧闻,但节点意义不减。


推荐理由:OpenAI 终于开源了,这是 GPT-2 之后第一次放开权重,120B 和 20B 两个尺寸直接对标 Llama 和 Qwen 的开源生态。虽然游戏 benchmark 排名不算惊艳,但信号本身比分数重要得多,所有基于开源模型做产品的团队都得重新评估选型。
OpenAI 发布两款新的开放模型(open models),官方推文称"Both of them"已上线,详见 openai.com/open-models。




我们的开放模型来了。 两个都有。 http://openai.com/open-models
推荐理由:OpenAI罕见发布开放权重模型,标志策略重大转变
Anthropic 推出 Claude Opus 4.1,作为 Claude Opus 4 的增量更新,具备增强的能力和性能改进。该版本不允许同时指定 temperature 和 top_p 参数,用户应仅使用其中一个。
推荐理由:Claude Opus 4.1 是 Opus 4 的增量升级,官方发布无夸张数据,但参数限制这个细节对开发者是实操提醒,用高端模型的团队值得重新评估一下效果。
(1/n) 🚀 借助 FastVideo,你现在可以在单块 H200 GPU 上于 5 秒内生成一段 5 秒的视频! 隆重推出 FastWan 系列,这是一个快速视频生成模型家族,通过我们称为“稀疏蒸馏”的全新配方训练而成,可将视频去噪时间加速 70 倍! 🖥️ 在线演示:https://fastwan.fastvideo.org/(感谢 @gmicloud 的支持!) 🔗 博客:https://hao-ai-lab.github.io/blogs/fastvideo_post_training/ 🔓 我们以 Apache-2.0 许可证完全开源我们的模型、代码和数据
推荐理由:视频生成终于从「等一分钟」进化到「实时出片」,FastWan 用稀疏蒸馏把去噪压了 70 倍,单卡 H200 五秒出五秒视频,做短视频工具和实时交互产品的团队该认真看看这个开源方案。
智谱发布旗舰模型 GLM-4.5(355B/32B 激活)与 GLM-4.5-Air(106B/12B 激活),含 FP8 量化版本,即日起原生支持 SGLang 框架。采用 MoE 架构与 128k 上下文,在 12 项基准测试中分列第 3 与第 6。GLM-4.5 在 BrowseComp 网页浏览任务中以 26.4% 准确率超越 Claude 4 Opus,工具调用成功率达 90.6%,编程与数学推理能力突出。
推荐理由:国产大模型Agent与编码能力跻身第一梯队,为开发者提供Claude/GPT之外的高性价比替代方案
上海人工智能实验室 InternLM 团队发布 Intern-S2-Preview-397B,定位面向科学智能与长程智能体的最强多模态基础模型,通过新的视觉语言预训练范式、20 多个领域的大规模多任务强化学习以及沙盒环境中的智能体强化学习提升通用推理与科学能力。
推荐理由:官方仓库同时给出 Intern-S2 两档新模型与 S1 系列的架构细节和基准对比,便于读者评估科学场景下的开源选型。
Kimi K2 采用混合专家(MoE)架构,拥有 320 亿激活参数和 1 万亿总参数,在非推理模型的前沿知识、数学和编程任务上达到 SOTA 性能。
推荐理由:月之暗面发布 Kimi K2,万亿参数 MoE 架构,多基准 SOTA
Liquid AI 发布新一代基础模型 LFM2,主打端侧部署,在 CPU 上解码与 prefill 速度最高达 Qwen3 的 2 倍,训练效率较上一代提升 3 倍。
推荐理由:官方发布端侧模型系列,给出与 Qwen3 等同尺寸模型的速度和基准对比数据,适合关注本地部署选型的读者参考。
xAI 正式发布 Grok 4,新一代大模型在数学推理和代码生成能力上大幅提升,延续实时获取 X 平台信息的特色。该版本支持更长上下文窗口和图像理解,即日起向 X Premium+ 订阅者开放。
推荐理由:xAI正式发布Grok 4旗舰大模型,重要版本更新值得关注
OpenRouter 宣布推出 Cypher Alpha,这是一款免费、通用型隐身模型,内置工具调用功能,用户可直接尝试。
推荐理由:OpenRouter 自家出的免费通用模型,带工具调用,去年夏天发的,现在看只能算个入门级 Agent 玩具,但免费试不亏。
Gemini Robotics On-Device 推出高效端侧机器人模型,具备通用灵巧操作与快速任务适应能力,支持本地设备直接部署运行。
推荐理由:DeepMind 发布端侧机器人模型,支持本地部署与快速任务适应
OpenMOSS 发布并开源 MOSS-TTSD-V0,支持中英双语对话语音生成、零样本双说话人音色克隆、声音事件控制和长语音生成,模型权重、推理代码和 API 全部开源并支持商用。
推荐理由:原文给出训练数据规模、Codec 设计和对比结果,读者可据此评估这个开源对话语音模型的可复用价值。


推荐理由:DeepSeek-R1 的常规迭代,幻觉降低和 JSON 输出是实用改进,但距离代际跃迁还差得远。开源权重直接可用,做推理链产品的团队值得花半小时跑一下。
DeepSeek 发布 R1 模型小版本升级 DeepSeek-R1-0528,在数学、编程与通用逻辑等基准测评中取得当前国内所有模型中首屈一指的成绩,整体表现接近 o3 与 Gemini-2.5-Pro。
推荐理由:后训练投入增加带来的推理提升幅度,为开源社区提供了可蒸馏的高质量思维链,小模型也能接近大模型表现。