跳到正文
北京时间

全部动态

今日 39 条
2月1日周日
  1. OpenMOSS / 复旦NLP / 上海创智 / MOSI(网页)62

    MOVA 发布:32B MoE 端到端同步视频-音频生成模型全栈开源

    OpenMOSS 团队发布 MOVA 音视频基础模型,总参数 32B MoE、激活 18B,支持文本或图像到音视频的端到端同步生成,最高 720p、单段 8 秒。模型采用非对称双塔架构(14B Wan 2.2 I2V 视频塔与 1.3B 音频塔)加双向 Bridge 和 Aligned ROPE 对齐时间轴,并开放模型权重、训练与推理代码及微调方案。

    推荐理由:原文给出架构、训练策略和开源范围,读者可以了解端到端音视频生成如何处理同步问题并可复现研究。

1月27日周二
  1. 公众号:月之暗面(Kimi)61

    Kimi 发布并开源 K2.5 模型,带来全新视觉理解、代码和 Agent 集群能力

    Kimi 发布并开源迄今最智能、最全能的 K2.5 模型,原生多模态架构支持视觉与文本输入、思考与非思考模式,在 Agent、代码、图像、视频及通用智能任务上取得开源 state-of-the-art 表现。

    推荐理由:Kimi K2.5把视觉理解和Agent集群能力打包开源,国内模型里比较早做这个组合的,虽然参数规模争议不小,但对想搭多模态Agent的团队是个可用的起点。

1月20日周二
  1. Liquid AI 模型与工程博客(网页)66

    Liquid AI 发布 LFM2.5-1.2B-Thinking,1.2B 参数端侧推理模型内存低于 1GB

    Liquid AI 发布可在手机上完全离线运行的推理模型 LFM2.5-1.2B-Thinking,内存占用约 900 MB,已上线 Hugging Face、LEAP 和 Playground。

    推荐理由:官方公布了小参数量思考模型的端侧内存、速度数据和训练配方,读者可以据此评估边缘推理方案的选型。

1月16日周五
  1. X:百川智能 (@BaichuanAI)67

    百川智能开源医疗大模型Baichuan-M3

    我们已正式开源新一代医疗大语言模型 Baichuan-M3,其在 HealthBench 上获得 65.1 分,并在 HealthBench Hard 上以 44.4 分夺冠。该模型在医疗领域全面超越 GPT-5.2。

    推荐理由:医疗大模型在 HealthBench 上超越 GPT-5.2 是个真料,开源后医疗开发者可以直接调优,但别急着相信所有宣传数字,等实测再下结论。

1月5日周一
  1. Liquid AI 模型与工程博客(网页)63

    Liquid AI 发布 LFM2.5 端侧模型家族,预训练扩展至 28T tokens

    Liquid AI 发布 LFM2.5-1.2B 模型家族,将预训练从 10T 扩展到 28T tokens 并加入强化学习后训练,覆盖 Base、Instruct、日语、视觉语言和音频语言五个变体。

    推荐理由:官方发布给出了完整基准数据和推理速度对比,读者可以据此评估 1B 级端侧模型在指令遵循和部署上的实际水位。

12月15日周一
  1. 通义 QwenAudio:原创语音项目60

    通义实验室开源 Fun-ASR 系列语音识别模型,含方言与 31 语言版本

    通义实验室发布 Fun-ASR 端到端语音识别模型系列并开源。Fun-ASR-Nano-2512 参数量 800M,基于数千万小时语音训练,支持中英日三语、7 种汉语方言和 26 种地方口音;Fun-ASR-MLT-Nano-2512 同为 800M,基于数十万小时训练,支持 31 种语言。

    推荐理由:原文给出两个识别模型的训练规模、语言覆盖和开源基准对比,还附部署与推理路径,读者可据此评估在中文和方言场景的可用性。

12月1日周一
  1. 公众号:DeepSeek(深度求索)84

    DeepSeek V3.2 正式版发布:强化 Agent 能力,融入思考推理

    DeepSeek 发布正式版 DeepSeek-V3.2 和长思考增强版 V3.2-Speciale,网页端、App 和 API 均已更新。

    推荐理由:V3.2将思考融入工具调用,在Agent评测中达到开源最高水平,泛化性提升可能改变复杂工具调用应用的模型选型。

  2. 公众号:DeepSeek(深度求索)66

    DeepSeek V3.2 正式版:强化 Agent 能力,融入思考推理

    DeepSeek 发布正式版 V3.2 与长思考增强版 V3.2-Speciale。V3.2 在推理 Benchmark 中达到 GPT-5 水平,并成为首个支持思考与非思考模式工具调用的模型。

    推荐理由:半年前的这版更新,把 Agent 和思考推理揉进了开源模型,回头看算是 DeepSeek 在智能体能力上的关键一刀,做 Agent 开发的至今绕不开它。

  3. DeepSeek:API 更新日志85

    DeepSeek-V3.2 及 DeepSeek-V3.2-Speciale 发布

    DeepSeek 将 deepseek-chat 和 deepseek-reasoner 均升级为 DeepSeek-V3.2,分别对应非思考模式与思考模式。同时非正式部署 DeepSeek-V3.2-Speciale 的 API 服务,价格不变,仅支持思考模式对话,不支持工具调用,最大输出长度默认 128K,服务截止至北京时间 2025-12-15 23:59。

    推荐理由:我觉得DeepSeek V3.2的亮点不是参数,而是思考模式正式接入主力API,意味着推理能力常态化,Speciale那个128K输出更像压力测试,做长文档的可以抓住窗口期探上限。

11月26日周三
  1. Prime Intellect(网页)69

    Prime Intellect 发布 INTELLECT-3:106B 参数 MoE 模型,大规模 RL 训练并全栈开源

    Prime Intellect 发布 INTELLECT-3,一个 106B 参数的 MoE 模型,在 GLM-4.5-Air 基座上经 SFT 和大规模 RL 训练,在数学、代码、科学和推理基准上达到同规模最先进水平。

    推荐理由:原文给出了完整的模型权重、训练框架与 RL 环境开源清单,读者可以据此复现大规模强化学习后训练。

11月24日周一
  1. Claude Platform:开发者版本说明(RSS)75

    Claude Opus 4.5 发布:最强模型登场,支持编程工具调用与 effort 参数

    Anthropic 发布 Claude Opus 4.5,定位为最智能模型,在视觉、编程和计算机使用能力上实现阶跃式改进,价格低于前代 Opus 模型。

    推荐理由:Opus 系列首次把价格降到「实用」区间,同时编码和视觉有阶跃提升,这对做软件工程和 Agent 的开发者是实打实的利好,配套的工具调用更新也补上了多步骤工作流的效率短板。

10月29日周三
  1. Cognition 模型 / Devin 博客(网页)64

    Cognition 发布 SWE-1.5 编码智能体模型,经 Cerebras 推理达 950 tok/s

    Cognition 发布软件工程模型 SWE-1.5,参数达数千亿级,与 Cerebras 合作以最高 950 tok/s 提供推理,速度为 Haiku 4.5 的 6 倍、Sonnet 4.5 的 13 倍。

    推荐理由:原文给出速度基准与模型加推理加智能体框架协同的训练细节,读者可据此评估高速编码智能体方案的可行性。

10月27日周一
  1. MiniMax:Blog(网页)62

    MiniMax M2与AI智能体:简中见巧

    MiniMax正式开源并发布了专为AI智能体(Agent)和代码场景设计的大语言模型MiniMax M2。该模型API定价极具竞争力,仅为Claude Sonnet价格的约8%,且推理速度更快。在关键的智能体能力方面,其工具调用和深度搜索表现接近顶尖模型,编程能力在国内处于领先地位。MiniMax M2旨在解决性能、价格与速度的“不可能三角”,为构建更普及的AI智能体应用提供基础,体现了其“智能平权”的愿景。

    推荐理由:MiniMax M2 把 Agent 模型的价格打到了 Claude 的 8%,速度还翻倍,开源权重直接可用,做 Agent 的开发者值得上手试试。

10月16日周四
  1. Cognition 模型 / Devin 博客(网页)62

    Cognition 发布 SWE-grep 与 SWE-grep-mini,用 RL 训练快速并行代码检索模型

    Cognition 发布 SWE-grep 和 SWE-grep-mini 模型,专注高度并行的代码上下文检索,检索能力匹敌前沿编码模型但耗时低一个数量级。模型每轮最多发起 8 个并行工具调用、限制 4 轮,通过多轮强化学习训练,奖励为文件与行范围检索的加权 F1;由 SWE-grep 蒸馏并继续 RL 得到 SWE-grep-mini。

    推荐理由:原文给出检索质量分数与推理速度对比数字,并说明多轮 RL 训练方法,读者可评估这种专用检索模型能否迁移到自己的编码工作流。

10月15日周三
  1. Claude Platform:开发者版本说明(RSS)64

    Claude Haiku 4.5 发布:最快最智能的 Haiku 模型,性能接近前沿

    Anthropic 推出 Claude Haiku 4.5,定位为最快且最智能的 Haiku 系列模型,性能接近前沿水平。该模型专为实时应用、高吞吐量处理以及对推理能力要求较高的成本敏感型部署场景设计。

    推荐理由:这是Haiku系列首次拥有接近前沿的性能,高速低成本让它在实时应用和高吞吐场景里很有竞争力,做成本敏感AI产品的值得认真考虑。

10月10日周五
  1. 蚂蚁 inclusionAI:GitHub 新仓库66

    Ming-VideoMAR:基于连续令牌的自回归视频生成模型

    Ming-VideoMAR 是一款仅解码器的自回归图像到视频生成模型,采用连续令牌统一视觉表征。它首次将时间因果性与空间双向性作为视频自回归核心原则,并提出了整合掩码生成的下一帧扩散损失。该模型首次实现了视频生成的零样本分辨率缩放,能灵活生成远超训练分辨率的视频。其在训练与推理效率上表现突出,参数量、训练数据量和GPU消耗仅为之前最佳模型Cosmos的极小比例(9.3%、0.5%和0.2%),同时在定量与定性评估中均实现超越。模型代码与检查点已开源,论文已被NeurIPS 2025接收。

    推荐理由:蚂蚁把自回归视频生成的训练成本砍到 Cosmos 的 0.2% 还能赢,这个效率信号比分数本身更值得关注,做视频生成的团队该认真看看它的课程学习和渐进分辨率策略。

10月1日周三
  1. Liquid AI 模型与工程博客(网页)64

    Liquid AI 发布 LFM2-Audio-1.5B 端到端音频基础模型

    Liquid AI 发布 LFM2-Audio-1.5B,一个支持音频与文本输入输出的端到端基础模型,扩展了 LFM2 家族。

    推荐理由:官方给出了 VoiceBench、ASR 词错率和低于 100ms 的延迟数据,读者可以据此评估 1.5B 参数模型在端侧实时语音场景的可用性。

9月29日周一
  1. 公众号:DeepSeek(深度求索)79

    DeepSeek-V3.2-Exp 发布,引入稀疏注意力提升长文本效率,API 降价超 50%

    DeepSeek 发布实验性模型 DeepSeek-V3.2-Exp,在 V3.1-Terminus 基础上引入 DeepSeek Sparse Attention(DSA)稀疏注意力机制,在几乎不影响输出效果的前提下大幅提升长文本训练和推理效率,公开评测表现与 V3.1-Terminus 基本持平。

    推荐理由:稀疏注意力在几乎不影响效果的前提下大幅降低长文本成本,API 降价 50% 让依赖长上下文的应用获得了更现实的部署条件。

  2. 蚂蚁 inclusionAI:GitHub 新仓库57

    inclusionAI发布MingTok-Audio:首个统一连续语音分词器

    inclusionAI团队推出了MingTok-Audio,这是首个能有效融合语义与声学特征的统一连续语音分词器,适用于语音理解与生成任务。该模型基于纯因果Transformer架构,去除了卷积层以提升效率,并采用VAE进行连续特征建模以实现高质量音频重建。在语音重建性能上,其帧率为50,在SEED-ZH和SEED-EN测试集上的PESQ分别达到4.21和4.04,SIM为0.96,STOI为0.98,显著优于对比模型。在下游ASR任务中,其在多个方言数据集上取得了更低的错误率,例如在Hunan Minnan数据集上WER低至9.80%。

    推荐理由:蚂蚁把语音 tokenizer 做到了 PESQ 4.2 的离谱分数,比第二名翻了快一倍,做语音理解和生成的团队值得拿这个当新 baseline 跑一下。

  3. Claude Platform:开发者版本说明(RSS)75

    Claude Sonnet 4.5 发布,面向复杂智能体与编程任务

    Anthropic 发布 Claude Sonnet 4.5,定位为复杂智能体和编程场景的最佳模型,拥有最高综合智能水平。同时推出 Amazon Bedrock 和 Vertex AI 的全球端点定价、新的 `model_context_window_exceeded` 停止原因、记忆工具(beta)以及上下文编辑功能(beta),后者可在接近 token 限制时自动清理旧工具结果与调用。

    推荐理由:这是Anthropic放出的Sonnet 4.5,瞄准编码和复杂Agent场景,Memory工具和上下文编辑也一起开了,对靠API搞产品的开发者算大版本更新,但普通用户不必自己折腾。

9月25日周四
  1. Liquid AI 模型与工程博客(网页)61

    Liquid AI 发布 Liquid Nanos 系列 350M–2.6B 端侧专用小模型

    Liquid AI 发布 Liquid Nanos 系列,包含 350M 至 2.6B 参数的任务专用 LFM2 模型,可完全在手机、笔记本和嵌入式设备上运行。

    推荐理由:原文给出各款小模型的参数量、任务定位和评测对比,读者可判断端侧专用模型能否替代云端大模型。

9月22日周一
  1. 公众号:DeepSeek(深度求索)60

    DeepSeek-V3.1 更新至 Terminus 版本,优化语言一致性与 Agent 能力

    DeepSeek-V3.1 已更新至 DeepSeek-V3.1-Terminus 版本,在保持原有能力基础上,缓解了中英文混杂、偶发异常字符等问题,并优化了 Code Agent 与 Search Agent 的表现。官方 App、网页端、小程序与 DeepSeek API 均已同步更新,开源版本已发布至 Hugging Face。

    推荐理由:V3.1-Terminus 重点改进了语言混杂和 Agent 表现,开源权重与 API 已同步,适合评估多语言应用和工具调用的稳定性提升。

9月2日周二
  1. FireRedTeam:原创语音与多模态项目62

    FireRedTeam 开源 FireRedTTS-2 长对话语音生成模型

    FireRedTeam 发布 FireRedTTS-2,一款面向播客和聊天机器人的长对话流式 TTS 系统,支持最多 3 分钟、4 个说话人的多语种对话生成,覆盖中英日韩法德俄语并支持零样本跨语言音色克隆。

    推荐理由:官方开源了长对话流式语音合成模型,给出多语言支持、延迟数据和部署方案,适合关注播客与对话生成的读者参考。

8月21日周四
  1. 公众号:DeepSeek(深度求索)80

    DeepSeek-V3.1 发布,迈向 Agent 时代的第一步

    DeepSeek 正式发布 DeepSeek-V3.1,采用混合推理架构,一个模型同时支持思考与非思考模式,官方 App、网页端及 API 均已同步升级。

    推荐理由:混合推理架构统一思考与非思考模式,Agent基准提升具体,API兼容Anthropic格式直接降低Claude Code接入门槛。

  2. 公众号:DeepSeek(深度求索)63

    DeepSeek-V3.1 发布,迈向 Agent 时代的第一步

    DeepSeek-V3.1 以混合推理模型形式开源,用户可一键切换思考模式,同时 Agent 智能体支持性能得到增强。

    推荐理由:DeepSeek V3.1 不是小修小补,混合推理和 Agent 支持让它从‘对话模型’转向‘行动模型’,开源这一步让 Agent 开发有了新底座。

  3. Cohere 产品与研究博客(网页)61

    Cohere 发布 Command A Reasoning 企业级推理模型

    Cohere 发布 Command A Reasoning,定位企业级推理任务,称在 BFCL-v3(70.3)、tau-bench、m-tau-bench 上优于 gpt-oss-120b、DeepSeek-R1 0528 和 Mistral Magistral Medium。

    推荐理由:官方发布企业推理模型,给出可私有部署的硬件门槛和可控 token 预算,适合关注本地化部署与成本控制的团队参考。

  4. DeepSeek:API 更新日志71

    DeepSeek-V3.1 发布,升级 chat 与 reasoner 双模式

    DeepSeek-V3.1 正式发布,deepseek-chat 与 deepseek-reasoner 分别对应其非思考与思考模式。新模型采用混合推理架构,思考效率较 DeepSeek-R1-0528 更高,并通过 Post-Training 优化提升工具使用与智能体任务表现。

    推荐理由:DeepSeek 把推理和非思考模式合并到一个模型,解决了之前切模型的体验割裂,Agent 能力提升对做工具调用的开发者是直接利好。

8月11日周一
  1. X:百川智能 (@BaichuanAI)71

    百川智能发布医疗增强推理模型Baichuan-M2

    今天我们推出了 Baichuan-M2,一款医疗增强的推理模型,它在 #HealthBench 基准测试上超越了包括 gpt-oss-120b 在内的所有开源模型。在此试用:https://huggingface.co/baichuan-inc/Baichuan-M2-32B #AIHealth

    推荐理由:百川 M2 是首个明确主打医疗推理的 32B 模型,在 HealthBench 上压过 GPT-OSS,做医疗 AI 应用的可以直接上 HuggingFace 拉下来跑,垂类专精可能比通用巨兽更接地气。

8月7日周四
  1. OpenRouter:Announcements(RSS)68

    GPT-5 已在 OpenRouter 上线

    GPT-5 现已登陆 OpenRouter 平台,具备长上下文能力,专为复杂推理和代码工作流设计。

    推荐理由:GPT-5 是 AI 史上的分水岭,长上下文和推理能力直接催生了一整代 agent 工具,哪怕过了快一年回头看,仍然值得搞清楚它改变了什么。

  2. OpenRouter:Announcements(RSS)68

    GPT-5 现已上线

    OpenRouter 平台已发布 GPT-5,该模型支持长上下文,专为复杂推理与代码工作流构建。

    推荐理由:这是 GPT-5 首次以大上下文和推理能力亮相,1M token 上下文让 code agent 直接从 demo 变成可用,现在看虽是旧闻,但节点意义不减。

  3. X:Sky Computing Lab (@haoailab)81

    OpenAI开源推理模型性能评测出炉

    [Lmgame Bench] 🔥 OpenAI 刚刚发布了两款开放权重的推理模型:gpt-oss-120B(约1170亿参数)和 gpt-oss-20B(约210亿参数),它们是自 GPT-2 以来首批开放权重的 OpenAI 模型。 我们在 Lmgame Bench 中对两者进行了测试,涵盖4款互动游戏: 🧱 推箱子 | 🟦 俄罗斯方块 | 🔢 2048 | 🍬 糖果传奇 以下是它们的排名(满分25分): → gpt-oss-120b → 第12名 → gpt-oss-20b → 第13名

    推荐理由:OpenAI 终于开源了,这是 GPT-2 之后第一次放开权重,120B 和 20B 两个尺寸直接对标 Llama 和 Qwen 的开源生态。虽然游戏 benchmark 排名不算惊艳,但信号本身比分数重要得多,所有基于开源模型做产品的团队都得重新评估选型。

8月5日周二
  1. Claude Platform:开发者版本说明(RSS)61

    Claude Opus 4.1 发布:性能增强的增量更新

    Anthropic 推出 Claude Opus 4.1,作为 Claude Opus 4 的增量更新,具备增强的能力和性能改进。该版本不允许同时指定 temperature 和 top_p 参数,用户应仅使用其中一个。

    推荐理由:Claude Opus 4.1 是 Opus 4 的增量升级,官方发布无夸张数据,但参数限制这个细节对开发者是实操提醒,用高端模型的团队值得重新评估一下效果。

  2. X:Sky Computing Lab (@haoailab)67

    FastWan视频生成模型实现70倍加速,5秒出片

    FastVideo团队推出FastWan系列快速视频生成模型。该模型采用名为“稀疏蒸馏”的新训练方法,能将视频去噪速度提升70倍。在单块H200 GPU上,仅需5秒即可生成一段5秒的视频。团队提供了在线演示,并依据Apache-2.0许可证完全开源了模型、代码和数据。

    推荐理由:视频生成终于从「等一分钟」进化到「实时出片」,FastWan 用稀疏蒸馏把去噪压了 70 倍,单卡 H200 五秒出五秒视频,做短视频工具和实时交互产品的团队该认真看看这个开源方案。

7月25日周五
  1. 上海人工智能实验室 InternLM:原创项目67

    上海AI实验室开源 Intern-S2-Preview-397B 与 Intern-S2-Preview-35B 科学多模态模型

    上海人工智能实验室 InternLM 团队发布 Intern-S2-Preview-397B,定位面向科学智能与长程智能体的最强多模态基础模型,通过新的视觉语言预训练范式、20 多个领域的大规模多任务强化学习以及沙盒环境中的智能体强化学习提升通用推理与科学能力。

    推荐理由:官方仓库同时给出 Intern-S2 两档新模型与 S1 系列的架构细节和基准对比,便于读者评估科学场景下的开源选型。

7月10日周四
  1. Liquid AI 模型与工程博客(网页)66

    Liquid AI 发布端侧基础模型 LFM2,含 0.35B/0.7B/1.2B 三个规格

    Liquid AI 发布新一代基础模型 LFM2,主打端侧部署,在 CPU 上解码与 prefill 速度最高达 Qwen3 的 2 倍,训练效率较上一代提升 3 倍。

    推荐理由:官方发布端侧模型系列,给出与 Qwen3 等同尺寸模型的速度和基准对比数据,适合关注本地部署选型的读者参考。

7月1日周二
  1. OpenRouter:Announcements(RSS)55

    OpenRouter 发布新隐身模型 Cypher Alpha

    OpenRouter 宣布推出 Cypher Alpha,这是一款免费、通用型隐身模型,内置工具调用功能,用户可直接尝试。

    推荐理由:OpenRouter 自家出的免费通用模型,带工具调用,去年夏天发的,现在看只能算个入门级 Agent 玩具,但免费试不亏。

6月20日周五
  1. OpenMOSS / 复旦NLP / 上海创智 / MOSI(网页)69

    OpenMOSS 开源 MOSS-TTSD-V0 中英双语对话语音生成模型

    OpenMOSS 发布并开源 MOSS-TTSD-V0,支持中英双语对话语音生成、零样本双说话人音色克隆、声音事件控制和长语音生成,模型权重、推理代码和 API 全部开源并支持商用。

    推荐理由:原文给出训练数据规模、Codec 设计和对比结果,读者可据此评估这个开源对话语音模型的可复用价值。

5月29日周四
  1. X:DeepSeek (@deepseek_ai)68

    DeepSeek-R1-0528发布 性能全面升级

    🚀 DeepSeek-R1-0528 现已发布! 🔹 基准测试性能提升 🔹 前端能力增强 🔹 减少幻觉现象 🔹 支持 JSON 输出与函数调用 ✅ 立即试用:https://chat.deepseek.com/ 🔌 API 使用方式不变 — 文档在此:https://api-docs.deepseek.com/guides/reasoning_model 🔗 开源权重:https://huggingface.co/deepseek-ai/DeepSeek-R1-0528

    推荐理由:DeepSeek-R1 的常规迭代,幻觉降低和 JSON 输出是实用改进,但距离代际跃迁还差得远。开源权重直接可用,做推理链产品的团队值得花半小时跑一下。

  2. 公众号:DeepSeek(深度求索)85

    DeepSeek-R1 更新至 0528 版本,推理能力显著增强

    DeepSeek 发布 R1 模型小版本升级 DeepSeek-R1-0528,在数学、编程与通用逻辑等基准测评中取得当前国内所有模型中首屈一指的成绩,整体表现接近 o3 与 Gemini-2.5-Pro。

    推荐理由:后训练投入增加带来的推理提升幅度,为开源社区提供了可蒸馏的高质量思维链,小模型也能接近大模型表现。

5月28日周三
  1. DeepSeek:API 更新日志71

    DeepSeek 将 deepseek-reasoner 升级为 DeepSeek-R1-0528

    DeepSeek 将 deepseek-reasoner 模型升级为 DeepSeek-R1-0528,推理能力显著增强,AIME 2025 得分从 70.0 升至 87.5,GPQA 从 71.5 升至 81.0。新版本优化了 Web 前端开发能力,并极大抑制了老版本 R1 的幻觉问题,同时支持 Json Output 与 Function Calling。

    推荐理由:DeepSeek 把 R1 的推理能力又拉高了一大截,AIME 涨 17 分、Aider 涨 14 分,JSON Output 和 Function Calling 的加入让它在 agent 场景里更实用了,做复杂推理产品的人应该第一时间切过去试试。