跳到正文
北京时间

模型发布

新模型的发布、开源与迭代:大模型厂商的旗舰更新、开源权重放出、性能与价格变化的第一时间记录。

710条精选相关主题产品更新论文研究开源生态

最新精选

第 681–700 条 · 共 710 条
5月28日周三
  1. DeepSeek:API 更新日志71

    DeepSeek 将 deepseek-reasoner 升级为 DeepSeek-R1-0528

    DeepSeek 将 deepseek-reasoner 模型升级为 DeepSeek-R1-0528,推理能力显著增强,AIME 2025 得分从 70.0 升至 87.5,GPQA 从 71.5 升至 81.0。新版本优化了 Web 前端开发能力,并极大抑制了老版本 R1 的幻觉问题,同时支持 Json Output 与 Function Calling。

    推荐理由:DeepSeek 把 R1 的推理能力又拉高了一大截,AIME 涨 17 分、Aider 涨 14 分,JSON Output 和 Function Calling 的加入让它在 agent 场景里更实用了,做复杂推理产品的人应该第一时间切过去试试。

5月20日周二
5月11日周日
  1. Prime Intellect(网页)67

    Prime Intellect 发布 INTELLECT-2,32B 推理模型通过全球分布式强化学习训练

    Prime Intellect 发布 INTELLECT-2,称其为首个通过全球分布式强化学习训练的 32B 参数推理模型,并在数学和编码基准上超过 QwQ-32B。

    推荐理由:原文给出分布式异步 RL 的完整基础设施与训练配方细节,并开源模型、代码和数据,读者可以了解去中心化训练的可行路径。

5月6日周二
4月15日周二
  1. Prime Intellect(网页)63

    Prime Intellect 发布 INTELLECT-2:32B 参数模型的全球去中心化强化学习训练

    Prime Intellect 发布 INTELLECT-2,称其为首个 32B 参数模型的全球无许可去中心化强化学习训练,任何人可贡献异构算力。

    推荐理由:官方完整公开了异步 RL 去中心化训练的框架、验证机制与数据过滤细节,读者可以照此评估和复用整套开源组件。

3月25日周二
  1. 公众号:DeepSeek(深度求索)74

    DeepSeek-V3-0324 发布:推理、代码与中文写作能力全面升级

    DeepSeek 发布小版本升级 DeepSeek-V3-0324,在数学、代码类评测集上得分超过 GPT-4.5,并增强了前端代码生成、中文写作与联网搜索能力。模型参数约 660B,开源版本上下文长度为 128K,网页端、App 和 API 提供 64K 上下文。权重已开源,采用 MIT License,允许蒸馏训练其他模型。

    推荐理由:推理能力提升至超越 GPT-4.5 的同时保持 MIT 开源许可,让低成本部署强推理模型的门槛进一步降低。

3月24日周一
  1. DeepSeek:API 更新日志72

    DeepSeek 将 deepseek-chat 升级为 DeepSeek-V3-0324

    DeepSeek 将 deepseek-chat 模型升级为 DeepSeek-V3-0324,推理能力增强,MMLU-Pro 升至 81.2,AIME 升至 59.4。同时优化了 Web 前端开发、中文写作(对齐 R1 风格)、中文搜索及 Function Calling 准确率,并修复了此前问题。

    推荐理由:这是 DeepSeek V3 发布后的一次重要版本更新,推理和代码能力提升显著,AIME 提升近 20 分,前端和中文写作体验优化,API 用户应该尽快切换。

3月21日周五
  1. Jim Fan

    NVIDIA 发布世界首个开源人形机器人基础模型 GR00T N1,仅 2B 参数,采用 VLM 加 Diffusion Transformer 架构实现端到端控制。模型基于真实遥操作、30 万+仿真轨迹及合成神经轨迹训练,在 GR1、1X Neo 等机器人上任务性能提升 30%,并可跨具身部署至百元级开源机械臂。

    引用Jim Fan@DrJimFan

    激动地宣布 GR00T N1,全球首个面向人形机器人的开放基础模型!我们的使命是让物理 AI 走向大众。通用机器人大脑的力量,尽在掌中——仅有 2B 参数,N1 从迄今汇编的最多样化物理动作数据集中学习,以小博大: - 真实人形遥操作数据。 - 大规模仿真数据:我们开源 300K+ 轨迹! - 神经轨迹:我们应用 SOTA 视频生成模型来“幻觉”出新的合成数据,其像素级特征具备准确的物理特性。用 Jensen 的话说,“系统性地无限数据”! - 潜在动作:我们开发新颖算法,从野外人类视频和神经生成视频中提取动作 token。 GR00T N1 是一个单一的端到端神经网络,从光子到动作: - 视觉-语言模型(系统 2)通过视觉和语言指令解读物理世界,使机器人能够对其环境和指令进行推理,并规划正确的动作。 - 扩散 Transformer(系统 1)以 120 Hz“渲染”平滑而精确的运动动作,执行系统 2 制定的潜在计划。 我们将 N1 部署在 GR1 机器人、1X Neo 机器人以及大量仿真基准上。N1 在家庭和工业环境中的多样化操作任务上实现了高达 +30% 的提升。 虽然人形机器人是 N1 的主要焦点,但我们的模型也支持跨具身。我们对其微调,使其能在价值 $110 的 HuggingFace LeRobot SO100 机械臂上工作!开放机器人大脑运行在开放硬件上。听起来正合适。 让我们一起解决机器人技术,一次一个 token。 我们的白皮书、Github 仓库、HuggingFace 模型和开放数据集页面的链接在帖子串中:🧵

    推荐理由:NVIDIA开源首个通用人形机器人基础模型GR00T N1,2B参数可部署于百元级机械臂

2月19日周三
  1. xAI:News(网页)

    Grok 3 Beta 发布:推理智能体时代来临

    Grok 3 Beta 正式发布,开启"推理智能体"时代。新版本强化深度推理与自主决策能力,支持复杂任务拆解和多步逻辑链处理,在数学、编程等推理密集型场景表现显著提升,标志着 AI 从简单问答向自主推理决策的范式转变。

    推荐理由:xAI发布Grok 3 Beta,主打推理智能体能力

2月10日周一
  1. Zyphra Research(网页)71

    Zyphra 发布 Zonos-v0.1 beta 开源 TTS 模型

    Zyphra 以 Apache 2.0 许可发布 Zonos-v0.1 beta,包含 1.6B transformer 与 1.6B SSM hybrid 两个实时 TTS 模型,后者是首个开源 TTS SSM 模型。

    推荐理由:官方发布了模型权重、API 定价和架构细节,读者可以据此评估开源 TTS 与专有模型的差距与可用性。

1月24日周五
1月20日周一
  1. DeepSeek:API 更新日志73

    DeepSeek 发布 deepseek-reasoner 推理模型

    DeepSeek 推出新模型 DeepSeek-R1,可通过指定 model=deepseek-reasoner 调用。该模型为推理模型,详细更新与调用指南已分别发布。

    推荐理由:R1 的 API 开放让开发者能直接调用推理能力,对需要深度思考的应用是个关键接入点,成本比同类更低。

12月26日周四
  1. 公众号:DeepSeek(深度求索)67

    DeepSeek-V3 正式发布

    深度求索正式发布 DeepSeek-V3 模型,性能比肩世界顶尖模型,速度跃升,价格更新。

    推荐理由:DeepSeek-V3 是 2024 年底国产模型的一次真正跃迁,首次亮剑就逼近闭源顶尖,开源权重更是直接改变了开发者生态。时隔一年半回头看,它仍是理解 DeepSeek 路径的起点。

12月19日周四
  1. Answer.AI 官方研发博客(RSS)82

    Answer.AI 发布 ModernBERT:替代 BERT 的新一代编码器模型

    Answer.AI 与 LightOn 联合发布 ModernBERT,这是一系列旨在取代 BERT 的 SOTA 编码器模型。该模型将 LLM 的最新架构改进(如 Flash Attention、RoPE)应用于编码器,支持 8192 token 上下文长度(远超传统 BERT 的 512),并在速度和下游任务性能上全面超越旧一代模型。提供 base (149M) 和 large (395M) 两种参数规模,已集成至 Hugging Face Transformers v4.48.0,可直接作为 BERT 类模型的即插即用替代品,适用于 RAG、分类及代码检索等场景。

    推荐理由:这是六年来首个真正意义上对 BERT 架构的重大升级,解决了长上下文限制并提升了效率,对依赖编码器的 RAG 和搜索系统开发者具有直接的生产力价值。

12月13日周五
12月10日周二
  1. DeepSeek:API 更新日志67

    DeepSeek 将 deepseek-chat 升级为 DeepSeek-V2.5-1210

    DeepSeek 将 deepseek-chat 模型升级为 DeepSeek-V2.5-1210,各项能力提升。数学能力在 MATH-500 基准测试中从 74.8% 提升至 82.8%,代码能力在 LiveCodebench (08.01 - 12.01) 基准测试中从 29.2% 提升至 34.38%。新版本还优化了文件上传和网页总结功能的用户体验。

    推荐理由:DeepSeek把deepseek-chat数学拉到82.8%,代码涨了5个点,做复杂推理的开发可以试试水,但这还是V2.5系列的常规升级,别当次代际跃迁。

11月29日周五
  1. Prime Intellect(网页)67

    Prime Intellect 发布 INTELLECT-1:首个全球分布式训练的 10B 参数模型

    Prime Intellect 发布 INTELLECT-1,称其为首个全球协作训练的 10B 参数语言模型,基于 Llama-3 架构在 1T token 上训练 42 天,跨五国三洲最多同时使用 112 张 H100。

    推荐理由:原文给出分布式训练的关键数字和 PRIME 框架细节,读者可以了解跨洲协作训练 10B 模型的可行性与工程代价。