Prime Intellect 发布 INTELLECT-2,32B 推理模型通过全球分布式强化学习训练
Prime Intellect 发布 INTELLECT-2,称其为首个通过全球分布式强化学习训练的 32B 参数推理模型,并在数学和编码基准上超过 QwQ-32B。
推荐理由:原文给出分布式异步 RL 的完整基础设施与训练配方细节,并开源模型、代码和数据,读者可以了解去中心化训练的可行路径。
Prime Intellect 发布 INTELLECT-2,称其为首个通过全球分布式强化学习训练的 32B 参数推理模型,并在数学和编码基准上超过 QwQ-32B。
推荐理由:原文给出分布式异步 RL 的完整基础设施与训练配方细节,并开源模型、代码和数据,读者可以了解去中心化训练的可行路径。
Prime Intellect 发布 INTELLECT-2,称其为首个 32B 参数模型的全球无许可去中心化强化学习训练,任何人可贡献异构算力。
推荐理由:官方完整公开了异步 RL 去中心化训练的框架、验证机制与数据过滤细节,读者可以照此评估和复用整套开源组件。
DeepSeek 发布小版本升级 DeepSeek-V3-0324,在数学、代码类评测集上得分超过 GPT-4.5,并增强了前端代码生成、中文写作与联网搜索能力。模型参数约 660B,开源版本上下文长度为 128K,网页端、App 和 API 提供 64K 上下文。权重已开源,采用 MIT License,允许蒸馏训练其他模型。
推荐理由:推理能力提升至超越 GPT-4.5 的同时保持 MIT 开源许可,让低成本部署强推理模型的门槛进一步降低。
DeepSeek-V3 新版已发布,关闭深度思考模式即可体验,模型权重同步开源。
推荐理由:DeepSeek-V3 发布时是开源模型的有力竞争者,但这条一年多前的旧闻如今毫无新意,对关注 AI 动态的你来说,可以直接跳过。
DeepSeek 将 deepseek-chat 模型升级为 DeepSeek-V3-0324,推理能力增强,MMLU-Pro 升至 81.2,AIME 升至 59.4。同时优化了 Web 前端开发、中文写作(对齐 R1 风格)、中文搜索及 Function Calling 准确率,并修复了此前问题。
推荐理由:这是 DeepSeek V3 发布后的一次重要版本更新,推理和代码能力提升显著,AIME 提升近 20 分,前端和中文写作体验优化,API 用户应该尽快切换。
Zyphra 以 Apache 2.0 许可发布 Zonos-v0.1 beta,包含 1.6B transformer 与 1.6B SSM hybrid 两个实时 TTS 模型,后者是首个开源 TTS SSM 模型。
推荐理由:官方发布了模型权重、API 定价和架构细节,读者可以据此评估开源 TTS 与专有模型的差距与可用性。
FireRedTeam 开源工业级 ASR 模型 FireRedASR,支持普通话、中文方言和英文,在公开普通话 ASR 基准上取得 SOTA,并具备歌词识别能力。
推荐理由:原文给出两个模型变体的架构差异和公开基准 CER/WER 对比数字,读者可据此评估选型。
DeepSeek-R1 发布,性能对标 OpenAI o1 正式版。模型遵循 MIT License 开放 API,训练技术同步公开。
推荐理由:虽已是旧闻,但 DeepSeek-R1 作为首个开源对齐 o1 的模型,其训练技术至今仍有参考价值,做推理方向的值得回溯。
DeepSeek 推出新模型 DeepSeek-R1,可通过指定 model=deepseek-reasoner 调用。该模型为推理模型,详细更新与调用指南已分别发布。
推荐理由:R1 的 API 开放让开发者能直接调用推理能力,对需要深度思考的应用是个关键接入点,成本比同类更低。
深度求索正式发布 DeepSeek-V3 模型,性能比肩世界顶尖模型,速度跃升,价格更新。
推荐理由:DeepSeek-V3 是 2024 年底国产模型的一次真正跃迁,首次亮剑就逼近闭源顶尖,开源权重更是直接改变了开发者生态。时隔一年半回头看,它仍是理解 DeepSeek 路径的起点。
Answer.AI 与 LightOn 联合发布 ModernBERT,这是一系列旨在取代 BERT 的 SOTA 编码器模型。该模型将 LLM 的最新架构改进(如 Flash Attention、RoPE)应用于编码器,支持 8192 token 上下文长度(远超传统 BERT 的 512),并在速度和下游任务性能上全面超越旧一代模型。提供 base (149M) 和 large (395M) 两种参数规模,已集成至 Hugging Face Transformers v4.48.0,可直接作为 BERT 类模型的即插即用替代品,适用于 RAG、分类及代码检索等场景。
推荐理由:这是六年来首个真正意义上对 BERT 架构的重大升级,解决了长上下文限制并提升了效率,对依赖编码器的 RAG 和搜索系统开发者具有直接的生产力价值。
DeepSeek 将 deepseek-chat 模型升级为 DeepSeek-V2.5-1210,各项能力提升。数学能力在 MATH-500 基准测试中从 74.8% 提升至 82.8%,代码能力在 LiveCodebench (08.01 - 12.01) 基准测试中从 29.2% 提升至 34.38%。新版本还优化了文件上传和网页总结功能的用户体验。
推荐理由:DeepSeek把deepseek-chat数学拉到82.8%,代码涨了5个点,做复杂推理的开发可以试试水,但这还是V2.5系列的常规升级,别当次代际跃迁。
Prime Intellect 发布 INTELLECT-1,称其为首个全球协作训练的 10B 参数语言模型,基于 Llama-3 架构在 1T token 上训练 42 天,跨五国三洲最多同时使用 112 张 H100。
推荐理由:原文给出分布式训练的关键数字和 PRIME 框架细节,读者可以了解跨洲协作训练 10B 模型的可行性与工程代价。
DeepSeek 上线推理模型预览版,其推理性能与 OpenAI 的 o1-preview 相当,并公开了模型的完整思维链。
推荐理由:虽然已是旧闻,但 DeepSeek 首次公开推理模型完整思维链,对理解 o1 类模型的内部机制是个重要线索,做推理模型研究的值得回看。
Liquid AI 发布第一代 Liquid Foundation Models(LFM),包含 1.3B、3.1B 和 40.3B MoE(激活参数 12B)三个语言模型,官方称在各规模上取得同级领先质量。
推荐理由:官方发布了三档模型的基准数据和内存表现,并说明非开源决定与边缘部署定位,读者可据此评估是否试用。
DeepSeek-V2.5 保留原有 Chat 模型的通用对话能力和 Coder 模型的代码处理能力,并更好地对齐人类偏好。
推荐理由:DeepSeek首次将通用对话与代码能力合一的开源模型,当时直接拉低了多任务成本,今天看仍是模型混合能力演变的早期标杆。
DeepSeek 将 V2 Chat 与 Coder V2 合并升级为 V2.5,API 用户通过 deepseek-coder 或 deepseek-chat 均可访问。新模型在通用与代码能力上显著提升,ArenaHard winrate 升至 76.3%,HumanEval 达 89%。
推荐理由:DeepSeek 把 coder 和 chat 合并成 V2.5,API 端点不变但性能全线拉高,已有的集成直接受益,代码和通用能力不再是两张皮。
DeepSeek 将 deepseek-coder 模型升级为 DeepSeek-Coder-V2-0724。此次升级为模型版本更新,具体参数规模、性能基准及可用性细节未在更新日志中披露。
推荐理由:DeepSeek Coder 升级到 V2-0724,编码能力再进一步,对 API 用户是直接可用的提升,虽然官方没给技术细节,但仍值得关注。
通义 FunAudioLLM 团队开源基于 LLM 的 TTS 系统 Fun-CosyVoice 3.0,官方称在内容一致性、说话人相似度和韵律自然度上超越前代 CosyVoice 2.0,面向零样本多语言语音合成。
推荐理由:官方发布开源 TTS 新版本,附评测表、安装与部署方式,适合关注多语言语音合成落地的开发者参考。
deepseek-chat 模型升级为 DeepSeek-V2-0517,IFEval Benchmark Prompt-Level 准确率从 63.9% 跃升至 77.6%,API 端“system”区域指令跟随能力同步优化,增强沉浸式翻译、RAG 等任务体验。JSON 格式输出准确性提升,内部测试集解析率从 78% 提高至 85%,引入恰当正则表达式后进一步升至 97%。
推荐理由:DeepSeek V2 的指令跟随从及格线拉到优秀线,IFEval 提升近 14 个点,沉浸式翻译和 RAG 体验会有明显改善,做应用层的值得试一下。
Zyphra 发布 7B 基础模型 Zamba,采用 Mamba 块加每 6 层共享权重的全局注意力层的混合架构。
推荐理由:官方原文给出架构设计、训练规模和开放 checkpoints 细节,读者可以据此评估 Mamba 混合架构在本地部署上的取舍。