Prime Intellect 发布 INTELLECT-2:32B 参数模型的全球去中心化强化学习训练
Prime Intellect 发布 INTELLECT-2,称其为首个 32B 参数模型的全球无许可去中心化强化学习训练,任何人可贡献异构算力。
推荐理由:官方完整公开了异步 RL 去中心化训练的框架、验证机制与数据过滤细节,读者可以照此评估和复用整套开源组件。
开源模型、框架与仓库动态:权重开放、社区项目爆火、开源与闭源的力量消长。
Prime Intellect 发布 INTELLECT-2,称其为首个 32B 参数模型的全球无许可去中心化强化学习训练,任何人可贡献异构算力。
推荐理由:官方完整公开了异步 RL 去中心化训练的框架、验证机制与数据过滤细节,读者可以照此评估和复用整套开源组件。
DeepSeek 发布小版本升级 DeepSeek-V3-0324,在数学、代码类评测集上得分超过 GPT-4.5,并增强了前端代码生成、中文写作与联网搜索能力。模型参数约 660B,开源版本上下文长度为 128K,网页端、App 和 API 提供 64K 上下文。权重已开源,采用 MIT License,允许蒸馏训练其他模型。
推荐理由:推理能力提升至超越 GPT-4.5 的同时保持 MIT 开源许可,让低成本部署强推理模型的门槛进一步降低。
DeepSeek-V3 新版已发布,关闭深度思考模式即可体验,模型权重同步开源。
推荐理由:DeepSeek-V3 发布时是开源模型的有力竞争者,但这条一年多前的旧闻如今毫无新意,对关注 AI 动态的你来说,可以直接跳过。
激动地宣布 GR00T N1,全球首个面向人形机器人的开放基础模型!我们的使命是让物理 AI 走向大众。通用机器人大脑的力量,尽在掌中——仅有 2B 参数,N1 从迄今汇编的最多样化物理动作数据集中学习,以小博大: - 真实人形遥操作数据。 - 大规模仿真数据:我们开源 300K+ 轨迹! - 神经轨迹:我们应用 SOTA 视频生成模型来“幻觉”出新的合成数据,其像素级特征具备准确的物理特性。用 Jensen 的话说,“系统性地无限数据”! - 潜在动作:我们开发新颖算法,从野外人类视频和神经生成视频中提取动作 token。 GR00T N1 是一个单一的端到端神经网络,从光子到动作: - 视觉-语言模型(系统 2)通过视觉和语言指令解读物理世界,使机器人能够对其环境和指令进行推理,并规划正确的动作。 - 扩散 Transformer(系统 1)以 120 Hz“渲染”平滑而精确的运动动作,执行系统 2 制定的潜在计划。 我们将 N1 部署在 GR1 机器人、1X Neo 机器人以及大量仿真基准上。N1 在家庭和工业环境中的多样化操作任务上实现了高达 +30% 的提升。 虽然人形机器人是 N1 的主要焦点,但我们的模型也支持跨具身。我们对其微调,使其能在价值 $110 的 HuggingFace LeRobot SO100 机械臂上工作!开放机器人大脑运行在开放硬件上。听起来正合适。 让我们一起解决机器人技术,一次一个 token。 我们的白皮书、Github 仓库、HuggingFace 模型和开放数据集页面的链接在帖子串中:🧵
推荐理由:NVIDIA开源首个通用人形机器人基础模型GR00T N1,2B参数可部署于百元级机械臂
Zyphra 以 Apache 2.0 许可发布 Zonos-v0.1 beta,包含 1.6B transformer 与 1.6B SSM hybrid 两个实时 TTS 模型,后者是首个开源 TTS SSM 模型。
推荐理由:官方发布了模型权重、API 定价和架构细节,读者可以据此评估开源 TTS 与专有模型的差距与可用性。
ARC Prize 发布对 DeepSeek R1-Zero 和 R1 的分析,两者在 ARC-AGI-1 上分别得分 14% 和 15.8%,与 o1(低算力 20.5%)相当,而 o3-preview 低算力达 75.7%。
推荐理由:作者基于 ARC-AGI-1 实测数据比较 R1-Zero 与 o1/o3,提出纯 RL 训练可绕过人类标注瓶颈和推理经济学两个分析角度。
FireRedTeam 开源工业级 ASR 模型 FireRedASR,支持普通话、中文方言和英文,在公开普通话 ASR 基准上取得 SOTA,并具备歌词识别能力。
推荐理由:原文给出两个模型变体的架构差异和公开基准 CER/WER 对比数字,读者可据此评估选型。
深度求索正式发布 DeepSeek-V3 模型,性能比肩世界顶尖模型,速度跃升,价格更新。
推荐理由:DeepSeek-V3 是 2024 年底国产模型的一次真正跃迁,首次亮剑就逼近闭源顶尖,开源权重更是直接改变了开发者生态。时隔一年半回头看,它仍是理解 DeepSeek 路径的起点。
Answer.AI 与 LightOn 联合发布 ModernBERT,这是一系列旨在取代 BERT 的 SOTA 编码器模型。该模型将 LLM 的最新架构改进(如 Flash Attention、RoPE)应用于编码器,支持 8192 token 上下文长度(远超传统 BERT 的 512),并在速度和下游任务性能上全面超越旧一代模型。提供 base (149M) 和 large (395M) 两种参数规模,已集成至 Hugging Face Transformers v4.48.0,可直接作为 BERT 类模型的即插即用替代品,适用于 RAG、分类及代码检索等场景。
推荐理由:这是六年来首个真正意义上对 BERT 架构的重大升级,解决了长上下文限制并提升了效率,对依赖编码器的 RAG 和搜索系统开发者具有直接的生产力价值。
ARC Prize 官方公布 2024 年获奖者并发布技术报告,共 1,430 支队伍提交 17,789 个方案,ARC-AGI-1 SOTA 从 33% 升至 55.5%,但 100 万美元大奖无人认领。
推荐理由:官方技术报告给出完整获奖方案与三类新方法总结,读者可以据此了解 ARC-AGI 分数提升背后的具体技术路线。
Prime Intellect 发布 INTELLECT-1,称其为首个全球协作训练的 10B 参数语言模型,基于 Llama-3 架构在 1T token 上训练 42 天,跨五国三洲最多同时使用 112 张 H100。
推荐理由:原文给出分布式训练的关键数字和 PRIME 框架细节,读者可以了解跨洲协作训练 10B 模型的可行性与工程代价。
ARC Prize 团队于 2024 年 10 月 24 日举办线上活动,说明为何单靠深度学习难以攻克 ARC-AGI,并提出结合深度学习与程序合成的技术路线。
推荐理由:Chollet 和 Knoop 系统论述 LLM 局限于记忆技能、需结合程序合成才能胜出 ARC-AGI 的技术路径,为理解智能与抽象层次提供了可迁移的分析框架。
DeepSeek-V2.5 保留原有 Chat 模型的通用对话能力和 Coder 模型的代码处理能力,并更好地对齐人类偏好。
推荐理由:DeepSeek首次将通用对话与代码能力合一的开源模型,当时直接拉低了多任务成本,今天看仍是模型混合能力演变的早期标杆。
通义 FunAudioLLM 团队开源基于 LLM 的 TTS 系统 Fun-CosyVoice 3.0,官方称在内容一致性、说话人相似度和韵律自然度上超越前代 CosyVoice 2.0,面向零样本多语言语音合成。
推荐理由:官方发布开源 TTS 新版本,附评测表、安装与部署方式,适合关注多语言语音合成落地的开发者参考。
SenseVoice 是一个语音理解基础模型,支持 ASR、语种识别、语音情感识别和音频事件检测。发布的 SenseVoiceSmall 检查点支持普通话、粤语、英语、日语和韩语,并输出情感与事件标签;采用非自回归端到端架构,同参数量级下推理速度比 Whisper-Small 快 5 倍以上、比 Whisper-Large 快 15 倍以上。
推荐理由:官方仓库文档同时给出基准对比、部署路径和微调方案,读者可以据此评估 SenseVoice 在中英文语音识别场景的可用性。
ARC Prize 官方宣布启动一项总奖池超过 $1,000,000 的竞赛,目标是击败 ARC-AGI 评测并开源解决方案,由 Mike Knoop 和 François Chollet 主办。ARC-AGI 于 2019 年推出,当前 SOTA 仅约 34%,对人类容易但现代 AI 极难。官方认为 LLM 依赖记忆而非真正推理,希望通过激励开源研究提升新想法的产生速度。
推荐理由:官方说明了设奖动机和 ARC-AGI 为何未被刷分,读者可以了解百万美元奖金背后的开源 AGI 主张。
Zyphra 发布 7B 基础模型 Zamba,采用 Mamba 块加每 6 层共享权重的全局注意力层的混合架构。
推荐理由:官方原文给出架构设计、训练规模和开放 checkpoints 细节,读者可以据此评估 Mamba 混合架构在本地部署上的取舍。