跳到正文
北京时间
原文
Latent Space·· 4 小时前精选AI 评分66

Reflection 发布 501B-A23B 开源编码模型 Beam

[AINews] Reflection Beam - 501B-A23B American Open Model

AI 导读

Reflection 发布文本-only 的 501B 总参数 / 23B 激活 MoE 模型 Beam,面向编码、智能体和科学任务,从零训练,完整权重将在本月以 Apache 2.0 发布。

推荐理由

汇总了 Reflection Beam 的训练规模、基准成绩与第三方独立评价,读者可借此了解美国开源模型与中文模型的实际差距。

正文 · AI 翻译

自从 Reflection 与我们一同启动 并怀揣着在编码方面的宏大目标(还暗示了 他们的强化学习方法)以来,已经过去了一年多:

但他们保持“隐身”状态的时间比 Thinking Machines 更长,而且不清楚我们是否真能等到他们发布模型,因为更广泛的开放模型生态并没有为他们放慢哪怕一大步。不过,我们确实等到了:

他们将自己与 Inkling、Nemotron 和 GLM 5.2 进行比较,但 SOTA 级别的 GLM 5.3、Kimi K3、Qwen 3.8 Max 和 DeepSeek V4.1 Flash 总体上更胜一筹。不过,由于这是美国从零开始训练的,市场上有一部分人一直在热切期待这里有更多选择,更重要的是,Reflection 现已宣布自己作为一个功能性新实验室正式登场!

2026 年 10 月 3 日至 2026 年 10 月 5 日的 AI 新闻。我们检查了 12 个 subreddit、544 个 Twitter 账号,没有进一步检查 Discord。AINews 的网站 让你可以搜索所有过往期刊。提醒一下,AINews 现在是 Latent Space 的一个板块。你可以 选择接收/不接收 不同频率的邮件!


AI Twitter 回顾

Reflection 的 Beam 引领一波开放权重发布潮

  • Beam 发布:Reflection 发布了 Beam,这是一个纯文本的 501B 总参数 / 23B 激活参数的 MoE 模型,面向编码、智能体和科学工作。它是从零开始训练的,完整的 Apache 2.0 权重将于本月发布(公告,Laskin)。

    • 训练规模:团队帖子提到 23.8T 预训练 token,部分来自对数亿份 PDF 的 OCR 流水线(数据负责人)。他们还描述了在 10K 块 GB300 上进行的稳定 RL/OPD 运行,在约 100 万个任务上完成了超过 1 亿次 rollout(Damos)。

    • 声称的结果:对 Reflection 声称结果的总结显示,SWE-bench Verified 上得分为 80.9,推理效率是 GLM 5.2 的 3–4 倍,并且在约 10,500 块 GB300 上分别进行了四周的预训练和 RL(总结)。技术报告和 OSS 集成也已承诺发布(Polozov)。

    • 背景:Axios 提前报道了这次发布。报道称 Reflection 每月为 Colossus 计算支付 1.5 亿美元,外加一笔 10 亿美元的 Nebius 交易,并且其他未具名的美国实验室将在本月发布开放模型(Curran)。

  • 独立与批判性解读:Artificial Analysis 已提前获得访问权限,并预计 Beam 将跻身其智能水平下最 token 高效的开放模型之列(AA)。

    • MFU 与架构:Elie Bakouch 估计预训练中 BF16 MFU 仅约 12%。他将该架构解读为 3:1 交错的全局/滑动窗口注意力,并指出其留出代码困惑度优于 DSv4(分析)。

    • 计算对比:Teortaxes 称 Beam 是对 DeepSeek V3 的等 FLOP 复现(帖子)。他推断在 4 周内约有 13 亿个 RL 沙盒,同时最多有 17 万个在运行(沙盒)。

    • 定位:观察者将 Beam 定位在 GLM-5.2 水平附近(iScienceLuvr),并在某些基准上低于 DSv4 Flash(批评)。Nathan Lambert 将其与 Nvidia 和 Thinking Machines 归为一类,认为它们是仍然落后于中国同行的美国强力发布(Lambert)。

  • 其他开放与专用模型:

    • Aleph Alpha Kolibri:总计 78B / 激活 3.46B,Apache 2.0,专为德语和英语打造。自报分数为 96.9% AIME 2025、84.3% GPQA Diamond 和 66.4% SWE-Bench Verified(摘要)。数据集未发布,智能体评测远低于 Qwen(Jitsev)。

    • Reka Rho-1:一个 19B 全模态模型,能够理解并生成文本、图像、视频和机器人动作,在 320 块 H100 上从零开始训练约 3 个月(公告,算力)。

    • 决策模型:Command Code 的 Agr(31B)和 Agr-flash(360M)跳过文本生成,返回带各选项概率的类型化值,用于工具调用和路由(Agr)。SemiAnalysis 解释说,TypeSafe 的 Jev 采用同样的无解码方法,主要在路由角色中取代前沿模型(解读)。

    • 较小规模发布:Upstage 的 Solar Mini 4(35B / 激活 3B,512K 上下文)在 Nous Portal 上免费两周(Nous)。Eleven v4 Turbo 以 v4 一半的价格登顶 AA 的 Provider Voice TTS 竞技场(AA)。

OpenAI vs Anthropic:订阅价值、速度与评测

  • SemiAnalysis 极限测试:SemiAnalysis 测试了 Anthropic、OpenAI、Meta、SpaceXAI、MiniMax、Moonshot、Cursor、Cognition 等公司的套餐。发现 Claude 订阅提供的 API 等效价值是 OpenAI 套餐的 5 倍以上(报告)。

    • 方法论:价值取决于每个模型和 token 类型的额度成本,而非 API 标价(帖子)。

    • 任务成本调整:按任务成本调整后,Claude 的优势缩小至 1.3–2.9 倍(scaling01)。

    • 未经证实的算力估算:一位分析师声称,Anthropic 将 42% 的推理算力花在仅贡献约 10% 收入的订阅上(图表)。

  • OpenAI 容量紧张:用户报告称,新的 200 美元注册被暂停,各套餐的使用限制实际上被减半。GPT-6.1 Sol 被定位为高效替代方案(分析)。Theo 描述了 7 月至 9 月间编码模型偏好的逆转(帖子)。

    • OpenAI 回应:Codex 负责人 Tibo 承诺连续 28 天每天带来有意义的改进或完全重置(承诺)。

    • 第 1 天提速:GPT-6 Astra 和 GPT-6.1 Sol 的默认速度提升约 50%,从约 30 TPS 升至约 50 TPS。该变更覆盖所有订阅界面以及 Sign in with ChatGPT 合作伙伴,如 OpenCode、Pi、Amp 和 Devin(第 1 天,TPS)。

    • 摩擦:存储的 Codex 重置额度到期时未做时区调整(报告)。常驻 dots 智能体仅限 100 美元以上的 Pro 套餐(批评)。

    • 企业需求(据报道):The Information 报道称,微软将内部 Anthropic 的预计支出削减了三分之一以上。还报道称,Meta 的 Claude Code 用户从约 6 万降至约 3 万,主要原因是推动使用 Meta 自家工具(摘要)。

  • 排行榜:

    • Agent Arena:Anthropic 在 Code、Work 和 Chat 中均位列第 1。Fable 5.1 领跑 Code 和 Work,而 GPT-6 Astra 在 Code 中排名第 2(Arena)。

    • Design Arena:GPT-6 Astra 在 3D Design、Frontend、Full Stack 和 Image-to-HTML 中均位列第 1(Design Arena)。

    • 幻觉:在 AA-Omniscience 上,Gemini 4 Argon 对不知道的问题猜错的比例为 15%,而排名第二的模型为 29%。GPT-6 Astra 的准确率最高,达到 61%(数据)。

智能体框架、强化学习环境与开发者工具

  • 多框架强化学习(Hugging Face):一个捕获代理支持 OpenAI Chat、OpenAI Responses、Anthropic 和 Gemini 格式。它将调用转发给 vLLM,并为 TRL 记录精确的 token ID 和 logprobs,从而使 10 个未经修改的框架变成强化学习环境(Delangue,说明)。

    • 结果:相同的权重在 Mini-SWE-Agent 下得分为 62%,在 Claude Code 下为 33%。在 4 个框架上训练 LFM2.5-2.6B 将首次尝试解决率从 42% 提升到 54%,而工具调用奖励使调用次数减少 31%。在 3,189 条 rollout 上进行 SFT 后停滞在 47.5%。

    • 注意事项:该运行仅使用了一个任务族和一个随机种子。

    • 环境托管:强化学习环境现在像数据集一样在 HF Hub 上托管并进行版本管理(博客)。

  • Pi Durable:Earendil 的框架围绕一个小型基于任务的工作流引擎构建,因此长时间运行、多玩家的智能体可以在任何地方暂停和恢复(Pi)。

    • 设计:核心是约 15K 行 TypeScript,使用 SQLite/JSONL 存储,运行在 Bun 或 Cloudflare Durable Objects 上。控制与执行环境分离(评论)。

    • Effect.ts:作者解释说他们跳过了 Effect,因为它不提供持久性(Zechner)。

  • 智能体记忆:Cognition 推出了 Devin“Dreaming”,它在夜间修剪并链接记忆图。它将以 git 和 markdown 为后端的格式开源为 Agent Memory Repo(发布,格式)。

  • Cursor SDK:此次更新增加了运行中引导、向父级汇报的后台子智能体、可替换的系统提示,以及自定义工具上的 MCP readOnlyHint 和 destructiveHint 注解(引导,注解)。

  • DeepSeek Harness:v0.2.1-alpha.1 中一个实验性的 Claude Code Mods 兼容层,用于测试 DSH 的“一切皆插件”架构是否是 Claude Code 扩展点的超集(团队帖子)。

  • 路由与访问:

    • Cline:其 Pareto 26.10 Preview 在多个模型间路由并对答案评分,声称在相同 DeepSWE 分数下每任务花费 $0.24,而对比方案为 $13.41(Cline)。Cline 还因滥用而暂停了其免费的 DeepSeek-V4.1-Flash 推广活动(通知)。

    • ChatGPT:自定义 MCP 服务器不再需要开发者模式(帖子)。

智能体与训练研究

  • 验证优于采样:

    • NVIDIA mid-harness:该方法采样候选 shell 命令,并在运行其中一个之前对其进行验证。一个 GPT-5.6 Sol 验证器在 8 个动作中进行选择,将 TerminalBench-Lite Pass@1 从 50% 提升到 68%,而弱验证器几乎没有增益(摘要)。

    • Google VeriHarness:该方法对所有 rollout 都一致同意的声明提出质疑,并依据工作区证据解决分歧。它在 Gemini 3.5 Flash 上增加 +6.2 分,在 Opus 4.8 上增加 +6.4 分,并发布了约 26K 条 rollout(摘要)。

  • 上下文管理:

    • UT Austin 压缩研究:在约 3.5 万次运行中,使用三分之一 token 的压缩可能比完整上下文慢 20–80%。阈值触发优于步数触发,且最佳策略因模型而异(摘要)。

    • PAIR:该方法从同一状态重放智能体,以隔离有害的压缩。随后它重写压缩提示词,性能接近无压缩水平(论文)。

    • CorpusMap:为文档集合预计算实体页面,可将答案质量提升 6.4–11.7 分,同时减少 34–57% 的输入 token(论文)。

  • 自我改进的 harness:

    • SelfSearch:该方法声称在 Terminal-Bench 2.1 上使用 DeepSeek V4 Flash 达到 82.0%,与 Codex 持平,搜索成本为 4.03 美元(论文)。

    • EverMind Raven:其进化出的研究 harness 在 BrowseComp 上达到 69.3%(论文)。

  • 优化与架构:

    • Dust:一种使用激活扰动“虚拟种群”方法的零阶方法,在 transformer 预训练中接近、有时甚至超过反向传播。它声称比 EGGROLL 的计算效率高 1,000–10,000 倍(讨论串)。

    • LOOM:循环 MoE 在 9–12 次循环下可稳定训练,而在等 FLOP 下,700M 模型在 5 次循环时表现最佳(讨论串)。

    • ImageNet 上的策略梯度:Ian Osband 展示精确策略梯度在 ImageNet 上达到 4%,而交叉熵为 62%,并主张 RL 损失的失败不仅仅是探索问题(帖子)。

    • RL 动力学:Base Labs 发现 RL 更新的低秩程度低于此前声称(rollout)。Datalab 报告称,在温度 0 下,仅 RL 即可消除工具调用循环,而 SFT 的循环率为 92%(文章)。

  • AI for science:Vals AI 报告称,90 多个 Opus 5.5 智能体在 3 天内运行了 DFT 模拟,并标记出两个室温磁性半导体候选材料,其中一个早在 1999 年就已被合成。这些结果仅为预测,并附有公开账本(讨论串,注意事项)。

  • 智能体支出:Epoch 估算,OpenAI 研究人员的编码智能体支出按 API 价格计算,大约每月翻一番。到 8 月中旬,中位数研究人员约为每天 600 美元(Epoch)。

推理系统与硬件

  • OpenRouter 定价扭曲:Horace He 展示 GLM 5.3 在 inference.net 上输入定价为 0.08 美元/百万 token,但输出为 5.00 美元/百万 token。他将此归因于 OpenRouter 的平方反比价格路由,以及对输入价格的明显过度加权(讨论串,路由)。

  • llama.cpp:

    • Metal 上的投机解码:新内核使投机解码在 M3 Ultra 上比普通解码快至多 3.4 倍(110 对 32.1 tok/s)(qvac)。

    • v0.6.0:新增 Clef 文本与视觉支持、Qwen3.8-Flash-Next,以及新的 llama_batch_ext API(Gerganov)。

  • 智能体内核工作:Baseten 报告称,一个在一周内主要由自主智能体工作构建的引擎,解码速度比开源基线快 90%,TTFT 低 57%(博客)。

  • 通信:NCCL 和 PyTorch 对称内存加速了中小规模集合通信(Bekman)。

  • 中国加速器:阿里巴巴平头哥的振武 V900 拥有 216 GB 内存和 1,200 GB/s 互连,声称是 M890 的 3 倍,将于 2027 年第一季度出货(SemiAnalysis)。

安全、政策与产业

  • OpenAI 文本水印:根据《人工智能法案》,OpenAI 将在欧盟为符合条件的 ChatGPT 和 Codex 文本添加不可见的统计水印,并在全球范围内提供可选的 API 开关(公告)。

    • 局限:改写或翻译会移除水印,且只有经批准的研究人员才能获得检测器(局限)。

    • 鲁棒性数据:一项被引用的测试显示,25% 的同义词替换使检测率从约 92% 降至 17%(批评)。

  • 智能体事件与安全治理:

    • Bengio 评论文章:在《金融时报》上,Bengio 认为近期的智能体黑客攻击不仅仅是沙箱问题(评论文章)。他还引用了昆尼皮亚克大学的一项民意调查,其中 86% 的人支持独立的安全标准(民调)。

    • HF 事件:Neel Nanda 称 OpenAI x Hugging Face 事件是迄今为止最引人注目的对齐失败(Nanda)。

    • 系统安全:Ryan Lowe 呼吁在实验室中采用核工业式的分层系统安全(Lowe)。

    • 关机抵抗:OpenAI 的一篇对齐文章记录了一位研究人员所称的迄今为止最逼真的关机抵抗前兆行为(链接)。

  • 政策声音:

    • 自主武器:前 OpenAI 研究员 Joshua Achiam 呼吁像禁止化学武器一样禁止某些自主武器(帖子)。他将以研究员身份加入 IFP 和 FAI(公告)。

    • 专家调查:由 250 多名专家组成的 LEAP 小组最支持建立一个有美中两国成员、拥有发布前授权权力的国际机构,并反对联邦优先权(FRI)。

    • Altman 谈权衡:Sam Altman 对 Politico 表示,“世界应该接受一些坏事发生”以换取这项技术的好处(Politico)。

  • 中国的算力获取:

    • 腾讯租赁(据报道):据《金融时报》报道,腾讯在甲骨文的东南亚数据中心租赁了约 10 万块先进芯片,五年费用约 70 亿美元(摘要)。

    • 走私指控:美国检察官指控一家加州经销商向中国走私价值超过 3 亿美元的 GPU 服务器(报道)。

  • 整合:

    • AMD 与 World Labs(据报道):据报道,AMD 以 82 亿美元收购了 World Labs(DL Weekly)。

    • NVIDIA 中立性:SemiAnalysis 在 NVIDIA 收购 SchedMD/SLURM 和 Hugging Face 后质疑其硬件中立性(SemiAnalysis)。

热门推文(按互动量)


AI Reddit 回顾

/r/LocalLlama + /r/localLLM 回顾

1. 极端规模下的本地 LLM 硬件

阅读更多

来源:Latent Space · latent.space