Reflection 发布 501B-A23B 开源编码模型 Beam
[AINews] Reflection Beam - 501B-A23B American Open Model
Reflection 发布文本-only 的 501B 总参数 / 23B 激活 MoE 模型 Beam,面向编码、智能体和科学任务,从零训练,完整权重将在本月以 Apache 2.0 发布。
汇总了 Reflection Beam 的训练规模、基准成绩与第三方独立评价,读者可借此了解美国开源模型与中文模型的实际差距。
自从 Reflection 与我们一同启动 并怀揣着在编码方面的宏大目标(还暗示了 他们的强化学习方法)以来,已经过去了一年多:
但他们保持“隐身”状态的时间比 Thinking Machines 更长,而且不清楚我们是否真能等到他们发布模型,因为更广泛的开放模型生态并没有为他们放慢哪怕一大步。不过,我们确实等到了:
他们将自己与 Inkling、Nemotron 和 GLM 5.2 进行比较,但 SOTA 级别的 GLM 5.3、Kimi K3、Qwen 3.8 Max 和 DeepSeek V4.1 Flash 总体上更胜一筹。不过,由于这是美国从零开始训练的,市场上有一部分人一直在热切期待这里有更多选择,更重要的是,Reflection 现已宣布自己作为一个功能性新实验室正式登场!
2026 年 10 月 3 日至 2026 年 10 月 5 日的 AI 新闻。我们检查了 12 个 subreddit、544 个 Twitter 账号,没有进一步检查 Discord。AINews 的网站 让你可以搜索所有过往期刊。提醒一下,AINews 现在是 Latent Space 的一个板块。你可以 选择接收/不接收 不同频率的邮件!
AI Twitter 回顾
Reflection 的 Beam 引领一波开放权重发布潮
Beam 发布:Reflection 发布了 Beam,这是一个纯文本的 501B 总参数 / 23B 激活参数的 MoE 模型,面向编码、智能体和科学工作。它是从零开始训练的,完整的 Apache 2.0 权重将于本月发布(公告,Laskin)。
训练规模:团队帖子提到 23.8T 预训练 token,部分来自对数亿份 PDF 的 OCR 流水线(数据负责人)。他们还描述了在 10K 块 GB300 上进行的稳定 RL/OPD 运行,在约 100 万个任务上完成了超过 1 亿次 rollout(Damos)。
声称的结果:对 Reflection 声称结果的总结显示,SWE-bench Verified 上得分为 80.9,推理效率是 GLM 5.2 的 3–4 倍,并且在约 10,500 块 GB300 上分别进行了四周的预训练和 RL(总结)。技术报告和 OSS 集成也已承诺发布(Polozov)。
背景:Axios 提前报道了这次发布。报道称 Reflection 每月为 Colossus 计算支付 1.5 亿美元,外加一笔 10 亿美元的 Nebius 交易,并且其他未具名的美国实验室将在本月发布开放模型(Curran)。
独立与批判性解读:Artificial Analysis 已提前获得访问权限,并预计 Beam 将跻身其智能水平下最 token 高效的开放模型之列(AA)。
MFU 与架构:Elie Bakouch 估计预训练中 BF16 MFU 仅约 12%。他将该架构解读为 3:1 交错的全局/滑动窗口注意力,并指出其留出代码困惑度优于 DSv4(分析)。
计算对比:Teortaxes 称 Beam 是对 DeepSeek V3 的等 FLOP 复现(帖子)。他推断在 4 周内约有 13 亿个 RL 沙盒,同时最多有 17 万个在运行(沙盒)。
定位:观察者将 Beam 定位在 GLM-5.2 水平附近(iScienceLuvr),并在某些基准上低于 DSv4 Flash(批评)。Nathan Lambert 将其与 Nvidia 和 Thinking Machines 归为一类,认为它们是仍然落后于中国同行的美国强力发布(Lambert)。
其他开放与专用模型:
Aleph Alpha Kolibri:总计 78B / 激活 3.46B,Apache 2.0,专为德语和英语打造。自报分数为 96.9% AIME 2025、84.3% GPQA Diamond 和 66.4% SWE-Bench Verified(摘要)。数据集未发布,智能体评测远低于 Qwen(Jitsev)。
Reka Rho-1:一个 19B 全模态模型,能够理解并生成文本、图像、视频和机器人动作,在 320 块 H100 上从零开始训练约 3 个月(公告,算力)。
决策模型:Command Code 的 Agr(31B)和 Agr-flash(360M)跳过文本生成,返回带各选项概率的类型化值,用于工具调用和路由(Agr)。SemiAnalysis 解释说,TypeSafe 的 Jev 采用同样的无解码方法,主要在路由角色中取代前沿模型(解读)。
较小规模发布:Upstage 的 Solar Mini 4(35B / 激活 3B,512K 上下文)在 Nous Portal 上免费两周(Nous)。Eleven v4 Turbo 以 v4 一半的价格登顶 AA 的 Provider Voice TTS 竞技场(AA)。
OpenAI vs Anthropic:订阅价值、速度与评测
SemiAnalysis 极限测试:SemiAnalysis 测试了 Anthropic、OpenAI、Meta、SpaceXAI、MiniMax、Moonshot、Cursor、Cognition 等公司的套餐。发现 Claude 订阅提供的 API 等效价值是 OpenAI 套餐的 5 倍以上(报告)。
OpenAI 容量紧张:用户报告称,新的 200 美元注册被暂停,各套餐的使用限制实际上被减半。GPT-6.1 Sol 被定位为高效替代方案(分析)。Theo 描述了 7 月至 9 月间编码模型偏好的逆转(帖子)。
OpenAI 回应:Codex 负责人 Tibo 承诺连续 28 天每天带来有意义的改进或完全重置(承诺)。
第 1 天提速:GPT-6 Astra 和 GPT-6.1 Sol 的默认速度提升约 50%,从约 30 TPS 升至约 50 TPS。该变更覆盖所有订阅界面以及 Sign in with ChatGPT 合作伙伴,如 OpenCode、Pi、Amp 和 Devin(第 1 天,TPS)。
摩擦:存储的 Codex 重置额度到期时未做时区调整(报告)。常驻 dots 智能体仅限 100 美元以上的 Pro 套餐(批评)。
企业需求(据报道):The Information 报道称,微软将内部 Anthropic 的预计支出削减了三分之一以上。还报道称,Meta 的 Claude Code 用户从约 6 万降至约 3 万,主要原因是推动使用 Meta 自家工具(摘要)。
排行榜:
Agent Arena:Anthropic 在 Code、Work 和 Chat 中均位列第 1。Fable 5.1 领跑 Code 和 Work,而 GPT-6 Astra 在 Code 中排名第 2(Arena)。
Design Arena:GPT-6 Astra 在 3D Design、Frontend、Full Stack 和 Image-to-HTML 中均位列第 1(Design Arena)。
幻觉:在 AA-Omniscience 上,Gemini 4 Argon 对不知道的问题猜错的比例为 15%,而排名第二的模型为 29%。GPT-6 Astra 的准确率最高,达到 61%(数据)。
智能体框架、强化学习环境与开发者工具
多框架强化学习(Hugging Face):一个捕获代理支持 OpenAI Chat、OpenAI Responses、Anthropic 和 Gemini 格式。它将调用转发给 vLLM,并为 TRL 记录精确的 token ID 和 logprobs,从而使 10 个未经修改的框架变成强化学习环境(Delangue,说明)。
结果:相同的权重在 Mini-SWE-Agent 下得分为 62%,在 Claude Code 下为 33%。在 4 个框架上训练 LFM2.5-2.6B 将首次尝试解决率从 42% 提升到 54%,而工具调用奖励使调用次数减少 31%。在 3,189 条 rollout 上进行 SFT 后停滞在 47.5%。
注意事项:该运行仅使用了一个任务族和一个随机种子。
环境托管:强化学习环境现在像数据集一样在 HF Hub 上托管并进行版本管理(博客)。
Pi Durable:Earendil 的框架围绕一个小型基于任务的工作流引擎构建,因此长时间运行、多玩家的智能体可以在任何地方暂停和恢复(Pi)。
智能体记忆:Cognition 推出了 Devin“Dreaming”,它在夜间修剪并链接记忆图。它将以 git 和 markdown 为后端的格式开源为 Agent Memory Repo(发布,格式)。
Cursor SDK:此次更新增加了运行中引导、向父级汇报的后台子智能体、可替换的系统提示,以及自定义工具上的 MCP
readOnlyHint和destructiveHint注解(引导,注解)。DeepSeek Harness:v0.2.1-alpha.1 中一个实验性的 Claude Code Mods 兼容层,用于测试 DSH 的“一切皆插件”架构是否是 Claude Code 扩展点的超集(团队帖子)。
路由与访问:
智能体与训练研究
验证优于采样:
上下文管理:
自我改进的 harness:
优化与架构:
Dust:一种使用激活扰动“虚拟种群”方法的零阶方法,在 transformer 预训练中接近、有时甚至超过反向传播。它声称比 EGGROLL 的计算效率高 1,000–10,000 倍(讨论串)。
LOOM:循环 MoE 在 9–12 次循环下可稳定训练,而在等 FLOP 下,700M 模型在 5 次循环时表现最佳(讨论串)。
ImageNet 上的策略梯度:Ian Osband 展示精确策略梯度在 ImageNet 上达到 4%,而交叉熵为 62%,并主张 RL 损失的失败不仅仅是探索问题(帖子)。
RL 动力学:Base Labs 发现 RL 更新的低秩程度低于此前声称(rollout)。Datalab 报告称,在温度 0 下,仅 RL 即可消除工具调用循环,而 SFT 的循环率为 92%(文章)。
AI for science:Vals AI 报告称,90 多个 Opus 5.5 智能体在 3 天内运行了 DFT 模拟,并标记出两个室温磁性半导体候选材料,其中一个早在 1999 年就已被合成。这些结果仅为预测,并附有公开账本(讨论串,注意事项)。
智能体支出:Epoch 估算,OpenAI 研究人员的编码智能体支出按 API 价格计算,大约每月翻一番。到 8 月中旬,中位数研究人员约为每天 600 美元(Epoch)。
推理系统与硬件
OpenRouter 定价扭曲:Horace He 展示 GLM 5.3 在 inference.net 上输入定价为 0.08 美元/百万 token,但输出为 5.00 美元/百万 token。他将此归因于 OpenRouter 的平方反比价格路由,以及对输入价格的明显过度加权(讨论串,路由)。
llama.cpp:
智能体内核工作:Baseten 报告称,一个在一周内主要由自主智能体工作构建的引擎,解码速度比开源基线快 90%,TTFT 低 57%(博客)。
通信:NCCL 和 PyTorch 对称内存加速了中小规模集合通信(Bekman)。
中国加速器:阿里巴巴平头哥的振武 V900 拥有 216 GB 内存和 1,200 GB/s 互连,声称是 M890 的 3 倍,将于 2027 年第一季度出货(SemiAnalysis)。
安全、政策与产业
OpenAI 文本水印:根据《人工智能法案》,OpenAI 将在欧盟为符合条件的 ChatGPT 和 Codex 文本添加不可见的统计水印,并在全球范围内提供可选的 API 开关(公告)。
智能体事件与安全治理:
政策声音:
中国的算力获取:
整合:
AMD 与 World Labs(据报道):据报道,AMD 以 82 亿美元收购了 World Labs(DL Weekly)。
NVIDIA 中立性:SemiAnalysis 在 NVIDIA 收购 SchedMD/SLURM 和 Hugging Face 后质疑其硬件中立性(SemiAnalysis)。
热门推文(按互动量)
Tibo:连续 28 天每天对 Codex 进行一次改进或重置 — 30.9K
Achiam:禁止某些自主武器 — 11.2K
OpenAI 欧盟文本水印 — 7.7K
Reflection 推出 Beam — 7.4K
HF:将编程测试框架作为强化学习环境 — 2.5K
AI Reddit 回顾
/r/LocalLlama + /r/localLLM 回顾
1. 极端规模下的本地 LLM 硬件
来源:Latent Space · latent.space