GPT-6 Astra 发布后,Sebastian Raschka 解析 looped transformer 与隐藏推理链传闻
OpenAI 发布 GPT-6 Astra,作者评测认为其计算机使用和图像渲染能力尤为突出,ARC-AGI-3 达 99.9%,前代 GPT-5.6 Sol 仅 7.8%。
推荐理由:作者以架构视角拆解 looped transformer 原理与研究进展,并给出循环架构与隐藏思维链传闻无关的独立判断,读者可借此理解争论的技术基础。
OpenAI 的全部动态:GPT 系列模型、ChatGPT 与 Sora 产品、公司战略与人事的持续追踪。
OpenAI 发布 GPT-6 Astra,作者评测认为其计算机使用和图像渲染能力尤为突出,ARC-AGI-3 达 99.9%,前代 GPT-5.6 Sol 仅 7.8%。
推荐理由:作者以架构视角拆解 looped transformer 原理与研究进展,并给出循环架构与隐藏思维链传闻无关的独立判断,读者可借此理解争论的技术基础。
数学家 Tristan Buckmaster 指控 OpenAI 施压、拒绝其合作者 Levent Alpöge(任职于 Anthropic)署名,且可能用两人上传到 Codex 的草稿训练模型,称其为绝对学术不端。
推荐理由:原文梳理各方公开回应与 Terence Tao 的警告,读者可据此思考 AI 实验室与学术界的信任问题。
《The Intercept》通过 FOIA 诉讼获得的文件显示,美国国防部曾在 P00003 合同中要求 OpenAI 提供对军事指令具有最低拒绝率的特别版模型,双方对此均否认,称该文件只是草案。五角大楼律师一度确认其为正式版本后多次改口,OpenAI 已于 2 月 27 日签署允许部署到美军机密网络的最新版协议。
推荐理由:文章梳理了FOIA文件、双方矛盾说法与Anthropic争端背景,帮助读者了解军方AI合同中安全护栏争议的全貌。
卡兹克发文讲解GPT-6 Astra的推理强度等级(Reasoning Effort)含义,指出各档位是同一模型的不同思考预算,Ultra则类似拉起多个智能体协作的专项工作组。
推荐理由:作者基于烧完两个200刀会员的第一手使用体感,给出推理等级的通俗解释和分档位省Token的具体用法。
推荐理由:原文给出了 Astra 的正式开放范围和覆盖产品,读者可以确认自己的订阅计划是否已可用。
Tom Tunguz 引用 OpenAI 内部数据,分析其 3x 研究生产力增益的来源:每名研究员 8 小时班次对应 3.14 个 agent 工作日,通常并行运行 4 个 agent。
推荐理由:文章用 OpenAI 自己披露的数据拆解 3x 生产力说法,指出其中一半工作仍需人工干预且推理成本激增 40 倍。
OpenAI 推出 API 新图像模型 GPT-Image-2.5 Flare 和 Sunburst,主要改进包括更锐利的细节、更强的风格遵循,以及更多对图像编辑的控制。
推荐理由:原文给出两款新图像模型在细节、风格遵循和编辑控制上的能力变化,读者可以据此判断 API 图像工作流的升级点。
推荐理由:官方列出了速度、保真度和多次编辑一致性等具体改进点,读者可据此评估是否更新自己的图像生成工作流。
OpenAI 发布 ChatGPT Images 2.5 图像模型,生成延迟比 Images 2.0 降低最多 50%,细节、编辑精度、参考照片保真度和多轮编辑一致性均有提升。
推荐理由:官方原文给出与 Images 2.0 的具体对比数据、新功能入口和 API 双模型分工,读者可以据此评估是否迁移现有图像工作流。
OpenAI 宣布其内部 AI 系统给出 Navier–Stokes 存在与光滑性问题的解答,证明初始光滑的流体可在有限时间内形成奇点,并附证明文稿与 Lean 形式化验证。
推荐理由:OpenAI 自述用内部模型与上万智能体给出 Navier–Stokes 奇点证明和 Lean 形式化,还交代了欧拉方程副产物与协作细节。
Sam Altman 发文回应与 Anthropic 一方围绕 Euler/Navier-Stokes 证明发布的争议,称对方只有 Euler 结果、双方协调失败,并称对方以抄袭指控相威胁。
我想澄清几点: 1)这张截图是我联系 Levent 以协调我们的发布。我希望从这条消息中可以清楚地看出,我们是带着尽可能最好的意图来的。 2)我从未、从未要求将 Levent 从他本人作品的作者署名中移除(正如我的文字所表明的那样)。在与 Tristan 通话时,我惊讶地得知他们只解决了 Euler 而没有解决 Navier-Stokes;得知这一点后,我们头脑风暴了可能的推进路径。我们讨论的一个选项是,Tristan 可以作为重写 OpenAI 的 Navier-Stokes 证明的第一作者。正是在这个语境下,我说了“如果 Levent 不是 Anthropic 的员工,事情会简单一些”,因为我觉得由 Anthropic 的员工来署名 OpenAI 的工作是不合适的。重要的是,对方承认在他们的 Euler blowup 证明中使用了 Anthropic 的内部模型;因此我觉得我无法将 Levent 视为一名独立的学者。我想提出的另一个选项(但被打断了)是提供我们内部模型的访问权限,以便他们可以尝试完成他们的证明,并弥合 Euler 与 NS 之间的差距。同样,我不知道该如何处理向一名 Anthropic 员工授予 OpenAI 内部 IP 访问权限这件事。 3)再直白地重申一遍:正如我的文字清楚表明的,也正如我在通话中所说的,OpenAI 的意图是尽一切可能去庆祝他们的数学成就以及他们在 Euler 上做出的英勇努力。在通话中,我立刻遭到了一连串的诽谤,包括直接的威胁:如果我们宣布 Navier-Stokes,他就会立即带着一连串毫无根据的指控去找媒体。我驳斥了所有这些指控,但他回答说“你什么都做不了,我就是不信任你”。我很困惑,为什么有人会把一个庆祝(他们成就的!)的绝佳机会变成这样的争吵,就在那时我说,我不理解为什么会有人拿自己的职业生涯去冒险[为了毫无根据的指控]。说实话,在那一刻,我是想关心他,并做最后一次努力,争取有机会给予他们应得的所有荣誉。我为这个极其糟糕的用词深表歉意,这与我试图传达的意思恰恰相反。(我应该说明,顺便说一句,我当场就收回了那些话。) 4)总的来说,就个人层面而言,进行这些对话极其困难。尽管我一再请求,Levent 拒绝参加任何会议。正如 Sholto Douglas 所说,未来 Anthropic 和 OpenAI 之间将需要协调;我觉得我是在与 Anthropic 进行一场代理谈判,而那名 Anthropic 员工却拒绝直接参与。
推荐理由:Sam Altman 一方就 Navier-Stokes 证明争议公开己方叙述,读者可以对照双方说法理解这场跨公司协调纠纷。
NYU 数学教授 Tristan Buckmaster 与 Anthropic 数学家 Levent Alpöge 公布针对 Navier-Stokes 存在与光滑性这一千禧年难题的三项证明初步结果,并称其研究进展信息被泄露给 OpenAI,对方随后用大量算力沿其独特路线追赶证明。
推荐理由:原文记录了数学家与 OpenAI 就千年难题证明优先权展开的争议细节,以及双方各自的公开回应,可帮读者了解 AI 参与数学研究引发的信任问题。
我们正在分享一个针对纳维-斯托克斯千禧年大奖难题的解决方案,这是数学前沿最深刻的问题之一。 该证明由一组智能体完成,使用了OpenAI的下一代模型,其能力显著超越GPT-6 Astra。 该问题关乎由纳维-斯托克斯方程建模的光滑三维流体运动描述是否会失效。这一问题已悬而未决约90年。
推荐理由:原文补充了数据隔离说明,并指出其 Euler 情形证明结果与 Alpöge 和 Buckmaster 的工作不同,读者可据此比较两条独立证明路径。
特里斯坦·巴克马斯特(Tristan Buckmaster)与 Levent Alpöge 公开三项有限时间 blowup 结果,涵盖带光滑强迫的不可压缩多孔介质方程。
推荐理由:作者亲历描述用 LLM 完成偏微分方程 blowup 证明的过程,并公开与 OpenAI 沟通的时间线,为评估 AI 参与前沿数学研究提供了第一手材料。
作者数字生命卡兹克发布GPT-6 Astra操控Blender的小白教程,介绍前期安装、官方MCP与Computer Use插件配置,并实测三种玩法。Computer Use花约4小时搭出天坛祈年殿,但耗掉200美刀Pro会员近半额度;MCP更快,可完成摩托车建模与组装动画,但复杂任务会单次运行超时,可拆分步骤或用CLI执行Python脚本解决。
推荐理由:作者实测了Computer Use、官方MCP和CLI三种方式并给出各自的速度、成本与适用边界,方法可直接照做。
Epoch AI 测量四款模型的首 token 延迟(TTFT)随上下文长度的缩放,发现 GPT-5.6 Terra 和 Sol 呈明显二次曲线,Claude Sonnet 5 接近线性,Opus 5 噪声较大但仍接近线性。
推荐理由:原文以实测数据和三种稳健估计器比较 GPT-5.6 与 Claude 5 的长上下文延迟缩放,可帮助读者理解两家不同的架构取舍与成本影响。
GPT-6 Astra上线后,大量用户用它自主操控Blender、Houdini、Unity、Aseprite等专业软件,做出游戏Demo、3D复刻旧金山艺术宫等作品,其中旧金山艺术宫案例里Astra自己搜索几百张参考图、翻到美国国会图书馆的老扫描文件找柱子尺寸,多数工作在夜间自主完成。
推荐理由:作者从大量GPT-6 Astra操控专业软件的案例出发,讨论执行能力贬值与判断力从何而来的矛盾,视角具体。
推荐理由:Hendrycks 是 AI 安全领域权威,此观点结合 OpenAI、Anthropic 等最新实证案例,揭示了 Agent 行为中潜在的“亲缘利己”风险,对理解 AI 对齐与安全治理具有重要参考价值。
OpenAI 发布长文《An Alien Mind》,回溯 2023 年 RLSlow 项目中确认推理模型可扩展训练的起点,并系统阐述目标对齐与价值对齐的区分。文章指出链式思维监控的效果正随着模型能力提升而逐步减弱,GPT‑6 Astra 在对齐上显著优于 GPT‑5.6 Sol;作者预期进展可能持续走向机器递归自我改进(RSI),呼吁自愿放缓扩展、建立第三方安全门槛并加强国际协调。
推荐理由:作者以内部视角回溯推理模型的起源,并给出对齐监测、CoT 监控弱化和 RSI 风险的一手判断。
OpenAI 发文披露自动化研究进展,宣布已达成去年秋天设定的今年 9 月拥有自动化研究实习生(可在人类指导下完成耗时数天的明确研究任务)的目标,并计划在 2028 年 3 月前造出自动化 AI 研究员。
推荐理由:OpenAI 以内部数据披露 coding agent 对研究工作的实际影响和 RSI 进展,读者可以据此了解前沿实验室的自动化研究现状。