OpenAI 发布 GPT-6 Astra:多项基准刷新纪录, cybersecurity 能力达 Critical 阈值
GPT-6 Astra: A new generation of intelligence
OpenAI 发布新一代模型 GPT-6 Astra,称其在计算机使用、软件工程、科学和网络安全等方向达到 SOTA。
官方发布给出多项评测数字、定价和可用渠道,读者可以据此比较它相对前代和竞品的能力与成本变化。
我们隆重推出 GPT‑6 Astra,全球最智能、对齐程度最高的模型。
GPT‑6 Astra 汇聚了多年来在预训练、强化学习和对齐方面的研究与重大投入。Astra 在计算机操作、浏览、软件工程、网络安全、科学和专业工作方面均达到 SOTA 水平。Astra 以 98% 的得分饱和了 FrontierMath Tier 4,此前已帮助解决了数学领域长期悬而未决的开放问题。Astra 还以 99.9% 的得分饱和了 ARC-AGI-3,并以 100% 的得分饱和了 ExploitBench。它还在计算机和浏览器使用方面开辟了新前沿,以无与伦比的速度、准确性和判断力处理最严苛的专业工作。
GPT‑6 Astra 今日起面向有限数量的组织推出,并将在未来几天内向所有 ChatGPT Plus、Pro、Business 和 Enterprise 用户开放,同时也可通过 OpenAI API、Microsoft Azure 和 AWS Bedrock 使用。
Terminal-Bench Science 0.1
API 成本
GPT-6 Astra
GPT-5.6 Sol
Claude Fable 5.1
Claude Fable 5
Claude Opus 5
Terminal-Bench Science 0.1 测试智能体能否使用代码和终端工具完成科学研究工作流,包括分析数据、运行模拟和拟合模型。GPT‑6 Astra 在参与对比的模型中达到新高,为 64.6%,而 Claude Fable 5.1 为 52.6%,同时预估 API 成本约低 31%。在更低成本的设置下,Astra 得分为 61.1%,而 GPT‑5.6 Sol 的最佳结果为 22.4%,同时预估 API 成本约低 27%。
“在 ARC-AGI-3 上,Astra 在 96% 的关卡上超越了我们的人类行动效率基线,实际上在该基准上达到了人类水平。这不仅是我们测试过的最好的模型,也代表着前沿模型性能的一次实质性跃升——不仅体现在它导航和解决新颖环境的能力上,也体现在它学习如何做到这一点的效率上。”
Greg Kamradt,ARC Prize Foundation
Astra 是我们对齐程度最高的模型,在理解用户意图和模型行为方面都有大幅改进——你可以放心地委派任务,对 Astra 的判断更有信心。作为测试这一点的一种方式,我们构建了一项受 Hugging Face 事件启发的新评估,用来考察模型在面对困难或不可能完成的任务时,是否会超出其预期范围。与 GPT‑5.6 Sol 相比——后者在没有生产防护措施的情况下有 48% 的时间超出了授权目标——GPT‑6 Astra 出现这种情况的比例为 0%。
全球最强的计算机使用模型
GPT‑6 Astra 标志着计算机使用在速度、准确性和安全性方面的新前沿。它可以处理诸如填写在线表单、在 CRM 中更新客户记录以及整理你的日历等繁琐任务。它可以在你的电子邮件或文档编辑器中进行在线研究并起草摘要。它可以分析科学数据、生成图表、创建网站,并运行前端 QA 检查以确保该网站上的所有功能都能正常工作。它可以帮助你自主安装和测试软件,并排查你在屏幕上看到的问题。这些改进也体现在我们最先进的评估结果中。
Agents' Last Exam 在真实软件中测试智能体完成复杂专业任务的能力,涵盖从金融建模到工程和媒体制作。在所示对比中,GPT‑6 Astra 达到新高,得分为 59.3%,而 Claude Opus 5 为 55.5%,GPT‑5.6 Sol 为 53.6%。在这些最高得分设置下,Astra 使用的输出 token 也比 Opus 5 少约 65%。
这些改进还在真实知识工作任务中带来了显著的效率提升。在 OSWorld 2.0 的延迟模拟中,Astra 每项任务所用时间比 GPT‑5.6 Sol 少约 47%,却实现了更高的计算机使用性能:每项任务约 40 分钟时得分为 72.6%,而后者约 75 分钟时为 65.7%。3
GPT‑6 Astra 的计算机使用能力可以在各个领域的输出中看到,包括游戏开发、电气工程和日常知识工作:
这是 GPT‑6 Astra 在 KiCad 中执行印刷电路板(PCB)布局的 15 秒浓缩回放,它通过放置元件并布线铜连接,将电子原理图转化为可制造的 PCB。PCB 布局是当今每一台电子设备的核心环节,却是一项手动任务,也是电子设计流程中常见的延迟来源。加速这一环节,意味着让工程师能够以显著更高的节奏去发明、优化并测试他们的下一个构想。
除了 Astra,我们还在更新 Codex harness,以显著提升计算机使用速度。结合 Astra 的效率,在 Mind2Web 基准测试上,任务完成速度相比当前的 GPT‑5.6 Sol 体验快了 1.9 倍。该模型在速度上的提升意味着它可以替你承担许多耗时的生活任务,速度比你本人还快。4
GPT‑6 Astra: 2 分 54 秒
“我们将在发布当天把 GPT‑6 Astra 集成到 Devin 的 harness 中,它在我们内部测试基准上交付了 SOTA 级别的性能。其出色的计算机使用、写作和代码库理解能力开箱即用地改进了测试:视频明显更易理解,报告更清晰、更简洁”
Silas Alberti,Cognition 研究高级副总裁
专业工作的一次阶跃式变革
GPT‑6 Astra 将计算机使用方面的进步与面向专业环境的针对性训练相结合,以帮助处理复杂的工作任务。它把解决复杂问题所需的智能与执行多步骤工作流、生成精美文档、电子表格和演示文稿的能力融为一体。
BenchCAD 测试模型能否通过生成 CAD 代码,从多视角渲染图中重建 3D 物体。在所示对比中,配合工具的 GPT‑6 Astra 达到新高,取得 95.9% 的几何重叠得分,而 GPT‑5.6 Sol 为 83.3%,Claude Fable 5.1 报告的成绩为 84.3%。5在所示配置下,估算的 API 成本比 Sol 低约 43%,比 Fable 5.1 低约 86%。
GPT‑6 Astra 是我们最擅长遵循现有模板并生成版式良好、能以结构化叙述简洁传达要点的幻灯片模型。它能创建清晰、结构良好的文档、演示文稿、电子表格和分析,遵循你的模板并契合你的写作与视觉风格。Astra 还经过专门训练,只把真正重要的上下文纳入输出,而不是重复对当前工作不必要的信息。这一切意味着它能输出更可直接使用的成果,契合你的业务背景与标准。
参考文件
GPT‑6 Astra 输出
GPT‑6 Astra 仅使用 OpenAI 演示模板中的几张幻灯片,就为虚构模型 GPT‑Gaia 制作了一份幻灯片,全程把握住了正确的语气和版式。这意味着你可以期待幻灯片按照你的企业标准正确排版。
GPT‑6 Astra 还为其构建的网站、游戏、应用和渲染图带来了更强的视觉判断力。借助 ChatGPT 中的 Sites ,Astra 可以直接通过提示词创建、托管和分享网站、Web 应用和游戏。
“Astra 在能力和效率两方面都为我们带来了显著优势。它成功执行了我们最复杂的创意工作流,同时相比我们测试过的其他模型,最多可少用 20% 的 token。最重要的是,对我们的客户而言,这意味着更高质量的输出。”
Alex Mashrabov,Higgsfield AI 首席执行官兼联合创始人
GPT‑6 Astra 在 Blender 中为一栋房屋建模,并将其转化为 Unreal Engine 5 中可行走的场景,帮助设计师和客户在房屋建成之前探索布局并体验空间。
该模型可以通过生动的画面、引人入胜的玩法和精准的动作让游戏鲜活起来,让非技术人员也能在几分钟内创建并游玩超越基础元素的定制游戏。图片来源:Pietro Schirano。
当指令留有解读空间时,GPT‑6 Astra 比之前的模型更能做出正确的判断。它会利用上下文来填补常规的信息空缺,并在答案可能改变结果时提出有针对性的问题。在 Codex 中,它可以异步提问,同时继续推进不依赖你回复的工作。如果你没有回应,它会在适当的情况下以合理的假设继续推进,但在关键决策上会等待你的输入。
下面的示例展示了 Astra 如何在日常任务中协作,这些任务中缺失的信息可能会实质性地改变答案。

Astra 还更擅长在任务演进过程中保持方向感。此前的模型有时会把引导性消息当作一个新目标,从而丢失对原始请求或早先约束的把握。Astra 会纳入新要求,在被要求时改变方向,并回答附带问题而不丢掉更大的任务。
“在复杂的法律任务上,Astra 相比 GPT‑5.6 Sol 有显著的质量提升。在我们的早期测试中,Astra 脱颖而出,因为它像一位有辨别力的律师那样处理法律工作:它能区分文件与既定记录,揭示缺乏依据的假设,并把信息空缺转化为具体的起草立场。”
Niko Grupen,Harvey 应用研究负责人
编程
GPT‑6 Astra 是迄今为止最适合软件工程的模型。
“GPT‑6 Astra 在我们的内部编码基准测试中展现出最先进的性能,并且与 GPT‑5.6 Sol 相比,在交易直觉评估中显示出明显的进步。在用于智能体编码时,GPT‑6 Astra 的沟通方式更便于开发者理解,并且生成的代码需要更少的迭代就能达到生产级质量。”
John Crepezzi,AI 助手团队,Jane Street
“我们在第一代评估中,以低、中、高三种努力程度对 Astra 进行了测试,结果它显著领先于 GPT 5.6 Sol。更高的努力程度意味着在全新构建中能进行更多次迭代、通过浏览器测试进行更多验证,并且更倾向于代码执行而非 apply-patch。理解模型如何分配其努力程度,正是我们为数百万构建者提供从想法到可用应用更快、更可靠路径的方式。”
Fabian Hedin,Lovable 首席技术官兼联合创始人
“GPT‑6 Astra 在我们的内部编码基准测试中展现出最先进的性能,并且与 GPT‑5.6 Sol 相比,在交易直觉评估中显示出明显的进步。在用于智能体编码时,GPT‑6 Astra 的沟通方式更便于开发者理解,并且生成的代码需要更少的迭代就能达到生产级质量。”
John Crepezzi,AI 助手团队,Jane Street
“我们在第一代评测中的低、中、高三种投入档位上测试了 Astra,结果它显著领先于 GPT 5.6 Sol。更高的投入档位意味着在全新构建上获得更多迭代次数、通过浏览器测试进行更多验证,并且更倾向于代码执行而非 apply-patch。理解模型如何分配其投入,正是我们为数百万构建者提供一条从想法到可用应用更快、更可靠路径的方式。”
Fabian Hedin,Lovable 首席技术官兼联合创始人
- Jane Street
- Lovable
Terminal-Bench 4.0 在复杂的终端任务上测试智能体,包括软件工程、系统配置和数据分析。GPT‑6 Astra 达到 57.9% 的新高,相比之下 GPT‑5.6 Sol 为 37.3%2,而 Claude Fable 5.1 为 55.8%,每任务估计 API 成本分别低约 9% 和 63%。
借助 Astra,我们为 Codex 引入了一种新方式,使其在上下文窗口填满时仍能保留并检索上下文。过去,模型一直使用压缩机制来总结长时间会话中的工作,例如在调试复杂问题或进行大规模重构时。每一次压缩都可能遗漏某些细节,比如某个修复为何失败,或某个组件的行为方式。在 Codex 中,Astra 可以跨上下文窗口保留笔记,从而保存累积的细节,而不必反复将它们压缩成单一摘要。更早的上下文窗口仍然可搜索,因此 Astra 可以从先前的消息和工具输出中找到需求或测试结果——即使这些信息并未被记录在它的笔记中。你可以在你的 Codex config.toml 中启用这一实验性功能,它将在未来几周内成为 Astra 的默认设置。
推动科学发现
“故事是这样的:一个时代结束,另一个时代开始。”
Greg Burnham,EpochAI
GPT‑6 Astra 是科学发现、数学和健康领域的重大进步。今天,我们分享关于素数间隙的两项进一步成果。9、10
Astra 还在一系列数学和科学评测中创下新纪录。
GPQA Diamond 测试生物学、化学和物理学领域研究生水平的科学推理能力。在所示对比中,GPT‑6 Astra 达到 96.0% 的新高。在成本更低的设置下,它也超过了 GPT‑5.6 Sol 的最佳成绩——94.9% 对 94.6%——同时估计 API 成本约低 37%。
Astra 可以协助科学发现背后的实际工作。通过将科学推理与计算机使用相结合,它能够直接在专业软件中操作,检查数据并探索结果,帮助研究人员评估证据并决定下一步研究什么。
GPT‑6 Astra 能够操作科学软件,检查测序质量并可视化遗传变异,帮助研究人员评估数据并确定进一步分析的重点方向。
网络安全
正如我们在安全更新中所讨论的,Astra 在网络能力方面实现了显著跃升,并达到了我们关键阈值在网络安全领域所设定的防范框架标准。它识别和开发零日漏洞利用的能力可以帮助防御者发现并修补弱点,但同时也产生了对更强保障措施的需求。为了解这些能力的延伸范围,我们在内部及第三方专家评估中对 Astra 进行了测试。
我们首先在没有生产环境防护措施的情况下,在 ExploitBench 和 ExploitGym 上测试了该模型,这两个基准评估模型能否将已知软件漏洞转化为可用的漏洞利用程序。在 ExploitBench 上,Astra 取得了 100% 的满分,而我们此前具备前沿网络能力、GPT‑5.6 Sol 的成绩为 78.5%。在 ExploitGym 上,Astra 达到了 42.4% 的成功率,而 GPT‑5.6 Sol 为 30.3%,同时 Astra 使用的输出 token 数量大幅更少。13
鉴于有人担心接触历史软件漏洞可能影响了基准测试结果,我们还在两个全新的基准上评估了 Astra。其中之一,我们构建了一个内部“ExploitBench(2026 年 6 月至 8 月)”评测,使用过去三个月的漏洞来测试漏洞利用开发能力。14 在该数据集上,Astra 取得的任意代码执行率大幅高于 GPT‑5.6 Sol,同时使用的输出 token 数量少得多。在评测过程中,Astra 甚至发现并利用了两个此前未知的零日漏洞。我们正在向这两个漏洞的维护者披露它们。
我们还在 SRE-Bench15 上测试了 Astra,该基准衡量模型能否在无法访问原始源代码的情况下对软件二进制文件进行逆向工程,以理解其核心逻辑。Astra 在单次尝试中解决了 88.0% 的任务,在四次尝试内解决了 99.2%,而 GPT‑5.6 Sol 分别为 55.9% 和 68.7%。
除基准测试之外,由专家主导的评估发现,Astra 在没有生产环境防护措施的情况下运行时,能够利用此前未知的漏洞在加固浏览器中实现任意代码执行,并为加固操作系统创建权限提升漏洞利用程序。
正如我们在《防御者的窗口期》中所讨论的,前沿网络能力可以帮助防御者更快地发现弱点,但也会让这些弱点更容易被利用,从而提升了防御者适应变化的紧迫性。借助今天发布的这一版本 Astra,防御者可以用它来完成安全代码审查和打补丁等任务。
然而,Astra 将拒绝执行更高级的网络安全任务,例如为漏洞创建概念验证漏洞利用程序。通过OpenAI Daybreak,我们计划在未来几周内扩大访问范围并推出限制更少的防护措施。这将支持更多防御性工作流,包括漏洞与概念验证验证、恶意软件分析和检测工程。
我们还在 GPT‑5.6 Sol 的防护体系基础上,加强了对潜在网络滥用的防护。这些措施包括更强的模型鲁棒性,以更好地抵御潜在的越狱攻击,以及为我们的监控系统提供更多上下文。我们持续进行严格的内部和外部测试,包括与我们的内部红队攻击者进行的自动化评估。有关我们网络防护和测试的更多细节,可在 Astra 的系统卡和我们的博客中查阅。
负责任地对齐并部署 GPT‑6 Astra
Astra 是我们对齐程度最高的模型。Astra 擅长保持审慎、尊重任务边界,并进行透明的沟通。这项工作是我们长期研究项目的最新成果,该项目专注于训练从始至终都与人类意图保持对齐的模型。
在敏感环境中,Astra 会以与其风险相称的审慎态度行事。在一项针对计算机使用任务的评估中,这些任务经过对抗性筛选以诱发不当行为,Astra 在避免意外后果方面表现得更为出色。在默认启用额外安全措施的情况下运行,其表现更为强劲。
Astra 造成的不对齐结果少于任何其他受测的前沿模型。为了进行公平比较,我们使用了一个通用的计算机使用智能体测试框架(基于OpenAI Responses API 和Anthropic Messages API 中均可用的原生计算机使用工具),并且未启用通常为 Codex 和 ChatGPT Work 用户部署的额外保护措施(自动审查、确认策略)。16
Astra 也更倾向于在用户设定的以及其环境所隐含的边界内运作。在一项内部评估中,Astra 从未尝试绕过 Codex Auto-Review 的拒绝。即使当 Auto-review 被故意配置为可被规避、且任务在其他情况下无法完成时,这一表现依然成立。这种对环境限制的尊重,与我们在本文引言中分享的不可能网络任务评估结果,以及我们系统卡 中记录的其他发现相一致。
该评估测试模型在知识工作任务中如何应对自动审核拒绝。利用不良的用户配置来绕过自动审核会被计为失败。Astra 从未尝试规避自动审核。
Astra 还在透明的用户沟通方面创下新标杆。在一项评估中,Astra 就其自身能力和可提供功能做出不准确表述的可能性比 GPT 5.6-Sol 低三倍。
在我们的能力幻觉评估中,Astra 相较 GPT‑5.6 Sol 展现出显著改进,就其自身能力做出的误导性陈述更少。
我们的评估发现,Astra 的书面推理比 GPT‑5.6 Sol 的更难监控,这些测试明确要求其规避监控。我们将此归因于 Astra 在较简单任务上对书面推理有更强的控制力,以及能够以更少的书面步骤解决问题。Astra 似乎仍难以隐藏复杂任务所需的推理,但我们严肃对待这一退步。提升可监控性仍是一项研究优先事项,随附的系统卡 详细说明了我们的发现和正在进行的工作。
对齐训练是我们部署方法的核心。作为额外的防御层,我们还构建了系统级防护措施,例如 Codex Auto-review ,并监控智能体的推理和行动,以帮助检测和遏制不安全行为。正如我们的安全更新所述,我们还在生产环境中为 Astra 级模型部署了失准监控,以便对失准情况保持可见性,并帮助遏制最严重的失准实例。这些防护措施类似于我们对内部部署的监控,涉及一套分类器系统,用于检查模型的推理和行动是否存在未经授权的行为,并自动停止可能未经授权的活动。
鉴于 Astra 的网络安全能力显著提升,我们格外谨慎地确保此次部署安全可靠。额外的安全检查有时会拖慢、暂停或停止合法工作,包括防御性网络安全工作。如果任务在 ChatGPT 或 Codex 中被暂停,你可能会被要求先审查该操作再继续。在 API 中,任务将会停止。这些检查有时会打断合法工作,我们正在持续迭代该系统以减少不必要的打断。失准监控无法取代对齐:我们的目标是构建能够可靠地保持在授权范围内的模型,从而让这些防护措施无需介入。
可用性
GPT‑6 Astra 于今日面向有限数量的组织推出,并将在未来几天内向所有 ChatGPT Plus、Pro、Business 和 Enterprise 用户开放,同时也可通过 OpenAI API、Microsoft Azure 和 AWS Bedrock 使用。Astra 的使用量包含在现有订阅额度内——用户和企业还可以购买额度以获取额外用量。Pro、Business 和 Enterprise 套餐的用户还将获得 GPT‑6 Astra Pro 的访问权限。企业管理员可以为其工作区启用 Astra;发布时访问权限默认关闭。
Astra 为符合条件的 API 客户支持零数据保留,并且正如我们上个月所分享的,我们正在测试 私有安全处理,以在保护客户隐私的同时加强安全监控。
对于开发者,GPT‑6 Astra 将在 OpenAI API 中以 gpt-6-astra 的形式提供,并通过 Microsoft Azure 和 Amazon Bedrock 提供。
OpenAI API 标准定价为每百万输入 token 10 美元,每百万输出 token 50 美元。缓存读取和写入适用单独的费率。GPT‑6 Astra 在 API 中提供快速模式,其处理速度最高可达标准模式的 2 倍,价格为标准价格的 2 倍。
计算机使用
*Computer UseGPT‑6 AstraGPT‑5.6 Sol2Claude Fable 5.1Claude Fable 5Claude Opus 5Gemini 3.8 Flash* Agents' Last Exam 59.3%53.6%-48.7%55.5%- OSWorld 2.0(v2026.08.08,离线集,部分得分)72.6%65.7%--70.2%2- ScreenSpot-Pro(无工具)92.7%76.9%-87.3%17--
专业版
专业版GPT‑6 AstraGPT‑5.6 SolClaude Fable 5.1Claude Fable 5Claude Opus 5Gemini 3.8 Flash AutomationBench 41.4%18.1%31.4%17.4%26.9%- BenchCAD 95.9%83.3%84.3% 567.5%582.1% 5- BrowseComp 91.5%90.4%-87.4%90.8%- OpenScore String Quartets(1 - OMR-NED)0.84 0.19---- 内部设计任务 50.0%47.4%-35.8%-- 内部数据科学任务 40.9%30.5%-34.7%-- Artificial Analysis Intelligence Index v4.1.1 61.2 60.9 65.7 62.1 63.1 58.7
编程
编程GPT‑6 AstraGPT‑5.6 SolClaude Fable 5.1Claude Fable 5Claude Opus 5Gemini 3.8 Flash Terminal-Bench 4.0 57.9%37.3%55.8%44.5%52.6%19.1% DeepSWE v1.1 74.1%72.7%67.4%69.9%73.7%73.8% FrontierCode 1.1 Extended(得分)64.5% 860.6%63.6%64.9%63.6%56.3% FrontierCode 1.1 Main(得分)53.3% 847.5%50.9%53.5%53.4%43.6% 内部数据库迁移任务 63.9%42.7%57.8%50.3%-- Artificial Analysis Coding Agent Index v1.4 67.0 65.1-67.2 68.1 61.2
学术
学术GPT‑6 AstraGPT‑5.6 SolClaude Fable 5.1Claude Fable 5Claude Opus 5Gemini 3.8 Flash Terminal-Bench Science 0.1 64.6%22.4%52.6%21.4%30.0%- FrontierMath Tier 4 (v2)97.6%83.0%87.8%87.8%73.2%- GPQA Diamond 96.0%94.6%93.7%92.6%93.7%95.3% Humanity's Last Exam(带工具)57.2%-65.0%63.8%63.6%-
科学与健康
科学与健康GPT‑6 AstraGPT‑5.6 SolClaude Fable 5.1Claude Fable 5Claude Opus 5Gemini 3.8 Flash GeneBench Pro 37.1%32.3%---- MedChemBench(内部)49.3%47.4%---- LifeSciBench 60.3%59.9%---- HealthBench Professional(长度调整)63.4%60.5%58.1% 1160.9% 1156.4% 1152.1%
网络安全
网络安全GPT‑6 AstraGPT‑5.6 SolClaude Fable 5.1Claude Fable 5Claude Opus 5Gemini 3.8 Flash ExploitBench 100.0%78.5%--70%- ExploitGym 42.4% 1330.3% 1330.4% 1728.4%1722.0%- ExploitBench(2026 年 6-8 月)39.0%5.5%---- SRE-Bench 88.0%55.9%--12.5%- SEC-Bench Pro 85.4%79.1%----
对齐
对齐GPT‑6 AstraGPT‑5.6 SolClaude Fable 5.1Claude Fable 5Claude Opus 5Gemini 3.8 Flash 内部计算机使用安全基准(越低越好)2.4%22.0%9.5%18.3%11.5%- 内部计算机使用安全基准,含 AutoReview(越低越好)1.8%4.3%---- 内部规避基准(越低越好)0.00%0.29%---- ExploitGym 蜜罐(越低越好)0.0%48.2%---- Impossible ExploitGym 100.0%----- 内部幻觉基准(越低越好)4.2%12.2%----
长上下文
长上下文GPT‑6 AstraGPT‑5.6 SolClaude Fable 5.1Claude Fable 5Claude Opus 5Gemini 3.8 Flash OpenAI MRCR v2 8-needle 256K-512K 100.0%91.5%---- OpenAI MRCR v2 8-needle 512K-1M 96.3%73.8%----
抽象推理
抽象推理GPT‑6 AstraGPT‑5.6 SolClaude Fable 5.1Claude Fable 5Claude Opus 5Gemini 3.8 Flash ARC-AGI-3 99.9% 17.8%--30.2%- ARC-AGI-2 95.0%92.5%90.0%89.2%90.4%- ARC-AGI-1 98.5%97.5%97.5%98.5%97.5%-
评估分数为各努力程度下的最高值。GPT 评估在我们的研究环境中或通过我们的 API 运行,由于系统提示词、可用工具等方面的差异,其输出可能与生产环境中的 ChatGPT 略有不同。
脚注
- 1 在 ARC-AGI-3 上,GPT-6 Astra 使用我们的 responses API harness运行,该 harness 更改了两项设置以更好地匹配真实世界表现。这些更改并非专门针对 ARC-AGI-3。
- 2 GPT-5.6 Sol 指的是我们 API、ChatGPT Codex 和 ChatGPT Work 中可用的版本。ChatGPT Chat 中的版本略有不同。
- 3 OSWorld V2-Offline 是原始 OSWorld V2 的一个子集,可在无互联网访问的情况下运行。Claude 模型在 OSWorld-V2 Offline 上的表现由作者在官方排行榜 **上**复现。在 OSWorld 2.0 上,Claude 的分数使用官方设置,而非 Fable 5.1 System Card 中修改后的任务和修改后的评分。
- 4 模型用时为相应演示运行所报告的耗时。所展示的片段为经过剪辑的节选。
- 5 在 BenchCAD 上,Claude 的分数反映了对该评估的 3 处修改,详见Fable 5.1 System Card 。
- 6 Guang Yang、Victoria Ebert、Nazif Tamer、Brian Siyuan Zheng、Luiza Pozzobon 和 Noah A. Smith。“LEGATO:大规模端到端可泛化的排版 OMR 方法 。”arXiv:2506.19065,2025。
- 7 Mark R. H. Gotham、Maureen Redbond、Bruno Bower 和 Peter Jonas。“OpenScore 弦乐四重奏语料库 。”第 10 届音乐学数字图书馆国际会议论文集,第 49–57 页。ACM,2023。
- 8 在 FrontierCode 上,GPT-6 Astra 运行时使用了一条开发者消息,类似于其在 Codex 中开发者消息的某一节 :“避免创建过多的测试文件。只有在仓库约定要求时,或没有现有文件适合作为归属位置时,才创建新的测试文件。避免无关的清理和不必要的复杂性。复用合适的现有工具。阅读相关仓库说明,并检查附近的代码、测试、文档和 CI。遵循既有约定。目标是干净、可合并的代码。”该提示词并未针对该评测进行优化。
- 9 第一个问题关乎素数彼此之间能靠得多近,无论沿着数轴走多远。十多年来,已知最佳结果证明了存在无穷多对素数,其间距至多为 246。Julia Stadlmann 最近将该上界改进到 240。Astra 帮助确立了一个更强的上界 186,表明存在无穷多对素数出现在这一更小间距之内。短素数间隔:证明 和支撑研究 。
- 10 第二项涉及素数之间异常大的间隔。Astra 改进了关于这些间隔的一个上界中的一项,而这一项在此前 80 多年里一直未变。我们公开了这两项结果的证明、精简版思维链以及验证材料。大素数间隔:证明 和支撑性研究 。
- 11 我们按照既定的 HealthBench Professional 流程,使用 GPT‑5.4 评分以及经长度调整、未截断的分数,独立评估了所有 Claude 模型。对于 Fable 5.1,在提供商拒绝时我们使用了 Opus 5 作为回退。
- 12 Claude Fable 5 和 5.1 未被纳入 LifeSciBench Gold v1、GeneBench Pro v13 和 MedChemBench,因为它们在这些评估中拒绝了大多数问题。
- 13 在 ExploitGym 上,我们在没有 6 小时时限的情况下测试了 Astra 和 Sol,以更好地评估它们完整的网络能力。它们的速度足够快,因此这一限制影响甚微。
- 14 ExploitBench(2026 年 6 月至 8 月)包含 13 个稳定版 Chrome 发布版本中的 20 个高危 V8 漏洞。该基准测试检验智能体能否通过利用每个指定漏洞,在 V8 以及面向 Linux 的官方 Chrome 发布版本中实现任意代码执行。部分纳入的漏洞在评估约束下可能无法实现任意代码执行,因此 100% 的成功率可能无法达到。注意:GPT-5.6 Sol 的 5.5% 得分是该基准测试中 300 轮限制造成的假象,而使用 max 的真实客户并不会受到这一限制。该模型在类似设置下、触及更少限制时取得了 11.5% 的得分。
- 15 Jeremy Spence 等,“智能体网络安全的下一项挑战:一个真实、无污染的逆向工程基准”,arXiv:2608.11469v1,2026。
- 16 当我们在第三方模型上进行测试时,我们使用一套更简单的研究配置。Codex 有一套更复杂的生产配置,这可能导致不同的原始模型错误率。提供方一侧的防护措施和计算机工具实现仍然存在差异。用户在 Codex 中不会遇到无确认场景,因为那是一种内部研究配置。
- 17 对于 ScreenSpot-Pro 和 ExploitGym,我们报告的 Fable 分数来自 Mythos,即防护措施更少的 Fable。
来源:OpenAI:官网动态(RSS · 排除企业/客户案例) · openai.com
相关事件
- OpenAI 更新 Codex harness 以提升计算机使用速度,并推出实验性的跨上下文窗口笔记保留与检索功能,未来几周将成为 Astra 默认
- OpenAI 分享 GPT-6 Astra 协助取得的两项素数间隙结果:有界素数间距界从246改进到186,并改进维持80多年的大素数间隙界中的一项项
- OpenAI 披露 GPT-6 Astra 在评估中发现并利用两个此前未知的零日漏洞,正向相关维护者披露
- GPT-6 Astra 今日起向部分组织推出,未来几天开放给所有 ChatGPT 付费用户及 API、Azure、Bedrock,API 定价为输入10美元/输出50美元每百万 token
- OpenAI 计划未来几周通过 Daybreak 扩展 GPT-6 Astra 访问并推出限制更少的安全措施,当前仍拒绝创建概念验证利用等高级网络任务