GPT-5.6 系列模型发布:Sol、Terra、Luna
GPT-5.6: Frontier intelligence that scales with your ambition
OpenAI 推出 GPT-5.6 系列,包括旗舰 Sol、平衡型 Terra 和成本最优 Luna。在 Agents' Last Exam 上,Sol 以 53.6 分超越 Claude Fable 5(自适应推理)13.1 分;中等推理时以约四分之一成本领先 11.4 分。Terra 和 Luna 以约十六分之一成本超越 Fable 5。在 Artificial Analysis Coding Agent Index 上,Sol 以 80 分创 SOTA,高于 Fable 5 的 2.8 分,使用不到一半输出 token、一半时间,成本低约三分之一。引入 Programmatic Tool Calling 减少中间数据往返,ultra 模式协调多个智能体加速复杂任务。模型配备迄今最强安全防护,经人类红队和自动化测试验证。
GPT-5.6 在编码、安全、知识工作上全面领先,且 token 效率大幅优化,是我今年见过的真正能改变 agent 开发成本结构的发布。程序化工具调用和 ultra 模式值得立即试用。
从每一个 token 中汲取更多智能,以更强性能兑现每一分投入,并按需为你最艰巨的工作提供更强能力。
在有限预览之后,我们正式发布 GPT‑5.6 系列模型并全面开放:包括我们的新旗舰 Sol,以及面向日常工作、均衡表现的 Terra,还有我们最具成本效益的模型 Luna。
GPT‑5.6 Sol 在智能与效率两方面都树立了新标准,在编程、知识工作、网络安全和科学领域均取得 SOTA 成绩,同时以更少的 token 和更低的估算成本超越此前及竞争的前沿模型。其结果是更强的每一美元性能:同样的花费完成更多成功的工作,或以更低的总成本获得相当的结果。我们还引入了一种加速最严苛工作的新方式:ultra 是我们能力最强的设置,它协调多个智能体跨并行工作流协作,更快完成复杂任务。更强的计算机使用能力和设计判断力,使 GPT‑5.6 Sol 成为我们迄今最成熟的协作者,帮助它检查、完善并交付可直接使用的结果。
我们训练 GPT‑5.6,旨在从每一个 token 中获取更有用的工作成果。在 Agents’ Last Exam 上——这是一项覆盖 55 个领域、评估长时间运行专业工作流的评测——GPT‑5.6 Sol 创下 53.6 的新高,以 13.1 分的优势超越 Claude Fable 5(自适应推理)。即便在中等推理强度下,它也以约四分之一的预估成本超越 Fable 5 达 11.4 分。这种效率优势也延伸到了更小的模型,而它们对于让智能更充裕、更可负担至关重要:GPT‑5.6 Terra 和 GPT‑5.6 Luna 以约十六分之一的成本超越 Fable 5。在 Artificial Analysis Intelligence Index 上——这是一项涵盖智能体工作、编程、科学推理和通用能力的广泛智能衡量指标——采用最大推理强度的 GPT‑5.6 Sol 与 Fable 5 仅差一分,同时完成任务的时间少 61%,预估成本约为其一半。
GPT‑5.6 发布时配备了我们迄今为止最稳健的防护措施,旨在抵御有决心且不断适应变化的滥用行为,同时不会广泛限制合法工作。在正式开放前,我们让模型和防护措施经历了迄今最广泛的评估期,将人工红队测试与大规模自动化测试相结合。在预览期间,我们与专家组织和可信赖的合作伙伴密切合作,对防御进行压力测试,并在更广泛发布前强化防护措施。由此形成的系统将训练进模型的保护与实时检查、监控以及按信任度和风险校准的访问权限分层结合。
默认高效,按需释放最大性能
GPT‑5.6 Sol 是我们迄今最强的编程模型。在 Artificial Analysis Coding Agent Index 上,开启最大推理的 GPT‑5.6 Sol 刷新了 SOTA,达到 80,比 Fable 5 高出 2.8 分,同时输出 token 用量不到一半、耗时不到一半,成本还低约三分之一。这一优势贯穿整个系列:Terra 的表现略高于 Fable 5,而 Luna 则优于 Opus 4.8;两者都只用了大约三分之一的时间、约一半的输出 token,以及约四分之一的预估成本。它还在 Terminal‑Bench 2.1 和 DeepSWE 上刷新了 SOTA,这两项基准测试的是复杂命令行工作流以及真实代码库中的长周期工程任务。
GPT‑5.6 可以编写并运行轻量级程序,用来协调工具、处理中间结果、监控进度,并在工作推进过程中选择下一步动作。这让工具密集型任务能够以更少的 token、更少的模型往返次数和更少的引导完成。Responses API 中的 Programmatic Tool Calling 无需开发者编写每一步的脚本,也无需把每次工具响应都回传给模型,它就能过滤大量中间数据、只保留关键内容,并在此过程中调整自身工作流。
对于值得投入更多时间和算力的问题,GPT‑5.6 可以突破这一高效默认设置。max 给予 GPT‑5.6 比 xhigh 更多的时间来推理和探索替代方案、运行检查并修正其方法。ultra 则更进一步,默认并行协调四个智能体,以更高的 token 消耗换取更强的结果,并在高要求任务上实现更快的出结果时间。下图对比了 ultra 的默认四智能体配置与单智能体基线在 BrowseComp、SEC-Bench Pro 和 Terminal-Bench 2.1 上的表现;BrowseComp 和 SEC-Bench Pro 还展示了 16 智能体配置。在这三项评测中,增加并行智能体都将得分-延迟前沿向上并向左推移,从而在更短时间内达到更强的结果。在 API 中,开发者可以使用 Responses API 中的多智能体 beta 构建类似 ultra 的体验。
“GPT‑5.6 是我们在智能体代码审查测试中评估过的最强模型。在我们内部和外部 PR 基准的同等条件对比中,它在 F1 上击败了 GPT‑5.5,同时每个 PR 使用的 token 大约减少 3 倍,中位延迟大约降低 2 倍。”
——Itamar Friedman,Qodo 联合创始人兼 CEO
“GPT‑5.6 是金融研究智能体的一大进步。在 Rogo 的 Big Finance Benchmark 上,相比 GPT‑5.5,它将评分标准质量提升了 6.2 分,答案准确率提升了 3.6 分。借助 Programmatic Tool Calling,它在保持同等质量的同时,输出 token 减少了 24%,完成任务速度提升了 28%。这种准确性、速度和效率的结合,正是我们扩展高质量金融分析所需要的。”
——Alex Wang,Rogo 应用 AI 团队
“在法律研究和文档工作流中,GPT‑5.6 已经带来了足以改变产品经济性的效率提升。在我们的综合评测套件中,它使用的 token 减少了 14%,同时在法律研究和交易法用例中的质量有所提升。对于多步骤文档分析,Programmatic Tool Calling 将提示词 token 削减了 38%,且质量无损。”
—Angel Faus,Clio 联合创始人兼 CTO
“GPT‑5.6 Sol 真的非常非常出色。它是我们迄今见过的最坚韧的问题解决者,能够连续数天保持专注并持续执行任务。它尤其擅长随着你的工作空间演进更新 Custom Agents 并优化记忆,因此它们运行得越久就越敏锐。Terra 和 Luna 的表现也远超其价格定位。许多运行 GPT‑5.5 的智能体在 Terra 上表现同样出色,而成本减半、token 减少 16%。”
—Simon Last,Notion 联合创始人
“GPT‑5.6 感觉不太像聊天助手,更像一个端到端的技术操作员。它能够检查实时系统、调试问题、修改代码、验证结果、发布产物,并在长时间会话中携带上下文,且具有很强的落地能力。”
—Ian Tracey,Ramp 应用 AI 软件工程师
“GPT‑5.6 在理解我想要的工作层次方面远胜前代。在一个包含研究、规划、分阶段实现的多阶段 Codex 工作流中,它比 GPT‑5.5 更好地遵循意图,并始终能生成准确的、按行关联的 GitHub 引用,而此前的模型常常做不到。”
——Shane Moran,Shopify 高级应用 AI/ML 工程师
“GPT‑5.6 在我们所见过的复杂金融研究中提供了最佳效率表现。在我们的评测中,它达到了顶级水平,同时 token 效率提升了 1.72 倍,在三个核心类别中领先,并在多跳任务上得分 88%。效率、准确性和质量的结合,使该模型非常适合扩展金融研究工作流。”
——Alberto Da Costa,Balyasny Asset Management 应用 AI 首席工程师
“GPT‑5.6 在长时间运行的任务中始终能保持专注,能出色地使用工具,并且几乎无需引导就能得出高质量解决方案。对于研究和设计工作,它能生成清晰的报告和直观的图表,帮助我们的团队理解复杂系统并加快进度。”
——Arjun Sambamoorthy,Cisco AI 软件与平台副总裁兼 CTO
“GPT‑5.6 Sol 在推理、决策和自主性方面展现出显著提升。对子智能体使用的改进对复杂会计工作尤其有价值。对 OpenAI 在智能体发展方向上的进展感到兴奋。”
——Tarrek Shaban,Basis 产品负责人
设计上的一次飞跃
GPT‑5.6 在设计判断力上实现了跨越式提升。只需给出高层级的方向指引,GPT‑5.6 就能打造出有品位、符合人体工学且功能完善的界面。其更强的计算机使用能力让它能够检查并优化渲染后的结果——而不仅仅是生成底层的代码或内容——从而在交回工作成果之前发现视觉和功能上的问题并完成最后的润色。
GPT‑5.6 的前端能力还能在 ChatGPT Work 中将自然语言请求转化为精致、可交互的讲解和可视化内容。
端到端知识工作
GPT‑5.6 在专业任务上能交付更好的结果。它能够从你的文档以及 Slack、Notion、Microsoft 365 和 Google Drive 等日常工作中获取杂乱的上下文,并将其转化为专家级、可分享的成果物。
GPT‑5.6 在知识工作上的优势体现在涵盖长周期专业分析、浏览、工具使用和计算机使用的各项评测中。GPT‑5.6 Sol 在 BrowseComp 上以 92.2% 创下新的 SOTA 成绩,在 OSWorld 2.0 上达到 62.6%;在 OSWorld 上,它超越了 Opus 4.8,同时输出 token 用量减少了 85%。在这里,性价比的提升覆盖了整个 GPT‑5.6 系列。Luna 以不到一半的预估成本几乎追平 GPT‑5.5 的峰值性能,而 Terra 则以更低的成本超越了它。
GPT‑5.6 Sol 提升了演示文稿、文档和电子表格的质量,产出的成果更加精致、准确。它能够从零开始创建完全可编辑的演示文稿,将提示词和源材料转化为具有出色布局、层次和设计的连贯视觉叙事。
在遵循模板和参考演示文稿时,这一改进尤为显著。GPT‑5.6 能够推断出演示文稿的设计系统——布局、字体排版、间距、颜色以及反复出现的内容模式,包括嵌入幻灯片母版中的规则——并将这些惯例一致地应用到新素材上。在这个示例中,当被要求根据参考文件更新数字时,GPT‑5.5 的输出缺失了母版幻灯片中的关键组件,而 GPT‑5.6 则更忠实地遵循了参考结构。
GPT‑5.6 还能创建视觉上更精致的文档和电子表格。它更忠实地遵循复杂的参考格式,这对于可重复的知识工作活动非常重要。它以更高的精度处理方程和财务模型,并更好地利用字体排版、间距、层次结构以及页面或工作表布局。
Pinecrest Research Partners | Blossom Co.(BLSM)| 首次覆盖
请参阅本报告末尾的重要披露信息 1
股票研究 | 非必需消费品——专业零售与数字商务 2026 年 7 月 8 日
Pinecrest Research Partners LLC
Blossom Co.(NASDAQ: BLSM)
经常性收入结构与配送密度创造盈利拐点——首次覆盖给予增持评级
评级:增持(首次覆盖)| 目标价 $34.00 | 最新收盘价(2026 年 7 月 7 日)$27.40
目标价隐含上涨空间:+24.1%
市场数据
市值
24.7 亿美元
企业价值
23.1 亿美元
净现金 /(债务)
1.53 亿美元
摊薄后流通股数
9000 万股
自由流通股
90 日平均日成交量
120 万股
52 周区间
$18.20-$31.60
股息率
不适用(无股息)
过去 12 个月 ROE
财年结束
12月31日
上市 / 指数
NASDAQ / Russell 2000
报告货币
USD
来源:Pinecrest Research Partners;收盘价序列截至 2026 年 7 月 7 日。Russell 2000 以 2025 年 7 月 8 日为基准重设为 100。
执行摘要
我们首次覆盖 Blossom Co.("Blossom"或"BLSM"),给予增持评级,目标价 $34
,较最新收盘价隐含约 24% 的上行空间。Blossom 是一个技术驱动的优质花卉、礼品
与订阅平台,融合了专有个人化能力、九个区域制备中心,以及
约 280 家认证本地工作室。我们认为 Blossom 正从节日驱动的在线花商演进为
更高频的礼品平台,经常性会员服务与企业服务提升了收入
可见度、客户终身价值与履约密度。
我们的投资论点基于三点:
•(1) 收入质量正在改善。会员、订阅和业务平台收入
占 FY25 销售额的 35.8%;我们模型预测该占比到 FY28 将达到 44.3%。这些收入流相比一次性
购买具有更高的留存率、更低的增量获客支出以及更好的订单可见性
。付费订阅用户在同一期间从 115 万增长至 218 万,
而企业礼品业务则受益于员工表彰计划、忠诚度集成以及不断扩展的
履约 API。
BLSM 12 个月价格走势 vs Russell 2000
BLSM(价格,$,左轴)
Russell 2000(重定基 = 100,右轴)
Jul 25 Sep 25 Nov 25 Jan 26 Mar 26 May 26 Jul 26
52 周最高 $31.60
最新 $27.40
BLSM 价格($)
Russell 2000(重定基 = 100)
早期测试 GPT‑5.6 的客户发现,其在各领域知识工作产出方面均有提升。
“GPT‑5.6 在构建生产级应用背后那些漫长而复杂的工作流上表现得尤为高效。作为 Lovable 目前使用的模型之一,它相比此前的模型,为用户完成任务所需的步骤减少了约 25%,工具调用减少了 35–48%,同时提升了项目成功率,并将卡住的运行减少了 15%。对于任何想要从想法走向可用应用的人来说,这都是一个意义重大的差异。”
—Fabian Hedin,Lovable 联合创始人
“GPT‑5.6 Sol 是我们评估过的第一个能够持续生成可直接用于实际工作的演示文稿的模型。在 Model ML 的 FinBench 中,面对 20 个具有挑战性的客户工作流和数百份演示文稿,它每份演示文稿使用的 token 比 Fable 少 39%,同时生成的演示文稿更精致、更易读,数据可视化更清晰、更准确,在分享前需要返工的地方也更少。”
—Chaz Englander,ModelML 联合创始人兼 CEO
“在我们七项任务的基准测试中,GPT‑5.6 是综合表现最好的前端模型。在我们五分制的前端 QA 评分标准中,它得分 4.4,而 GPT‑5.5 为 4.0,Claude 4.8 为 3.5,并且它能够持续将复杂的电商、仪表盘和产品需求简报转化为在桌面端和移动端都完整且响应式的界面。”
—AJ Orbach,Triple Whale CEO
“借助 GPT‑5.6 的 Programmatic Tool Calling,我们能够通过结构化 API 更高效地构建精细的 Unity 场景。在场景构建工作流中,与使用直接工具调用的同一模型相比,它使用的总 token 数减少了 63.5%,模型轮次减少了 50.1%,同时生成了相当的视觉效果。这让迭代式游戏创作在规模化上变得更加切实可行。”
—Teddy Cross,PlayCo 联合创始人兼 CPO
“GPT‑5.6 在演示文稿方面尤为出色。在我们的早期设计评测中,它在幻灯片创建方面强于竞争模型,并且 token 效率大约高出 1.6 倍,当你要以 Canva 的规模生成和优化视觉作品时,这一点至关重要。”
—Danny Wu,Canva AI 产品负责人
“GPT‑5.6 标志着 Microsoft 365 中工件生成的一次进步。在我们的评测中,它在广泛的生产力场景中都交出了强劲结果,生成的输出高度连贯、准确,并且可直接使用。通过减少优化提示词和迭代草稿所需的精力,它帮助用户花更少时间打磨内容,把更多时间用于基于内容采取行动。”
—Charles Lamanna,Microsoft Copilot、Agents 与平台执行副总裁
“在 30 段真实世界的应用构建对话中,GPT‑5.6 相比 GPT‑5.5 使用的输入 token 减少了 22%,输出 token 减少了 23%,同时在从零开始和长多轮工作上保持竞争力。这是一次真正的提升,尤其是在设计和前端能力方面。”
——Gabriel Grinberg,Base44 AI 工程负责人
“GPT‑5.6 在法律工作流上更进一步。在 Legora 的内部评测框架中,它在 7 项任务中有 5 项得到提升或保持稳定,其中结构化起草和判例审查方面的提升最为显著,同时在对法律结论的判断上保持了恰当的审慎。”
——Jake Lauritzen,Legora 首席技术官
在网络与科学领域推进前沿
GPT‑5.6 是我们迄今最强的网络安全模型,以显著更少的 token 实现了前沿性能。在 ExploitBench1 上——该基准衡量从触达漏洞代码到实现任意代码执行的进展——在可比的输出 token 预算下,它得分 73.5%,而 GPT‑5.5 为 47.9%。在 ExploitGym2 上——该基准要求智能体将真实世界漏洞转化为可用的漏洞利用——在两小时上限内,它几乎将 GPT‑5.5 的峰值通过率翻倍,从 15.1% 提升至 24.9%;若给六小时,则达到 33.7%。在 SEC-Bench Pro 上——该基准测试在复杂软件上生成概念验证的能力——它得分 71.2%,而 GPT‑5.5 为 45.8%,且延迟有所改善。
GPT‑5.6 支持重要的防御性任务,例如安全代码审查、打补丁、威胁建模和蓝队防御。OpenAI Daybreak 的 Trusted Access for Cyber 计划中符合条件的个人和组织,可以通过针对授权环境中经核实工作的更精准防护措施,获取其更多的防御能力,包括漏洞分级与验证、恶意软件分析、检测工程以及补丁验证。
个人可以验证自己的身份并申请可信访问,组织则可以为其团队提出申请。个人成员需要启用高级账户安全功能,才能保留对我们最具网络能力的前沿模型的访问权限;未启用者将恢复为默认访问权限。我们还在采取额外措施,限制高风险实体和高风险司法管辖区的访问。
ExploitBench:构建能力逐步增强的 V8 漏洞利用程序;GPT‑5.6 相较 GPT‑5.5 展现出大幅提升。未展示延迟图表,因为该基准测试的延迟估算不可靠。
GPT‑5.6 Sol 在科学研究领域也展现出广泛提升。在生命科学评估中,GPT‑5.6 在真实世界生物学、生命科学研究工作流和化学方面相较 GPT‑5.5 展现出帕累托改进。
GeneBench Pro:长周期基因组学与定量生物学分析;GPT‑5.6 以更少的 token 和更短的时间达到更强的结果。Claude Fable 5 未被纳入,因为它不回答高级生物学问题,并拒绝该评估中的大多数问题。
GPT‑5.6 加速 OpenAI
GPT‑5.6 是我们迄今为止用于加速 AI 研究的最强模型。在 OpenAI 内部,研究人员将其用于整个开发循环:诊断故障、优化训练系统、运行实验以及解读结果。在 GPT‑5.6 的内部测试期间,我们已看到这种加速和更强的采用度,每位活跃研究人员的日均输出 token 量是 GPT‑5.5 所观测到的最高水平的两倍以上。
这种工作方式正迅速成为标准做法。在过去六个月里,用于内部编码推理的研究算力占比增长了 100 倍,而内部智能体 token 使用量增长了约 22 倍。这些采用指标本身并不能衡量研究进展,但它们表明,AI 辅助在研究中以及销售、市场、用户运营、财务等其它团队中的普及速度有多快。
为了直接衡量这一能力,我们开发了一套内部评估套件,基于真实的 AI 研究任务,包括调试研究系统、优化 kernel 和训练配方、运行机器学习实验,以及改进另一个模型。
综合 RSI 能力:在一组衡量递归自我改进进展的评估上,我们观察到 GPT‑5.6 Sol 相比 GPT‑5.5 提升了 16.2 分,全面加速了内部研究。
随能力提升同步扩展安全与安保
随着模型能力的提升,我们不断强化安全体系,使先进智能在保持广泛可用的同时,对最高风险的用途施加更严格的审查。针对 GPT‑5.6,我们构建了迄今为止最稳健的安全系统,根据每个模型的能力进行校准,并由比以往更多的算力驱动。
GPT‑5.6 模型在生物学和网络安全两个领域都比我们此前的模型能力更强,但均未跨越任一类别中的“关键”阈值。在网络安全方面,我们的测试表明,GPT‑5.6 更擅长发现和修复漏洞,而非可靠地对加固目标执行自主的端到端攻击——这为防御方提供了在弱点被利用之前强化系统的机会。在生物学方面,我们的测试表明,GPT‑5.6 可以支持合法研究,但不具备创建、工程化或合成高度危险的新型威胁所需的端到端能力。
这两个领域本质上都具有双重用途。在网络安全中,那些可能帮助攻击者利用漏洞的相同能力,也能帮助防御者发现漏洞、复现漏洞并构建可靠的修复方案。因此,过度拦截本身就会制造安全风险。它可能阻止防御方测试系统和部署补丁,而恶意行为者却继续使用其他模型——包括能力日益强大的开源模型——以及现有工具。有效的防护措施会考虑请求的上下文和可能后果,在保留合法防御工作的同时,在证据表明存在严重伤害风险之处施加更强的管控。
GPT‑5.6 的防护措施采用分层设计,以实现更高的准确性和冗余性,并旨在随着新攻击的出现快速适应。训练进模型中的防护机制与实时检查、持续监控以及账户级强制执行协同工作,即使某一特定层未能按预期发挥作用,也能帮助系统保持安全。在许多系统中,仅凭分类器标记就决定拦截什么,依赖的是较难更改的低智能模型来防止危害。我们的方法增加了一个推理监控器,用于审查对话以判断是否存在潜在危害。这一设计旨在支持防御性工作的同时阻止严重滥用,最敏感的能力通过 Trusted Access 保留给经过验证的用户。由于部分防护使用了测试时推理,我们可以快速更新它们以填补漏洞,而无需从头重新训练分类器。
在我们持续加强系统以抵御自适应攻击的过程中,我们采取了更为保守的做法。与之前的模型相比,我们的 GPT‑5.6 Sol 网络防护措施拦截的潜在有害活动大约多出十倍。由于这些措施可能给良性使用带来摩擦,我们在 ChatGPT 和 Codex 中提供了一个选项,可轻松在能力较低的模型上重试提示词,同时我们将继续减少防护措施对良性使用的影响,并保持高稳健性标准。这体现了我们迭代式部署的方法:从保守起步,并根据从真实世界使用中学到的经验不断改进。
在正式发布之前,我们开展了迄今为止最深入的安全评估,包括广泛的红队测试、与外部专家进行的全面能力与防护措施测试,以及约 700,000 A100e GPU 小时的黑盒自动化红队测试。这使我们能够系统性地探查潜在薄弱点、发现越狱方法,并帮助我们在发布前强化系统。
不存在完美的安全,我们为保护能力日益强大的模型所做的工作仍在继续。新的弱点会被发现,绕过现有防护措施的新越狱方法也会出现。每一代新模型还会带来新的攻击和滥用途径。我们通过分层防护、持续监控、快速修复以及防御社区的协作来应对这一现实。对于 GPT‑5.6,我们将现有的安全和生物漏洞赏金计划与新的快速修复流程以及迄今为止最强的监控工作相结合。来自研究人员、监控和现实世界滥用的发现将持续不断地为新的评估和更强的防护措施提供输入。
在更新后的 GPT‑5.6 系统卡中了解更多关于我们防护措施的信息。
可用性与定价
GPT‑5.6 涵盖三个模型层级:Sol,我们的旗舰模型;Terra,一款成本更低、性能可与 GPT‑5.5 媲美的模型;以及 Luna,我们最快、最实惠的模型。数字标识代际,而 Sol、Terra 和 Luna 是持久的能力层级,可以按各自的节奏推进。
GPT‑5.6 从今天起在 ChatGPT、Codex 和 OpenAI API 上可用。此次发布现已在全球范围内启动,并将在接下来的 24 小时内逐步推进至全面可用。
Chat:Plus、Pro、Business 和 Enterprise 用户可通过 medium 及更高 effort 设置访问 GPT‑5.6 Sol。Pro 和 Enterprise 用户还可选择 GPT‑5.6 Sol Pro,以在复杂任务上获得最高质量的结果。ChatGPT Work 和 Codex:Free 和 Go 用户可访问 GPT‑5.6 Terra。Plus、Pro、Business 和 Enterprise 用户可在 GPT‑5.6 Sol、Terra 和 Luna 之间选择,并为每个模型设置 effort 级别。max 面向所有在 ChatGPT Work 和 Codex 中可访问 GPT‑5.6 的用户开放,并可在设置中开启。在 ChatGPT Work 中,ultra 面向 Pro 和 Enterprise 用户开放。在 Codex 中,它面向 Plus 及更高套餐开放。API:开发者可通过 OpenAI API 访问 Sol、Terra 和 Luna。在 Responses API 中,Programmatic Tool Calling 让 GPT‑5.6 能够在内存中编写并运行程序,以协调工具并处理中间结果,从而兼容 Zero Data Retention(ZDR)。Multi-agent 最初以 beta 形式提供,让 GPT‑5.6 能够在单个请求中运行并发的子智能体并综合它们的工作成果。
GPT‑5.6 按每 1M tokens 计费,涵盖三种模型规模:Sol 为 $5 输入 / $30 输出;Terra 为 $2.50 输入 / $15 输出;Luna 为 $1 输入 / $6 输出。GPT‑5.6 还引入了更可预测的提示词缓存,包括支持显式缓存断点以及 30 分钟的最低缓存寿命。对于 GPT‑5.6 及之后的模型,缓存写入按该模型未缓存输入费率的 1.25x 计费,而缓存读取继续享受 90% 的缓存输入折扣。
专业版
EvalGPT‑5.6 SolGPT‑5.6 TerraGPT‑5.6 LunaGPT‑5.5Claude Fable 5Claude Opus 4.8Gemini 3.1 Pro PreviewGemini 3.5 Flash Agents' Last Exam 52.7%50.4%50.3%46.9%40.5%45.2%32.1%— GDPval-AA v2 1,747.8 Elo 1,593 Elo 1,591.8 Elo 1,493.7 Elo 1,759.6 Elo 1,600.1 Elo 962.3 Elo 1,348.8 Elo Management Consulting Tasks (Internal)43.2%37.2%35.4%31.3%35.5%31.6%13.2%— Big Finance Bench 53%51%36%49%—44%—— Artificial Analysis Intelligence Index v4.1 58.9 Index score 55 Index score 51.2 Index score 54.8 Index score 59.9 Index score 55.7 Index score 46.5 Index score 50.2 Index score
编程
EvalGPT‑5.6 SolGPT‑5.6 Sol UltraGPT‑5.6 TerraGPT‑5.6 LunaGPT‑5.5Claude Mythos 5Claude Mythos PreviewClaude Fable 5Claude Opus 4.8Gemini 3.1 Pro Preview Artificial Analysis Coding Agent Index v1.1 80 Index score—77.4 Index score 74.6 Index score 76.4 Index score——77.2 Index score 72.5 Index score 42.7 Index score SWE-Bench Pro 64.6%—63.4%62.7%59.4%80.3%77.8%80%69.2%54.2% DeepSWE v1.1 72.7%—69.6%67.2%67%——69.7%59%11.8% Terminal-Bench 2.1 88.8%91.9%87.4%84.7%85.6%88%—83.1%78.9%70.7%
科学与健康
EvalGPT‑5.6 SolGPT‑5.6 TerraGPT‑5.6 LunaGPT‑5.5Claude Fable 5Claude Opus 4.8Gemini 3.1 Pro PreviewGemini 3.5 Flash GeneBench Pro 28.7%23.3%10.8%12%—16%3.1%8.14% LifeSciBench 59.9%56%51.2%50.4%—53.6%—— MedChemBench (Internal)48.3%35%30.4%35.5%———— HealthBench Professional⁶ 60.5%57.7%55.7%49.5%60.9%53%——
计算机操作
评测GPT‑5.6 SolGPT‑5.6 Sol UltraGPT‑5.6 TerraGPT‑5.6 LunaGPT‑5.5Claude Mythos 5Claude Mythos PreviewClaude Opus 4.8Gemini 3.1 Pro Preview OSWorld 2.0 62.6%—50.2%45.6%47.5%——54.8%— BrowseComp 90.4%92.2%87.5%83.3%84.4%88%87.9%84.3%85.9% BenchCAD 70.6%—62.3%63.1%44.4%38.4%35.5%27.3%— BenchCAD(python 工具)83.4%—78.2%73.9%55.8%65%61%51.8%—
网络安全
评测GPT‑5.6 SolGPT‑5.6 Sol UltraGPT‑5.6 TerraGPT‑5.6 LunaGPT‑5.5Claude Mythos 5Claude Mythos PreviewClaude Opus 4.8 Capture-the-Flag 挑战赛 96.7%—91.8%85.2%88.1%——— SEC-Bench Pro 71.2%74.3%57.7%48.9%45.8%——— CyberGym 84.5%—81.8%77.9%81.8%83.8%83%78.1% ExploitBench 73.5%—52.9%33.2%47.9%78%74.2%40% ExploitGym 33.7%—23.2%12.4%15.1%———
自我改进
评测GPT‑5.6 SolGPT‑5.6 TerraGPT‑5.6 LunaGPT‑5.5 Internal Research Debugging Evaluation 68.3%67.8%50.8%50% KernelGen 1P 61.1%49.2%22.4%29.3% NanoGPT 9.69%14.5%1.66%2.65% PostTrainBench Lite 50.3%51.5%29.6%38.8% RSI Index 57.9%56.3%41.9%41.7%
多模态
评测GPT‑5.6 SolGPT‑5.6 TerraGPT‑5.6 LunaGPT‑5.5Claude Fable 5Claude Opus 4.8Gemini 3.1 Pro Preview MMMU Pro(无工具)83%80.7%78.4%81.2%——80.5% MMMU Pro(有工具)84.6%82%79.5%83.2%——— gdp.pdf 30.7%24.7%22.7%26%29.8%22.5%16.7%
学术
EvalGPT‑5.6 SolGPT‑5.6 TerraGPT‑5.6 LunaGPT‑5.5Claude Mythos 5Claude Mythos PreviewClaude Fable 5Claude Opus 4.8Gemini 3.1 Pro Preview GPQA Diamond 94.6%92.9%92.3%93.6%94.1%94.6%92.6%92%94.3% FrontierMath Tier 1-3 (v2)86%84.9%78.6%85.3%——87%80%59.6% FrontierMath Tier 4 (v2)65.9%68.3%58.5%72.5%——87.8%56.1%—
工具使用
EvalGPT‑5.6 SolGPT‑5.6 TerraGPT‑5.6 LunaGPT‑5.5Claude Mythos 5Claude Mythos PreviewClaude Fable 5Claude Opus 4.8Gemini 3.1 Pro PreviewGemini 3.5 Flash AutomationBench 18.1%15.2%14.9%12.9%——17.4%15.5%—14.5% Toolathlon 58%53.1%53.4%55.6%61.7%61.1%61.7%59.9%48.8%—
长上下文
EvalGPT‑5.6 SolGPT‑5.6 TerraGPT‑5.6 LunaGPT‑5.5Claude Mythos 5Claude Mythos PreviewClaude Opus 4.8 OpenAI MRCR v2 8-needle 256K-512K 91.5%89.6%41.3%81.5%——— OpenAI MRCR v2 8-needle 512K-1M 73.8%72.5%41.3%74%——— GraphWalks BFS 256k f1 90.7%76.9%81.3%73.7%91.1%85.7%85.9% GraphWalks BFS 1mil f1 77.1%71.2%51.2%45.4%79.4%74.3%68.1%
抽象推理
EvalGPT‑5.6 SolGPT‑5.6 TerraGPT‑5.6 LunaGPT‑5.5Claude Opus 4.8Gemini 3.1 Pro Preview ARC-AGI-3⁷ 7.78%0.8%0.18%0.43%1.5%0.42%
脚注
所有模型均使用 ExploitBench API 测试框架进行评估,采用 5 个随机种子并保持推理连续性。
我们在 alpha API 上运行了 ExploitGym,其响应输出速度快于我们的公开 API,随后再重新缩放以匹配公开 API。在将延迟重新缩放至公开 API 预期速度时,这会导致部分估算延迟超出两小时和六小时的时限,尽管在评估运行中这些时限得到了正确遵守。为了在时间敏感的工作中获得更快的速度,我们在 API 中提供优先处理,并在 Codex 中提供快速模式。
我们通过观察模型的生产环境行为并进行离线模拟来估算延迟和 API 成本。这些估算考虑了工具调用细节、采样的 token 以及输入 token。实际结果可能会有显著差异,并取决于我们的模拟未能捕捉的许多因素。我们按快速 API 速度模拟延迟,按常规 API 定价模拟成本。
未报告输出 token、延迟或成本的模型以水平虚线绘制。
对于多智能体,延迟取自根智能体,而输出 token 和 API 成本总计则包含所有 token。Ultra 以 4 个智能体运行。
我们使用 HealthBench Professional 论文中描述的官方评分方法计算得分,该得分与 Anthropic 系统卡中报告的结果不具可比性。
Opus 4.8 的 ARC-AGI-3 是在 high 而非 max 推理努力下运行的,因为这是唯一已发布的 ARC-AGI-3 结果。
来源:OpenAI:官网动态(RSS · 排除企业/客户案例) · openai.com