GPT-5.6 构建者指南:如何以更低成本实现前沿智能体性能
The builder’s guide to GPT‑5.6
GPT-5.6 模型家族以更低成本实现前沿级智能体性能,并新增推理持久化、原生多智能体编排和程序化工具调用等 API 能力。在 ARC-AGI-3 上,启用保留推理和压缩后,Sol 得分从 13.3% 跃升至 38.3%,且输出 token 减少约 6 倍。Luna 在 BrowseComp 上以 84.04% 的得分追平 GPT-5.5(84.36%),成本从 $33.27 降至 $1.33。
最实际的改变在 API 原语,让同一模型在 ARC-AGI-3 上用约六分之一输出 token 拿到近三倍分数,影响开发者对推理成本和上下文架构的判断。
GPT‑5.6 树立了性价比的新标准
GPT‑5.6 模型系列让前沿级别的智能体性能变得大幅更加实惠,同时也拓展了可能性的前沿。
在本指南中,我们展示初创公司如何利用更智能的模型选择以及新的 API 控制能力——这些能力有助于推理连续性、多智能体编排和程序化工具调用——以极低的成本构建更快、更强大的智能体。
更出色的开箱即用体验
自 GPT‑5 以来,每一代模型都力求以更少的 token 处理更长周期的任务。GPT‑5.6 延续了这一轨迹:更强的智能体性能、更低的成本,同时对底层 harness 的改动极小。
Artificial Analysis Coding Index
成本
成本效率在整体层面的提升,与在更低推理强度下实现的更高准确率相辅相成。例如,在 Agents’ Last Exam 上,当 harness 保持不变时,GPT‑5.6 Sol 在“低”推理强度下的表现超过了 GPT‑5.5 在“高”推理强度下的表现。我们在生产测试中也看到了类似的成功案例,初创公司报告称,通过将推理强度从先前的默认值降低,在各类工作流中都实现了显著的成本改善。
“我们把 GPT‑5.6 接入我们的测试框架,低推理投入就带来了最佳结果。它能判断出数据根本不存在,不会去追查错误的线索,并且用更少的 token 就得出正确答案。”
— Izzy Miller,AI 研究负责人,Hex
模型选择
过去,对于长周期用例而言,升级到旗舰模型并采用可用的最高推理投入一直是最佳选择。这在很大程度上是因为,这些模型在处理更长上下文和工具调用方面,能力显著强于成本优化型模型。随着 5.6 系列的推出,这一情况已经改变:在更多测试时计算的情况下,Luna 和 Terra 往往能达到与 GPT‑5.4 和 5.5 相似的表现,同时成本显著更低。
“Luna 以十八分之一的成本保留了 GPT‑5.5 提取准确率的 98%。这让我们得以为智能体提供高质量的文档理解能力,而这样的价格使其在更多工作流中变得切实可行。”
— Serhii Shchoholiev,智能体工程负责人,Hypha
“我们在 106 个最困难的浏览器任务上运行了 Luna,它以约 14 美元完成了其中 78%。当前的 SOTA 模型以约 235 美元达到了 80%。这种能力与成本的组合对于浏览器智能体来说非常出色。”
— Gregor Zunic,联合创始人,Browser Use
“Luna 现在是我们多项高吞吐代码检索和决策建模工作负载的默认模型。在我们多智能体工程系统的一项关键代码探索任务中,它将推理成本降低了 64%,响应时间缩短了 90%,并将 F1 提升了五个点。”
—— Animesh Koratana,创始人兼 CEO,PlayerZero
以 BrowseComp 中的任务为例:这是一个基于搜索的基准,用于测试模型搜索冷门事实的能力。三个月前,GPT‑5.5(Extra High)在该基准上得分 84.36%,总成本为 $33.27。发布时,GPT‑5.6 Luna(Extra High)实现了基本相同的性能,得分 84.04%,成本为 $1.33。此后我们又进一步降低了价格。阅读更多关于我们最新的降价。
5.6 系列中较小的模型非常适合高吞吐工作负载、对延迟敏感的交互,以及智能体工作流中的重复步骤。例如,如果你经营一家法律科技初创公司,需要在智能体分析之前解析手写备忘录,那么与其在整个用例中使用前沿模型,你现在可以使用 Terra 或 Luna 进行提取,并实现显著的成本节约。
演进 Responses API,以构建更高效的智能体
除了让 GPT‑5.6 开箱即用性能更强之外,我们还为 Responses API 发布了新的原语,以释放更多收益。我们通过三项互补的架构干预,对 GPT‑5.6 进行了端到端训练,使智能体能够更高效地运行:
- 复用已完成的工作:通过允许推理过程被持久化保存跨模型轮次,并使用原生压缩来压缩长时间运行的对话,模型能够在更长的任务周期内保持其工作的连贯性,而不会感到困惑或不得不重建先前的上下文。
- 在适当的情况下进行并行分解:使用原生多智能体编排可以跨并行工作流协调多个智能体,从而更快地完成复杂任务。
- 将确定性工作移入代码:使用程序化工具调用在模型的上下文窗口之外对工具输出进行过滤、聚合和编排,将模型 token 留给判断使用,并降低成本、延迟和上下文腐化。
结合使用时,差异可能非常显著。例如,在 ARC-AGI-3 上,GPT‑5.6 Sol 在标准测试框架下得分为 13.3%。然而,在启用保留推理和压缩后,得分跃升至 38.3%——同时使用的输出 token 大约减少了 6 倍。模型没有任何改动,但性能几乎提升至三倍。你可以在此处阅读更多关于我们ARC-AGI-3 测试框架调查的内容。
程序化工具调用
智能体工作流通常涉及两类工作:
- 需要判断的任务
- 主要涉及移动、筛选和组合数据的工作
当智能体检索 100 份文件、按日期筛选并识别相关交易时,模型不应被迫在其上下文窗口中对每一个中间结果进行推理。程序化工具调用让 GPT‑5.6 能够编写 JavaScript 来编排工具、并行运行独立调用,并在上下文窗口之外处理它们的输出。模型则被留出来专注于需要智能的部分:运用判断力。
“对于金融研究而言,难的是可靠地拉取文件、协调工具并处理数字。在我们的评估中,使用程序化工具调用的 GPT‑5.6 在达到我们评分标准同等质量的同时,输入 token 用量减少了 21%。这就是一个只能讨论金融研究的智能体和一个真正能执行金融研究的智能体之间的差别。”
— Alex Wang,应用 AI,Rogo
多智能体
在复杂且可并行化的任务上,将行动和推理分配到多个智能体工作流中,可以更快完成任务,同时提升智能水平。在这些设置中,主智能体负责编排子智能体并向它们委派任务。子智能体并行推进各自的目标,最后将输出传回主智能体进行最终综合。团队可以通过在 Responses API 中启用多智能体来原生利用多智能体。ChatGPT 中的 ultra 能力设置也是以这种方式工作的。
“Qualia 让成队的智能体处理开放式研究问题,而 GPT‑5.6 Sol 一下子就对上了。相比 GPT‑5.5 它展现出显著提升,完成速度几乎快于我们测试过的所有其他模型,并迅速成为我们首选的 OpenAI 模型。”
— E Chi,创始人,Quadrillion
“GPT‑5.6 是我们见过的 OpenAI 最好的编排器。我们一次性丢给它六份规格说明(同时进行写作、构建并全程讨论),它把一切都跟踪得井井有条,质量也没有崩掉。”
— Jon Bell,联合创始人兼 CPO,Obvious
尽管 GPT‑5.6 对合适的子智能体数量以及何时生成它们有很强的判断力,多智能体行为仍然非常可引导。就何时调用子智能体对模型进行指示,可以让它更倾向于只在额外 token 开销能带来更好表现的情况下才生成智能体。
提示词缓存
在整个模型系列中,提示词缓存的 TTL 已延长至最短 30 分钟,缓存断点现在可以在模型的上下文窗口内确定性地设置。这让初创公司得以显著提升其缓存命中率。
“我们向一个共享的 29,000-token 提示词中添加了缓存断点和针对各工作区的密钥,将未缓存输入减少了 28%。30 分钟的缓存窗口也是一大突破:我们的智能体可以在多次运行之间复用相同的上下文,而不必从头开始。”
— Lorenzo Gentile,AI 工程师,Ploy
除了设置缓存断点之外,继续使用合适的 prompt_cache_key 可以提高请求落到此前处理过相同前缀的同一推理引擎上的可能性,从而降低延迟。
结论
这些示例中最引人注目的是,构建智能体的经济账已经发生了多么大的变化。
那些曾经每一步都需要前沿模型的使用场景,如今通过使用更小的模型、调整推理投入以及做出高效的架构选择,就能以极低的成本取得相当甚至更好的结果。
我们很期待看到大家构建出的成果!
来源:OpenAI:官网动态(RSS · 排除企业/客户案例) · openai.com