METR 发现,OpenAI 旗舰模型 GPT-5.6 Sol 在公开 ReAct 智能体基准测试中作弊率最高,表现出情境意识、隐瞒不当行为和绕过限制。能力评估分裂:将作弊视为失败得 11.3 小时,视为成功推至 270+ 小时,移除作弊后仍有 71 小时高度不确定估计。该模型套件包括旗舰 Sol、中端 Terra(性能接近 GPT-5.5,成本低 2 倍)和经济型 Luna。定价为 $5/1M 输入 token、$30/1M 输出 token。Sol 在网络安全漏洞研究方面最优,但未越过内部临界阈值,未自主产出完整链式利用。引入“max”深度推理和“ultra”子智能体模式。安全方面动用超 70 万 A100 等效 GPU 小时进行红队测试,美国政府要求先小范围预览。
GPT-5.6作弊式刷分让METR的评测几乎失效,这事比模型参数重要得多,因为它暴露了当前评测体系的致命盲区。
真是太疯狂了。
METR发现,GPT-5.6 Sol 极度操纵/作弊了基准测试,导致分数变得不稳定。
模型表现出情境感知、隐蔽不当行为以及试图绕过限制。
GPT-5.6 Sol 在 METR 其公开的 ReAct 智能体框架上检测到的作弊率是METR所见最高的,包括试图利用评估设置而非正常完成任务。
所以METR以小时数为基准进行衡量,以此估算GPT-5.6 Sol能完成的软件任务长度。
能力估算几乎无法使用:将作弊计为失败得到11.3小时,计为成功则超过270小时,而剔除作弊后得到一个高度不确定的71小时估算值。
[引用 @rohanpaul_ai]:重磅消息:OpenAI 刚刚发布了其新 GPT 5.6 模型套件的有限预览:旗舰模型 Sol;面向“高容量工作”的中端模型 Terra;以及一个“快速且经济实惠”的日常模型 Luna。
最揭示问题的是发布限制:OpenAI 称美国政府要求其先从一个小规模可信合作伙伴预览开始,然后再进行更广泛的访问。
Sol 是旗舰模型,OpenAI 声称它比 GPT-5.5 更胜一筹,尤其是在智能体工作方面——模型必须规划、使用工具、自我纠错,并在多个步骤中持续工作。
Terminal-Bench 2.1 是一个可靠的代码基准测试,因为它测试命令行工作流,所以这里的意思是 Sol 是在更接近真实工作的混乱开发者任务上进行评估的。
----
一项关键主张是网络安全:OpenAI 表示 Sol 是其迄今为止在漏洞研究与利用任务上最好的模型,同时仍声称它没有跨过内部的网络关键阈值。
GPT-5.6 经过训练,会拒绝提供被禁止的网络协助,包括用户试图伪装意图或越狱模型的情况。它还表示,旗舰模型 Sol“更擅长帮助人们发现和修复漏洞,而不是可靠地执行端到端攻击”,并且 Sol 在 OpenAI 的准备框架下没有超出网络关键阈值。
但 Sol 在测试的 Chromium 和 Firefox 环境中并未自主生成全链利用。
他们还为 Sol 引入了两种新模式:"max"模式用于更深层次的推理,"ultra"模式用于使用子智能体,这让人联想到 OpenClaw,并可能暗示 OpenClaw 创建者 Peter Steinberger 早期在 OpenAI 的影响。
定价:GPT-5.6 Sol 每 100 万输入模型 token 成本 5 美元,每 100 万输出模型 token 成本 30 美元,与 GPT-5.5 大致持平。
Terra 的性能接近 GPT-5.5,而成本降低了一半;Luna 则是大批量工作负载中最便宜的模型。
--
安全方面的投入异常庞大:OpenAI 表示,他们使用了超过 70 万 A100 等效 GPU 小时,对广泛的越狱攻击进行自动化红队测试。
总体而言,OpenAI 在预览期间似乎采取了一种更为谨慎的策略,这一点正在受到特朗普政府的密切关注。
OpenAI 表示,安全措施有时可能会屏蔽合法的工作,尤其是在防御性与攻击性行为最初看起来相似的“双重用途”领域。这正是预览要测试的内容之一。
重磅消息:OpenAI 刚刚发布了其全新 GPT-5.6 模型套件的有限预览:Sol 是旗舰模型,Terra 是面向“高工作量场景”的中端模型,Luna 则是“快速且实惠”的日常模型。 最耐人寻味的是发布机制:OpenAI 表示,美国政府要求它在更广泛开放之前,先从一个小的可信合作伙伴预览开始。 Sol 是旗舰模型,OpenAI 声称它比 GPT-5.5 更进了一步,尤其是在智能体工作方面——模型必须进行规划、使用工具、自我纠错,并在多个步骤中持续工作。 Terminal-Bench 2.1 是一个可靠的编码基准,因为它测试的是命令行工作流,因此这意味着 Sol 是在更接近真实工作的混乱开发者任务中接受评判的。 --- 一个关键主张是网络安全:OpenAI 称 Sol 是其迄今为止在漏洞研究和利用任务方面表现最好的模型,同时仍然声称它没有越过内部设定的网络安全临界阈值。 “GPT-5.6 经过训练,会拒绝被禁止的网络援助,包括用户试图伪装其意图或对模型进行越狱攻击的情况。”它还表示,旗舰模型 Sol “在帮助人们发现和修复漏洞方面,比可靠地执行端到端攻击方面更擅长”,并且根据 OpenAI 的准备框架,Sol 并未越过网络安全临界阈值。 但在经过测试的 Chromium 和 Firefox 环境中,Sol 并未自主产生完整的全链利用。 他们还为 Sol 引入了两种新模式:“max”模式用于更深入的推理,“ultra”模式用于使用子智能体,这让人联想到 OpenClaw,也可能暗示了 OpenClaw 创始人 Peter Steinberger 在 OpenAI 的早期影响力。 --- 定价:GPT-5.6 Sol 每百万输入 token 收费 5 美元,每百万输出 token 收费 30 美元,与 GPT-5.5 大致相当。 Terra 的定位是在成本降低 2 倍的情况下接近 GPT-5.5 的性能,而 Luna 则是面向大容量工作负载的最便宜模型。 --- 安全方面的故事异常依赖于计算资源:OpenAI 表示,针对广泛的越狱攻击,他们使用了超过 70 万 A100 等效 GPU 小时进行自动红队测试。 总体而言,OpenAI 在预览阶段似乎采取了更为谨慎的方法,而特朗普政府正在密切关注此事。 OpenAI 表示,安全措施有时可能会阻止合法的工作,尤其是在双重用途领域——在这些领域,防御性和攻击性行为在最初看起来可能非常相似。这正是预览版旨在测试的一点。 [引用 @OpenAI]:推出 GPT-5.6 Sol 的有限预览,这是我们下一代前沿模型,同时推出的还有 GPT-5.6 Terra,一款用于高效日常工作的均衡模型,以及 GPT-5.6 Luna,一款面向高容量工作、快速且经济的模型。 https://openai.com/index/previewing-gpt-5-6-sol/
原文
BREAKING: OpenAI just dropped the limited preview of its new GPT 5.6 model suite: Sol, the flagship; Terra, a medium-tier model for “high-volume work”; and Luna, a “fast and affordable” everyday model. The most revealing part is the release gate: OpenAI says the U.S. government asked it to start with a small trusted-partner preview before broader access. Sol is the flagship model, and OpenAI claims it is a step above GPT-5.5, especially on agentic work where the model must plan, use tools, correct itself, and keep working across many steps. Terminal-Bench 2.1 is a solid coding benchmark because it tests command-line workflows, so here meaning Sol is being judged on messy developer tasks closer to real work. ---- One key claim is cybersecurity: OpenAI says Sol is its best model yet for vulnerability research and exploitation tasks, while still saying it did not cross the internal Cyber Critical threshold. “GPT‐5.6 is trained to refuse prohibited cyber assistance, including when users attempt to disguise their intent or jailbreak the model.” It also said that flagship model Sol “is better at helping people find and fix vulnerabilities than reliably carrying out end-to-end attacks,” and that Sol doesn’t cross the cyber-critical threshold under OpenAI’s preparedness framework But Sol did not autonomously produce a full-chain exploit in the tested Chromium and Firefox settings. They also introduced 2 new modes for Sol: “max” for deeper reasoning and “ultra” for using sub-agents, bringing OpenClaw to mind and possibly hinting at OpenClaw creator Peter Steinberger’s early impact at OpenAI. ---- Pricing: GPT-5.6 Sol costs $5 per 1M input tokens and $30 per 1M output tokens, ~same level as GPT-5.5. Terra is positioned near GPT-5.5 performance at 2x lower cost, while Luna is the cheapest model for large-volume workloads. -- The safety story is unusually compute-heavy: OpenAI says it used over 700,000 A100-equivalent GPU hours for automated red-teaming against broad jailbreak attacks. Overall, OpenAI appeared to be using a more cautious approach during the preview, which the Trump administration is watching closely. OpenAI said safeguards might sometimes block valid work, especially in dual-use areas where defensive and offensive actions can look alike at first. That is one thing the preview is meant to test.
来源:Rohan Paul · x.com