跳到正文
北京时间
原文
Anthropic:Newsroom(网页)·· 2026-07-24精选AI 评分92

Anthropic 发布 Claude Opus 5

Introducing Claude Opus 5

AI 导读

Anthropic 发布 Claude Opus 5,其智能水平接近 Claude Fable 5,但价格减半。该模型在 Frontier-Bench v0.1 上性能超过 Opus 4.8 两倍以上,在 ARC-AGI 3 上得分是次优模型的三倍。Opus 5 即日起成为 Claude Max 的默认模型和 Claude Pro 的最强模型。

推荐理由

Anthropic 这次把 Opus 的性价比条拉满了,性能翻倍价格减半,实际编码和知识工作基准已经超越所有模型。最打动我的是它自查自纠的严谨,写代码像真开发者一样审自己的页面,这种责任心以前只在人身上见过。

正文 · AI 翻译

Introducing Claude Opus 5

Claude Opus 5 今日正式上线。它是一款深思熟虑且主动积极的模型,智能水平接近 Claude Fable 5 的前沿水准,而价格仅为其一半。

在 Frontier-Bench 和 GDPval-AA 等编程与知识工作评测中,Opus 5 成为新的 SOTA,不过在网络安全任务上仍落后于 Mythos 5。

Opus 5 专为日常使用而设计:它的工作效率高于其他模型。它是 Claude Max 上新的默认模型,也是 Claude Pro 上最强的模型。

性能与成本效益

Claude Opus 5 在与前代 Opus 4.8 相同的成本下,性能大幅提升。本节图表展示了性能如何随模型的 effort 设置而变化,客户可利用该设置来优化智能水平,或节省 token 以获得更快、更便宜的结果。

Opus 5 在重要的软件工程任务上表现卓越。例如,在 Frontier-Bench v0.1 上,Opus 5 超越了所有其他模型,且以更低的单任务成本实现了 Opus 4.8 两倍以上的性能。在 CursorBench 3.2 上,在 max effort 下,该模型的成绩与 Fable 5 的峰值分数相差不到 0.5%,但单任务成本仅为其一半;在 high、xhigh 和 max effort 下,它在同等成本下的表现也优于所有其他模型。

我们在知识工作和问题解决任务上看到了类似的结果。例如:

  • 在 ARC-AGI 3 上,这是一项要求模型解决全新问题的评测,Opus 5 的得分是第二好模型的三倍。
  • 在 Zapier AutomationBench 上,该基准衡量模型能否从头到尾完成业务任务,在每项任务成本相同的情况下,Opus 5 的通过率约为第二好模型的 1.5 倍。即便在其最低努力设置下,Opus 5 通过的任务数量也超过任何其他模型。
  • 在 OSWorld 2.0 这一计算机使用基准上,Opus 5 在任意给定成本下都优于其他所有模型,以略高于三分之一成本超越了 Fable 5 的最佳成绩。

在多项相关评测中,它也是我们表现最佳、最具成本效益的模型:

在科学研究方面,Opus 5 相比 Opus 4.8 有显著提升。在我们所有的生命科学评测中,它的表现都优于 Opus 4.8,这些评测涵盖结构生物学、有机化学和生物信息学等主题。其提升在有机化学任务上尤为突出,例如从光谱数据推断分子结构(在我们的内部基准上比 Opus 4.8 高出 10.2 个百分点),以及在蛋白质相关任务上,例如预测蛋白质序列变异如何影响其功能(此处高出 7.7 个百分点)。

最后,Opus 5 能够生成强大得多的视觉输出:

媒体内容 · 前往原文查看
Opus 5 可视化了气流掠过空气动力学(以及非空气动力学)物体时的流动情况。在风洞中尝试不同的设置,点击这里。

使用 Claude Opus 5

Claude Opus 5 在验证自身工作并反复迭代直至成功方面要强得多。在评估和早期访问测试中,我们和我们的用户发现了许多体现 Opus 5 能动性和周密性的例子:

  • 在一项 Frontier-Bench 任务中,Opus 5 拿到了一张机械零件的图纸,并被要求编写代码将其重建为 3D FreeCAD 模型。然而,在这项任务中,模型被有意设置为无法直接查看该图纸。Opus 5 的应对方式是编写自己的计算机视觉流水线,从原始像素中提取几何信息,然后重建出完整的机械零件。它反复成功地做到了这一点;在相同设置下,没有任何竞争模型能在五次尝试后解决该任务。
  • 面对一个流行开源包管理器中的真实 bug,Opus 5 找到了根本原因,并修复了社区补丁遗漏的一个边缘情况。一个竞争模型只修复了表面症状(而非底层原因),随后便报告该 bug 已解决。
  • 一家交易公司的工程师使用 Opus 5,在一次会话中为一家新交易所构建了市场数据源。此前的模型完全无法完成这项任务,即便工程师提供了详尽的方案。由于找不到可用于验证的实时数据源,Opus 5 甚至构建了自己的测试框架,以检查其代码是否正确解析了该交易所的数据。

以下是我们的早期访问客户就使用 Opus 5 的体验所提供的更多反馈:

logo

在 FrontierCode 1.1 上,Claude Opus 5 以一半的成本达到了接近 Fable 级别的性能。在 Devin 中,它在高难度调试和根因分析任务上也展现出特别的优势。

logo

Claude Opus 5 以 Opus 的速度和成本,带来了接近 Fable 5 的智能水平。在 CursorBench 上,它仅次于 Fable 5,并且具有许多相同的行为表现。我们很期待看到开发者们在 Cursor 中如何使用它。

logo

Claude Opus 5 登顶了 Zapier 的 AutomationBench 排行榜,且消耗的 token 并不比此前的 Claude 模型更多。它拿到一份原始账户健康工作簿,端到端地跑完了一整套流失预防流程:标记高风险账户、通知正确的负责人,并为留存运营团队生成摘要。此前的模型都没能通过;Opus 5 达到了 100%。

logo

在我们的基因组学分析工作中,Claude Opus 5 表现得比我们运行过的任何模型都更像一位严谨的科学家。它会主动选用合适的统计检验来排除混杂因素,通过独立方法交叉核验自身结果,并在漫长的多步骤分析中始终保持正轨。

logo

在我们的内部评测中,Claude Opus 5 超越了其家族中的每一个模型。它不仅在我们最困难的智能体编程任务上表现更好——比 Opus 4.7 提升了 22%——而且更加稳定,每次运行之间的方差要小得多。对于 Lovable 上数百万的构建者来说,这种一致性就是全部。一次又一次构建,结果始终可靠。

logo

Claude Opus 5 是 Opus 家族自 4.5 以来最大的一次飞跃。在相同的全栈应用构建任务上,前端最先体现出这一点:这是我们见过的 Opus 模型中最好的动画、游戏和 3D 作品。

logo

我们非常喜欢 Claude Opus 5。对于我们的智能体所处理的那种开放式分析工作,它相比 Opus 4.8 是一次严格的升级,而且提升最大的地方恰恰是最关键之处:那些更难、更模糊的任务。回答更清晰、更简洁,我们还看到在更高推理投入水平下效率也有所提升。

logo

对于我们的分析师每天运行的金融研究工作流而言,Claude Opus 5 相比 Opus 4.8 是一次显著的提升。它在数值推理、表格处理以及精度至关重要的更敏锐的批判性思维方面表现突出。

logo

Claude Opus 5 提供了对专业企业内容分析至关重要的行业洞察力与准确性。Box 发现,Opus 5 比 Opus 4.8 高出 8%,并在技术、医疗和公共部门组织日常依赖的数据分析(提升 11%)和尽职调查(提升 17%)工作流中带来了显著的性能提升。

logo

Claude Opus 5 相比 Opus 4.8 是一次明确的代际跃升。在一个周末里,我让它担任我的开发环境的幕僚长:它搭建了自己的监控程序,驱动每一台机器,只在需要做判断时才会找我。

logo

Claude Opus 5 在我们的 Fundamental Research Assistant 代码库中进行了大规模修改,在整个智能体工作流中根据反馈不断调整,并且比我们用过的任何模型都更清晰地解释其推理过程。它处理了我们通常需要拆分成许多更小片段的工作。

logo

在一些我们最棘手的金融建模任务上,Claude Opus 5 在准确性和效率两方面都明显优于 Opus 4.8。它的性能下限实质性更高,尤其是在深度金融领域逻辑方面。在各个努力等级上,它平均准确率高出 9 个百分点,同时轮次和工具调用减少了三分之一,耗时减少了 60%。

logo

Claude Opus 5 会像一位真正的前端开发者那样检查自己的工作。在我们的基准测试中,它会在桌面和手机宽度下用浏览器打开自己的页面,发现了一个隐藏在移动端折叠线以下的产品和一个跑到屏幕外的结账按钮,并在交回工作之前把两者都修复了。

logo

与之前的 Opus 模型相比,Claude Opus 5 在法律智能体工作上的表现明显提升,我们在公司治理和仲裁等业务领域看到了最大的收益。Opus 5 在较低推理等级下保持质量的能力也让我们印象深刻,与处于最大推理等级的 Opus 4.8 相比,它在达到相近表现的同时平均生成的 token 少了 26%。

logo

Claude Opus 5 对我们而言最大的提升在于更长周期的工作:先构建一整套演示文稿,然后再修改它。产出物的质量决定了我们最终上线哪个模型,而这是我们见过的最明显的提升——更好的视觉理解、更整洁的排版、更少的幻灯片问题。

logo

Claude Opus 5 的判断力最为突出。在交接一个 PR 时,它不会急于发布:它会核实分支、检查模板,并思考测试方面的影响,从而让交接干净利落。较老的模型往往会抢跑,然后被我们的检查卡住。

logo

在一次架构重构会议中,Claude Opus 5 对我提出的一个设计方案提出了反对意见,而且在我坚持己见时也没有让步。相反,它准确解释了我的想法中哪些部分是有价值的,把它的异议收窄到一个具体的设计问题上,并提出了一个折中方案,既保留了好的部分,又修复了缺陷。正是这种判断力,让我们能够在减少监督的情况下信任它。

logo

在首轮红线标注上,Claude Opus 5 在我们测试过的所有模型中得分最高,几乎是 Opus 4.8 的两倍。评论质量也更好:在 NDA 上,它能用更少的时间、更少的轮次完成红线标注,同时准确率保持不变或更高。

logo

Claude Opus 5 能写出干净、紧凑的 diff,没有死代码,而且在微妙的、代码库特有的问题上,它是更强的隐患发现者。我们正在将其用于生产工作负载。

logo

我们肯定会迁移 Cosmos 中的大量用例,那是我们的统一智能体平台。我们期待越来越多地将 Claude Opus 5 用于代码审查,而且我可以自信地说,我们宁愿人们使用 Opus 5 而不是 Opus 4.8。

logo

Claude Opus 5 最突出之处在于判断力。它在写下任何一行代码之前会思考得更深入,在规划阶段就能发现自己的逻辑错误,而不是事后才发现,并且会推理一个答案为什么正确,而不仅仅是它是否能运行。这是我们见过的从一个 Claude 模型到下一个模型之间在问题解决能力上最明显的跃升,我们期待看到它在 JetBrains IDE 中被采用。

logo

Claude Opus 5 是我们交易基准测试中测试过的最强 Opus 模型,而它达到这一水平所用的推理 token 大约只有 Opus 4.8 的七分之一,延迟不到其一半。以极少的算力换来更好的答案。

logo

Claude Opus 5 让监控智能体能够在生产环境中管理自身部分记忆,使其在更长的时间跨度上更加自主、更加可靠。该智能体将其上下文视为一份活的文档:在标记出我们某项服务中的潜在异常后,它会针对生产环境重新核验自己的假设,发现该信号是良性的,将更正写入自己的记忆,并自行停用其监控查询。

logo

Claude Opus 5 是一款强大的智能体编程模型,专为长时间运行、多步骤的工作而打造。它能深入理解你的代码库,在复杂任务中保持思路连贯,并且比 Opus 4.8 更有效地厘清功能开发和缺陷修复的需求。开发者现在可以在 Kiro 中使用 Opus 5 进行构建,借助其先进能力来攻克雄心勃勃的项目。

对齐与安全

对齐。在部署前测试中,我们的自动化行为审计发现 Opus 5 是我们迄今为止对齐程度最高的模型(如下图所示)。它比 Opus 4.8、Sonnet 5 或 Fable 5 更好地遵循Claude 的宪法;表现出最低的欺骗行为发生率;并且最不容易被诱骗而遭到滥用。在避免可能产生难以逆转副作用的鲁莽行为方面,它也是我们迄今为止最安全的模型。

在我们的自动化行为审计中,Opus 5 的整体失准行为得分为 2.3,是我们近期模型中最低的。

安全性。 Opus 5 并未在具有风险的双用途能力方面推进前沿。在与私营部门和政府合作伙伴共同开展的严格评估中,我们发现它在生物学研究和攻击性网络安全两方面均仍落后于 Mythos 5。有关这些评估的更多信息,可参见我们的系统卡。

与其前代 Opus 4.8 一样,我们有意避免在网络任务上训练 Opus 5。尽管如此,该模型由于整体能力提升,在这些任务上已大幅进步,在发现网络安全漏洞方面已接近 Mythos 5。然而,在将这些漏洞武器化利用——也就是把漏洞转化为实质性网络威胁——方面,它仍大幅落后于 Mythos 5。

Opus 5 在 OSS-Fuzz 上的表现说明了这一点。OSS-Fuzz 是我们开发的一项评估,用于衡量模型在缺乏大量人工指导的情况下发现并进而利用漏洞的能力。尽管 Mythos 5 和 Opus 5 在识别漏洞方面的成功率相近,但 Opus 5 在开发漏洞利用程序方面的得分远落后于 Mythos 5。

在我们的网络安全评估之一 OSS-Fuzz 上,Opus 5 在识别软件漏洞方面接近 Mythos 5(左图),但在为其开发漏洞利用程序方面成功率明显更低(右图)。

Opus 5 的保障措施

Claude Opus 5 的保障措施旨在允许该模型在网络安全和生物学领域发挥有益用途。这些措施与我们应用于 Opus 4.8 的措施类似,不同之处在于针对一小部分网络任务设置了更严格的护栏。

网络安全。Opus 5 的网络分类器限制程度相应低于 Fable 5 上的分类器。它们允许 Opus 5 在源代码中查找漏洞,但会阻止“基于二进制”的漏洞扫描(一种更可能与恶意行为者相关联的方法)、渗透测试以及漏洞利用生成。

根据我们的测试,我们预计这些分类器的干预频率将比 Fable 5 上的分类器低约 85%。在 Claude.ai、Claude Code 和 Claude Cowork 中,任何被标记的请求将默认回退到 Opus 4.8。在 API 上也可以启用回退到 Opus 4.8。

我们的 Cyber Verification Program(CVP)为原本会因模型保障措施而受阻的网络安全工作提供便利。已经加入 CVP 的企业和研究人员可立即访问安全限制更少的 Opus 5 版本。

生物学。由于 Opus 5 拥有与 Opus 4.8 类似的一整套安全保障措施,它现在是我们面向科学研究的最强大的通用可用模型。尽管如此,该模型在长时间运行的自主研究任务上仍表现出重要局限,而我们预计 AI 模型正是在这类任务上会带来最重大的生物学相关风险。(Mythos 5 仍是这类生物学工作中更强的模型。)作为本次发布的一部分,在 Fable 5 上被拦截的生物学相关请求现在将路由至 Opus 5,而非 Opus 4.8。

快速上手

Claude Opus 5 今日已在所有平台上线,定价为每百万输入 token 5 美元、每百万输出 token 25 美元(与 Opus 4.8 相同)。开发者可以通过 Claude API 使用 claude-opus-5 开始上手。

它还提供 Fast 模式,运行速度约为默认速度的 2.5 倍。与 Opus 4.8 一样,Fast 模式在 Claude Platform 上以 Opus 5 基础价格的两倍提供,并可通过 Claude Code 中的用量额度使用。

除 Opus 5 之外,我们还发布了两个 beta 版更新:

  • 对话中途更换工具,在 Claude Platform 上。在一次对话中,开发者现在可以更改 Claude 可使用的工具,而不会使提示词缓存失效。
  • API 上的自动回退。用户现在可以选择让 Opus 5(或 Fable 5)上被我们的安全分类器标记的请求自动路由到另一个模型。开启自动回退后,API 请求默认始终路由到最佳可用模型,而不是被拦截。

与之前的 Opus 模型一致,Opus 5 对一般访问没有数据保留要求。

如需了解如何充分发挥 Opus 5 的更多指导,请参阅我们的提示词指南。

脚注

Frontier-Bench v0.1,Effort 图:这些结果来自 Frontier-Bench v0.1 的一次内部运行,使用 mini-SWE-agent 测试框架和 GKE 后端,每个任务取 5 次尝试的平均奖励。对于 Opus 5 和 Fable 5 因安全分类器拒绝的情况,Opus 4.8 作为回退模型。

来源:Anthropic:Newsroom(网页) · anthropic.com