Claude Sonnet 5 发布
Introducing Claude Sonnet 5
Claude Sonnet 5 是 Anthropic 推出的最新 Sonnet 模型,具备计划、浏览器和终端工具使用能力,可自主运行。性能接近 Opus 4.8,定价更低:即日起至 2026 年 8 月 31 日,输入 token $2/百万,输出 $10/百万,之后恢复为 $3/百万输入和 $15/百万输出。相比 Sonnet 4.6,在推理、工具使用、编程和知识工作等智能体能力上大幅提升。在 BrowseComp 和 OSWorld-Verified 评测中严格优于 Sonnet 4.6。安全评估显示不良行为率更低,幻觉和谄媚减少,但网络安全能力弱于 Opus 4.8。即日起在所有套餐及 Claude Code、Claude API 中可用。
Claude Sonnet 5 把代理能力从 Opus 下放到了 Sonnet,性能接近 Opus 4.8 但价格只有三分之一,这对开发者来说性价比飞跃。虽然还不是最强,但已经能让许多复杂任务从勉强可用变成可靠。

Claude Sonnet 5 被打造为迄今最具智能体能力的 Sonnet 模型。它能够制定计划、使用浏览器和终端等工具,并以自主方式运行,而这种水平在几个月前还需要更大、更昂贵的模型才能实现。
对许多开发者而言,智能体 AI 时代始于 Sonnet 级模型:Claude Sonnet 3.5、3.6 和 3.7 是首批在编程和工具使用方面展现出令人印象深刻技能的模型。不过,近期智能体能力最明显的提升出现在我们的 Opus 级模型上。
Sonnet 5 缩小了这一差距:其性能接近 Opus 4.8,但价格更低。在推理、工具使用、编程和知识工作等智能体性能的重要方面,它相比前代 Sonnet 4.6 有实质性提升:

我们的安全评估发现,Sonnet 5 的整体不良行为发生率低于 Sonnet 4.6,在智能体场景中使用通常也更安全。评测还显示,其执行网络安全任务的能力远低于我们当前的 Opus 模型。
从今天起,Claude Sonnet 5 已在所有套餐中上线:它是 Free 和 Pro 套餐的默认模型,同时面向 Max、Team 和 Enterprise 用户开放。它也可在 Claude Code 和 Claude Platform 中使用,上线时推出优惠定价,截至 2026 年 8 月 31 日,每百万输入 token 收费 2 美元,每百万输出 token 收费 10 美元,此后定价将调整为每百万输入 token 3 美元、每百万输出 token 15 美元。开发者可以通过claude-sonnet-5通过Claude API.
使用 Claude Sonnet 5
下方图表对比了 Sonnet 5 与 Sonnet 4.6 和 Opus 4.8 在不同effort水平下的表现,评估项目为智能体搜索评测BrowseComp以及计算机使用评测OSWorld-Verified。Sonnet 5(橙色线)相较 Sonnet 4.6(灰色线)实现了严格意义上的提升,并且覆盖的成本-性能选项范围远广于 Opus 4.8(黄色线)。它在中等 effort 下提供了显著改善的成本效率;在更高 effort 下的表现可在部分任务上比肩 Opus 4.8。在 Sonnet 5 与 Opus 4.8 之间,用户可以通过调整 effort 水平来找到成本与性能之间的合适平衡。

来自我们早期访问合作伙伴的反馈始终一致:Sonnet 5 比其前代产品更具智能体能力。测试人员描述了它如何完成此前 Sonnet 模型会中途停止的复杂任务,如何在没有被明确要求的情况下检查自己的输出,以及如何以极具吸引力的价格完成所有这些智能体工作:
Claude Sonnet 5 为我们的智能体提供了一个强大的执行层,用于多步骤软件工程工作。它能在杂乱的技术环境中很好地处理持续编码、工具使用和调试,对于注重贯彻到底和技术根基的工作流尤其有用。
我们交给 Claude Sonnet 5 一项由两部分组成的任务——更新 Salesforce 客户层级、向企业联系人发送发布公告——它端到端地完成了。这在过去常常会中途卡住。对于日常自动化而言,这简直是无需犹豫的选择。
Claude Sonnet 5 以更少的投入完成更多工作。同样的输出质量,达成所需的步骤更少。它也能干净利落、始终如一地拒绝不安全的请求。在 Lovable,我们正将强大的工具交到数百万构建者手中。一个懂得何时说不的模型,与一个懂得如何构建的模型同样重要。
我们用 Claude Sonnet 5 跑了几十个我们最具挑战性的真实 pull request,它每一个都自主推进到了经过测试、验证的结果——让我们的工程师得以专注于判断、决策和最终签核。
我让 Claude Sonnet 5 调查一个 bug。它未经提示就写了一个复现测试,实现了修复,然后将其暂存以确认去掉改动后 bug 会复现。全部一次完成。
借助 Claude Sonnet 5,智能体能够按计划推进、遵循我们的规范,并交付干净的多步骤改动,而且成本高效。
Claude Sonnet 5 在遗留代码上表现最佳——竞态条件、隐藏测试、那些没人愿意碰的部分。它能将故障追溯到真正的根因,并交付持久的修复,而不是打补丁掩盖症状。
在 Eve 的原告法律任务上,Claude Sonnet 5 处于帕累托前沿。我们在法律研究和分析方面看到了最明显的提升,其性价比之高让迁移的选择变得轻而易举。
ClickHouse 的智能体实时探索数据并即时产出洞察,因此在测试新模型时,洞察速度至关重要。Claude Sonnet 5 以更紧凑的步骤进行推理,让我们的用户明显更快地得到答案。这种速度差异是我们的客户能切身感受到的。
在 Pace,我们的计算机使用智能体在运营团队已经在用的系统上运行保险工作流——投保单录入、FNOL、损失运行报告。Claude Sonnet 5 始终能采取正确的操作,并且执行迅速,而这正是真实保险工作所要求的。
对于管理高并发、复杂工作负载的企业团队而言,Claude Sonnet 5 代表着真正的进步——在关键之处表现强劲,同时具备让规模化变得切实可行的速度与成本特性。在若干复杂任务上,它超越了当前的前沿水平,同时以低成本提供快速响应。对于大规模运行的企业来说,这是实实在在的运营收益。
Claude Sonnet 5 处理了我们测试的全部编码任务,同时解决了更多问题。这是对质量和效率的双重实质性提升。
Claude Sonnet 5 是一个强大的智能体编码模型,其准确率达到顶级水平,可与 Opus 级模型相媲美,并且相较 Sonnet 4.6 有明确的阶跃式提升。它会进行彻底的探索,并在复杂任务上明显更持久地保持专注。
安全评估
我们的部署前安全评估发现,Sonnet 5 整体上相比 Sonnet 4.6 有所改进。在智能体安全方面,该模型更善于拒绝恶意请求,并能更好地抵御提示词注入攻击中的劫持企图。该模型表现出比 Sonnet 4.6 更低的模型幻觉和谄媚率。在我们的自动化行为审计中——该审计测试了包括配合滥用和欺骗在内的多种失准行为——Sonnet 5 的整体得分更低(即更安全)。然而,与能力更强的 Opus 4.8 和 Claude Mythos Preview 相比,它在这项评估中确实表现出略高的失准行为率。

我们没有刻意用网络安全任务来训练 Sonnet 5。它可以执行一些常规的、无害的网络任务,但在测试潜在危险网络技能的评估中——例如开发软件漏洞利用程序——它的表现明显不如 Opus 4.8 和 Mythos 5 等模型。下图展示了一项评估的得分,该评估测试了模型为 Firefox 浏览器中的漏洞开发漏洞利用程序的能力。Sonnet 5 从未能够开发出完整可用的漏洞利用程序,但它的部分成功率确实略高于 Sonnet 4.6。后一变化很可能源于通用智能的提升,而非专门的训练。

由于 Sonnet 5 在这些任务上比其前代略强,我们在发布时默认启用了网络安全保障措施。这些保障措施——可实时检测并阻止危险的网络用途——与 Claude Opus 4.7 和 4.8 中现有的保障措施相同(因为我们判断 Sonnet 5 带来的整体网络安全风险水平较低,所以这些保障措施不如随 Fable 5 发布的那些严格,后者会阻止范围广得多的网络安全任务)。1
我们在众多安全与能力评估中对 Sonnet 5 的完整评估结果报告于Claude Sonnet 5 系统卡中。
可用性与定价
Claude Sonnet 5 今日已在所有平台上线,推出优惠价格:每百万输入 token 2 美元、每百万输出 token 10 美元,优惠持续至 2026 年 8 月 31 日。此后将转为标准定价:每百万输入 token 3 美元、每百万输出 token 15 美元。2 我们已提高 Chat、Cowork、Claude Code 和 Claude Platform 的速率限制3,以适配更高 effort 等级带来的更高 token 用量;用户可以选择最适合其具体项目的等级。
更新日志
2026 年 6 月 30 日编辑:在本文原始版本中,我们包含了一张 BrowseComp 评测的成本-性能图表,该图表基于一种更简单的方法论的数据,未能反映我们用于智能体搜索评测的标准方法论。这导致低估了 Sonnet 5 在该评测上的表现。
我们现在已更新该图表,使其与我们使用并在 Sonnet 5 系统卡中讨论的方法论一致(该方法论使用了 10M token 预算,并配合压缩和程序化工具调用)。我们也更新了相关文字。
脚注
1 Sonnet 5 是我们网络验证计划的一部分,该计划即日起在原生 Claude Platform、AWS 上的 Claude Platform 以及 Microsoft Foundry 中的 Claude(托管于 Azure 和 Anthropic)上提供,并即将在 Google Vertex 中的 Claude 上推出。已加入网络验证计划的组织自动在 Sonnet 5 上享有相同的访问权限,无需重新申请。总体而言,对于需要减少护栏限制的网络安全工作,我们推荐使用 Claude Opus 4.8。
2 Sonnet 5 是 Sonnet 4.6 的升级版,但它使用了更新的 tokenizer,改变了模型处理文本的方式以提升性能(这类似于我们在 Claude Opus 4.7 中引入的 tokenizer 变更)。代价是相同的输入可能映射到更多 token:根据内容类型不同,大约为 1.0–1.35×。引入期定价的设置使得过渡到 Sonnet 5 大致上成本中性。
3 2026 年 4 月 26 日,我们在原生 Claude Platform 上提高了每个使用层级的 Sonnet 和 Haiku 速率限制,并简化为三个层级(Start、Build 和 Scale)。你可以在 Claude Console 中查看你的层级和当前限制,或阅读文档了解更多。
- Humanity's Last Exam:我们更新了 Humanity's Last Exam 的评分模型,并将 Sonnet 4.6 的得分更新为 34.6%(无工具)和 46.8%(有工具)。这就是该得分与Sonnet 4.6 发布博客中所报告得分不同的原因。
- OSWorld-Verified:我们调整了 OSWorld-Verified 评测的运行方式,以更准确地反映模型在真实世界中的表现,并将 Sonnet 4.6 的得分更新为 78.5%。这就是该得分与Sonnet 4.6 发布博客中所报告得分不同的原因。
来源:Anthropic:Newsroom(网页) · anthropic.com