跳到正文
北京时间
原文
MarkTechPost(RSS)· Michal Sutter·· 3 小时前精选AI 评分80

Anthropic 发布 Claude Sonnet 5.5:Terminal-Bench 4.0 得分 70.6%,价格维持 $2/$10

Anthropic Releases Claude Sonnet 5.5: 70.6% on Terminal-Bench 4.0 at the Same $2/$10 Price

AI 导读

Anthropic 发布 Claude Sonnet 5.5,是 Claude 5.5 家族第二款模型,定位为 Opus 5.5 更快更省的补充,已在 Claude Platform、AWS、Google Cloud 和 Azure 上线。

正文 · AI 翻译

Anthropic 刚刚发布了 Claude Sonnet 5.5。这是 Claude 5.5 家族中的第二个模型,紧随 Claude Opus 5.5 之后。Anthropic 将其定位为 Opus 5.5 更快、成本更低的补充。它面向范围明确的日常任务、bug 修复,以及打磨文档、幻灯片和电子表格。

它可以部署吗? 可以,它已在 Claude Platform 上线,代号为 claude-sonnet-5-5,同时登陆 AWS、Google Cloud 和 Microsoft Azure。这是一个闭源权重模型,因此无法自行托管。

相比 Sonnet 5 有哪些变化

Anthropic 报告称,相比 Sonnet 5 有 4 项主要升级:

  • 速度: 输出生成速度提升 30% 以上,使其成为迄今为止最快的 Sonnet。
  • 每任务成本: 最高降低 30%,因为它需要的 token 和工具调用更少。
  • 写作: 行文更清晰,早期测试者称它是更好的协作伙伴。
  • 视觉与长时程任务: 这是首个仅凭截图就能通关 Pokémon Red 的 Sonnet。

来自 模型概览 的规格:1M token 上下文、128K 最大输出,以及 2026 年 6 月的可靠知识截止日期。自适应思考默认开启。Effort 分为 5 个级别:low、medium、high、xhigh 和 max。

基准测试

以下所有分数均为厂商在 发布文章 中报告。方法论见 Sonnet 5.5 System Card。

  • Terminal-Bench 4.0: 70.6%,而 Sonnet 5 为 10.3%,Opus 5.5 在 Xhigh 下为 66.4%。
  • CursorBench 4.0: 55.5%,比 Opus 5.5(57.8%)低约 2 个百分点。
  • FrontierCode 1.1: Xhigh 下为 52.1%,Max 下为 46.2%。GPT-6 Sol 得分为 49.3%。
  • GDPval-AA v2.1: 1844,而 Opus 5.5 为 1846,Sonnet 5 为 1449。
  • OSWorld 2.1: 计算机使用方面为 80.1%,接近 Opus 5.5(81.8%)。
  • Humanity’s Last Exam: 使用工具时为 64.5%,高于此前的 54.9%。

Max 结果低于 Xhigh 是有原因的。在 Max 下,模型更常运行多智能体代码审查。这有时会导致超时或超出范围的编辑,而 FrontierCode 会对此扣分。Anthropic 还表示,Opus 5.5 在复杂、开放式工作上仍然明显更强。

定价与效率

标价与 Sonnet 5 保持不变:每百万输入 token 2 美元,每百万输出 token 10 美元。缓存读取每百万 token 0.20 美元,缓存写入每百万 token 2.50 美元。这是 Opus 5.5(4 美元/20 美元)的一半。节省来自 token 效率,而非降价。

客户数据支持这一点。Balyasny Asset Management 测得每个答案约 121K token,而 Sonnet 5 为 497K。Base44 报告每次应用构建迭代 3.6 次,而 Opus 5 为 7.7 次。Zendesk 处理工单速度提升 20%。

Effort 默认值因平台而异。Claude Code 和 Claude 应用默认为 Medium。Claude Platform 默认为 High。

对比情况

功能Claude Sonnet 5.5GPT-6 SolGemini 3.1 Pro PreviewClaude Opus 5.5
开发者AnthropicOpenAIGoogleAnthropic
每 1M token 价格(输入/输出)$2 / $10$2 / $10(提示最长 272K)$2 / $12(提示最长 200K)$4 / $20
上下文窗口1M token1,050,000 token1,048,576 token1M token
最大输出128K token128K token65,536 token128K token
知识截止日期2026年6月2026年4月20日未列出2026年6月
推理控制自适应思考,5个努力等级6个努力等级(从none到max)支持思考自适应思考(始终开启)
输入文本、图像文本、图像文本、图像、视频、音频、PDF文本、图像
FrontierCode 1.152.1%(Xhigh)49.3%未报告54.4%
GDPval-AA v2.118441487未报告1846
Chartography(无工具)61.6%53.6%未报告64.4%
发布阶段正式可用正式可用预览正式可用
开放权重否否否否

基准测试分数由Anthropic自行报告;GDPval-AA由Artificial Analysis运行。价格为标准API标价,核实于2026年9月28日。

交互式讲解

Claude Sonnet 5.5,交互式讲解

点击浏览基准测试、努力等级、任务成本和API迁移检查器。

选择一个努力等级。Sonnet 5.5提供5个。

推理深度

速度与token节省

仪表为示意性质,反映Anthropic所描述的方向(努力等级越高,推理时间越长,对工作的检查越多)。建议来自Sonnet 5.5迁移指南。

按标价(每100万token输入$2、输出$10,Sonnet 5与5.5相同)的示意性估算。

Sonnet 5,每任务

Sonnet 5.5,每任务

按每月10,000个任务计算,你可节省

节省来自更少的token和工具调用,而非更低的标价。你的实际比例取决于工作负载。

从你的Sonnet 5时代代码中选择一个设置,看看Sonnet 5.5会返回什么。

来源:Anthropic发布帖和Claude Platform文档,2026年9月28日© Marktechpost

要点

  • Sonnet 5.5在Terminal-Bench 4.0上得分70.6%,高于此前的10.3%。
  • 定价保持$2/$10,但每任务成本最多下降30%。
  • 它在GDPval-AA上与Opus 5.5相差不到2分。
  • 首个具备网络防护和推理提取分类器的Sonnet。
  • 现可通过API、AWS、Google Cloud和Azure部署。

查看官方公告、迁移指南和系统卡。所有功劳归于本项目的研究者。另外,欢迎在 Twitter 上关注我们,别忘了加入我们的 150k+ML SubReddit 并订阅 我们的Newsletter。等等!你在telegram上吗? 现在你也可以在telegram上加入我们了。

需要与我们合作推广你的GitHub Repo或Hugging Face页面或产品发布或网络研讨会等? 联系我们

文章Anthropic发布Claude Sonnet 5.5:在Terminal-Bench 4.0上达到70.6%,价格同为$2/$10首发于MarkTechPost。

来源:MarkTechPost(RSS) · marktechpost.com