Anthropic 发布 Claude Sonnet 5.5:Terminal-Bench 4.0 得分 70.6%,价格维持 $2/$10
Anthropic Releases Claude Sonnet 5.5: 70.6% on Terminal-Bench 4.0 at the Same $2/$10 Price
Anthropic 发布 Claude Sonnet 5.5,是 Claude 5.5 家族第二款模型,定位为 Opus 5.5 更快更省的补充,已在 Claude Platform、AWS、Google Cloud 和 Azure 上线。
Anthropic 刚刚发布了 Claude Sonnet 5.5。这是 Claude 5.5 家族中的第二个模型,紧随 Claude Opus 5.5 之后。Anthropic 将其定位为 Opus 5.5 更快、成本更低的补充。它面向范围明确的日常任务、bug 修复,以及打磨文档、幻灯片和电子表格。
它可以部署吗? 可以,它已在 Claude Platform 上线,代号为 claude-sonnet-5-5,同时登陆 AWS、Google Cloud 和 Microsoft Azure。这是一个闭源权重模型,因此无法自行托管。
相比 Sonnet 5 有哪些变化
Anthropic 报告称,相比 Sonnet 5 有 4 项主要升级:
- 速度: 输出生成速度提升 30% 以上,使其成为迄今为止最快的 Sonnet。
- 每任务成本: 最高降低 30%,因为它需要的 token 和工具调用更少。
- 写作: 行文更清晰,早期测试者称它是更好的协作伙伴。
- 视觉与长时程任务: 这是首个仅凭截图就能通关 Pokémon Red 的 Sonnet。
来自 模型概览 的规格:1M token 上下文、128K 最大输出,以及 2026 年 6 月的可靠知识截止日期。自适应思考默认开启。Effort 分为 5 个级别:low、medium、high、xhigh 和 max。
基准测试
以下所有分数均为厂商在 发布文章 中报告。方法论见 Sonnet 5.5 System Card。
- Terminal-Bench 4.0: 70.6%,而 Sonnet 5 为 10.3%,Opus 5.5 在 Xhigh 下为 66.4%。
- CursorBench 4.0: 55.5%,比 Opus 5.5(57.8%)低约 2 个百分点。
- FrontierCode 1.1: Xhigh 下为 52.1%,Max 下为 46.2%。GPT-6 Sol 得分为 49.3%。
- GDPval-AA v2.1: 1844,而 Opus 5.5 为 1846,Sonnet 5 为 1449。
- OSWorld 2.1: 计算机使用方面为 80.1%,接近 Opus 5.5(81.8%)。
- Humanity’s Last Exam: 使用工具时为 64.5%,高于此前的 54.9%。
Max 结果低于 Xhigh 是有原因的。在 Max 下,模型更常运行多智能体代码审查。这有时会导致超时或超出范围的编辑,而 FrontierCode 会对此扣分。Anthropic 还表示,Opus 5.5 在复杂、开放式工作上仍然明显更强。
定价与效率
标价与 Sonnet 5 保持不变:每百万输入 token 2 美元,每百万输出 token 10 美元。缓存读取每百万 token 0.20 美元,缓存写入每百万 token 2.50 美元。这是 Opus 5.5(4 美元/20 美元)的一半。节省来自 token 效率,而非降价。
客户数据支持这一点。Balyasny Asset Management 测得每个答案约 121K token,而 Sonnet 5 为 497K。Base44 报告每次应用构建迭代 3.6 次,而 Opus 5 为 7.7 次。Zendesk 处理工单速度提升 20%。
Effort 默认值因平台而异。Claude Code 和 Claude 应用默认为 Medium。Claude Platform 默认为 High。
对比情况
| 功能 | Claude Sonnet 5.5 | GPT-6 Sol | Gemini 3.1 Pro Preview | Claude Opus 5.5 |
|---|---|---|---|---|
| 开发者 | Anthropic | OpenAI | Anthropic | |
| 每 1M token 价格(输入/输出) | $2 / $10 | $2 / $10(提示最长 272K) | $2 / $12(提示最长 200K) | $4 / $20 |
| 上下文窗口 | 1M token | 1,050,000 token | 1,048,576 token | 1M token |
| 最大输出 | 128K token | 128K token | 65,536 token | 128K token |
| 知识截止日期 | 2026年6月 | 2026年4月20日 | 未列出 | 2026年6月 |
| 推理控制 | 自适应思考,5个努力等级 | 6个努力等级(从none到max) | 支持思考 | 自适应思考(始终开启) |
| 输入 | 文本、图像 | 文本、图像 | 文本、图像、视频、音频、PDF | 文本、图像 |
| FrontierCode 1.1 | 52.1%(Xhigh) | 49.3% | 未报告 | 54.4% |
| GDPval-AA v2.1 | 1844 | 1487 | 未报告 | 1846 |
| Chartography(无工具) | 61.6% | 53.6% | 未报告 | 64.4% |
| 发布阶段 | 正式可用 | 正式可用 | 预览 | 正式可用 |
| 开放权重 | 否 | 否 | 否 | 否 |
基准测试分数由Anthropic自行报告;GDPval-AA由Artificial Analysis运行。价格为标准API标价,核实于2026年9月28日。
交互式讲解
Claude Sonnet 5.5,交互式讲解
点击浏览基准测试、努力等级、任务成本和API迁移检查器。
选择一个努力等级。Sonnet 5.5提供5个。
推理深度
速度与token节省
仪表为示意性质,反映Anthropic所描述的方向(努力等级越高,推理时间越长,对工作的检查越多)。建议来自Sonnet 5.5迁移指南。
按标价(每100万token输入$2、输出$10,Sonnet 5与5.5相同)的示意性估算。
Sonnet 5,每任务
Sonnet 5.5,每任务
按每月10,000个任务计算,你可节省
节省来自更少的token和工具调用,而非更低的标价。你的实际比例取决于工作负载。
从你的Sonnet 5时代代码中选择一个设置,看看Sonnet 5.5会返回什么。
来源:Anthropic发布帖和Claude Platform文档,2026年9月28日© Marktechpost
要点
- Sonnet 5.5在Terminal-Bench 4.0上得分70.6%,高于此前的10.3%。
- 定价保持$2/$10,但每任务成本最多下降30%。
- 它在GDPval-AA上与Opus 5.5相差不到2分。
- 首个具备网络防护和推理提取分类器的Sonnet。
- 现可通过API、AWS、Google Cloud和Azure部署。
查看官方公告、迁移指南和系统卡。所有功劳归于本项目的研究者。另外,欢迎在 Twitter 上关注我们,别忘了加入我们的 150k+ML SubReddit 并订阅 我们的Newsletter。等等!你在telegram上吗? 现在你也可以在telegram上加入我们了。
需要与我们合作推广你的GitHub Repo或Hugging Face页面或产品发布或网络研讨会等? 联系我们
文章Anthropic发布Claude Sonnet 5.5:在Terminal-Bench 4.0上达到70.6%,价格同为$2/$10首发于MarkTechPost。
来源:MarkTechPost(RSS) · marktechpost.com