跳到正文
北京时间
原文
The Decoder:AI News(RSS)· Matthias Bastian·· 14 小时前精选AI 评分78

Anthropic 发布 Claude Sonnet 5.5,基准接近 Opus 5.5 且每任务成本最多降低 30%

Anthropic's Claude Sonnet 5.5 nearly matches Opus 5.5 on benchmarks while costing up to 30 percent less per task

AI 导读

Anthropic 发布 Claude Sonnet 5.5,输出速度提升超过 30%,因每任务消耗 token 更少,有效成本最多降低 30%,多项基准接近 Opus 5.5。

正文 · AI 翻译

Anthropic 发布了 Claude Sonnet 5.5,这是其 Claude 5.5 家族中的第二个模型。它的输出生成速度提升超过 30%,每项任务成本最多降低 30%,并在多项基准测试中几乎追平 Opus 5.5。

Opus 5.5 专为需要审慎判断的复杂任务而打造。Sonnet 5.5 则面向定义明确的日常工作,例如修复 bug、撰写文档、制作演示文稿和创建电子表格。Anthropic 还宣布 Claude Haiku 5.5 将在未来几周内推出。该模型将专注于高吞吐量、低成本的使用场景。

凭借 Fable、Opus 和 Sonnet,Anthropic 已经拥有了与 OpenAI 的 GPT-6 Astra、Sol 和 Luna 相对应的产品,后者拉开了最新一轮价格战。大致来说,Opus 略高于 Sol,Sonnet 高于 Luna,Fable 高于 Astra,不过 Anthropic 的整体收费更高。对应层级之间的性能差异小到足以让成本成为决定性因素。Haiku 可能帮助 Anthropic 缩小这一差距。

编程性能大幅跃升

据 Anthropic 称,Sonnet 5.5 与其前代之间的性能差距在编程方面最为显著。在用于测试智能体编程的 Terminal-Bench 4.0 上,Sonnet 5.5 达到 70.6%,而 Sonnet 5 为 10.3%。在重现 Cursor 编辑器真实编程会话的 CursorBench 4.0 上,Sonnet 5.5 得分为 55.5%,而 Sonnet 5 为 34.1%,仅比 Opus 5.5(57.8%)低两个百分点。

Anthropic 表示,在 FrontierCode 1.1 的“High”设置下,Sonnet 5.5 的得分比 Sonnet 5 高出十分,而每项任务成本约为后者的十五分之一。早期测试者称赞该模型理解代码库的速度之快。Sonnet 5.5 还比其前代更频繁地批量调用工具,从而减少了所需步骤数。

推理强度方面有一个奇怪的问题。在最高努力级别“Max”下,Sonnet 5.5 在 FrontierCode 上的得分实际上比在“Xhigh”下更差。Anthropic 表示,在最大努力下,该模型更频繁地触发一个代码审查功能,将工作拆分给多个子智能体。在某些情况下,这会导致超时或任务范围之外的更改,而这两者都会受到 FrontierCode 的惩罚。

知识工作几乎追平 Opus 5.5

在 OpenAI 开发的 GDPval-AA 知识工作基准测试中,Sonnet 5.5 得分为 1,844 分,该测试涵盖来自 44 个职业和 9 个行业的任务。这几乎追平 Opus 5.5(1,846),并比 Sonnet 5(1,449)高出约 400 分。按照 Anthropic 的数据,OpenAI 的 GPT-6 Sol 为 1,487 分。在视觉图表识别测试 Chartography 上,Sonnet 5.5 从 15.6% 跃升至 61.6%。

类别 基准测试 Sonnet 5.5 Sonnet 5 Opus 5.5 GPT-6 Sol
基于智能体的编程 Terminal-Bench 4.0 70.6% 10.3% 66.4%¹ —
基于智能体的编程 FrontierCode 1.1(Main) 46.2%(Max);52.1%(Xhigh)² 42.4% 54.4% 49.3%
基于智能体的编程 CursorBench 4.0 55.5% 34.1% 57.8% —
知识工作 GDPval-AA v2.1³ 1,844 1,449 1,846 1,487
知识工作 AA Briefcase v1.1³ 1,811 1,359 1,822 1,483
跨学科思维 Humanity's Last Exam(带工具) 64.5% 54.9% 67.7% —
计算机技能 OSWorld 2.1(部分评估) 80.1% 57.0% 81.8% —
可视化图表识别 Chartography(不带工具) 61.6% 15.6% 64.4% 53.6%

¹ 对于 Opus 5.5,Terminal-Bench 4.0 显示的是“Xhigh”设置下的最高分。² Sonnet 5.5 在 FrontierCode 上“Max”的得分低于“Xhigh”。³ Sonnet 5.5 的数值来自一个预发布版本,其中一个此后已修复的 bug 可能影响了结构化输出。

早期测试者称 Sonnet 5.5 是更自然的对话伙伴,对设计有感觉。Anthropic 声称,该模型能出色地重做用户界面并执行幻灯片模板,结果几乎无需修饰。

Anthropic 还表示,Sonnet 5.5 是首个仅凭截图就能通关《宝可梦 红》的 Sonnet 模型。OpenAI 的 Astra 最近在游戏基准测试中展现了类似进展。这类任务在几年前还被视为难题,往往需要定制算法。如今,即便是一个产品家族中的中端模型也能应对。

同样的 token 价格,每项任务消耗更少 token

Sonnet 5.5 每百万 token 的价格与 Sonnet 5 相同:输入 token 2 美元,输出 token 10 美元,缓存读取 0.20 美元。Anthropic 称,由于该模型每项任务使用的 token 更少,实际成本最多可降低 30%。输出生成速度也提升了 30% 以上。这些说法仍需独立测试来证实。

每百万 token 价格 Claude Opus 5.5 GPT-6 Sol Claude Sonnet 5.5 GPT-6 Luna
输入 token 4 $ 2 $ $2 $0.10
输出 token $20 $10 $10 $0.50
缓存读取访问 $0.20 $0.20 $0.20 $0.01
缓存写入访问 $5 $2.50 $2.50 $0.125

与 Anthropic 的其他模型和 OpenAI 的同类产品一样,Sonnet 5.5 提供可调节的 effort 设置,让用户在成本、速度与输出质量之间权衡。Anthropic 称,在低或中等设置下,Sonnet 5.5 已在多项基准测试中超越 Sonnet 5 的最佳成绩,而每项任务成本仅约为其十分之一。不过,为每项任务找到合适的 effort 级别,仍更像是一门艺术而非科学。

为更强大的模型新增网络安全防护措施

Claude Sonnet 5.5 现已在所有主流云平台上可用,包括 Amazon Web Services、Google Cloud 和 Microsoft Azure。与 Opus 5.5 和 Sonnet 5 一样,Anthropic 以零数据保留的方式提供该模型。开发者可通过 Claude Platform 使用模型 ID“claude-sonnet-5-5”访问。

由于 Sonnet 5.5 在网络安全方面的能力远超其前代,Anthropic 首次为 Sonnet 模型添加了防护措施。涉及高风险网络安全任务的请求会被明显改道至 Sonnet 5。通过扩展的网络验证计划,合格专业人员可申请分级访问权限。

Anthropic 还添加了针对蒸馏攻击的安全分类器,与其最强大模型中使用的同类。这些措施是否真正有效,应在未来几个月内见分晓。如果中国实验室一直从此类攻击中获益,堵住这一途径可能会再次拉大与西方实验室的差距。

没有炒作的 AI 新闻——由人类精选

订阅 THE DECODER,享受无广告阅读、每周 AI 新闻通讯、每年六次独家“AI Radar”前沿报告、完整档案访问以及评论区访问权限。

来源:The Decoder:AI News(RSS) · the-decoder.com