跳到正文
北京时间
原文
Artificial Analysis 完整文章(网页)·· 2 天前精选AI 评分80

Claude Sonnet 5.5 达到 Artificial Analysis 智能指数第 2 名

Claude Sonnet 5.5 reaches #2 on the Artificial Analysis Intelligence Index

AI 导读

Artificial Analysis 发布对 Claude Sonnet 5.5 的评测:其智能指数得分 56,max effort 下比 Sonnet 5 高 18 分,升至第 2 名,仅落后 Opus 5.5 (max)。

推荐理由

Artificial Analysis 实测指出 Sonnet 5.5 逼近 Opus 5.5 依赖约 193k 输出 token,成本细节对选型有直接参考价值。

正文 · AI 翻译

Anthropic 发布了 Claude Sonnet 5.5:它在 Artificial Analysis Intelligence Index 上得分 56,仅落后 Opus 5.5(max)2 分,但每任务输出 Token 数是我们见过的最高水平

查看模型页面

在 max 努力下,Sonnet 5.5 比 Sonnet 5 提升 18 分,并在 Intelligence Index 上升至第 2 名,仅次于 Opus 5.5(max)。Anthropic 将 Sonnet 5.5 的定价与 Sonnet 5 保持一致,为每 100 万缓存输入/输入/输出 token $0.2/$2/$10。然而,它每任务输出的 Output Tokens 更多,每任务成本为 $7.60(比 Sonnet 5 的每任务成本高约 50%)。

关键要点:

➤ 在智能体终端使用和知识工作上比肩领先模型: 在 Terminal-Bench 4.0 中,Claude Sonnet 5.5 达到 64%,而 Opus 5.5 和 GPT-6 Astra 为 60%。在 AA-Briefcase(1811 对 1822 Elo)、GDPval-AA(1844 对 1846 Elo)和 AutomationBench-AA(71% 对 70% 头条分数)上,Sonnet 5.5 与 Opus 5.5 达到同等水平,尽管实现这一成绩的 token 使用量显著更高

➤ 我们测得的最高 token 使用量: 在 max 努力下,其性能接近 Opus 5.5,Claude Sonnet 5.5 每个 Intelligence Index 任务使用约 193k Output Tokens。这是我们测得的最高 token 使用量,比 Opus 5.5(max)或 Sonnet 5(max)高约 60%,约为 GPT-6 Astra(max)的 7 倍

➤ 定价仍为每百万输入/输出 token $2/$10,与 GPT-6 Sol 一致: 按此定价,Claude Sonnet 5.5 位于 Intelligence 对 Cost per Task 帕累托前沿之外。在高努力水平下,它落后于 Opus 5.5;而较低努力水平下,GPT-6 Astra 或 Sol 配置能以更低成本提供同等性能。在此基础上,高努力设置最具竞争力,在 Intelligence 上以实际上相同的 Cost per Task 紧随 GPT-6 Sol 之后

➤ 在事实知识和科学推理上落后于 Opus 5.5: 作为更小级别的模型,Sonnet 5.5 在 AA-Omniscience 中的事实知识上仍落后于 Opus 5.5。它的事实准确率为 54%,而 Opus 5.5 为 66%,不过幻觉率更低(47% 对 59%)。在 Humanity's Last Exam 和 SciCode 上,它也比 Opus 低约 6 分

这些评估是在 Claude Sonnet 5.5 的预发布部署上进行的,Anthropic 发现其存在一个 bug,可能会降低对使用结构化输出的请求的响应质量。该问题已在公开发布版中修复,Anthropic 预计变化极小或性能略微被低估,但我们很快会重新运行相关评估。

其他模型细节:

➤ 上下文窗口: 100 万 token,支持图像和文本输入,与 Sonnet 5 相同

➤ 定价: 与 Sonnet 5 最新的每 100 万输入/输出 token $2/$10 相同;缓存写入 $2.5,缓存读取 $0.2

➤ 努力设置: 五档(low、medium、high、xhigh、max)。Intelligence Index 评估在全部五档下运行,并启用了 Anthropic 的默认回退。我们看到 Sonnet 5.5 在整个 Intelligence Index 中约 0.1% 的任务上发生回退,主要是在 Terminal-Bench 4.0 中,所有情况下都回退到 Sonnet 5

Claude Sonnet 5.5 (max) 在 Terminal-Bench 上取得大幅进步,在 Terminal-Bench 4.0 和 Terminal-Bench-Science 中均跻身顶级模型之列。在 Terminal-Bench 4.0 中它得分 64%,比 Claude Sonnet 5 (max) 提升了 50 分,并略高于 Opus 5.5 和 GPT-6 Astra (xhigh) 的 60%。

在我们的 Terminal-Bench-Science 排行榜上——该基准测试衡量智能体在终端中完成跨领域真实科研工作流的能力——它得分 53%,仅次于 GPT-6 Astra 和 Opus 5.5。Terminal-Bench-Science 目前未纳入 Artificial Analysis Intelligence Index。

为实现其超常表现,Claude Sonnet 5.5 (max) 在每项 Intelligence Index 任务上使用约 193k 输出 token,这是我们测量到的最高值,约为 GPT-6 Astra (max) 的 7 倍。

然而,其较低 effort 设置在 Intelligence 与每任务输出 Token 的权衡上覆盖了更广的范围,low、medium 和 high effort 设置均落后于 GPT-6 Sol 的 high、xhigh 和 max effort。在这一区间,Sol 以更少的输出 token 提供了更高的性能。

Claude Sonnet 5.5 在全部推理 effort 下于 Artificial Analysis Intelligence Index 中各单项评估的完整细分:

在以下网址将 Claude Sonnet 5.5 与其他领先模型进行比较:https://artificialanalysis.ai/models/releases/claude-sonnet-5-5

来源:Artificial Analysis 完整文章(网页) · artificialanalysis.ai