跳到正文
北京时间
原文
Artificial Analysis 完整文章·· 2 天前精选AI 评分78

Anthropic 发布 Claude Haiku 5.5,Artificial Analysis 评测得分 43

Anthropic has released Claude Haiku 5.5

AI 导读

Anthropic 发布 Claude Haiku 5.5,在 Artificial Analysis Intelligence Index 得 43 分,较上一代 Haiku 一年内提升 26 分,是首个支持 effort 设置与 adaptive thinking 的 Haiku 模型。

推荐理由

原文给出 Haiku 5.5 的跑分、token 消耗与分层定价细节,并指出 token 用量偏高和拒绝率问题,可作为选型参考。

正文 · AI 翻译

Anthropic 发布了 Claude Haiku 5.5,在 Artificial Analysis Intelligence Index 上得分 43——在上一个 Haiku 发布一年后提升了 26 分

查看模型页面

Haiku 5.5 是首个具备 Anthropic 努力设置和自适应思考的 Haiku 模型,Anthropic 还引入了分层定价。

Haiku 5.5 比其前代更便宜——对于不超过 100k token 的提示,每 100 万输入/输出 token 收费 $0.10/$0.50(与 GPT-6 Luna 相同,是上一代 Haiku 模型的 10%)。然而,超过 100k 后,这一价格会上涨 5 倍至 $0.50/$2.50。网站尚未反映分层定价,因此 Haiku 5.5 的临时成本数据不包含阶梯上涨成本。我们正在开发支持,并将很快跟进 Cost per Task 的覆盖。

关键要点:

➤ 领先的小型模型性能:在最大努力下,Haiku 5.5 略微领先于 GLM-5.3 Flash(42)、Gemini 3.8 Flash(41)和 GPT-6 Luna(38)等模型。其得分与 Kimi K3(44)相当,后者是一个 2.8T 参数的开源权重模型,并落后 Claude Sonnet 5.5(max,56)13 分

➤ 相比 GPT-6 Luna 的 token 使用量很大:Haiku 5.5(max)在每个 Intelligence Index 任务上使用约 162k 输出 token,约为 GPT-6 Luna(max,约 50k)的 3 倍。从 xhigh 提升到 max 增加 2 分,但 token 用量约为 1.8 倍。在相近智能水平下,它也使用比 GPT-6 Luna 更多的 token:Haiku 5.5(high)以每任务约 55k token 得分 38,而 Luna(max)以约 50k token 得分 38,且在较低努力设置下差距扩大

➤ 在智能体知识工作方面能力很强:在 AA-Briefcase(我们针对现实知识工作任务的私有评估)上,Haiku 5.5(max)达到 1578 Elo,领先于包括 Kimi K3 和 GLM-5.3 在内的模型,并与 Muse Spark 1.3(max)相当

➤ 终端使用方面的改进:在 Terminal-Bench 4.0 上得分 33%,高于 Haiku 4.5 的 0%。这与 GLM-5.3 Flash 持平,并领先于 Gemini 3.8 Flash(20%)和 GPT-6 Luna(13%)

➤ 事实知识较低,但幻觉相对较少:正如对较小类别模型的预期,Haiku 5.5 的事实知识低于其同系列模型。AA-Omniscience 准确率为 36%,而 Gemini 3.8 Flash 为 55%,GPT-6 Luna 为 44%,但这部分是因为它更愿意承认自己不知道——其幻觉率更低,为 40%,而两者分别为 55% 和 77%

➤ AutomationBench-AA 结果可能被低估:Haiku 5.5 得分 35%,而 GPT-6 Luna、Gemini 3.8 Flash 和 GLM-5.3 Flash 为 53–60%。在发布前测试中,一个安全拒绝问题导致模型过度拒绝。Anthropic 正在努力解决此问题——我们将在修复后重新运行此评估,并预计该分数会上升

其他模型细节:

➤ 上下文窗口:100 万 token,高于 Claude 4.5 Haiku 的 200k

➤ 定价:不超过 100k token 时,每 100 万输入/输出 token 为 $0.10/$0.50,超过后为 $0.50/$2.50。缓存读取 $0.01(超过 100k 为 $0.05),5 分钟缓存写入 $0.125(超过 100k 为 $0.625)

➤ 多模态:文本和图像输入,文本输出

Claude Haiku 5.5(max)在每个 Intelligence Index 任务上使用约 162k 输出 token,多于 Opus 5.5(max),约为 GPT-6 Luna(max)的 3 倍。在不同努力设置下,Haiku 5.5 为达到相近的 Intelligence Index 分数,使用的输出 token 多于 GPT-6 Luna

Claude Haiku 5.5(max)在我们的私有前沿知识工作评估 AA-Briefcase 上达到 1578 Elo,处于 GPT-6 Astra(max)和 Claude Fable 5.1(high)的置信区间内

Claude Haiku 5.5 在不同 effort 设置下,Artificial Analysis Intelligence Index 中各项单独评估的完整细分

来源:Artificial Analysis 完整文章 · artificialanalysis.ai