跳到正文
北京时间
原文
Artificial Analysis· @ArtificialAnlys · X·· 3 小时前精选AI 评分74
AI 导读

Anthropic 发布 Claude Haiku 5.5,在 Artificial Analysis 智能指数得 43 分,较上一代 Haiku 一年内提升 26 分。

推荐理由

评测方给出 Haiku 5.5 在智能指数、token 用量和多个基准上的具体数据,可与同档小模型直接对比选型。

正文 · AI 翻译

Anthropic 发布了 Claude Haiku 5.5,在 Artificial Analysis Intelligence Index 上得分 43——在上一个 Haiku 版本发布一年后提升了 26 分

Haiku 5.5 是首个具备 Anthropic 努力设置和自适应思考的 Haiku 模型,Anthropic 还引入了分层定价。

Haiku 5.5 比其前代更便宜——对于不超过 100k tokens 的提示,每 1M 输入/输出 tokens 收费 $0.10/$0.50(与 GPT-6 Luna 相同,是上一个 Haiku 模型的 10%)。然而,超过 100k 后,这一价格会上涨 5 倍至 $0.50/$2.50。网站尚未反映分层定价,因此 Haiku 5.5 的暂定成本数据未包含这一阶梯上涨成本。我们正在开发支持,并将很快跟进 Cost per Task 覆盖。

关键要点:

➤ 领先的小型级模型性能:在最大努力下,Haiku 5.5 略微领先于 GLM-5.3 Flash(42)、Gemini 3.8 Flash(41)和 GPT-6 Luna(38)等模型。其得分与 Kimi K3(44)相当,后者是一个 2.8T 参数的开源权重模型,并落后 Claude Sonnet 5.5(max,56)13 分

➤ 相比 GPT-6 Luna 使用大量 tokens:Haiku 5.5(max)每个 Intelligence Index 任务使用约 162k 输出 tokens,约为 GPT-6 Luna(max,约 50k)的 3 倍。从 xhigh 提升到 max 增加 2 分,但 tokens 约为 1.8 倍。在相近智能水平下,它也使用比 GPT-6 Luna 更多的 tokens:Haiku 5.5(high)得分 38,每任务约 55k tokens,而 Luna(max)得分 38,约 50k tokens,且在更低努力设置下差距扩大

➤ 在智能体知识工作方面能力很强:在 AA-Briefcase 上,这是我们针对现实知识工作任务的私有评估,Haiku 5.5(max)达到 1578 Elo,领先于包括 Kimi K3 和 GLM-5.3 在内的模型,并与 Muse Spark 1.3(max)相当

➤ 终端使用方面的改进:在 Terminal-Bench 4.0 上得分 33%,高于 Haiku 4.5 的 0%。这与 GLM-5.3 Flash 持平,并领先 Gemini 3.8 Flash(20%)和 GPT-6 Luna(13%)

➤ 事实知识较低,但幻觉相对较少:正如较小级别模型所预期,Haiku 5.5 的事实知识低于其同系列模型。AA-Omniscience 准确率为 36%,而 Gemini 3.8 Flash 为 55%,GPT-6 Luna 为 44%,但这在一定程度上是因为它更愿意承认自己不知道——其幻觉率为 40%,低于 55% 和 77%

➤ AutomationBench-AA 结果可能被低估:Haiku 5.5 得分 35%,而 GPT-6 Luna、Gemini 3.8 Flash 和 GLM-5.3 Flash 为 53–60%。在发布前测试中,一个安全拒绝问题导致模型过度拒绝。Anthropic 正在解决这一问题——我们将在修复后重新运行此评估,并预计该分数会上升

其他模型细节:

➤ 上下文窗口:1 million tokens,高于 Claude 4.5 Haiku 的 200k

➤ 定价:每 1M 输入/输出 tokens 在不超过 100k tokens 时为 $0.10/$0.50,超过后为 $0.50/$2.50。缓存读取 $0.01(超过 100k 为 $0.05),5 分钟缓存写入 $0.125(超过 100k 为 $0.625)

➤ 多模态:文本和图像输入,文本输出

来源:Artificial Analysis · x.com