跳到正文
北京时间
原文
Anthropic:Newsroom·· 1 天前精选AI 评分78

Anthropic 发布 Claude Haiku 5.5,运行成本平均降低约 75%

Introducing Claude Haiku 5.5

AI 导读

Anthropic 发布 Claude Haiku 5.5,定位为迄今最便宜、最快的小模型,适合摘要、压缩、数据库查询、分类等高吞吐任务,并可搭配 Opus 5.5 和 Sonnet 5.5 担任编码子智能体。

推荐理由

官方发布了定价、基准成绩与订阅 API 额度变化,读者可以据此评估小模型在低成本智能体任务中的适用场景。

正文 · AI 翻译

隆重推出 Claude Haiku 5.5:我们迄今为止发布的最便宜、最快、能力最强的小型模型。

Claude Haiku 5.5 专为高并发、成本敏感型任务而设计。它能可靠地处理快速且重复性的工作负载(如摘要、压缩、数据库查询和分类请求)。作为编码工作中的子代理,它与 Opus 5.5 和 Sonnet 5.5 搭配使用效果出色。而且,由于它也是我们迄今为止最快的模型,它尤其适合对速度敏感的任务,如实时客户支持和浏览器使用。¹

Haiku 5.5 的价格远低于 Haiku 4.5。平均而言,其运行成本现在降低了约 75%。²

伴随此次发布,我们也在提升整个模型系列的价值。我们将 Claude Sonnet 5.5 的缓存读取价格减半,这意味着 Sonnet 5.5 在大多数代理型工作上的运行成本现在降低了约 20%。此外,我们还为 Claude Max 和 Team 订阅用户推出了一项新的月度 API 额度,旨在支持用户在 Claude 平台上构建新的代理和应用程序。

性能

以下是 Claude Haiku 5.5 在一系列基准测试中的表现:

Haiku 5.5Haiku 4.5GPT-6 LunaSonnet 5.5供参考
知识工作GDPval-AA v2.1162073514371840
知识工作AA-Briefcase v1.1157861413361824
计算机使用OSWorld 2.172.4%离线子集15.7%离线子集48.9%离线子集83.9%离线子集
多学科推理Humanity’s Last Exam45.9%无工具10.2%无工具—56.9%无工具
57.4%使用工具18.7%使用工具—64.5%使用工具
代理型编码Terminal-Bench 4.039.2%0.0%16.4%70.6%
代理型编码FrontierCode 1.1 (Main)46.4%—42.4%52.1%Xhigh
视觉推理Chartography46.4%无工具6.4%无工具29.1%无工具61.6%无工具

有关我们如何运行评估的详细信息,请参阅 Haiku 5.5 系统卡。

Haiku 5.5 是我们首个配备可调节努力程度设置的 Haiku 级模型。这意味着,与我们的其他模型一样,用户可以选择是优化成本还是优化智能。下图展示了 Haiku 5.5 在每个努力程度设置下在三项基准测试中的表现:

OSWorld 2.1(离线子集)准确率与成本对比

OSWorld 2.1 衡量代理操作真实计算机完成长时间、多步骤任务的能力。

在早期测试中,我们的客户报告的结果与上述性能和成本改进一致。以下是他们对该新模型的评价:

引述

“我们对 Claude Haiku 5.5 印象非常深刻,尤其是它的速度。我们在 AI Teammates(我们的人工智能代理产品)的评估套件中运行了它,涵盖了对缺陷进行分类、设置项目以及搜索大型项目组合以发现高风险或逾期工作等用例。与我们目前使用的模型相比,任务完成的延迟降低了 30% 以上,每个代理轮次的推理速度最高提升了 2.5 倍。体验明显更加流畅。”

公司Asana

作者Aaron Vinh,资深软件工程师

定价

下表展示了 Claude Haiku 5.5 的定价与我们其他模型的对比。当用于提示词不超过 100,000 个 token 的任务时,Haiku 5.5 的性价比尤为突出,而此类任务约占我们此前 Haiku 模型请求量的 90%。

每 100 万 token 价格Haiku 5.5
提示词不超过 / 超过 100k
Haiku 4.5Sonnet 5.5
缓存读取$0.01 / $0.05$0.10$0.10
缓存写入$0.125 / $0.625$1.25$2.50
输入 token$0.10 / $0.50$1.00$2.00
输出 token$0.50 / $2.50$5.00$10.00

安全性

对齐。相较于 Haiku 4.5,Claude Haiku 5.5 在几乎所有对齐评估中都展现出重大改进。特别是,我们发现其行为失准的实例大幅减少,配合滥用的意愿也更低。该模型的系统卡更详细地描述了我们的评估流程和结果。

保障措施。与其能力相符,Haiku 5.5 的网络安全保障措施比 Haiku 4.5 更为严格,但比我们应用于其他近期模型的措施略为宽松。在网络安全方面,相比我们对 Sonnet 5.5 的保障措施,它们允许更广泛的防御性任务,但仍会阻止渗透测试及其他更可能被攻击者使用的技术。

Haiku 5.5 的生物学保障措施与 Sonnet 5、Sonnet 5.5 和 Opus 5 相同。它们允许研究性生物学问题,但会限制访问我们判断可能造成危害的请求。从事更广泛生物学和网络活动的组织可以申请我们的生命科学验证计划和网络验证计划。

可用性

Claude Haiku 5.5 现已在所有平台上线,包括 Amazon Web Services、Google Cloud 和 Microsoft Azure。在 Claude 平台上,开发者可以通过 claude-haiku-5-5 开始使用。

详情请参阅我们的迁移指南。

更多更新

除了 Claude Haiku 5.5 的新定价外,我们还在进一步提升模型和产品的价值。

首先,从今天起,我们将降低 Claude Sonnet 5.5 的缓存读取价格。缓存读取现在便宜 50%:每百万 token 0.10 美元,而非 0.20 美元。由于缓存读取占模型 token 消耗的很大一部分,这将使 Sonnet 5.5 在大多数智能体任务上的成本降低约 20%。

例如,以下是此次降价对 Sonnet 5.5 在 Terminal-Bench 4.0 上性能与成本之比的影响:

Terminal-Bench 4.0准确率与成本对比

Terminal-Bench 4.0 衡量模型在命令行界面内完成复杂、多步骤专业任务的能力。

这张图表说明了 Haiku 5.5 与我们更大模型之间的一个重要区别。对于像 Terminal-Bench 4.0 所衡量的复杂智能体编码任务,Sonnet 5.5 和 Opus 5.5 仍是更好的选择。相比之下,Haiku 5.5 最适合范围更窄的任务——这些任务若使用此前版本的 Claude 可能会因成本过高而无法实现——例如压缩、摘要或子智能体工作。

其次,本周我们将向所有 Max 和 Team 订阅用户推出每月 API 额度,可用于 Claude 平台。Max 5x 用户每月将获得 100 美元额度,Max 20x 用户将获得 200 美元,Team 订阅用户将获得最高 500 美元,并在其用户之间共享。这些额度旨在让我们的用户能够尝试构建调用我们 API 的工具、应用和智能体。它们可用于我们的任何模型。如需了解更多信息,请参阅我们的帮助中心文章。

对于开发者,我们还更新了 Claude Python 和 TypeScript SDK,以测试版形式新增对 computer use 和 browser use 的支持。鉴于 Haiku 5.5 在速度、能力和价格方面的综合优势,它尤其适合这些任务。你可以在我们的 Claude 平台文档中了解更多相关信息。

来源:Anthropic:Newsroom · anthropic.com