Anthropic 与 Accenture 合作开展嵌入式独立评估
Partnering with Accenture on embedded evaluation
Anthropic 宣布与 Accenture 合作,对其前沿模型开展嵌入式独立评估,合作由 Accenture 旗下 AI 业务 Faculty 主导,包括评估与红队测试、对齐评估和测试模型安全防护。
原文说明了嵌入评估的运作方式和资金安排,读者可以了解第三方内部评估在安全承诺验证中的实际边界。
我们正与 Accenture 合作,对前沿 AI 进行独立评估。这是朝着我们 CEO 在文章《我们必须把控前沿节奏》中所作承诺迈出的重要一步——将评估人员嵌入 Anthropic 内部。
该合作将由 Accenture 旗下专注于 AI 的业务部门 Faculty 牵头,内容包括评估和红队测试模型、开展对齐评估,以及测试模型防护措施。Accenture 帮助众多行业的企业和政府部署 AI。他们对企业在实践中如何使用 AI 的理解,塑造了其安全方法论,而他们也将把这一视角带入对我们模型的评估中。
Anthropic 和 Accenture 各自预计将在未来五年内投入至少 $1 billion,用于建设这一领域的能力。
嵌入式评估是一种新做法,关于其如何运作的许多细节仍在制定中。与如今的外部评估人员不同,嵌入式评估人员将在 AI 公司内部工作,其访问权限可与员工相当。这种权限使他们能够观察模型在训练中逐步成形,跟踪决定这些模型如何构建和部署的各项决策,并直接与员工交流。从这一有利位置出发,嵌入式评估人员可以评估一家公司如何运作,核实其是否履行安全承诺,并识别盲点。他们还可以报告事件,并让公众对收益与风险有更充分了解。
需要明确的是,独立的嵌入式评估人员并不会减轻我们的责任,而是有助于让责任更可验证。我们模型的安全仍然是我们的责任。
目前,对于嵌入式评估方应当有权访问哪些信息,或者他们应如何报告自己的发现,都还没有标准。对于如何资助独立评估,也还没有确定的体系。从长远来看,我们认为资金应来自 pooled 或政府来源,正如我们在 6 月的 Advanced AI Framework 中所呼吁的那样。由于这两者目前都不存在,我们计划以不同的资助安排与不同的评估方合作。
鉴于这项工作的重要性和紧迫性,Anthropic 将直接资助 Accenture 的工作。我们也在与 METR 及其他非营利评估方对话,以利用他们自己的资金试点嵌入式评估的各个要素。最终,我们认为前沿 AI 需要一个以共同标准运作的评估方生态。
我们预计前沿实验室会同时与多家组织合作。我们的合作是非排他性的;Anthropic 将与未来几周内公布的其他评估方合作,Accenture 也将以类似身份与其他 AI 开发者合作。
我们将继续训练并发布前沿模型,并且希望在我们这样做的过程中,有独立评估方与我们并肩工作。我们现在分享这些早期努力,是为了让公众和其他 AI 开发者看到我们的流程。我们预计,随着这一领域逐渐成熟,我们的方法也会演进;随着我们的工作开始,以及我们引入更多评估方,我们会分享更多信息。
来源:Anthropic:Newsroom(网页) · anthropic.com