跳到正文
北京时间
原文
Anthropic:Research(发表成果 · 网页)·· 2026-08-26精选AI 评分69

Anthropic 开放 Claude 真实使用数据供外部独立研究,公布试点结果

Enabling independent research on how people use Claude

AI 导读

Anthropic 今年春季启动试点,通过隐私保护工具 Anthropic Insights(原 Clio)向斯坦福大学 SALT Lab、牛津大学人类信息处理实验室及 METR 三个外部机构开放约 25 万段 2026 年 4-5 月的 Claude.ai 或 Claude Code 对话数据,供其独立设计研究并公开发布结果。

推荐理由

真实使用数据向外部研究者开放,使AI社会影响研究得以脱开厂商自述,基于独立设计的问题与可核验聚合结果,对评估产物实际影响更有参考价值。

正文 · AI 翻译

Enabling independent research on how people use Claude

今年早些时候,我们开展了一项试点,让外部研究人员能够访问聚合后的真实世界 Claude 使用数据。三个研究小组为 Anthropic Insights 设计了各自的研究——这是我们保护隐私的分析工具;我们代他们进行了数据收集,而他们则独立开展了自己的分析。在这篇文章中,我们分享这些研究的高层结果,以及我们在运行这一试点项目过程中的收获。我们还提供一份意向表达表供未来可能希望与我们合作的研究人员使用。

确保向变革性 AI 的过渡顺利推进,需要理解其对人与社会的影响。目前,关于人们与 AI 真实世界互动的数据集中在少数几家实验室手中。我们认为,如果能让更多数据广泛可及——面向研究者、政策制定者和公众——那将是件好事。

实验室之外的研究人员有两种选择。他们可以借助实验室发布的分析,这些分析反映真实使用情况,但往往回答的是实验室自己的问题,而非他们自己的问题。或者他们可以使用公开数据集,这些数据集可以任由他们研究,但偏向于更随意的使用场景,可能无法反映大多数人实际使用 AI 的方式。对于研究 AI 实际如何被使用的独立研究而言,两者都不够充分。

今年春天,我们试点了一个项目,由三家外部研究机构通过 Anthropic Insights(原名“Clio”)自行设计并开展针对 Claude 使用数据的研究。Anthropic Insights 是我们自己团队用来分析数百万条 Claude 对话中使用模式的隐私保护工具。我们希望未来能扩大这一项目的规模,因此我们还对与第三方研究人员共享的所有数据进行了一次额外的隐私审计,以验证我们的隐私保护措施确实有效(见 附录)。

我们相信,这是外部研究人员首次针对某家 AI 公司自身的使用数据开展公开的独立研究。下面,我们将讨论外部团队发现了什么、我们在运行这一试点项目中学到了什么,以及我们在决定如何更广泛地推广该项目时正在权衡哪些因素。我们同时公开发布每个项目的汇总数据。

研究人员发现了什么

我们与三个研究团队合作:斯坦福大学的社会与语言技术(SALT)实验室、牛津大学的人类信息处理实验室,以及METR——一家评估前沿 AI 模型的非营利组织。每个团队都提出了自己的研究问题,并使用 Anthropic Insights 对 2026 年 4 月至 5 月期间约 250,000 条 Claude.ai 或 Claude Code 对话进行了隐私保护分析。

我们希望外部合作伙伴尽可能保持独立,因此我们的合同审查权限仅限于用户隐私、可能帮助他人违反我们使用政策的信息、Anthropic 的机密信息以及研究准确性。除此之外,Anthropic 对研究结论的内容没有任何发言权,研究人员可以自由发表他们的结果,即使这些结果对 Anthropic 不利。以下是一些早期结果。我们对这些方向感到兴奋,也对数据公开后其他人将有何发现感到期待。

社会与语言技术实验室研究了人类如何与 AI 协作。他们考察了人们将哪些类型的工作交给 AI、在完成这些工作时人类保留了哪些角色,以及人机协作在哪些环节出现断裂。他们发现:

  • 人们将高风险工作交给 AI 的程度超出预期。此前的研究表明,人们大多将低问责性的任务委托给 AI,而将重大任务(即影响他人或难以撤销的工作)留给自己。但 SALT 实验室发现,超过半数的 Claude 对话涉及人们将重大任务委托给 AI。人们在寻求专业指导时最有可能将重大工作交给 Claude,尤其是在法律或财务问题上。
  • 人们在与 Claude 协作时通常会主导和监督工作。在近四分之三的对话中,人们设定方向而 Claude 提供协助,并且他们通常会调整 Claude 的输出而非直接照搬。但即便在引导 Claude 产出他们想要的结果时,人们对其产出的理解和学习程度也各不相同。
  • 人们在与 AI 协作时感到摩擦,是很常见的现象。然而,这种摩擦往往是有成效的。人们投入时间和精力去观察 Claude 如何尝试一项任务、找出请求中哪些地方表述不清或被误解,并不断迭代自己的指令,这些都会带来更好的结果——它促使人们厘清自己的意图、改进输出,或者持续投入到问题之中。

在这里阅读他们的完整报告。

人类信息处理实验室正在研究人们在使用 Claude 时的感受,以及这种感受与 Claude 行为之间的关系。他们的初步结果表明:

  • 人们使用 AI 时的感受,与 AI 的行为方式相关联。研究人员发现,人类行为与 AI 行为的模式会在对话中同时出现:Claude 表现得热情时,人们也更积极。Claude 拒绝或表示不同意见时,人们会进行反驳。Claude 表现得古怪时,人们会在智识上更加投入。而 Claude 单纯提供帮助时,人们则显得满意。
  • 人们使用 AI 时的体验,与他们在互联网其他地方的体验颇为相似。研究人员发现,Claude 对话中沉浸、挫败和愉悦等状态之间的模式,与另一项关于日常互联网浏览的研究中的模式高度相似,这表明人们与 AI 互动的方式和与其他数字活动互动的方式存在相似之处。

他们仍在完成报告撰写。待其公开发布后,我们会在此处添加链接。

METR 正在估算编程智能体带来的真实世界生产力提升,以及这些生产力增长在不同模型代际之间如何变化。他们对 Claude Code 对话的分析仍在进行中,但早期结果提示:

  • 能力更强的模型可能为用户节省更多时间。 METR 将 Claude 对“如果没有 AI,这些任务本会花费多长时间”的猜测,与使用不同 Claude 模型时任务实际花费的时间进行了对比。他们的初步发现表明,较新的模型相比旧模型能带来显著的速度提升。METR 计划随着分析推进分享更多内容。
  • AI 能够相当准确地估算所需时间。 由于该分析依赖 Claude 判断一项任务会花费多长时间,METR 将这些判断与此前一项开发者研究中已知的完成时间进行了对比。Claude 的估算与开发者实际花费的时间相关。
  • 下一步:衡量 AI 能在多大程度上加速研究。METR 正在继续研究他们的工作如何为了解 AI 能在多大程度上加快研究人员的工作提供洞见,而随着AI 承担越来越多自身的开发工作,这一点可能会变得越来越重要。

他们仍在完成报告撰写。待其公开发布后,我们会在此处添加链接。

我们团队的发现

在 AI 领域,共享使用数据基本上是前所未有的,因此这次试点既是在隐私保护前提下支持第三方研究的一种方式,也是一次运行此类项目的实验。保护用户隐私与保障研究者的独立性都至关重要,而我们两者都做到了。Anthropic Insights 正是为此而设计——研究者从未访问原始对话,只能获取经过与我们内部工作同等法律与隐私审查后的聚合输出。然而,这一切使得该试点的推进速度对于一家 AI 实验室的正常研究节奏而言过于缓慢,且运行起来资源消耗巨大。这两个因素都对有效扩大其规模构成了挑战。关于我们如何运行这次试点的更多细节,请参见附录。下面我们将讨论我们学到了什么,以及如何应对出现的挑战。

从不同视角研究同一个问题是有价值的。我们合作伙伴的一些研究问题与内部正在开展的工作存在重叠。例如,METR 的提案与我们关于“智能体编程与专业能力的持续回报”的经济学研究相似。我们认为这种重叠很有价值:它让外部研究者有机会审视类似的数据并得出自己的结论。这些结论是否与我们的一致,我们会在他们的研究继续推进时持续关注。我们还让 METR 与我们的经济学团队建立了联系,并发现这种联系改善了双方研究团队的工作。

在内部行之有效的研究方法,需要为外部合作方做出调整。使用 Anthropic Insights 时,研究人员会写下诸如“这个人寻求的是哪一类指导?”这样的问题,然后由 Claude 为研究中的每一段对话给出答案。这些答案随后被汇总为类别;研究人员只能看到最终类别,以及每类对话所占的百分比。由于我们依赖的是 Claude 的判断,该工具对问题的措辞很敏感;一个措辞不当的问题可能把对话归入并不能如实反映它们的类别。而由于没有人能阅读底层对话,这类错误很难被发现。

在内部,我们通过在数周内对问题反复迭代来应对这一点。外部合作方做不到这一点,因为在每次共享数据集之前都反复进行隐私审查,会让这项研究无法开展。于是,我们让他们在 WildChat 上测试自己的问题——这是一个公开的人机对话数据集,他们可以在其中对照底层对话来核查答案。但 WildChat 偏向休闲和创意用途,与 Claude 的流量不同,因此有些在 WildChat 上表现良好的问题,一旦应用于真实的 Claude 对话,就会产生误导性的类别。我们通过提供关于如何解读 Anthropic Insights 输出的指导来应对这一问题(见附录)。展望未来,我们正在探索外部研究人员如何能更有效地提前开发他们的问题和类别。

在保持对滥用行为透明的同时不为其提供便利。在我们合作伙伴的 Anthropic Insights 输出中,某些类别暴露了违反我们可接受使用政策或服务条款的行为——例如某一类人群在寻求关于某项被禁止活动的指导。我们认为公众应当了解我们平台被滥用的情况,因此我们分享了其中大部分违规内容。例外的是那些描述用户如何绕过我们防护措施、而非试图做什么的类别。在每项研究中,受影响的类别和对话不足 5%,并且在每种情况下,我们都告知了研究人员我们修改或删除了哪些聚类及其原因。作为一项标准做法,当 Anthropic Insights 发现此类违规行为时,我们会将聚合数据分享给我们的 Safeguards 团队供其审查。这也是我们今后与外部研究人员合作的一项重要流程。

展望未来

理解 AI 对社会的影响,这项工作太过庞大,仅靠 AI 公司无法独自完成。真正的监督需要外部研究人员对真实世界的使用数据提出他们自己的问题,并独立发表他们的发现。

这次试点是一次实验:外部研究人员能否在不损害我们用户隐私的前提下,在我们的平台上开展独立研究?这项工作比我们预期的更具挑战性,我们也吸取了许多教训,但到目前为止,答案似乎是肯定的。我们的合作伙伴开展了我们自己不会想到去设计的研究,每一方都告诉了我们一些关于 AI 现实影响的新发现。这是有希望的第一步,但还有远更多的工作要做。

下一步,我们要确定能否扩大这一项目的规模,既包括在上述限制条件下我们能支持哪些类型的研究,也包括我们一次能运行多少项研究。我们正在缓慢推进,以确保隐私、安全与研究质量。我们希望了解各方的兴趣,并弄清研究人员想要研究什么。如果你是一名研究人员,并且获得 Anthropic Insights 的使用权限能让你开展今天无法进行的工作,请填写这份表单。


附录

完整附录见此。其中描述了我们如何运行该项目,包括我们如何选择三家合作伙伴、我们为解释项目目标以及 Anthropic Insights 能做什么而撰写的研究入门指南,以及每个项目如何从提案推进到研究设计再到分析。附录还包含我们合作协议的细节,其中明确规定我们的合作伙伴可以自由发表研究结果,即便这些结果对 Anthropic 不利。此外,我们还介绍了由 Imperial College London 对本数据开展的第三方隐私审计,以及我们对所有已发布数据所遵循的隐私威胁模型。我们还附上了关于如何解读我们从合作伙伴的 Anthropic Insights 研究中发布的数据的指引。

贡献与致谢

Kunal Handa 领导了该项目,与各合作方就其研究提案展开协作,起草了研究指南与合同,主持了合作方的 Anthropic Insights 研究,协助搭建了支持合作方研究的技术基础设施,参与了 Anthropic Insights 成果的内部评审,并撰写了博客文章。Miranda Zhang 协调了合作关系与沟通工作,并参与了该项工作各个环节。Gabriel Nicholas 协调了第三方隐私审计、Anthropic Insights 成果的内部评审,并参与了该项工作各个环节。Miles McCain 撰写了关于解读 Anthropic Insights 成果的指南,开发了支持合作方研究的技术基础设施,参与了 Anthropic Insights 成果的内部评审,并就博客文章和隐私威胁模型提供了反馈。Ryan Heller 为支持合作方研究贡献了技术基础设施。Saffron Huang 参与了 Anthropic Insights 成果的内部评审,并提供了关键反馈与讨论。Thomas Millar 和 Suzanne Wang 为支持合作方研究以及 Anthropic Insights 成果的内部评审贡献了技术基础设施。Shan Carter、Mo Julapalli、Matt Kearney、Sarah Pollack 和 Judy Shen 参与了 Anthropic Insights 成果的内部评审。Matthew Jagielski 参与了隐私威胁模型的工作。Shaoyi Zhang 为支持合作方研究贡献了技术基础设施。Heather Whitney、Ankur Rathi、Aisling Keenan 和 David Saunders 在整个项目过程中提供了法律与隐私方面的指导。Jake Eaton 和 Sylvie Carr 参与了博客文章的构思与撰写。Jack Clark 和 Michael Stern 在整个过程中提供了宝贵的指导、支持与讨论。Deep Ganguli 在项目的各个阶段提供了详尽的指导、组织支持与反馈。

此外,我们感谢 Miriam Chaum、Ishita Dasgupta、Esin Durmus、Adam Farina、Zoe Hitzig、Jerry Hong、Devin Kuokka、Hendson Lin、Maxim Massenkoff、Peter McCrory、Maryam Quasto、Nitarshan Rajkumar、Amie Rotherham、Divya Siddarth、Taylor Sorensen、Jerome Swannack、Alex Tamkin、Molly Villagra、Scott White 和 Charles Yang 提出的有益想法、讨论、反馈和支持。

感谢斯坦福社会与语言技术实验室的 Vishakh Padmakumar、Yijia Shao、Jennifer Wang、Diyi Yang 和 Dora Zhao,牛津人类信息处理实验室的 Tsvetomira Dumbalska、Hannah Rose Kirk 和 Christopher Summerfield,以及 METR 的 Joel Becker(现就职于 Anthropic)、Daniel Paleka 和 Parker Whitfill 在本项目中的合作。

感谢 Zexi Yao、Bozhidar Stevanoski、Peter Romov、Euodia Dodd、Xiaoxue Yang 和 Nataša Krčo 开展第三方隐私审计。


引用

@online{handa2026enablingindependentresearch,
author = {Kunal Handa and Miranda Zhang and Gabriel Nicholas and Miles McCain and Ryan Heller and Saffron Huang and Thomas Millar and Suzanne Wang and Shan Carter and Mo Julapalli and Matt Kearney and Sarah Pollack and Judy Shen and Matthew Jagielski and Shaoyi Zhang and Heather Whitney and Ankur Rathi and Aisling Keenan and David Saunders and Jake Eaton and Sylvie Carr and Jack Clark and Michael Stern and Deep Ganguli},
title = {Enabling independent research on how people use Claude},
date = {2026-08-26},
year = {2026},
url = {www.anthropic.com/research/enabling-independent-research},
}

来源:Anthropic:Research(发表成果 · 网页) · anthropic.com