Anthropic:智能体编码中专业知识回报持续存在
Agentic coding and persistent returns to expertise
Anthropic 基于约40万次 Claude Code 交互会话(2025年10月至2026年4月)分析发现:人类主导规划决策(做什么),Claude 主导执行决策(怎么做)。领域专业知识越强,模型每次指令完成的工作量越多。各类职业完成任务的成功率与软件工程师平均相近;领域专家成功率更高,但与中级用户差距不大。七个月间调试会话占比下降近一半,使用转向端到端智能体任务(部署运行代码、分析数据、编写非代码文档),典型任务价值平均上升约25%。
这份报告用40万次真实会话数据揭示了一个反直觉发现,决定Agent编码成败的,不是会不会写代码,而是对自己领域问题的理解深度。对非技术背景用AI编程的人和产品经理都是重要信号。
核心发现
- 在此前工作的基础上,我们提出了一个研究交互式智能体编程的框架,其依据是对 2025 年 10 月至 2026 年 4 月期间约 400,000 个 Claude Code 会话进行的隐私保护分析。我们评估了任务构成、人机协作以及成功率。
- 在典型会话中,人做出大部分规划决策(做什么),而 Claude 做出大部分执行决策(怎么做)。一个人带入会话的领域专业知识越多,Claude 每条指令完成的工作就越多。在编程任务上,每一个主要职业的成功率——即完成此人原本打算做的事,并有可验证的证据,如通过测试或已提交的工作——平均而言几乎与软件工程师相同。
- 一个人的领域专业知识越多,会话以成功告终的频率就越高——不过中级用户与专家用户之间的差距并不大。在我们观察的七个月里,用于调试的会话占比下降了近一半,使用方式转向更端到端的智能体式使用:部署和运行代码、分析数据,以及撰写非代码文档。
- 在这七个月里,典型任务的价值——我们通过与自由职业招聘信息进行比较来估算——在几乎所有类型的工作中都有所上升,平均约 25%。
引言
智能体编程已迅速兴起。自 2025 年底以来,带有编程智能体活动的 GitHub 项目占比已增长一倍以上,1而 Claude Code 用户如今平均每周花 20 小时使用该工具。2没有正式编程经验的人,能否成功指挥智能体完成复杂的技术工作?而这些工具的快速普及与改进,对广义的知识工作又意味着什么?尽管我们尚未对这些问题有完整答案,但我们从 Claude Code 的使用数据中寻找早期信号。
本报告基于对 2025 年 10 月至 2026 年 4 月期间约 235,000 人的约 400,000 次交互会话所进行的隐私保护分析,提供了关于 Claude Code 在实践中如何被使用的证据。它建立在先前工作的基础之上,这些工作聚焦于 Claude Code 会话中的自主性度量,以及Claude Code 如何改变 Anthropic 内部的工作方式。3在此,我们提出一个用于描述交互式 AI 编程助手使用情况的框架:正在完成何种工作、由谁完成,以及是否成功。我们聚焦于通过命令行界面(CLI)、Claude.ai或 Claude Code 桌面应用使用 Claude Code 的情况。4通过追踪智能体编程的使用情况如何随模型能力提升而变化,我们可以更好地理解这些工具如何影响编程专业人士与知识工作者的劳动力市场。
Claude Code 上发生的一切,或许预示着知识工作的未来走向——智能体正逐渐嵌入非编程类工作。我们发现,Claude 正在处理更复杂、更有价值的任务。与此同时,在智能体编程中仍存在明确的分工:人决定构建什么,智能体决定如何构建。
我们还发现证据表明,放大该工具有效使用的是领域专业知识,而非编程熟练度。具体而言,领域专家成功率更高,也更容易从错误和误解中恢复。然而,专家与中级用户之间的差距并不大——这表明,只要在某一领域具备熟练度,就足以几乎像深度精通者一样有效地使用该工具。
这些发现让我们得以初步窥见劳动力市场可能发生的转变。在我们的数据中,成功取决于一个人对所要解决问题的理解程度,而非是否接受过编程训练。如果这些模式在整个经济体中普遍成立,那就意味着:尽管智能体编程工具可能正在吸收部分实现密集型工作,但它们同时也在奖励那些对工作中所解决问题有扎实理解的人。编程智能体并非在替代领域专业知识——工作者带给智能体的理解越多,智能体所能完成的高质量工作就越多。
分工
人们用 Claude Code 做什么
为了解人们用 Claude Code 做什么,我们将每个会话归类为九种工作模式之一——即最能描述该会话试图完成之事的单一活动。5 其中四种模式涉及直接编写或维护代码:构建新东西、修复损坏之处、测试代码,以及编排其他智能体或自动化流水线。另一个类别是运维软件——部署、配置、运行流水线、监控系统。有两个类别更侧重于弄清该做什么:理解现有系统如何运作,以及在做改动之前规划改动。还有两个类别采取与代码无关的行动,或者代码只是最终产品的附带产物:分析数据,以及通过演示文稿和其他基于文字的文件进行沟通。
约 56% 的会话由编写(25%)、修复(26%)或测试与编排代码(5%)构成。软件运维占 17%,而 14% 的会话是规划或探索,13% 产出分析或文字(图 1)。

每个交互式会话都被归类为最能描述其试图完成之事的单一模式。
我们通过让模型读取每个会话的转录记录来对其进行分类,然后使用我们的隐私保护分析工具,将其与每个会话自动记录的遥测数据进行比对,包括是否添加或删除了任何代码行。两个来源高度一致——例如,在我们分类器标记为创建或修改代码的会话中,超过 90% 在遥测数据中显示出了代码变更。详见附录。
谁来决定什么
Claude Code 的自主性有多高?能力评估表明,其上限很高且仍在上升:在METR 的时间跨度评估等基准测试中,前沿模型如今能够完成人类需要数小时才能完成的软件任务,并在过程中自主克服各种障碍。但在实际使用中,情况究竟如何?在此,我们考察在真实会话中,人和 Claude 各自做了多少引导工作。
我们从两个角度考察这一问题。首先,我们关注人们在多大程度上将决策委托给 Claude;其次,我们考察他们向 Claude 下达了多少操作。为了理解一次会话中的决策分工,我们基于会话内容构建了一个隐私保护的决策归因分类器。我们让分类器列出一次会话中所有有意义的决策。我们将这些决策分为规划(做什么、采用哪种方法、什么算完成)和执行(改哪些文件、写什么代码、用什么语言写、运行哪些命令)。随后,分类器将每项决策归因于 Claude 或用户,从而为每次会话给出两个数字:用户在规划决策中的占比,以及用户在执行决策中的占比。
平均而言,人们做出约 70% 的规划决策,但只做出 20% 的执行决策(图 2)。在实践中,智能体编程存在明确的分工——人决定构建什么,智能体决定如何构建。
为了理解一次会话中的操作委托情况,我们考察会话的结构而非内容。一次 Claude Code 会话涉及 Claude 与用户来回交换提示词(来自用户)和操作(由 Claude 执行)——用户写一个提示词,Claude 去执行一些工作,然后用户再写一个提示词,如此往复。在一次典型会话中,大约有四个这样的轮次。在我们从 10 月到 4 月的历史数据中,用户发送的每个提示词平均会引发 Claude 执行约 10 个操作组成的链条——有时超过 100 个。6在每个轮次中,Claude 读取文件、编辑代码、运行命令,并平均输出 2,400 词的内容。
Claude 在两次检查之间完成多少工作,很大程度上取决于由谁来做决策。当用户掌握执行的控制权(即做出超过 80% 的执行决策)时,Claude 每轮采取的行动较少(约八次行动)。而当 Claude 掌握规划的控制权(即做出超过 80% 的规划决策)时,它采取的行动数量最多(约 16 次)。

各会话中,归因于 Claude 而非用户的规划决策(做什么)与执行决策(怎么做)占比的分布。在典型会话中,用户做出约 70% 的规划决策,而 Claude 做出约 80% 的执行决策。
专业水平
Claude 会从每份对话记录中,按从新手到专家的五点量表,对用户在该任务中表现出的专业水平进行评分。专业水平分类器会寻找三类信号:用户表述指令的精确程度、用户要求 Claude 核实的内容,以及倾向于用户纠正 Claude 还是 Claude 纠正用户。请注意,专业水平所捕捉的内容与职位头衔或一般能力有相当大的不同,而且关键在于,它是针对具体任务的。一位资深工程师第一次问 Rust 问题,在 Rust 方面就是初学者。一位从未用过 Python 的会计,如果能准确告诉 Claude 某个 Python 脚本必须执行哪些对账规则,并能在月末结账时发现它处理不当的边界情况,那么他在这项任务上就是专家。
下表展示了我们在分类器中如何定义每个专业水平,并附上来自编码智能体会话公开数据集 SWE-chat 的一个示例请求。被归类为“新手”的对话给出的是通用指令,不隐含任何领域特定知识。“专家”对话则传达了对代码库和技术环境的深入理解。

这些示例对我们的分类器所标注的真实会话进行了改写、匿名化和压缩。表中使用的许多会话来自一个公开的智能体编程会话数据集 SWE-chat。[
我们量化了专业知识水平与 Claude 在每个提示词下的输出和活动之间的关系。在典型的新手会话中,每个提示词会触发约五次 Claude 操作和大约 600 词的输出,而专家会话触发的操作链长度是前者的两倍多(12 次操作),输出量则是五倍(3,200 词)(图 3)。新手与专家会话之间的这一差距出现在每一种工作类型和每一个任务价值区间中。
这些指标补充了我们在此前关于 Claude Code 的报告中的自主性指标,后者追踪的是智能体运行多长时间以及人们多久会自动批准其操作。相比之下,我们的决策归因指标捕捉的是在整个会话中谁做出了实质性决策,而我们的每提示词输出和操作指标衡量的是每个人类提示词触发了 Claude 多少自主活动。

对于更专业的用户,Claude 在每次提示词中产生更多操作(左侧柱)和文本输出(右侧柱)。箱体覆盖四分位距(在中位数处分割)。须线表示第 5 至第 95 百分位数。白点为几何均值。两种上升趋势均具有统计显著性(p < 0.001),每一相邻等级之间的递进亦然;在控制工作模式、任务价值、月份、职业和模型族、并按用户聚类标准误的回归中,它们仍保持显著(每提升一个专业等级,操作数 +9%、输出量 +13%)。
谁在使用 Claude Code,以及用于什么
用户
为了解是谁在从事这些工作,我们从会话记录中推断每位用户的职业,并将其映射到美国劳工统计局标准职业分类(SOC)体系中的23个大类之一。分类器被指示只能依据以下信号:智能体在会话开始时加载的项目上下文、用户文件的名称与结构、他们引用的任何产物(例如法律文书、临床数据、财务报告、课程大纲等)以及他们使用的词汇。7 它被明确指示不得将编写代码这一行为本身视为从事编程职业的证据。只有当存在明确信号表明软件或数据工作是用户的职业时,会话才会被归类到编程类 SOC 代码(计算机与数学职业)。如果一位律师编写脚本来自动标记一文件夹合同中的缺失条款,即使该会话的工作主要是软件工作,也会被映射到法律职业。当没有关于用户职业的信号时,该会话则保持未分类。
我们能够在大约70%的会话中推断出职业。在这一集合中,计算机与数学职业——这一涵盖大多数软件相关工作的类别——不出所料是最大的群体。紧随其后的是商业与金融运营;艺术、设计与媒体;管理;以及生命、物理与社会科学。在我们的样本中,增长最快的非软件职业群体是管理、销售和法律职业。
这项工作
2025 年 10 月至 2026 年 4 月期间,使用 Claude Code 完成的工作构成发生了显著变化。最明显的变化是,用于修复损坏代码的会话占比从 33% 降至 19%(图 4)。取而代之的是,围绕代码展开的工作占比有所增加。运维软件的会话占比从 14% 增长至 21%。写作和数据分析的占比大约翻了一倍,从约 10% 增至 20%。
这些任务本身的价值也在提升。我们通过估算这些工作在自由职业市场上需要多少费用来近似计算每个会话的经济价值,并以真实招聘帖子的公开数据集进行校准。按照这一衡量标准,10 月至 4 月期间,平均每个会话的估算价值上升了 27%。这一增长在多种类型的工作中均有体现。构建型、运维型和修复型任务的估算价值均增长了约三分之一或更多(分别约为 43%、34% 和 32%)。这些价格估算较为粗略,因此我们主要用它们来比较不同时期任务之间的相对变化,而非将其作为字面意义上的美元数值来解读。8 关于任务估算器构建方式的详细信息,请参见附录。

七个月窗口期内各工作模式的会话占比。修复损坏代码的会话占比从 33% 降至 19%,而运维软件、分析数据和撰写文档的占比则有所增长。
成功取决于用户带来了什么
任务估算价值是了解 Claude Code 如何帮助人们完成工作的一种方式。另一个角度是考察有多少会话是成功的,以及会话的哪些特征与成功相关。在我们所有的成功衡量指标中,我们都看到了一个清晰的模式:一个人在会话中展现出的专业水平越高,成功的可能性就越大。大部分增益集中在专业水平较低的一端——新手会话与中级会话之间的差距,大于中级会话与专家会话之间的差距。
在转向成功会话的特征之前,我们应当明确我们是如何衡量成功的。我们并不观察用户在现实世界中的结果,也无法直接询问他们是否从 Claude 那里得到了想要的东西。因此,我们依赖两项互补的、基于对话记录(transcript)的衡量指标。第一项是判定成功,它来自一个分类器,该分类器读取完整的对话记录,并判断此人是否成功完成了他们原本打算做的事情(选项包括:成功、部分成功、失败、无明确目标)。随后,两个配套分类器会评估该判断的证据强度,以确定经验证的成功。一个成功信号分类器会寻找可验证的成功证据。具体而言,它会寻找与工作相匹配的 git 活动,如提交和拉取请求,以及测试套件通过,还有用户的明确肯定。它将会话从“无信号”到“弱信号”(1)再到“多个硬信号”(5)进行评分。一个并行的失败信号则对出错的证据进行评分——错误、测试失败、重试、用户对输出提出异议。经验证的成功要求同时满足:该会话被判定为成功,并且至少有一个可验证的硬成功信号。在以下分析中,由于聚焦于会话中成功或失败的程度,我们排除了被归类为“无明确目标”的会话,这类会话约占我们完整样本的 7.7%。
专业能力的回报
那么,什么样的会话最成功?事实证明,上文所述的会话专业能力评级,对会话的成功与否影响极大。
有人可能会担心,真正的驱动因素并非专业知识——也许专家只是选择了不同的任务,或者在其他方面存在差异。在本节中,我们通过比较在同一月份、针对同一主题、来自同一大类职业群体的人所做同类工作、估算价值相同的会话,来部分回应这一担忧,并考察结果如何因个人的专业水平评级而有所不同。

这些示例对来自智能体编程交互公开数据集 SWE-chat 的真实会话进行了转述和总结,并由我们的分类器进行标注。
在我们所有的成功衡量指标中,一个人在会话中展现的专业知识越多,该会话就越有可能成功。被评为新手水平的会话达到我们最严格的衡量标准——验证成功——的比例为 15%,至少达到部分成功的比例为 77%。被评为中级或以上的会话达到验证成功的比例为 28-33%,部分成功的比例为 91-92%(图 5)。
在每项衡量指标中,大部分增益来自从新手到中级的提升;从中级到专家之间,斜率有所下降。在附录中,我们给出了图 5 背后回归分析的详细信息。

按用户对任务的专业水平自评(从新手到专家的五点量表)划分的对话结果。左侧面板包含所有对话。中间和右侧面板仅限遇到麻烦的对话(失败信号 > 3),并展示仍以各种成功和失败定义结束的比例。每个点都是调整后的比率——我们仅通过比较具有相同工作模式、相同任务价值区间、相同月份、相同任务主题以及相同类型用户(是否从事软件相关职业)的对话,来估计不同专业水平之间的差异。这些点背后回归分析的详细信息见附录。须线是样本均值的置信区间(大多数太小,在此图中不可见)。这些图排除了被成功结果分类器判定为没有明确目标的对话。
在过程中遇到挑战的对话中也出现了类似的梯度。当失败信号记录了经核实的失败证据时,我们称该对话遇到了麻烦。这可能是错误、测试失败、多次尝试做同一件事,或者用户表达沮丧或不满。在遇到麻烦的对话中,经核实为成功的比例从新手自评对话的 4% 上升到专家自评对话的 15%,且已计入上述所有控制变量(图 5)。从更宽松的衡量标准来看,我们发现至少部分成功的比例在新手对话中为 60%,在中等至专家水平的对话中为 80-81%。
我们还追踪了这种反向关系——专业能力与各种失败衡量指标之间的关系。请注意,在这项分析中,被判定为失败的会话是那些甚至没有部分成功的会话。我们将一个陷入困境的会话称为被放弃,如果它被判定为失败且没有写入任何一行代码:在用户看起来是新手的情况下,19% 的会话最终被放弃,而其他所有人则为 5-7%。换句话说,经验最少的用户在努力想要获得他们追求的结果时,更有可能放弃。专业能力的部分价值似乎在于能够将智能体引导到正确的方向。9
职业可能不如专业能力重要
在软件相关职业的人群中,其会话总体上有约 30% 达到经验证的成功,而其他职业的用户达到经验证成功的比例约为 26%。在产生代码的会话中(即至少新增或修改一行代码的会话),这两个数字分别为 34% 和 29%(图 6)。在我们更宽松的成功定义下,软件相关职业与其他职业之间的差距缩小——两组在产生代码的会话中分别有 89% 和 88% 至少达到部分成功。这五个百分点的差距很小,而且在七个月里既没有扩大也没有缩小,尽管两组的成功率都在上升。在产生代码的会话中,我们数据集中规模最大的十个职业中的每一个,在成功率方面都与软件工程师相差不超过七个百分点。管理类职业的经验证成功率最高,略高于软件工程类职业。其更高的经验证成功率可能反映了管理技能可以迁移到指挥智能体上。但这也可能部分反映了我们的测量方式:验证部分依赖于对话记录中的明确确认,而管理者在得到自己想要的结果时可能更倾向于表达出来。10

在至少新增或修改一行代码的会话中,按用户推断职业分组,规模最大的十个组中达到严格成功定义——评判成功和经验证成功——的会话占比。每个组与软件/数学用户(SOC 代码:计算机与数学职业)的差距都在七个百分点以内。误差线为基于不同账户计算的 95% 置信区间。
展望未来
本报告中的结果呈现出一幅正在浮现的图景:智能体编程放大了某些形式的知识与技能,同时替代了另一些。在产出代码的会话中,每一个主要职业的成功率都与软件相关职业相差仅几个百分点。看来,编程智能体正在让编程背景与成功编程之间的关联变得不那么重要。
与此同时,成功的会话更有可能展现出领域专业知识。被评为专家级的会话,其验证成功的概率是新手级会话的两倍以上;而当会话遇到困难时,新手放弃会话的比例是其他所有人的数倍。这种协作的形态让这幅图景更加丰富——领域专家能够引导 Claude 在每一次指令中完成更多工作。因此,引导 Claude 走向成功的能力,更多来自对某个领域的掌控,而非编写代码的能力。任何领域中具备这种掌控力的人,如今或许能够完成他们此前无法胜任的技术工作。而完全不具备此类专业知识的人,从同一工具中获得的收益将少得多。而且这些收益主要来自胜任,而非精通——对领域的实际掌握就能获取大部分收益,而深度专业化在此之上仅能额外增加一点点。
这些发现尚属初步。与我们大多数研究一样,我们无法衡量现实世界中的结果,例如某次会话中编写的代码此后是否真的被使用或被丢弃,或者是否产出了具有经济价值的成果。此外,本报告排除的非交互式使用占据了相当大一部分活动。构建一个衡量它的框架是未来工作的优先事项。而且,我们对会话的所有分类都依赖于模型对对话记录的解读。在附录中,我们展示了我们的分类器会按预期方向跟踪独立的遥测数据,并在大多数会话上与一个强大的参考模型保持一致。但分类器在大规模验证上仍然充满挑战,而 Claude Code 会话又增添了更多困难,因为它们可能过于漫长和复杂,以至于人工标注无法作为真实基准。
本报告所呈现的图景将随着模型、用户以及二者之间分工的变化而更新。我们希望这些衡量指标能让我们在重大转变发生时对其进行追踪。例如,如果专业知识的回报开始随时间下降,那将表明模型开始提供目前由用户带来的关键判断力,并且这些工具带来的收益正在扩展到领域专家之外。如果由软件职业之外的用户成功完成的编程会话占比持续增长,这可能表明软件生产正在成为各个领域日常工作的一部分,而不再是单一职业的产物。这些转变将改变谁能从智能体编程中受益、受益多少,并将对劳动力市场中最受看重的能力产生影响。
附录
引用
@online{hitzig2026agentic,
author = {Zoe Hitzig and Maxim Massenkoff and Eva Lyubich and Shaoyi Zhang and Ryan Heller and Peter McCrory},
title = {Agentic coding and persistent returns to expertise},
date = {2026-06-16},
year = {2026},
url = {https://www.anthropic.com/research/claude-code-expertise},
}
致谢
感谢:Jake Eaton、Sarah Pollack、Hanah Ho、Szymon Sacher、Anton Korinek、Santi Ruiz、Kerry Persen、Ankur Rathi、Alex Tamkin、Heather Whitney、Cat Wu、Kacie Jenkins、Jennifer Martinez、Amie Rotherham、Boris Cherny、Eleanor Dorfman、Miles McCain 和 Jack Clark。
脚注
- 一项初步研究覆盖了 128,000 个公开代码仓库,估计截至 2025 年 10 月底,16-23% 的项目中检测到了编程智能体活动。一项后续研究采用相同方法,发现该时期之后创建的项目中采用率高出两倍以上。对智能体编程活动的检测依赖于智能体共同作者标签和配置文件,这很可能低估了实际使用量。
- 请注意,这里衡量的是 Claude Code 处于活跃运行状态的小时数,而非用户亲手向 Claude 输入的时间。
- 此外,Sarkar(2026)和Baumann 等人(2026)分别通过研究 Cursor IDE 会话和公开可用的会话,提供了理解智能体编程的视角。
- 请注意,我们排除了通过第三方集成开发环境和软件开发工具包运行的 Claude Code 使用情况。因此,我们也排除了用户在 CLI 中通过
claude -p “<prompt>”运行单个提示词的“无头”模式会话。我们排除这类使用,是因为它在两个关键方面有所不同——其中大部分是程序化调用,Claude Code 嵌入在自动化工具和流水线中,而非与用户对话;而且即便有用户在场,我们也无法像在纳入统计的界面上那样端到端地观察用户的会话。 - 本报告中的所有分类器均使用 Claude Sonnet 4.6,除非另有说明。关于分类器的详细信息,包括其完整文本和验证结果,可在附录中找到。
- 每个提示词对应的操作数量呈长尾分布。约 2% 的会话平均每个提示词超过 100 个操作,约每 270 个中有 1 个平均超过 200 个,约每 2,300 个中有 1 个平均超过 500 个。
- 与本报告中的所有指标一样,这些推断均使用我们的隐私保护分析工具生成。没有研究人员会阅读单个对话记录,职业标签绝不会与可识别的用户关联,我们仅在达到最低不同用户数量阈值后观察聚合数据。
- 我们在此采用的估算方法旨在揭示会话价值的相对差异,而非绝对价值。金额基于与自由职业者市场的比较——而非受薪工作——并且来自 Claude Code 会话与职位发布之间最终较为模糊的匹配。由于相对估算会消除这些问题带来的任何一致性偏差,我们更侧重于相对估算。
- 以遇到麻烦为条件,会为不同用户筛选出不同的会话。专家整体上遇到麻烦的频率更低,因此他们确实遇到的麻烦会话很可能涉及更难的问题——以会话的价格估算值作为会话复杂度的代理指标,我们可以看到,从专业能力量表的最低端到最高端,麻烦会话的平均估算值大约翻了一倍。因此,恢复率差距的一部分可能反映的是:新手卡在常规问题上,而专家卡在具有挑战性的难题上。
- 即使模型错误地将管理者归类,那些被用来判定用户很可能是管理者的信号——也许体现在任务如何被委派和明确的方式上——往往与更大的成功相关联。换句话说,也许表现得像管理者会带来更大的成功。
来源:Anthropic:Research(发表成果 · 网页) · anthropic.com