AI 工程生产力远超常态:从 20% 提升到 3 倍
AI Engineering Productivity is Anything But Normal
过去六个月多项数据显示,AI 工程生产力提升远超常态:NVIDIA 报告 3 万开发者提交代码量增加 3 倍且缺陷率持平,Anthropic 内部采用 Claude Code 后人均代码量提升 2.5 倍。多数公司仅分发 AI IDE 时效率提升约 20-30%,而构建智能体编排的前沿公司可实现 3 倍产出,软件工厂模式如 Devin 在 Nubank 带来 8 倍效率提升和 20 倍成本降低。
作者汇总多家公司的公开数据,把 AI 编程提效分成三个梯队,读者可对照自身团队判断所处位置与差距。
我们现在身处一个应当对彼此抱有 3 倍期待的时代。
在过去六个月里,一个又一个数据点接踵而至:
- NVIDIA 报告称,在 30,000 名开发者中,提交的代码量增长了 3 倍,而 bug 率持平。1
- Amplitude 每周生产环境的提交量增至三倍,如今一个 AI 智能体已是其代码库的前三大贡献者。2
- Anthropic 测算,自内部采用 Claude Code 以来,每位工程师编写的代码量增长了 2.5 倍,质量保持稳定。3
- Replit 在同一时期团队规模翻倍、每位工程师的产出增至三倍,而评审时间、回滚和事故均持平。4
上图将整个生态划分为三个不均衡的层级,每一层都由公司能捕获多少模型能力来界定。5
第一层是如今大多数公司所经历的状况。部署一个 AI IDE,其他什么都不改,结果只是小幅提升。
“工程负责人引入 AI 时预期获得 2-3 倍的生产力提升,但实际落点更接近 30%。”
— Augment Code6
Faros 对 22,000 名开发者的遥测数据证实了这一点:工程师完成史诗级任务的速度快了 66%,但每位开发者对应的 bug 数量增加了 54%。7 Google 的随机对照试验给出的数字是 21%,接近 GitHub 的 24%。89 这就是默认结果。
接下来是前沿梯队。这一梯队的公司围绕模型构建了 harness,编排在 GitHub、Linear 和 Slack 之间共享上下文的智能体;遇到需要判断的情况则上报给工程师处理。
“每位员工都会获得一个管理者智能体,它会以循环方式生成工作者智能体。我们的内部智能体在安全测试和事件分诊方面,以十分之一的成本超越了七位数价位的 SaaS 工具。”
— Amjad Masad,Replit,“The Self-Driving Company”4
人工 PR 审查时间下降了 30%。复杂支持处理时间下降了 60%。代码总贡献量上升了 5.8 倍。3 倍这个数字就出自这里。
第三类是软件工厂,这个名字在这里恰如其分。它们是机械化生产软件的 AI 机器。Cognition 的 Devin 能够端到端地重构单体代码库。Factory.ai 正在 NVIDIA、Adobe、Blackstone 和 EY 部署软件工厂。10
“Nubank 使用 Devin 进行大规模重构,实现了工程效率 8 倍的提升和成本 20 倍的降低。”
— Contrary Research,2026 年 1 月11
Goldman Sachs 正在让 Devin 与 12,000 名人类开发者并肩试点,并公开估计智能体 AI 可以达到以往工具 3-4 倍的速率。12
AI 工程生产力提升已经到来。初步数据展示了可以期待什么:大多数团队应当从 20% 的生产力提升过渡到 3 倍的生产力提升,而它们并不寻常。
-
Boris Cherny,Claude Code 负责人,在 Big Technology 播客上,2026 年 7 月。↩︎
-
上方的分布仅作示意,并非统计结果。每个点都是来自已发表研究、RCT 或公司披露的已报告倍数。它并非取自某个抽样总体,且该曲线是对已报告结果模式所做的右偏对数正态拟合,而非对原始数据的拟合。请将其视为一种形态论证,而非估计量。↩︎
-
Google 内部随机对照试验,约 100 名工程师,2024 年。被 DORA 报告引用;汇总见 Value Add VC。↩︎
-
GitHub、Microsoft 与 Accenture 联合一家大型金融科技公司开展的研究,约 450 名开发者,2024 年。↩︎
-
Contrary Research,《Cognition》,2026 年 1 月。↩︎
来源:Tomer Tunguz 博客(VC 分析) · tomtunguz.com