AI中心的数据黑洞
The data black hole at the center of AI
智能的一种定义是样本效率,但近年AI进步主要靠扩充数据分布和增加算力。强化学习本质是合成数据生成——投入大量算力通过验证器筛选“好”数据,再训练模型预测正确输出。这一过程需要每个领域和技能的海量人类专家示例,数据行业年收入已达数十亿美元。近日Epoch报告,开源模型仅落后前沿闭源模型4个月,原因在于数据可从公开API蒸馏,而超参数等不易复制。人类一生接触约2亿token,前沿模型训练在数十到数百T token之间,相差近百万倍——机器人、自动驾驶等领域同样存在巨大效率差距。
Dwarkesh 把 AI 的‘笨’归因于数据效率远低于人类,计算虽简但直指要害,他给出的一个逆向洞察是开源模型四个月追上闭源,正是数据驱动进步的最好证据。
对智能的一种定义是样本效率——也就是说,在某个给定领域里,你需要看过多少数据才能流畅且胜任地运作。过去几年里,我们在训练样本效率上是否真的取得了很大进展,这一点并不清楚——看起来更像是我们大幅拓宽并改进了数据分布。
AI 一直在变好的主要方式,是通过加入更多、更好的数据,并扩展算力来首先开发这些数据。显然,RL 是实现这一点的主要方式。你可以把 RL 看作一种合成数据生成——你把大量算力投入到验证器上,以找出“好的”数据。然后你训练模型去预测这些正确的 rollout,就像你训练它去预测互联网文本中的下一个词一样。
要让这个过程奏效,模型必须至少先验地具备一定的概率来预判出正确解法,这也是为什么你还需要在每一个你希望模型胜任的领域和技能上,投入多到令人脑力透支的人类专家轨迹。
这种人类专家数据有多么任务特定、多么量身定制,怎么强调都不为过。如果你想获得一些直观感受,可以去读读Mercor或 Surge 网站上的一些职位描述。那里有Word 专家的招聘信息,负责把遗留文档转换成精美的 Word 文件;还有法律专家,负责撰写逼真的并购尽职调查或证券申报文件;还有管理咨询顾问,负责撰写模板化的市场研究,以及几十种其他特定类别。
而且不仅数据必须如此高度领域特定,数据量还必须极其庞大!每一项技能都对应着至少数百名人类专家,他们在生成示例补全、撰写评分标准,并解释自己的思维链。这个生产专家标注(以及让这些被精心编目的技能得以固化的 RL 环境)的数据产业每年能赚取数十亿美元收入,很快就会达到数百亿,这并非没有原因。
想象一下,如果你要学会打磨一个 Word 文件,需要上几十年的课程、同时有数百位教授授课、还要完成数百万道练习任务。即便这样比较任务数量,也仍然低估了差距——模型必须对它们那数量远为庞大的任务逐一进行艰难得多的反复训练。人类学生可能把一道教科书习题练习一两次,而 GRPO 会让模型对每个任务生成数百到数千次 rollout。我们正在建造某种弗兰肯斯坦式的怪物,用十亿块精心构造的示例拼接缝合而成。
Epoch 最近报告称,开源模型仅落后最先进的闭源模型 4 个月。我认为,开源模型和此前的落后者之所以能相对容易地在几个月内追上前沿,原因在于数据才是进步的真正驱动力。而数据可以很容易地从公开 API 中蒸馏出来,超参数、训练技巧和架构上的微观优化则不能——如果后者才是推动大部分进步的因素,那么追赶的难度会比我们观察到的更大。
人们很容易忘记这些模型训练所用的数据量有多大,以及它比我们人类一生所见的数据多出多少。我们把这些 AI 看作一个闪烁着各种能力的星系,但在它们的中心,肉眼不可见地、将所有星座维系在一起的,是一个庞大到难以想象的数据黑洞。
中场休息:比较人类与 AI 的样本效率
如果一个人平均每小时听到和看到约 2,000 个词,那么从出生到成年,他们会看到约 2 亿个 token。相比之下,前沿模型训练所用的数据在 10 万亿到 100 万亿 token 之间。这接近一百万倍的差距。
一个人可以在几小时内学会遥操作任何随机的人形机器人或机械臂。机器人技术之所以还没有成为一个十万亿美元级的产业、拥有一支无穷无尽的 Unitree G1 大军在现实世界中从事各种有用的工作,原因就在于我们的 AI 学习效率远低于人类,即使我们已经收集了数百万小时的演示数据,也不足以让它们执行复杂的、开放式的任务。
一个青少年大约练习 20 小时就能学会开车。即使把他约 16 年积累的物理直觉也算作相关训练数据,那也至少比 Waymo 和 Tesla 训练其自动驾驶汽车模型所需的数据量少了 3-4 个数量级。
我想回应一下人们对这类比较的一些常见反对意见:
数十亿年的进化就是我们的预训练,所以把我们一生中所见到的如此之少的数据,与这些冷启动的大语言模型必须学习的数据相比,是不公平的。
我们的基因组是 3GB,其中大约 1-2% 是蛋白质编码。这根本没有足够的空间来存储那些据称经过预训练的模型参数(前沿模型的规模达到数 TB)。更贴切的类比大概是:进化找到了正确的超参数和损失函数(旁注:我曾与 Adam Marblestone 做过一期有趣的播客,他在其中主张损失函数才是进化更重要的发现),但相当于参数训练的过程仍然在一生之中持续进行,并被编码在一生中构建起来的大脑神经连接图谱里。
即便我们能够把预训练一个基础模型所需的数万亿 token 解释为是在追赶进化,这仍然无法解释为什么边际能力的获得需要如此多的数据——一旦你接受了教育,你不需要 100 位不同的教授来学习一门新的编程语言,但 AI(即便已经过预训练)却需要。
这些比较还没有把我们一生中所见到的多模态数据计算在内。如果把所有这些感官信息都算上,我们从出生到成年大概处于 10s 到 100s of billions of tokens 的量级。
失明或失聪的人被切断了这类感官信息,可能缺乏相应感官的能力,但仍然拥有与其他人相同的一般智能。这表明,这数十亿的感官 token 并不是真正让人类变聪明的东西。
事实上,只能通过手语和阅读(而非听觉)交流的失聪者,所摄入的语言 token 远少于我们此前计算出的 2 亿个,而即便如此,这也足以让他们成为完全通用的智能。
缩放定律告诉我们,更大的模型样本效率更高。人脑有 100T 个突触——如果每个突触约为 1 个参数,而前沿模型目前大约为 5T 参数,那么也许再扩大一两个数量级的参数规模,我们就能达到人类水平的样本效率。
缩放定律方程的工作原理是,参数项和数据项被独立地加到损失上。如果你有一个以计算最优方式训练的模型,假设你问:如果我只想最大化样本效率、使用更少的数据——而我会不惜投入任意多的参数来实现这一点,那会怎样?用 Chinchilla 缩放定律论文中的常数(即便换成不同的常数,结果的性质也不会改变),即使你把参数数量增加到无穷大,也只能将保持相同损失所需的数据量减少约 10 倍。人类的样本效率比这些模型高出数千到数百万倍。当前模型的缩放根本无法弥补这一差距。这确实表明,人类处在一条完全不同的缩放曲线上。
样本效率重要吗?
但你可能会问,样本效率为什么重要?实验室有两个总体目标:自动化白领工作,以及自动化 AI 研究本身。人类水平的样本效率对其中任何一个来说是必需的吗?
白领工作的赌注在于,软件工程师、分析师或会计师所做的常见任务,嗯,是常见的。而我们可以通过 RL 和 SFT 相当轻松地将常见任务纳入分布之中。这些 AI 实验室的收入曲线表明,即使我们无法复现人类的样本效率,将任务纳入分布也能带来巨大的价值。
是的,训练 AI 完成这些任务远比训练人类低效得多。但那又怎样?人类的寿命无法容纳这些模型所经历的培训量和广度。如果你作为一个人,有某种奇怪的学习障碍,需要读遍 Github 上每一个公开仓库才能成为一名合格的开发者,那么训练你是不划算的。你在教育的早期阶段就得靠社会保障过活了,而且即便你训练完成,你也只能一次做一个项目。但 AI 可以通过一次灌入数吉瓦级的训练来学习这些技能。而它们所学到的东西可以摊销到数十亿次会话中,所以我们可以在训练它们时低效得离谱,却仍然大幅盈利。
白领员工需要做多少“分布外”的思考,而这些是你根本无法提前训练的?这与其说是一个关于 AI 研究的问题,不如说是一个关于不同工作本质的问题。而且这也取决于具体的工作——有些工作足够机械、足够可预测,以至于早在现代 AI 时代之前就已被自动化,例如银行柜员或旅行社代理。还有一些工作则要求每天处理与数据分布相距甚远的问题。即便是软件工程(据说是 AI 最先取代的工作)也是其中之一。我敢打赌,2028 年对人类软件工程师的总体需求会比现在更多,这在很大程度上要归功于 AI 的互补性投入。
实验室针对后一类工作的计划是:先自动化 AI 研究,然后让自动化的 AI 研究员去解决这个样本效率问题。那么问题就变成了:那些不具备人类水平样本效率的 AI,能否仍然解决通往类人智能与学习之路上剩余的科研问题。
这个问题我会在未来的博客文章中讨论——我认为人们目前对智能爆炸的思考方式相当笨拙。要么人们完全否定 AI 加速 AI 进展的可能性,要么他们就干脆假设另一端会蹦出个上帝。人们并没有在推理:从 LLM 起步的极其快速的进展,究竟会是什么样子。
赞助商
感谢 Mercury 赞助本文!
Mercury 刚刚发布了一项名为 Command 的新功能,它让我能在自己的银行平台中直接使用 AI。由于我基本上用 Mercury 来运营整个业务,Command 能够访问完成实际工作所需的全部信息。我可以让它发送发票、归类支出,甚至转账……而 Command 会直接处理妥当。了解更多请访问 mercury.com/command
来源:Dwarkesh Patel:Podcast & Blog(RSS) · dwarkesh.com