跳到正文
北京时间
原文
Hacker News 热门(buzzing.cc 中文翻译)· martialg·· 2026-07-06精选AI 评分75

AT&T 1956年专利法令:公共天才的私有化

公共天才的私有化

AI 导读

1956年1月24日,全球最大私营公司AT&T签署专利法令,将其7,820项未过期专利免费授权给所有美国企业,并承诺未来专利按“合理费率”许可。作为交换,AT&T得以保留Western Electric,但被禁止进入电信以外的业务。贝尔实验室69%的非电信专利(涵盖化学、半导体、光学等)迅速公开,在短短几年内催生了约35亿美元衍生专利价值,并直接推动了肖克利半导体、仙童半导体及英特尔的诞生。戈登·摩尔称该法令是“商业半导体行业最重要的进展之一”,为美国硅谷的起飞奠定了基础。

推荐理由

用贝尔实验室专利释放的历史对照今天前沿实验室的语料抓取,论证清晰且有新意。提出的“语料版税”虽非万能,但为互联网公共品被私人捕获提供了集体补救思路,每个在网上留下痕迹的人都该看一眼。

正文 · AI 翻译

《万物上游》随笔一

2026年7月2日

1956年1月24日,美国电话电报公司是全球最大的私营企业。

其营收几乎占美国国内生产总值的2%。它雇用了746,000名员工。它拥有贝尔实验室——那个传奇的研究部门,彼时已经孕育出晶体管、太阳能电池、信息论和射电天文学,同时还在积极铺设第一条跨大西洋电话电缆。在随后的几十年里,它还将贡献出UNIX、现代蜂窝电话技术、CCD图像传感器、第一颗有源通信卫星,以及一长串其他科学里程碑。这一段独一无二的智力产出,为贝尔的科学家们最终斩获五项图灵奖和十项诺贝尔奖铺平了道路。

从许多指标来看,作为一家受监管的垄断企业,AT&T的日子过得非常滋润。

然而就在这一天结束之前,AT&T已经签字放弃了其全部7,820项未到期专利的独家权利,免收版税,任何提出申请的美国公司均可获得。AT&T还将以"合理费率"授权其未来申请的任何专利。一座前沿的知识产权宝库就这样突然且不可逆转地向自由市场敞开了大门。

反垄断官员最初将这一和解方案宣传为一场胜利。司法部称其为重大胜利,一名司法部律师甚至称赞它“堪称奇迹”。尽管 AT&T 作为一家受监管的垄断企业已经存在了数十年,其回报率被限制在相对保守的(以今天的标准衡量)每年约 7%,政府监管机构仍进一步追查并确立了一套具有里程碑意义的额外限制措施,以遏制 AT&T 的垄断权力。

然而,公众情绪很快开始转变。《商业周刊》称该法令“不过是轻描淡写地拍了一下手腕”。众议院一个小组委员会后来认定,该法令因其对 AT&T 独家供应链和垂直整合的宽容态度,堪称“反垄断法执法史上的一个污点”。无论是通过费率合同为 AT&T 庞大研究预算提供补贴的费率缴纳者,还是联邦政府中的许多人,都认为这种前所未有的经济集中度对共和国而言仍然过于危险,不能任其继续发展下去。

如今臭名昭著的 1956 年专利法令,只是 AT&T 与联邦政府之间历经七年谈判达成的和解方案的一半。AT&T 希望继续通过其子公司 Western Electric 制造电话设备,但监管机构认为这种垂直整合正在排挤行业内的竞争。联邦政府自身在这个问题上也矛盾重重,以至于艾森豪威尔总统时期的国防部长 Charles Wilson 恳求诉讼律师,将 AT&T 与 Western Electric 剥离“违背了我们国家的根本利益”。

和解方案的另一半禁止 Bell 从事电信以外的任何业务。

随后对历史记录的一项分析显示,贝尔的专利中有 69% 与电信几乎无关。相反,它们涵盖从化学到半导体,再到金属加工、照明、光学等诸多领域。

和解协议的两部分合在一起,确保了这份丰厚的知识成果——约占当时所有未到期美国专利的 1.3%——几乎在一夜之间变得可自由获取,并且得到了山姆大叔的保证:那头又大又坏的贝尔实验室法律恶狼不会找上门来。

短短几年之内,这些被释放的专利就在电信行业之外催生了近 $6B 的后续专利价值。其中约 $3.5B 的价值来自年轻初创公司提交的专利。这场初创企业爆发中一个著名的分支,历经 Shockley Semiconductor,再到 Fairchild Semiconductor,最终通向那家名为 Intel 的传奇公司。

Intel 的联合创始人戈登·摩尔(以摩尔定律闻名)后来将这场由同意判决书驱动的创新 cascade 描述为:

“这是商用半导体行业最重要的发展之一。[它]让商用半导体行业真正在美国起步。贝尔实验室的自由许可政策,与戈登·蒂尔离开贝尔实验室创办 Texas Instruments、威廉·肖克利同样离开并在于帕洛阿尔托创办 Shockley Semiconductor 这样的人之间,存在直接联系。这开启了硅谷的成长。”

沉积

一代才华横溢、由公共资金资助的科学家,缔造了世界上有史以来最具影响力的技术天才集群之一。贝尔实验室产出了大量专利,发明了众多产品,并在数十年间成为美国前沿科学无可争议的中心。但这一切是如何做到的?

想象一片精心打理的稻田,由一丝不苟的农民修成梯田,他们花费数年时间精确地营造出一个肥沃的环境。它看起来不过是一片水淹的田地,但事实证明,水稻是少数几种能耐受根系被淹没的主要作物之一。由于大多数杂草同样无法耐受水淹,水本身就完成了除草的工作。这种刻意的淹水还切断了有机物分解所需的氧气,因此土壤能保留更多养分,而不是像干燥、通气的田地那样把养分烧掉。而温暖、浸水的泥浆还兼具三重身份——它是固氮微生物绝佳的栖息地。一片打理得当的稻田在很大程度上能自我施肥,一季又一季,有时甚至持续数百年。这片不起眼的泥水塘,实际上是人类设计过的最具生产力的种植系统之一。

AT&T 作为垄断企业所拥有的独特经济地位,为贝尔实验室那种刻意实验、耐心探索、延迟收获的文化奠定了基础。贝尔实验室依托的是一个庞大而稳定的全国性收入基础,无需每个预算周期都重新证明其合理性。美国监管机构通过对 AT&T 的定价来确定这一收入基础,采用的是对其投资于网络的资本计算固定百分比回报的方式。这里的投资资本指的是交换机、电缆、建筑等诸如此类的东西。

在一家普通公司,研究是一项要尽量压缩的成本,但在 AT&T 并非如此。

在贝尔实验室,每一美元的研究投入都同时做了两件事。首先,也是最重要的,它是一项由美国电话费率缴纳者依据合同补贴的、无风险且可回收的成本。其次,它是 AT&T 得以建设和部署的、资本密集型新技术的源泉。这笔资本支出扩大了其保证回报率所依据的费率基数本身。在这些新技术上花的钱越多,在同样约 7% 的受监管回报率下获得的绝对利润就越大。

这种安排几十年来对所有各方都非常有效,但未必可以复制。我们也并不显然应该尝试重建它,因为它同样伴随着真实的代价。低效的过度投资、缺乏价格纪律,以及最重要的——将发明囤积在垄断高墙之后的激励,都损害了费率缴纳者的利益。但在 20 世纪的大部分时间里,这些有保证的利润确实客观地创造了一片广阔的稻田,让一项又一项技术创新得以在其中茁壮成长。

如今的前沿科学看起来有所不同。它植根于模型权重和 GPU。它被 token 支出和智能体循环所淹没。它在数据中心里开花结果。

尽管 AI 辅助研究作为一个领域仍然年轻,但使用统计数据表明,在各大 AI 实验室内部及其周围正在发生一些重大的事情。严肃的人们正在使用这项新技术来解决真实的问题,有时是整类此前无法解决的问题。蛋白质结构、研究数学、材料设计、药物发现和复杂系统分析,只是 AI 模型切实提升研究人员清除人类科学障碍能力的几个领域。但这片肥沃的土壤又从何而来?

这其实算不上什么秘密。

OpenAI 表示,它“主要依赖公开可用的信息来教[其]模型如何变得有用”。Anthropic 曾试图建立一个“囊括‘世间所有书籍’的中央图书馆”来训练其模型。Sam Altman 本人也详细阐述道,他们的前沿模型是在“人类的集体经验、知识[与]所学”之上训练出来的。

剥去这些委婉说辞,剩下的就是赤裸裸的现实:这些前所未有的能力,是由全球每一个曾经写下过任何东西的人所进行的自我表达拼装而成的。

而基于这一现实所打造出的产品,按照前沿实验室自己的营收、预测和使用数据来看,是一代人之内所创造出的最有价值的东西。

Anthropic 的年化营收运行率从 2024 年 1 月的 $87M 飙升至年底的 $1B,到 2025 年大约翻了 10 倍,并在 2026 年 5 月刚刚达到 $47B。这使其成为历史上复合增长最快的企业软件公司。OpenAI 也没落后太远。据估计,如今 80% 的美国劳动力所从事的工作中,都有一部分工作内容暴露在这些模型之下。所有这些影响之所以成为可能,靠的是在规模以数十亿人的一生来衡量的数据语料上进行的长达数周的训练运行。

这是对公共天才的私人攫取。

前沿模型,是把海量训练数据压缩成数值权重。书籍、论坛、代码仓库、手册、论文、聊天记录、转录文本、法庭案例、随笔、评论区、文章、教程,以及前沿实验室那支爬虫大军在互联网内外爬取到的每一个飘忽念头——这一切汇聚在一起,规模之庞大令人瞠目。

在某种意义上,它的不可理解几乎就像一层精神铠甲。它太大了,无法被直接理解。

想象一片狂野的河流三角洲。当水从高地奔流向海,它侵蚀沿途的土地,把碎屑作为沉积物带往下游。淤泥、沙子、黏土,以及各种有机物质,从每一条支流和河岸的每一寸土地——从耕地到崎岖的山坡——被冲刷而下,最终汇聚在三角洲。河流沿途所滋养的每一个生命的丰饶也同样如此。一个大陆级的流域,翻涌、积聚,最终在终点沉淀下来。大量迥异的物质在三角洲中交汇,形成了某种繁茂、奇异而充满生机的东西。

而人类全部知识的总和,若非如此,又是什么呢?

从历史书页中刮取的每一簇字母(即 AI 模型所摄入的字面 token),都是人类探索之河永不停歇地流淌所沉积的一粒淤泥。堆积足够多的颗粒,你便能理解星辰的运行。凝视泥土足够久,你便能看见逻辑本身的结构。大语言模型将冲积土壤转化为答案的质变,正是孕育它的社会的一场盛大丰收。

但减去那些脏数据,就没有增量了。

减去语料库,就没有收获。

什么都没有。

模型并非在真空中学会推理。它通过一次又一次又一次地观察理性,从而吸收了理性。它的泛化能力,是它所吸纳的每一个示例、每一次纠正、每一场论证的下游产物。历史、文化与科学的回响中,某个人类的决策,为今天聊天机器人的回答搭好了舞台。这种被培育出的智能,生长于人类意义建构的沉积层之上,但这里的每一层沉积,无不是由某个人留下的。

这些人当中,许多已经离世。他们写下了古代典籍,验证了基础科学,记录了从古至今的世界历史,造福于我们所有尚存于世的人。但同样,这些人当中也有许多仍然在世。他们正在编写模型输出的可运行代码。他们正在把基础科学推向其前沿之外。他们正在组织、调查、行动并回应着永不停歇的时事信息流。任何与当下相关的回答,都是从某个人那里借来的。

事实上,你就是那些人中的一员。字面意义上的。

你凌晨两点发的垃圾帖。那条对陌生人文章的精妙回复。你留下的那条尖刻餐厅评论。你的配文、评论、内部笑话,以及你所有的公开对话。你曾为那条无限分叉的数字交流之河做出的每一份贡献,无论大小,都已沉积在三角洲的某处。

人人都拥有互联网

尼罗河三角洲养育了埃及五千年。湄公河和恒河地区至今仍养育着数亿人。每一个文明摇篮的形成,都全部或部分归功于大河的泛滥平原和三角洲,这绝非巧合。这些地区仅凭其原材料固有的丰饶,就支撑人类度过了最原始的时期。这片泥土渴望迸发出生命,然而不知何故,地球上最肥沃的农田几乎无一例外都是偶然形成的。

互联网亦是如此。

我们这些信息高速公路上的无数数字居民,当初并非要创建一个训练语料库。我们为自己写作,也为彼此写作。我们开玩笑、争论、教学、抱怨、调情、调试代码,一路汇成了这团相互关联的原材料聚合体,如今被私人资本所收割。经济学领域(它也在语料库之中)对此有专门的词汇。

要对任何资源进行分类,经济学家会问两个问题。它是否具有排他性,是否具有竞争性?

更直白地说,你能阻止别人使用它吗?一个人使用它,会减少其他人所能剩下的吗?

其中存在一些限定条件和子类别,但这个简单的测试为我们提供了一张地图。

如果一种物品具有排他性且具有竞争性,它就是私人物品。想想三明治。如果我把它吃了,它就没了,而法律保护我免受三明治窃贼的侵害。

如果一种物品具有排他性但基本上不具有竞争性,它就是俱乐部物品。Netflix 订阅就是一种俱乐部物品。如果我看了一部电影,你仍然可以看,但前提是我们都付费获得了访问权限。

如果一种物品难以排除他人使用且具有竞争性,它就是公共池塘资源。牧场是经典的例子。许多农民都可以使用这片牧场,虽然一头牛吃草不会毁掉这片草地,但牛足够多的话,它们最终会把草啃到只剩泥土。这就是臭名昭著的“公地悲剧”问题。

最后,如果一种物品难以排除他人使用且不具有竞争性,它就是公共物品。路灯就是公共物品。一旦街道被照亮,我们所有人都可以在灯光下行走,而我这样做并不会使道路对你变暗。

私人物品和俱乐部物品通常由追求利润的主体及其运营所在的法律体系来管理。公共物品主要由政府或无人管理,而公共池塘资源往往存在于一个阈限空间中——人人都想从中获益,却没有人愿意承担维护成本。

前沿实验室普遍主张,根据合理使用版权制度,互联网上的数据可以公开用于训练。从经济学角度来说,这一论点意味着互联网是一种公共品。大规模抓取、摄取和使用互联网数据用于训练,并不会破坏原始数据。每一篇博客文章、每一条推文、每一场骂战确实仍然在那里,而且大部分仍然可以访问。没有人明确地拥有它。

你发帖所在的平台拥有你的帖子吗?你是与平台共享所有权吗?这种关系会随时间变化吗?

毕竟你是免费把它发到网上的。

但授予访问权限并不等同于授予许可。一张借书证让你可以阅读一本书,而不是复印整座图书馆。购买国家公园通行证并不赋予伐木权。走进一家营业中的商店并不等于你有权偷走它的库存。互联网上作品的公开可访问性并不自动赋予使用权。

而“你发布了它,你就接受了这一切”还存在第二个更深层的问题。直到不久之前,LLM 训练数据这一使用场景根本不存在,在线发布内容的当事方也不可能合理地预见到它。一个 2008 年的博主不可能同意自己的作品被用于训练今天的语言模型,因为当时这根本无法想象。同意无法被追溯性地赋予,更不用说针对一个从科幻支线情节变成现实的事情。

LLM 当前的法律战场是一个悬而未决的故事。

值得注意的是,尽管有我们的道德直觉,但获取途径和同意与否,与前沿实验室的主要法律抗辩主张——“合理使用”——并不相关。相反,法院在裁定合理使用抗辩时会评估四项标准。他们会考察使用受版权保护材料的目的、作品的性质、使用的数量,以及对原作市场的影响。在实践中,这四项标准通常会归结为两个重要问题。

新作品是否具有转换性,以及它是否损害了原作的市场?

2025 年 6 月,Alsup 法官在 Bartz 诉 Anthropic 一案中裁定,使用合法获得的书籍进行训练“本质上是转换性的”,但用盗版书籍构建其书库则“本质上、不可救药地构成侵权”。面对这一喜忧参半的胜利,Anthropic 面临着理论上高达 $70B 的版权损害赔偿风险,并在几个月后迅速以 $1.5B 达成和解。这是美国历史上(迄今为止)最大的版权和解案,既没有授予 Anthropic 任何未来的许可,也没有为今后的法律提供任何澄清。

在一项相关裁决中,Kadrey 诉 Meta 一案中,Chhabria 法官认定 LLM 训练同样具有转换性,并勉强裁定市场损害的证据不足。他在裁决中批评原告几乎没有提供任何市场稀释的证据,并指出 LLM 有能力用与训练数据相似的 AI 作品充斥市场,“在此类案件中,往往会使原告在第四项因素上决定性地获胜——从而在合理使用问题上整体获胜。”

让讨论更加复杂的是,美国版权局在 2025 年发布了一份不具约束力的报告,结论是公开可获取性并不天然允许合理使用式的模型训练。截至本文写作时,尚无既定的法律标准来衡量大语言模型驱动的市场稀释,但这注定将成为未来法律裁决中的一场重大交锋。眼下,已有数十起诉讼和政策之争正在检验前沿实验室不断演变的训练数据抗辩策略。

这些实验室最具诱惑力的抗辩,也是最简单的那一个。

“它只是在阅读”是技术专家为 AI 模型训练辩护时的一句常见说辞,而且这是一个很有说服力的论点。每一个在世的作家,都是由他们读过的书塑造而成的。没有人会因为受到《老人与海》的启发而给海明威的遗产管理方寄一张支票。如果模型只是另一个读者,那它所欠的,就和每个读者所欠的一样:什么都不欠。

一个人一生读一万本书,也只是多成为一个作家,以人类的速度工作,以人类的产量出版,一粒一粒地把自己的沉积物归还给三角洲。而一个读遍一切的模型,则变成了一台印刷机,印出更多的印刷机。它以工业级的产量吐出作品,训练自己的后继者,只需按下一个按钮,就能与它所吞食的那些作家竞争。灵感从未稀释过市场,但印刷会。

古腾堡印刷机于 1440 年前后的发明,最终促成了 1710 年《安妮法令》的通过。一个由势力雄厚的图书出版商组成的卡特尔游说英国议会,试图恢复他们对图书贸易的垄断权,而议会却将这项权利授予作者,使其成为法定所有者。在位者请求保护,而公众的代表却把所有权交到了创作者手中。

这部法令奠定了现代版权法的基础。在印刷机出现之前,这其实并无必要,因为大规模盗版实际上不可能发生。新的技术格局引发了一场复制浪潮,淹没了为上一个时代的问题而设计的法律体系,但这场清算用了超过两个半世纪才真正展开。

能印出更多印刷机的印刷机,不会让我们等那么久。

糟蹋三角洲

从表面上看,这片承载着人类集体知识沉积物的丰饶河流三角洲,确实像是一种公共物品。前沿实验室抓取并摄取互联网这片庞大的沉积体,从字面意义上并没有摧毁原始材料。法院已经开始朝这个方向作出裁决,但和许多法律裁决一样,这在狭义上是正确的,却完全没抓住要点。

对训练语料这一问题持扁平化理解,是对互联网各功能层及其参与者实际互动方式的误解。到目前为止,我们只分析了文本层。前沿实验室抓取进训练语料的网页、文章、帖子、评论以及其他一切内容,只是其中显而易见的一块,但互联网还有许多其他层,正是它们为文本层的存在设定了条件。

除了协议层或访问层这类显而易见的技术层之外,我们还必须考虑互联网的发现层、注意力层、贡献层和诚信层,以及它们之间行为的流动。互联网能否持续发挥效用,取决于人们能否找到、参与、贡献,并最终相信他们在网上所访问之物的价值。

当被框定为一份静态语料时,互联网是否因 AI 训练运行而受损并不明显。当然,它受损的方式不同于过多牛群可能对牧场草地造成的损害。

相反,真正受损的是那个最初演化出来、用以丰富这份语料的复杂系统。互联网是一叠相互连接的公共品、俱乐部品和公共池资源。不同的层相互反应、相互强化,使整体既有价值,又容易受到 LLM 所带来的特定伤害。

没有任何人类创作者能凭一己之力与生成式输出的原始体量竞争,后者正不断淹没我们的算法和注意力。互联网的各层在这里表现得不太像牧场,而更像一条道路或一个电子邮件收件箱。它们在某个阈值之前是非竞争性的,超过之后则灾难性地变为竞争性的。

因此,随着一条推文的衍生品的衍生品被 AI 不断变体,认真参与网络的动力也随之消退。如果你发的东西没人看得到,又拼不过一万个随着欢快电子乐起舞的 AI 狗狗变体,而当你终于做出真正令人印象深刻的东西时,热门评论却只是指责你是 AI——那为什么还要在网上创作和分享呢?生成式 AI 工具能以几乎为零的边际成本,向网络的任何角落灌入媒体内容——无论是不是垃圾——这或许正是那辆早在 90 年代就已驶出站台的“永远向所有人发垃圾信息”巴士上最后一脚踩死的油门。

这是一个重要时刻。对这片肥沃语料层的天真收割,是对那些使之成为可能的人们的公然攻击。网络的某些部分很可能已经断裂。如果我们处理不当,整个互联网可能会不可修复地断裂。然而,我们并非没有可用的工具来应对。

我们已经知道如何保护一片公地。Elinor Ostrom 因记录了瑞士高山牧场、日本森林和西班牙灌溉网络如何可持续地共享其公地长达数百年,而于 2009 年获得诺贝尔奖。她总结出了持久公地的八项条件:明确界定谁可以从中取用、规则与当地条件相匹配、受影响的人对规则有发言权、由对使用者负责的各方进行监督、对过度使用实行渐进式惩罚、有可及的争议解决途径、承认社区组织起来的权利,以及跨层级嵌套的治理。

把互联网放进这份清单逐条对照,八项条件几乎无一成立。它的边界模糊不清,由所有人共同注入,却无人设防。填充它的人对其治理方式毫无发言权。它的规则含糊不明,只是零星地被诉诸法律,而且仅限于少数财力雄厚的当事方。监督即便存在也极为薄弱,永远是事后追责,从不主动介入。没有监测机制,没有分级处罚,没有解决争端的共同场所。用 Ostrom 的精确含义来说,它根本不是一个被治理的公共资源。它是一个被拔掉了塞子的公共池资源。

这就是我们陷入这团乱麻的原因。就像当年库雅荷加河渗出污泥、布法罗溪被泥浆淹没的时代一样,我们正面临一场网络工业径流灾难,即将毁掉整个三角洲。

归属崩塌

河流目前仍在流淌。新的沉积物继续在三角洲沉积,语料层继续增长,各家实验室继续抓取。

而当它们进行抓取时,它们持续将互联网庞大的增量压缩为固定的权重集合,但这一持续进行的仪式又暴露出另一个问题。这一次是价值问题,而非质量问题。

具体来说,就是谁凭什么价值获得报酬的问题。

根据前沿实验室的说法,这数十亿条被抓取的数据点不知何故单独来看毫无价值,但 collectively 却价值数万亿美元。

他们所说的“无价值”,指的是训练集中不需要任何单独被抓取的作品。删掉其中任何一件,模型几乎察觉不到。因此,没有任何单一作品真正重要。因此,没有任何单一作品应得报酬。

但如果我们能合上那惊掉的下巴,腾出工夫嚼一嚼他们喂给我们的东西,就会发现这些单独的数据点显然并非无价值。

这是一种修辞伎俩。是自封的侦探在说黑话,宣称“既然我们算不清到底被偷了多少珠宝,就没法提出任何指控。”只不过他们同时也是那个小偷。而且刚刚开了一家珠宝店。

这种“哎呀没办法”的说辞,当然是荒谬的。糟糕的记账做法并不能抹去清清楚楚的价值转移,尤其是在根本无法记账的情况下。

从原则上讲,从法律角度看这种记账是不可能的,因为版权法本是为了规制离散的复制行为而建立的。法院判例假定侵权者是从可辨识的主体那里复制可枚举的作品。而大语言模型训练是一次性地对数十亿件作品进行统计性吸收。这是一种不同的形态,却有着相同的道德本质,但由于这种提取行为是一种新机制,法律工具还无法真正抓住它(暂时还不能)。

但更令人担忧的是,试图进行定量记账在数学上可能根本就是不自洽的。

评估训练输入价值的领先形式化方法是 Shapley 值,它对一个输入在所有可能出现的排序中的边际贡献取平均。但这个数值并不是作品本身的属性。它是该作品与训练集中所有其他作品之间关系的函数。同一份文档放在不同的训练集中,会有不同的 Shapley 值。把同一个模型训练两次,由于训练具有随机性,Shapley 值可能每次运行都不同。研究人员甚至不认同 Shapley 是正确的贡献度量,而且为前沿规模的模型计算真实的 Shapley 值在计算上是不可行的。这些模型训练一次就可能需要数周;精确的 Shapley 核算需要在不可能穷举的输入组合上反复重新训练。因此就目前而言,不存在任何客观的估值方案能够计算出任何作品的具体份额,因为一旦实施,立刻就会被诉讼到无疾而终。

在可预见的未来,前沿规模 LLM 训练的个体归因行不通。你无法按贡献比例向人们付费,因为不存在可操作的、具体的份额。这正是误导的根源。实验室们把这一事实解读为“如果我们无法归因,那我们什么都不欠。”

我认为它的含义是你无法按比例付费,但这笔钱仍然该付。

为公共天才付费

这就是问题的真正形态。个体创造出独特的作品,但从来不是孤立完成的。互联网本质上是公共性的。协作与冲突都在滋养着整体。

枝条经修剪而长得更壮。最肥沃的土壤由腐殖质构成。藤蔓靠接触攀爬。友善的心灵彼此为思想授粉,而捕食者与猎物则互相逼得跑得更快。这团混杂着垃圾与才华的庞杂之物之所以有价值,恰恰因为每一部分与其他部分之间有着千差万别的关系。在它们之间鲜活的间距里,人类认知萌芽、绽放、结果。尽管孤独天才的浪漫叙事深入人心,互联网终究是一项团队协作。

而如果你无法指认出最有价值的那位贡献者,你就向整个团队付费。

这笔付费就是版税。它是一笔以美元和美分计量的账目,记录着大语言模型从我们之中最优秀和最糟糕的人身上所提取的公共才智。

不妨称之为语料版税。

前沿实验室按总营收的固定比例缴入一个公共基金。该基金每年向每一位符合条件的美国人支付同等金额。任何比这更精巧的机制都会把计量难题重新引入,并将在法庭上经历一万次吹毛求疵的死亡。

我提出一个美国机制,因为国际制度是通过国家承诺建立起来的。美国并非唯一有资格主张权利的公众,但在实践中,它拥有足以确立首个持久政策的监管引力。较小的市场若想施加类似的版税,可能会把前沿实验室赶出其司法辖区,这使得一个旗舰级的美国制度很可能成为日后全球性补救方案的锚点。

随着大语言模型将自身融入互联网,并重塑人类表达的激励机制,对于如何补偿集体性、无法归属的贡献这一问题,版税成了唯一自洽的答案。前沿实验室不能继续无拘无束地收割互联网。它们必须回补那些滋养其模型所依赖的丰饶三角洲的上游源头,否则互联网将在十年内变得面目全非。

我们以前就建造过这套机制的更小版本。

当私人实体从共享资源中获利时,我们承认公众理应对这些收益拥有索取权。阿拉斯加永久基金正是遵循这一直觉。每一位符合条件的居民都能分得一份任何单个居民都无法独自主张的资源财富。既然我们无法可靠地衡量任何一个人的文字对模型而言价值几何,那么分配就应当反映这种归属的失败,而不是假装解决了它。

当个体的主张多到无法逐一估价时,我们不会假装它们毫无价值;当私人实体破坏公共空间时,我们宣告他们应对这种破坏负责。在河流燃烧了一个世纪之后,国会于1980年设立了超级基金(Superfund),并把清理账单交给了污染者——即便那些倾倒行为在当时是合法的。没有人需要去追溯哪只桶毒害了哪口井。那些从有毒废物中获利的行业出钱修复了土地。

有人会说,Bell 案的先例支持的是开放权重,而不是开支票,但救济方式取决于所受的伤害。在 Bell 案中,竞争对手受到的伤害是知识上的封锁,因此救济方式是开放获取。而今天,贡献者受到的伤害是知识价值被榨取。由此推论,支付报酬才是让受伤者得以复原的救济方式。

语料库版税起初可能很少。也许只够每年多买一箱啤酒,但金额多少并不重要,重要的是它所赋予的地位。它向公众表明,他们不仅仅是用来训练日益庞大的大语言模型的原材料。如果实验室对他们正在构建的东西判断正确,啤酒钱会变成买菜钱,再变成房租钱,并随着实验室及其收入的增长而增长。如果实验室判断错了,那也不会是因为版税拖垮了商业模式。普通人的生活、争论、提问、玩笑、纠正和创作,帮助维系着那些模型所消耗的语料库,而这让他们以主动参与而非被寄生剥削的方式被纳入其中。语料库要么是不可或缺的,要么不是。如果是,它就有价格,而各行各业每天都在为不可或缺的投入付费。实验室在与 Reddit、News Corp 和美联社的授权交易中,已经承认了这一点。

这不是福利,因为福利假设的是公司在补贴公众,而实际上补贴的方向恰恰相反。这不是慈善,因为慈善意味着没有获得任何回报。这不是税收,因为税收将盈余视为公司财产,只是公众对其享有索取权。

这是补偿。

这类问题在法律上的术语是“不当得利”,但普通法版本的不当得利概念,对于摆在我们面前这件事来说太过狭小。在普通法律中,不当得利所追问的是:一方是否在使另一方受损的情况下获益,且在当时的情形下保留全部获益有失公平。

前沿实验室正是通过将一份无偿的、大规模聚合的、由公众生成的语料库转化为私有的基础设施级价值,同时威胁着该语料库得以再生的条件,从而获得了这样的利益。他们这样做的规模和扩散程度,已使个别诉讼无法合理地为其定价。问题的规模告诉我们,救济必须是集体性的。

对根植于公共语料库的价值支付版税,是一种回报。回流到互联网的东西是应得的,而非馈赠。这是对公众天才的版税。

版税只是解决方案的一部分。它是更大的贡献与维系体系中的一块拼图。它并不取代版权主张或私人许可合同。在所有权清晰可辨的地方,这些仍然可以、也应当发生。版税所解决的,是那无法归属的长尾创造力——它们无法组织起来、无法谈判、也无法通过诉讼进入许可市场。

这些实验室的所作所为在性质上并不新鲜,只是规模不同。这是对公众天才在文明尺度上的私人攫取。这不应令我们感到意外。建立在公众支持之上的企业实体,常常试图将上行收益私有化,同时将使其得以实现的那些条件社会化。特殊组织此前就曾以这种方式滥用其特殊地位。不同之处在于,这一次受影响的群体是所有人同时。

也许,自 5000 多年前我们第一次在黏土上刻下痕迹以来,我们就一直在朝这个方向构建。我们通过记录、收集和分类,一路把自己推向了脆弱。一旦每一个被外化的想法、每一个写下的字、每一张图表、每一处花饰和每一个措辞都能被卷进一个机械精灵之中,又有谁能抵挡住把它卖回给当初提供它的人的诱惑呢?

这就是为什么公众需要一项主张。前沿实验室越来越想要获得公用事业般的特权与权力,却不愿承担随之而来的公共义务。语料版税通过让公众从它使之成为可能的财富中分得一份,恢复了这笔交易中的一些平衡。公众已经承受了这些模型所创造的世界带来的负面影响,理应得到其中一部分正面收益。

语料版税确保人类那些散落的智慧火花,在它们帮助创造的事物中拥有切身利益。

封面:Thomas Cole,《帝国历程:毁灭》(1836)

来源:Hacker News 热门(buzzing.cc 中文翻译) · wysr.xyz