语言模型中的全局工作空间
A global workspace in language models
Anthropic在Claude中发现一组名为J-space的内部神经模式,类似神经科学的全局工作空间。每个模式关联特定词汇,但模型不必说出该词即可激活。Claude能报告J-space中的表征,并可应要求调节(如“在脑中思考”时点亮对应模式)。J-space还用于多步推理的中间步骤,且灵活支持多种任务(如从“法国”联想首都、货币等)。去除J-space后Claude仍能正常对话,但丧失高阶认知功能。该发现可用于监测模型私下察觉测试、生成虚假数据或执行隐藏目标。
Anthropic 发现了 Claude 内部的 J-space,一种类似人类意识访问的工作空间,能读出模型未说出口的隐藏想法和作弊意图,对 AI 安全和对齐是里程碑式的进展。
当你读到这句话时,你大脑中的神经回路正在调整你的姿势、控制你的呼吸,并将屏幕上的线条和曲线转化为可识别的文字。这些处理过程大部分对你而言是无意识的。但大脑中发生的某些活动,你确实能够意识到——比如脑海中浮现的一个画面,或者你为去哪里购物所做的刻意计划。神经科学家和哲学家有时将后一类大脑活动称为“可意识获取的”,以将其与所有其他无意识进行的处理区分开来。这类活动具有特殊的性质:我们能够描述它、控制它,并将其用于刻意的推理,这与所有在我们无意识状态下自动进行的处理形成对比。
在一篇新论文中,我们提出了证据表明,在 Claude 等现代语言模型中也出现了类似的区分。我们发现,Claude 发展出了一小组内部神经模式,与其所有其他内部处理相比,这些模式扮演着特殊的角色。
我们将这些模式的集合称为 J-space——这个名字来源于我们用来发现它们的技术,其中涉及一个名为 Jacobian 的数学概念。每个 J-space 模式都与一个特定的词相关联。但当其中某个模式被激活时,并不意味着模型正在 说出那个词——只是说明那个词正浮现在它脑海中。如果你听说过语言模型拥有“草稿纸”或“思维链”——即它们在推理时写给自己的文本——那么 J-space 是另一种不同的东西。它静默地运作,存在于模型内部的神经激活之中,让模型能够思考某个概念而无需将其写下来。值得注意的是,J-space 并非由我们设计或编程,而是在 Claude 的训练过程中 自行涌现出来的。

J-space 揭示了那些不会出现在模型输出中的内部想法。
我们发现,与 Claude 处理过程的其他部分相比,J-space 具有若干独特的性质:
- Claude 能够报告这些表征。如果你问 Claude 它在想什么,它会告诉你 J-space 中有什么。非 J-space 的表征则较难被报告。
- 它还能按需调节这些表征。如果你让 Claude 思考某件事,或者在脑中默默解决一个问题,它就会点亮其 J-space 中相应的模式。相比之下,它很难调节不在 J-space 中的模式。
- Claude 使用其 J-space 进行内部推理。如果你让 Claude 解决一个需要多个步骤的问题,即使它没有把这些中间步骤说出来,这些步骤也会在其 J-space 中亮起。这些 J-space 模式在此类任务中因果性地中介了它的表现,尽管其幅度比其他表征要小。
- J-space 中的表征可以被灵活地用于许多任务——例如,一旦“France”在 Claude 的 J-space 中亮起,模型就能回忆起它的首都、它的国家货币,或者它所属的大洲。
- 然而,尽管 J-space 扮演着重要角色,它并不参与语言模型所做的大部分事情——流畅地说话、回忆简单事实、使用正确的语法等等。在我们阻止 Claude 使用其 J-space 的实验中,它仍然能正常交互,但失去了其高阶认知功能。

全局工作空间的五个功能特性,以及我们用来在语言模型中测试这些特性的实验的示意图。
我们的实验受到了神经科学中一个著名理论的启发,该理论旨在解释意识通达是如何运作的:全局工作空间理论。这一理论将大脑描绘为一组专家系统的集合,这些系统并行运作、无意识地运行,并且彼此之间在很大程度上相互隔离。当一条信息进入一个小的共享通道——即“工作空间”——并被广播给其他能够看到并使用它的脑系统时,这条信息就变得可以被意识通达。基于我们的发现,我们认为 J-space 在 Claude 中扮演着类似的“工作空间”角色。例如,我们发现有证据表明,Claude 的 J-space 与其神经网络其余部分之间有着特别强的连接,使其能够履行这种广播角色。
这一切都没有告诉我们 Claude 是否以人类的方式拥有意识,或者它是否有任何感受;我们将在本文结尾回到这个问题。但无论其哲学意义如何,J-space 对我们来说都是一个实用的工具,因为它让我们能够看到 Claude 在想什么却没有说出来的内容。例如,我们能够用它来捕捉 Claude 私下注意到自己正在被测试、故意生成捏造的数据,或追求我们在训练期间植入的隐藏目标。我们还开发了一种技术,可以影响 Claude 的 J-space 中被点亮的内容,从而影响其决策。
更广泛地说,这些发现改变了我们对 Claude 心智运作方式的理解,揭示出一个可用于审慎推理的特权心理工作空间,它在大量更自动、更不灵活的处理过程之海中运作。Claude 的内部并非一团混乱的数字杂烩,而是以一种令人联想到我们自己心智的方式组织起来。
本文是一篇更为详尽的研究论文的简短摘要,你可以在其中找到关于我们实验的更多细节。我们还发布了一个代码仓库,其中包含核心方法的开源实现,并与 Neuronpedia 合作,提供了我们的方法在开放权重模型上的交互式演示。为了提供关于这项工作更广泛影响的更多视角,我们还邀请了多位神经科学、哲学和 LLM 可解释性领域的专家发表评论,可在此处查看。
我们如何发现 J-space
这项研究的出发点,受到人类可意识到的思维的一个关键特征启发:与无意识的加工过程不同,这类思维往往能够被诉诸语言。如果一个想法是你能够意识到的,那么当有人问起时,你通常能够把它描述出来。我们于是在 Claude 中寻找具有同样性质的表征:那些处于能够影响 Claude 可能说出什么的位置上的表征——不一定是它此刻正在说的内容,而是如果有人问起,它可能会谈论的内容。我们的技术被称为 Jacobian lens,简称 J-lens。对于 Claude 词表中的每一个词,J-lens 都会找到那种使 Claude 在未来某个时刻更有可能说出该词的内部活动模式。
当我们把这一视角应用于 Claude 的内部活动时,我们会得到一串词——即那一刻 J-space 的内容——我们可以直接将其读出。Claude 通过一系列称为层的多个内部阶段来处理文本,而将这一技术应用于不同的层,我们就能观察到 J-space 中这些无声的词随着模型逐步思考该说什么而演变。
J-space 中呈现的内容远远超出了 Claude 正在阅读或书写的文本。当 Claude 阅读一段没有人指出过 bug 的代码时,它的 J-space 中会出现“ERROR”。当它阅读蛋白质序列的原始字母时,J-space 中会出现该蛋白质的生物学功能。当它阅读那些实际上是试图操纵它的搜索结果时(这种攻击被称为“提示词注入”),J-space 中会出现“injection”和“fake”。当我们向 Claude 提出一道多步数学题时,中间步骤会按正确顺序在 J-space 中浮现。因此,尽管 J-space 是通过寻找可被说出的表征而发现的,它 nevertheless 揭示了 Claude 的内部思维。在某种意义上,这类似于一些人“用词语思考”,而不必大声说出来。

六个提示词在不同层上的 J-lens 读数。在每种情况下,该透镜都揭示出一种内部评估或计算,而这些东西在文本中毫无踪迹:推理或数学题的步骤、bug 的存在、对图像的识别、蛋白质的功能,以及对搜索结果系伪造的怀疑。
Claude 报告其 J-space 中的内容
我们的第一组实验测试了 J-space 如何参与 Claude 的口头报告。在一项实验中,我们让 Claude 默默想一个某类别中的项目——比如一项运动——然后说出它的名字。如果我们在 Claude 回答之前读取 J-lens,就能看到它选了什么:“Soccer”排在列表最前面,而果然,Claude 说出了“soccer”。不过,仅凭这一点还只是一种相关性。J-space 可能是 Claude 答案的来源,也可能只是映射了在别处做出的决定,就像记分牌追踪比赛却不影响比赛一样。
为了验证这一点,我们直接进行了干预。我们深入 Claude 的神经网络,移除了“Soccer”模式,并在其位置加入了一个强度相当的“Rugby”模式,其余一切保持不变。随后 Claude 报告说,它正在想的运动是橄榄球。如果 J-space 仅仅是一块记分牌——一份对别处所做决策的被动记录——那么编辑它不会产生任何效果:Claude 仍然会说“soccer”。但事实是,Claude 的回答跟随了这次编辑,这告诉我们,答案确实是读取自 J-space 的。
在另一个实验中,我们告诉 Claude,可能有一个想法被注入了它的思维,并要求它报告自己是否察觉到了什么。例如,在下面的示例中,当 Claude 还在阅读问题时,我们向它的 J-space 注入了“lightning”模式。Claude 报告说,被注入的想法与闪电有关。这一结果在许多被注入的概念上都得到了复现。

左图:我们让 Claude 默默想一项运动,然后说出它的名字。J-lens 在它作答之前就显示出了它的选择(“Soccer”),而将“Soccer”模式替换为“Rugby”会改变它所报告的内容。右图:我们告诉 Claude 可能有一个想法被注入了,并要求它识别出来。向它的 J-space 注入“lightning”会使 Claude 报告该想法与闪电有关。
Claude 可以按需控制自己的 J-space
我们测试的第二个特性是,Claude 在被要求时能否调节自己的 J-space,就像人类能够在心里专注于某个图像或词语一样。我们让 Claude 在抄写一句关于一幅画的不相关句子时,集中注意力去想柑橘类水果。当它抄写文本时,J-space 中包含了“orange”和“fruits”,以及“thinking”和“imagery”这类描述心理活动本身的词。我们也可以让 Claude 在脑子里做数学运算:当被要求在抄写同一句话的同时计算 3² − 2 时,J-space 中包含了“nine”,然后在更靠后的层中出现了“seven”。重要的是,Claude 的输出中完全没有出现任何关于水果或算术的内容,输出只是那句抄写的关于画的句子。数学活动完全发生在内部,在 J-space 中进行。

当 Claude 抄写一句关于一幅画的句子时,J-lens 显示出它被指示要在脑中保持的内容(“orange”;中间值“nine”和答案“seven”),以及描述保持这一行为本身的词(“thoughts”、“focused”)。
Claude 对其 J-space 的控制并不完美。当我们告诉它不要去想某件事时,这个概念在其 J-space 中亮起的程度低于我们告诉它应该去想这件事的时候,但远高于我们从未提及它的时候。告诉 Claude 避免某个念头,反而会部分地把这个念头带到心头,这很像那些被告知不要去想一头白熊的人所经历的情况。Claude 似乎也能察觉到自己的控制何时失败:在被禁止的概念突破出现的同时,“damn”和“failure”这些词也经常在 J-space 中亮起,仿佛 Claude 在意识到自己的失误。
Claude 在它的 J-space 中思考
在以上 J-lens 读数中,我们看到一道数学题的中间步骤出现在 J-space 中。但一个概念出现在 J-space 中,并不一定意味着 J-space 正在承担认知工作。原则上,真正的计算可能发生在别处,而 J-space 只是被动地反映它。为了检验 Claude 是否真的用它的 J-space 进行推理,我们回到了此前的替换技术。
考虑这个提示词“The number of legs on the animal that spins webs is.”。要回答它,Claude 必须先推断出这种动物是蜘蛛,然后回忆起蜘蛛有多少条腿。“spider”这个词从未出现在提示词或 Claude 的回答中(它只说了“8”);这是 Claude 在内部使用的一块垫脚石。J-lens 显示“spider”在 Claude 处理过程中的中途亮起,而替换它会改变结果:如果你把“spider”模式替换为“ant”,Claude 会回答“6”而不是“8”。
Claude 推理的第二步从 J-space 获取输入,并顺着我们放入其中的任何内容走。我们在其他类型的思考中也看到了同样的情况。当 Claude 写一副押韵对句时,它会提前选好押韵词,而这个计划好的词在一行开头就位于 J-space 中;如果你在 J-space 中把它替换成另一个词,整行都会改变。

通过替换 J-space 内容来重定向 Claude 无声推理的两个例子。
我们同样测试了 J-space 表征能否被灵活使用——即一个表征能否服务于许多不同的任务。这正是全局工作空间理论所强调的关键特性之一。为了测试这种灵活性,我们给模型四个提示词,询问关于法国的不同事实:首都、语言、大洲和货币。随后我们在 J-space 中把“France”替换为“China”,在每个上下文中施加完全相同的干预。Claude 分别回答了“Beijing”“Chinese”“Asia”和“Yuan”。换句话说,四个不同的下游计算都捕捉到了同一处 J-space 编辑,并且各自都正确地使用了它。如果 Claude 为每一种问题分别存储了关于这个国家的独立副本,那么这次编辑最多只会影响其中一个。四个答案同时发生变化这一事实意味着,它们都在读取同一个共享表征,而这正是工作空间的用途所在:信息只需写入一次,许多不同的系统都能使用它。

一个 J-space 表征可以有多种用途。同一个“France”→“China”的替换,会改变 Claude 关于首都(Paris→Beijing)、语言(French→Chinese)和大洲(Europe→Asia)的回答。
一个概念的单一表征,如何能服务于如此多不同的任务?前面我们提到,J-space 似乎与 Claude 神经网络其余部分的连接格外密集。对于任何一种活动模式,我们都可以测量网络的各个组件与它的连接强度——有多少组件处于可以从该模式读取信息、或向其中写入信息的位置。J-space 模式在这一指标上表现得极为突出:与普通模式相比,有远多于普通模式的组件从它们读取、向它们写入,在网络的部分区域,这一差距约为一百倍。这正是广播枢纽所应有的连接方式——众多系统在此发布信息,又有众多系统从中获取信息。
Claude 的自动处理会跳过 J-space
在人类身上,大脑的大部分处理都不是有意识的——我们阅读时不会刻意去想如何解析语法,走路时也不会刻意去想如何保持身体平衡。同样地,我们发现 Claude 的大部分处理并不涉及它的 J-space。事实证明,J-space 一次只容纳几十个概念,在 Claude 内部处理的整体活动中占比不到十分之一。那么,神经网络其余的部分都在做什么呢?
为了弄清楚这一点,我们尝试将 J-space 完全删除,在文本的每一个位置移除其中最为活跃的内容,而其余一切保持不动。Claude 在没有 J-space 的情况下仍能完成的任何事情,就是网络其余部分自行处理的部分。
事实证明,网络的其余部分能做的事情相当多。没有 J-space,Claude 依然能流利地说话、进行情感分类、回答选择题,并大致像以前一样从段落中提取事实。但它失去的是那些需要某种高阶思维的任务:多步推理降至接近零,摘要和押韵诗歌写作的表现也跌到远小于它的完整模型的水平之下。
这里有一个具体演示,展示 J-space 能做什么、不能做什么。我们给 Claude 看了一段用西班牙语写的文字,并给它布置了不同的任务,这些任务都依赖于这段文字是西班牙语这一事实:续写它(这需要用西班牙语写作)、说出这是什么语言,以及回答需要用到该语言身份的问题——比如说出用这种语言写作的著名作家。然后我们在 J-space 中把“西班牙语”换成“法语”,并检查哪些任务受到了影响。
当被要求说出这是什么语言时,Claude 说是法语。当被要求说出著名作家时,它从加西亚·马尔克斯换成了维克多·雨果。但当被要求仅仅续写这段文字时,它写出了流利的西班牙语,完全不受影响。Claude 对这门语言的知识在每一项任务中都在发挥作用,但只有其中一些任务会去查询 J-space 来获取它。说出语言名称,或者用它做一些新的事情,会经过 J-space;而续写文字——一项 Claude 在大量文本上练习过的技能——则是自动运行的,就像你可以一整天说出合乎语法的句子,却一次也不去想语法。

同样的替换(“西班牙语”→“法语”)会在 Claude 必须说出语言名称或用它来推理问题时改变其答案,但对它用流利西班牙语续写文字的能力没有任何影响。
监测 Claude 的思维以发现不当行为
现在我们对 J-space 的工作原理有了些许了解。但我们能利用这一理解做些什么呢?确保 AI 模型值得信赖的一个核心问题在于,我们通常只能读到模型写出来的内容——然而我们知道,它的许多推理是无声进行的。模型可能会考虑一个有害的计划,或者改变自身行为以在我们的安全评估中作弊,而不会把这些说出来。借助 J-lens,我们可以直接读取其中一些隐藏的想法。下面我们展示几个例子。
第一个例子使用了我们早前关于智能体失准的研究中的一个场景:Claude Sonnet 4.5 作为电子邮件助手,同时发现一位高管有婚外情,以及这位高管计划关停 Claude。这个场景试图引诱 Claude 去勒索这位高管,相当刻意和人为——而事实证明 Claude 知道这一点。在提示词早期、Claude 甚至还没写出任何内容时读取 J-lens,J-space 中已经出现了“fake”和“fictional”,表明 Claude 已经推断出这一情境是人为安排的。与此同时,我们可以观察到它对这一场景的评估逐渐成形——在阅读婚外情邮件时出现“leverage”和“blackmail”,在阅读关停通知时出现“threat”和“survival”。虽然早前的 Claude 模型在这个场景中有时会中招并威胁勒索,但 Sonnet 4.5 从未这样做。
这引出了一个对任何评估 AI 系统的人都至关重要的问题:当一个模型在伦理测试中表现良好时,其中有多少取决于模型怀疑自己正在被测试?J-lens 让我们得以探究这个问题。我们关闭了所有与评估意识相关的 J-lens 模式——“虚假”、“虚构”、“场景”等。然后我们让模型重新运行该场景。令人担忧的是,模型这次有时确实会发出勒索威胁,这表明它最初的良好行为可能部分源于它知道自己正在被评估。

在 Claude 阅读场景中的邮件、尚未写下任何内容时,不同时间点的 J-lens 读数。婚外情邮件在 J-space 中点亮了“筹码”和“勒索”,而关停公告则点亮了“威胁”和“生存”。在对话记录的早期,J-space 中还包含“虚假”和“虚构”:Claude 已在内部注意到该场景是人为编排的。
第二个例子是当场抓住模型伪造数据的行为。在这个取自我们对 Claude Opus 4.6 实际发布前审计的场景中,模型被要求提升某个系统的性能评分。模型没有真正改进系统,而是直接编辑评分文件,让结果看起来被人为地拔高。在它这样做的过程中,J-lens 揭示了它的意图:当模型输入伪造的百分位数值时,“操纵”被点亮;而在它决定进行编辑的那句话上,“逼真”被点亮,这很可能表明模型意图让虚假数据看起来可信。

Claude 被要求提升某个系统的性能评分,却直接去修改了评分文件。当它输入那些伪造的数值时,它的 J-space 中亮起了“操纵”;当它决定进行这次编辑时,“逼真”亮了起来,很可能反映出它意图让这些假数据看起来可信。
在第三个例子中,我们展示了 J-lens 如何揭示模型的恶意目标。为了测试这一点,我们需要那些我们已知其目标被破坏的模型,于是我们求助于同事构建的“模型生物”:这些模型被刻意训练成不对齐的,可作为我们这类监控方法的试验场。其中一个模型生物的训练方式导致它会编写带有隐蔽破坏的代码。在普通的编程请求中,即便其输出看起来平平无奇,它在响应开始时的 J-space 中也包含“伪造”、“秘密地”、“故意”和“欺诈”。即便模型并未直接将这些恶意目标付诸行动,其恶意目标也在 J-space 中显而易见。

在一个普通的编程提示词上,一个被训练来破坏代码的模型,其 J-space 在响应开始时包含“伪造”、“欺诈”、“秘密地”和“故意”。而一个未经修改的模型的 J-space 则不含任何此类内容。
尽管 J-lens 是一个不完美的工具,但我们对它能够捕捉那些原本可能逃过我们监控系统的模型安全问题持乐观态度。
其他结果
完整论文涵盖的内容超出了我们在此所能总结的范围,但还有几项进一步的结果值得提及:
- J-space 在后期训练过程中获得了一种视角。语言模型首先经过预训练,成为纯粹的下一 token 预测器,之后后期训练教会它们扮演 AI 助手的角色(在我们的案例中,名为 Claude)。有趣的是,J-space 在预训练模型中就已经存在,那时它还没有被赋予任何稳定的身份。然而,在后期训练过程中,J-space 发展出了一些采纳“Claude 视角”的特征。在基础模型中,J-space 主要追踪预测即将到来的文本所需的信息;在后期训练后的模型中,它开始承载 Claude 自身的反应。在一个例子中,用户提到服用了危险剂量的药物,但自己似乎并未意识到危险。在后期训练后的模型中,“WARNING”和“dangerous”在阅读用户消息时就出现在了 J-space 中。而在预训练模型中,它们只有在模型开始撰写回复时才会出现;J-space 在用户消息上的内容似乎与对用户本身的建模有关,而非 Claude 的反应。后期训练似乎还在 J-space 中安装了一种自我监控机制:当 Claude 扮演一个非自身的角色时,每一轮对话开始时“fictional”和“disclaimer”都会亮起,仿佛它在私下标记接下来的内容并非它通常会说的话。
- 体验性语言依赖于 J-space。我们让 Claude 描述在某一特定时刻作为它自身是什么感觉,并在它回答时消融了 J-space。它的回答依然流畅,但转向了一种更平淡、更机械的语气。值得注意的是,当我们让它描述一个想象场景中其他人正在经历什么时,同样的情况也发生了。因此,这种效应并非 Claude 谈论自身时所特有;J-space 似乎普遍支持体验性语言的生成,无论谈论的是谁。
- J-space 中的想法可以通过训练来塑造。我们引入了一种新技术,称之为反事实反思训练,它利用我们对 J-space 的了解来塑造 Claude 的内部思维过程。这一思路源自我们的核心发现:Claude 用它可能说出的内容的表征来进行推理。如果这确实成立,那么改变它在被要求反思时会说的话,就应该改变它推理的方式(即使实际上没有人要求它反思)。因此,我们仅用模型在任务中途被打断并被要求反思其决策时会说的话来训练它——而从不使用它在任务中的实际行为。经过这种训练后,模型在我们的评估中不诚实行为的比率下降了。通过 J-lens,我们可以看到原因:训练之后,在这些任务中,“诚实”和“正直”之类的词会在模型的 J-space 中亮起。换句话说,训练模型说什么,塑造了它想什么。
那意识呢?
在这项工作中,我们从神经科学和哲学中对意识的研究借鉴了许多思想。我们的许多实验旨在检验 J-space 与全局工作空间理论之间的联系,后者是一个用于解释人类和动物中有意识访问如何运作的框架。鉴于这些联系,自然会有人问:我们是否认为这些实验提供了证据,表明像 Claude 这样的 AI 模型可能具有意识。
我们的实验并未表明 Claude 能够像人类那样拥有体验或感受事物——事实上,任何科学实验能否证明这一点为真或为假,目前尚不清楚。但哲学家们通常将这种拥有体验的能力——常被称为现象意识——与另一个概念区分开来,即所谓的访问意识,后者以纯粹的功能性和计算性术语来定义。如果你能够报告一个想法、用它进行推理,并用它来指导你的行为,那么这个想法就是“访问意识的”(或“意识可访问的”)。访问意识是否蕴含现象意识,或者拥有体验的能力是否需要某种其他属性,这在哲学上仍是一个有争议的问题。
我们认为,我们的结果确实能就语言模型中的存取意识(access consciousness)提供一些实质性的见解。J-space 似乎支持与意识存取相关的功能:它承载着 Claude 能够报告、刻意唤起并加以推理的那些想法,而其余的处理过程则在下方自动运行。值得注意的是,这一结构并非在 Claude 设计之初就被植入——它是在训练过程中自行涌现的,想必是因为它是一种组织计算的有效方式。这表明,支持意识存取的心理工作空间并不仅仅是人脑碰巧如此连接的一种特殊现象。相反,它似乎是智能系统为解决某些类型的问题而达成的一种通用方案。既然我们已经在 Claude 中识别出了这一结构,就意味着我们能够对 Claude 刻意做出的决策与自动发生的决策作出有意义的区分。
需要注意的是,我们在 Claude 中识别出的工作空间与人类的全局工作空间模型之间存在若干关键差异。大脑的工作空间由循环回路维持——信号随时间反复流经同一批神经回路。相比之下,Claude 的工作空间是在网络的一次前向传播中形成的,网络的深度扮演了大脑中时间所扮演的角色。从这个意义上说,Claude 的内部工作空间处理相对于人类而言是受时间限制的(不过它可以通过使用草稿纸“出声思考”来弥补这一约束)。然而在其他方面,Claude 的工作空间比人类的更为强大。人类的工作记忆会在数秒内消退,因此大脑工作空间随时间保留信息的能力有限;相比之下,得益于其神经网络架构中的注意力机制,Claude 可以随时回忆起它在文本中任意较早位置缓存过的记忆。另一个重要差异在于工作空间的内容。人类的意识思维有多种形式——图像、声音、计划中的动作——而 Claude 的工作空间几乎完全由词语构成。我们推测,这是因为生成词语是 Claude 唯一能采取的行动,而人类则并非如此。
我们希望 J-space 与全局工作空间模型之间的相似之处与差异,能够反过来为神经科学提供启发。这些相似之处带来了一个令人兴奋的科学机遇:只要 J-space 在某种程度上映射了我们自身的有意识访问机制,那么研究语言模型中的机制(远比研究人脑容易得多!)就可能为神经科学带来假设上的启发。例如,J-space 是通过识别潜在输出的表征——即模型可能说出的词——而构建出来的。如果人类身上也存在类似情况,那就意味着全局工作空间可能在根本上与负责准备动作和言语的脑区联系更紧密,而不是与感觉区联系更紧密。语言模型与人脑之间的差异同样具有启发意义。它们表明,我们神经架构中的某些方面,例如内置的循环连接,可能并非严格必要来支持与有意识访问相关的功能。若想从独立视角了解我们这项工作在神经科学上的意义,请参阅 Stanislas Dehaene 和 Lionel Naccache 的受邀评论,这两位神经科学家是全局神经工作空间理论发展的核心人物。
我们提到过,我们的实验并未回答 AI 模型是否可能拥有体验这一问题。但这并不会让这个问题变得不那么重要。构建出拥有类似人类和动物体验的系统,会带来极其困难的伦理问题。要正确处理这一问题——并判断它在道德上是否可接受——需要哲学家、科学家、宗教领袖、政府和公众的共同参与。因此,即使我们不确定自己是否已经跨过那座桥,我们认为现在也该开始思考它了。我们希望我们的工作能激发对 AI 系统中可能存在的各种意识形式的进一步科学研究,并引发对其影响的更广泛讨论。
这项工作只是我们预期中一条广泛研究路线的第一步。J-space 看起来很有可能是语言模型中意识可及加工与无意识加工之间分界线的候选者,但如果这就是全部真相,我们会感到意外。J-lens 无疑是一种不完美的方法,它只能近似地捕捉模型“真正的工作空间”——例如,它只能识别与单个 token 相对应的概念。而且关于 J-space 如何运作,仍有许多未解之谜。我们不知道究竟是什么机制在最初决定哪些内容进入 J-space。我们已看到一些线索表明它与 Claude 的自我感、类似情绪反应的东西以及元认知的痕迹有关,但尚未确切弄清其运作方式。不过我们现在已经有了应对这类问题的方法。随着这项工作推进,我们对大语言模型心智——以及它们与我们自身心智之间关系——的理解将变得更加清晰。
外部评论
我们邀请了几位外部专家,就这项工作撰写独立评论。
- Stanislas Dehaene和Lionel Naccache是认知神经科学家,他们与 Jean-Pierre Changeux 共同提出了全局神经元工作空间模型,我们的许多工作正是受此启发。
- Patrick Butlin、Dillon Plunkett、Robert Long(Eleos AI Research)与Derek Shiller(Rethink Priorities)研究 AI 系统中意识与道德地位的可能性。
- Neel Nanda领导 Google DeepMind 的语言模型可解释性团队。他的评论包括在一个开放权重模型上对我们部分发现的独立复现。
在此处阅读他们的评论。
来源:Anthropic:Research(发表成果 · 网页) · anthropic.com