2024年7月电路更新:迈向神经网络机制理解的下五个挑战
Circuits Updates — July 2024
Anthropic可解释性团队分享了2024年7月的多项研究进展与初步想法,并指出了未来面临的五大核心挑战。这些挑战包括:大量未被提取的“缺失特征”可能构成神经网络的“暗物质”;跨层叠加现象使特征难以映射到特定层;注意力叠加可能掩盖了如归纳头等基本单元的真实结构;权重叠加产生的“干扰权重”给电路分析带来混淆;以及如何将微观的电路理解整合为宏观的模型认知。团队认为,尽管在特征叠加等问题上已取得显著进展,但这些新挑战是通往神经网络机制性理解道路上的关键障碍。
可解释性研究新挑战,帮助理解AI模型黑箱,对安全和信任至关重要。
接下来的五大难关
克里斯·奥拉;亚当·杰明编辑
如果一年前你问我,机械可解释性领域的关键未解决问题是什么,我会告诉你最重要的问题是叠加。紧随其后的可能是可扩展性挑战:即使我们能将非常大的模型分解成可理解的片段,又如何将其转化为对模型整体的理解?然后我可能会把注意力叠加列为第三级挑战。自那以后,叠加问题取得了非常显著的进展(例如 Bricken 等人、Cunningham 等人、Templeton 等人、Gao 等人的工作)。因此,现在似乎是时候停下来盘点一下,问一问:"在实现神经网络的机械理解之前,我们面前还有哪些障碍?"从我个人角度来看,有几个障碍是我们需要面对的重大挑战。
在深入探讨之前,有必要描述一下我设想的前进路径,这样我们才会遇到这些障碍。大致上,我设想的是:
- 我们找到可解释的特征,这些特征是我们所关注计算的"变量"。
- 我们理解计算这些特征的电路。
- 我们以某种方式将这种对神经网络的微观理解,转化为能够回答我们关心问题的宏观图景。
沿着这条路径,我看到未来还有五个额外的障碍:
- 缺失的特征。从历史上看,我们路径的第一步——找到可解释的特征——曾因叠加问题而严重受阻。现在这个问题已基本解决:我们可以自动提取大量可解释的特征。然而,我们似乎很可能只提取了其中一小部分特征。可能存在数量极其庞大的稀有特征,我们目前还无法提取。如果没有重大的算法创新,我们可能永远无法解析那些最稀有的特征,从而留下一种神经网络暗物质。
- 跨层叠加。考虑一个具有100层的模型。如果模型试图实现的电路相对较浅——也许大多数电路的深度不超过10步——那么相邻层中的神经元在梯度下降看来可能并没有太大区别。从试图将这样的电路映射到模型架构的角度来看,将某个表示放在第10层还是第11层可能差别不大。从这个角度看,相应的神经元几乎是并行的。因此,可能会出现跨层叠加的情况,即某个特征的实现并没有清晰地映射到特定层上。我们基本的字典学习方法无法解决这个问题。(另见此处的讨论。)
- 注意力叠加。正如神经元组合可以在叠加中表示额外特征,我们相信注意力头组合也可以在某种注意力叠加中表示额外的“注意力特征”。如果是这样,我们可能遗漏了许多理解神经网络计算的基本单元——这些单元与“前一个token头”或“归纳头”的概念同等重要。此外,即使对于归纳头这类熟悉特征,我们可能也看不到其最清晰的版本,因为这些特征可能分散在多个注意力头中,或被叠加中的其他特征所掩盖。而且,由于许多常规特征交互是通过注意力机制介导的,这也使得电路分析变得困难。这就像试图在没有“指向我上方位置的神经元权重”这一概念的情况下理解卷积神经网络电路。在思考电路时,我们常将注意力头视为扮演着类似于卷积神经网络中“相对位置”的角色。考虑“放大”顶部的汽车检测电路,该电路寻找汽车上方的车窗和下方的车轮。“上方”和“下方”的关系由注意力头泛化实现,这些注意力头既能处理这种简单关系,也能处理更抽象的关系。另请参阅此处关于注意力与类卷积结构之间关系的注释,以及Cordonnier等人(交互式可视化)工作中展示的相对位置头的实际示例。
- 干扰权重。正如我们可以将特征视为以神经元组合的叠加形式表示,将注意力头视为以跨注意力头的叠加形式表示,我们也可以将“真实神经网络电路权重”视为由一种权重叠加来表示。如果这一点成立,那么当我们尝试直接计算特征之间的虚拟权重时,就会观察到“干扰权重”——这些权重在神经网络中以某种真实意义存在,但它们仅仅作为一种折衷方案而存在,以便模型能够表示其他电路。目前,证明干扰权重真实存在的最佳证据可能来自类似特征之间 logit 权重的散点图,例如在《迈向单义性》一文中的这些图表中所示。我们在其他电路分析工作中也遇到过这种情况,即当我们直接计算特征与 logit 之间的虚拟权重时。这些干扰权重对于电路分析来说可能极其令人困惑,因为它们基本上毫无意义,并且在分布内本不应产生影响(尽管它们可能有助于解释对抗样本)。
- 宏观审视。即使我们能够达到理解神经网络中所有单个特征和电路的程度,仍将面临一个进一步的挑战:如何将其转化为对神经网络整体的理解。对此,一个流行的答案是自动化可解释性(这无疑会有所帮助),但我更希望看到从更大尺度的结构、普遍性和宏观对应关系角度给出的答案。
当然,在所有这些之后,最终的挑战是“既然你已经没有了根本性的障碍,那就真正去理解这个神经网络”。
尽管面临上述一系列挑战,我们仍有充分的理由保持乐观。首先,我们相信在不久的将来,有可行的路径可以在其中许多问题上取得进展。这些问题相对而言尚未被充分探索,至少存在一些显而易见的突破口。其次,这些问题之间并不像叠加的基本形式那样常常相互阻碍,导致下游问题难以研究。因此,我们有可能并行攻克这些难题。这一点同样适用于“理解网络”或“神经网络生物学”的最终目标——它似乎较少受到这些问题的阻碍,更像是我们可以用有趣的方式真正去攻克它,而每个问题上的边际进展都会让整体变得容易得多。
什么是线性表征?什么是多维特征?
作者:Chris Olah;编辑:Adam Jermyn
在可解释性研究中,有一组重要的直觉贯穿始终,可以追溯到著名的词嵌入结果,甚至更早。国王 − 男人 + 女人 = 女王。方向是有意义的单位。我们可以通过向量运算来操控表征。我们在叠加问题上的工作很大程度上建立在这种基本直觉之上,并在研究过程中试图将其明确为“线性表征假说”。
Engels 等人近期关于多维特征的研究让我们意识到,我们在这个话题上的一些表述不够清晰。因此,我们想重新探讨这个话题。什么是线性表征?或者更确切地说,线性表征应该是什么?哪个定义最能精准地抓住可解释性研究中那些有趣且重要的核心?然后,我们将探讨这个定义对多维特征意味着什么。
一个令人困惑的定义
当我们在《玩具模型》一文中阐述线性表征假说时,我们将其描述为“特征即线性方向”的假说。
我们将神经网络表示称为线性表示,如果特征对应于激活空间中的方向。在线性表示中,每个特征 f_i 都有一个对应的表示方向 W_i。多个特征 f_1, f_2… 以值 x_{f_1}, x_{f_2}… 激活的存在,由 x_{f_1}W_{f_1} + x_{f_2}W_{f_2}… 表示。
这个定义混淆了两个重要且不同的主张:特征本质上是单维对象,以及特征在数学意义上表现为线性。这相当令人困惑!
数学线性表示
在实践中,我们逐渐使用“线性表示”来特指特征的这第二种属性,即特征以“数学线性”的方式表现,无论它们是否是单维的。也就是说,如果一个表示满足以下条件,它就是线性的:
- 组合即加法:某个特征的存在通过添加该特征来表示。例如,“非正式写作风格”中的“反馈”由对应于这些特征或概念的向量之和来表示。
- 强度即缩放:某个特征的强度(或者模型对其存在性的置信度)通过幅度来表示。也就是说,如果某事物看起来很可能是在谈论星期一,但指代不明确,我们往往会看到在特征方向上添加的幅度相应较小。可能存在一些二元特征(如记忆特征),它们只取 0 或 1 的值。这类特征可能有不同的缩放要求,即它们不需要连续缩放。当然,在许多情况下,我们可能仍然有二元变量的概率,这又使其变得连续。
未来,我们或许需要考虑增加第三个标准,即“近似线性可读”:特征的强度可以通过一个线性函数来获取,仅存在一定程度的噪声。这与 Vaintrob 等人的研究类似。对于分离良好的单维特征,这一性质可由其他属性推导得出;但对于多维特征,它可能是必要的。然而,我们既不确定这一点的正确形式化定义是什么,也不确定它应该属于“线性表示”的一部分,还是属于其他某种属性。
在“特征是单维的”与“特征在数学上是线性的”之间,我们认为数学上的线性性质要深刻得多,并且通常是我们真正关心的性质。如果存在多维特征,大多数机制可解释性研究只需稍作调整即可适应。(甚至可以说,我们的工作可能会变得更简单!)但如果表示在上述意义上不是数学线性的,那就得推倒重来——大量问题,比如“我们应该如何理解权重?”,都将被重新提出。因此,为这第二个问题设立一个术语,并将其视为一个独立的问题,似乎非常重要。
线性多维特征
现在,我们正式转向多维特征或特征流形的问题。这个问题早就该讨论了!在《玩具模型》一文中,我们实际上承诺过要解释如何将线性表示的定义扩展到这类特征,但未能发布相关的附录。事实证明,线性表示的新定义可以容纳多维特征,但这会对其几何结构施加约束。
如上所述,数学上的线性要求多维特征满足两个性质。“组合即加法”要求该特征能够与其他特征相加。这意味着它所形成的流形必须与其他特征正交,或者在叠加状态下近似正交。实际上,这并非严格必要,但它是“组合即加法”成立的充分条件。实际上的必要条件要更复杂一些。
更有趣的要求是“强度即缩放”,这极大地限制了可能流形的几何结构。流形上的每个点在缩放时都会形成一条“射线”,代表该特征在不同强度水平下的表现。这些射线共同构成一条路径,使整个流形收缩回零点。当然,所有特征的零点都可以通过偏置来移动。那么,语义变化就需要是垂直于该方向的角运动。
附注:特征流形嵌入的潜在问题
如上所述,还有一个有趣的额外特性,即模型可能希望“线性读取”特征并无噪声地恢复它们。实现这一点的一种方法是让特征几乎正交,那么线性可读性就隐含在线性表示的通常定义之中。
但在特征流形中,流形上邻近的点在定义上几乎是平行的。这正是关键所在!尽管如此,模型可能希望比内在拓扑的自然嵌入所暗示的更能区分这些点。(我们之前关于特征流形的更新在一个玩具设置中对此进行了非常初步的探讨。)
我们怀疑,这种“特征流形可能以比其拓扑结构所暗示的更复杂的方式嵌入,以实现特定的距离度量”的想法,实际上可能非常深刻且重要。例如,人们可能倾向于认为,如果流形在其早期主成分上有清晰的投影,那么其余部分就是噪声。但事实上,这些噪声可能对于实现正确的几何结构至关重要。
多维特征与方向
如果我们采用这种线性表示的新定义,像 Li-Nanda 交换这样的证据是否就不再支持它了?非正式地说,许多被引用来支持线性表示假说的结果,要么是通过线性探针提取信息,要么是添加一个向量来影响模型行为。这些通常被讨论为“修改方向”,所以你可能会担心,如果我们允许多维特征,它们就不适用了!但实际上,它们陈述的是关于数学线性这一性质本身。
理解这一点的一种方式是考虑一个假想的线性多维特征中的“射线”。这些射线具有固定的语义含义。它们本质上是一维特征,“锁定”在流形上某个特定点的语义含义上。从这个角度看,线性多维特征类似于一个无限、连续的一维特征集合——一种特征流形。如果你只对某个预定义的语义属性感兴趣(就像探针分析中的情况),那么该属性仍然对应一个方向。
主要区别在于,这些“射线”并不具有特权地位。如果我们把它们视为特征,那么就会存在无限多个潜在特征。
这开始触及另一个问题:什么使得某物成为多维特征或特征流形,而不是一组共现的一维特征集合?似乎合理的是,任何多维特征可能都可以被理解为一维特征的集合,这些一维特征构成了参数化该流形的一组基。但如果存在连续性,那么将它们理解为多维特征可能更为自然。例如,如果“周二午夜”被表示为介于周二和周三之间,这似乎就是证据,表明它们之间确实存在连续的表征,并且倾向于认为它们是一个多维特征。另一个问题是,该流形是否存在一个特权基,即一组特别自然的、用于参数化该流形的一维特征。
关于定义
我完全不确定上述任何定义或框架能否经得起时间的考验。在研究中,定义可以且应该发生变化并保持流动性。拉卡托斯有一本精彩的书叫《证明与反驳》,讲述了定义的演变往往富有成效且至关重要——如果你还没读过,那本书非常棒。随着我们对事物理解的加深,我们会找到更深刻的思想来切分现实。让我们继续追问这些思想究竟是什么。
同样值得记住的是,不完美的理论和框架仍然可以富有成效。我们可能还需要很长时间才能真正找到思考问题的正确方式,但这或许并不像看上去那么糟糕。
神经网络的暗物质?
克里斯·奥拉;由亚当·杰明编辑
在最近的工作中,我们训练了一个稀疏自编码器,解析出了1300万个特征。然而,这些特征似乎只是触及了表面。有了1300万个特征,我们找到了旧金山某些社区的特征,但克劳德了解旧金山的小咖啡馆,并且能回答关于街道交叉口的问题。据推测,旧金山每个社区至少有上百家这样的商铺、街道、公园等。这意味着特征数量至少还要高出两个数量级,而这些特征在数据集中相应地更为稀少,甚至可能更多。
还有许多其他迹象表明存在极其罕见且数量庞大的特征。例如,你可以对与人相关的特征做出类似上述的论证(克劳德知道我是谁,但我们显然离提取出"克里斯·奥拉"特征还差得很远)。但一个更有趣的不同例子是,可能存在"记忆特征"(类似于《走向单义性——有限状态自动机》中的概念)——这些特征可能数量庞大且极其稀疏。这两个例子都说明了一种更广泛的可能性:神经网络可能拥有异常罕见且稀疏的特征。这些特征很可能占绝大多数(尽管由于不常见,重要性较低)。而且,除非取得重大突破,否则我们可能实际上无法解析出低于某个稀有度水平的特征。
从这个角度来看,这些稀有特征可能是一种可解释性研究中的“暗物质”。最初,暗物质仅指“我们无法直接观测,但能感知其影响的存在”。随着时间推移,人们对暗物质本质的约束越来越强,逐渐形成了共识,认为它很可能是一种非重子物质。在借用这个类比时,我们指的是其最初(更宽泛)的概念,这很贴切,因为可解释性这个领域在学科状态上更接近20世纪初的宇宙学,而非21世纪初的宇宙学。也许绝大多数特征都存在,但因为过于稀有而基本不可见。我认为这个类比之所以有用,有两个原因。首先,它有助于描绘一个科学领域的图景——在这个领域中,部分研究对象是无法直接触及的。其次,它暗示了一种研究思路:尝试通过间接方式研究这些不可见的记忆特征。
延续这个类比:字典学习给了我们一台望远镜,让我们得以窥视神经网络并观察特征。我们最早的实验只能观测到最亮的“恒星”(最重要、最常见的特征)。随着我们不断完善字典学习的科学方法,我们能够分辨出越来越多暗弱的恒星(更稀有的特征)。但神经网络宇宙中可能仍有很大一部分是实际上无法观测的暗物质。
(这里一个关键未解问题是,我们能否找到效率高出几个数量级的字典学习变体,从而解析出更多特征。这并非完全不可能,但看起来也非常不确定。这个问题的答案将决定足够稀有的特征是否实际上无法被解析。)
使用注意力透视表测试基础模型质量
作者:Nicholas L Turner, Adam Pearce, Trenton Bricken, Adam Jermyn;编辑:Chris Olah
最近,我们尝试复现团队早期论文《Transformer 电路的数学框架》中的一项关键成果:即“透视表”,它使我们能够将单层 Transformer 解释为实现了跳跃三元组(skip-trigrams)。下方展示了一个示例表格:
我们发现这些结果对训练 Transformer 时的细微问题异常敏感,导致复现过程相当繁琐。本次更新将分享我们复现这些结果所需的细节。
我们认为,这种方法对于研究单层模型中的注意力机制通常非常有用(这可能有助于我们研究注意力叠加现象),并希望分享更详细的指南能帮助其他人使用它。我们也希望这能作为一个案例研究,更广泛地说明细微细节如何影响可解释性结果。
构建透视表
透视表可视化了模型从输入嵌入到特定注意力头,再直接到 logits 的路径上的行为。在仅含注意力的单层模型中,这涵盖了 QK 和 OV 电路的完整路径,如《一个数学框架》中所述。
换句话说,这些表格概括了两个 vocab_size × vocab_size 的矩阵。第一个矩阵(QK 电路)量化了上下文中任何查询 token 对某个键 token 的注意力程度(softmax 之前,使用注意力“分数”或 logits)。另一个矩阵(OV 电路)衡量完全关注某个给定键 token 对模型输出 logits 的影响(需考虑去嵌入前任何层归一化的缩放因子)。这两个矩阵都完全忽略了位置嵌入的影响。
定义一些术语,设:
N_v 为词表大小,
d_{\textrm{model}} 为残差流大小,
d_{\textrm{head}} 为注意力头维度,
W_E \in \mathcal{R}^{d_{\textrm{model}} \times N_v} 为嵌入矩阵,
W_U \in \mathcal{R}^{N_v \times d_{\textrm{model}}} 为去嵌入矩阵,
W_Q, W_K, W_V \in \mathcal{R}^{d_{\textrm{head}} \times d_{\textrm{{model}}}} 为注意力头的输入权重,
W_O \in \mathcal{R}^{d_{\textrm{model}} \times d_{\textrm{head}}} 为注意力头的输出权重,
L_A(x) 为注意力前的层归一化(如果存在),
L_U(x) 为去嵌入前的层归一化(如果存在),
且 \beta_U 为去嵌入前层归一化的偏置。
那么我们可以将电路矩阵写为:
C_{QK} = L_A(W_E)^T W_Q^T W_K L_A(W_E)
C_{OV} = W_U L_U(W_O W_V L_A(W_E)) - \beta_U
这些形式为编写此类代码时检查工作提供了一些方法。在从模型中移除位置信息后,QK 电路应精确匹配注意力 logits。当确保一个注意力头从关注单个 token 产生的输出是残差流中唯一的内容时(并在移除层归一化偏置后),OV 电路也应匹配输出 logits。
我们减去反嵌入的层归一化偏置,因为它仅代表对 logits 的直接偏置。如果模型有强烈倾向忽略特定 token,那么在 OV 电路中你只会看到这个现象,而看不到相对效应。
一旦我们形成这两个大矩阵,我们就根据以下启发式函数 H_K 对每个关键 token 进行评分,并在表格中显示前 N 个。我们通过类似的启发式 H_Q 将每个关键 token 与一组关注该关键 token 的查询 token 相匹配,并通过 H_O 匹配受影响的输出 token。
H_K(k) = max(C_{QK}[:, k] * P[:]) * max(C_{OV}[:, k]) * P[k],
H_Q(q, k) = C_{QK}[q, k] * P[q],
H_O(o, k) = C_{OV}[o, k]
其中 P[t] 是特定 token ID t 出现在训练集中的似然。该启发式函数旨在选择那些在注意力和输出上都具有强效应的关键 token。我们目前通过采样来估计 P[t]。原始的数据透视表仅报告了将 P 乘法应用于 k 轴,即:
H'_K(k) = max(C_{QK}[:, k]) * max(C_{OV}[:, k]) * P[k]
但我们发现将其应用于两个轴会得到稍好的结果。
实际考量
我们在不同架构的模型中看到了可解释的跳跃三元组,包括使用不同位置嵌入以及有或没有层归一化的模型。最佳运行结果显示约 25%–75% 的可解释三元组条目,同时伴有大量复制条目。我们建议对显示可解释条目少于约 10% 的表格保持怀疑态度,因为你可能正在“解释”海市蜃楼。这些比例来自仅有 1–4 层的小模型,在该范围之外可能很容易发生变化。
尽管如此,在此范围内我们发现,有几个变量会显著增加或降低成功找到可解释跳跃三元组的可能性。
- 训练超参数:使用表现不佳的超参数进行训练时,生成的透视表往往令人困惑。
- 训练数据集:如果数据集包含易于解释的领域(例如,英语自然语言、Python 代码等),则有助于观察模型已学习到的信号。区分一个模型是成功学习了你无法解读的结构,还是根本没有学到有用的结构,可能很困难。
- 层数:不出所料,单层模型最容易在透视表中显示出结构,尽管多层模型的后几层也往往显示出可读的结构。
使用数据集过滤测量特征敏感性
作者:Nicholas L Turner, Adam Jermyn, Joshua Batson;编辑:Joshua Batson
在我们近期使用字典学习特征的工作中,评估一个特征对某个概念的专一性比评估其敏感性更容易。我们将专一性定义为:在检测器触发(例如,学习到的特征达到一定激活水平)的情况下,该概念存在的可能性。我们通过检查特征被激活的数据集样本来评估这一点。我们将敏感性定义为:在概念存在的情况下,检测器触发的可能性。这更难测量,因为要在大规模文本语料库中准确判断一个可能模糊的概念是否存在,需要一些谨慎的处理,如下所述。
在此,我们探索使用 Claude 来帮助我们通过评估文本中概念的相关性来量化敏感性。我们发现,不同版本的 Claude 通常与人工抽查结果一致(并且彼此之间也一致)。此外,在量化特征专一性时,我们发现特征并不能被我们在《扩展单语义性》中与之关联的松散概念完美描述。相反,我们找到了一些证据表明,多个特征共同代表了广泛的主题,尽管尚不清楚这种理解是否能完全解释特征响应中的差距。
一种数据集过滤方法
评估敏感性时,必须使用该概念可能出现的代表性分布。在《迈向单义性》研究中,我们针对少数简单概念建立了概率计算代理(例如 DNA 序列,将其建模为从相关字母表中随机抽取的字符串)。这些代理衡量的是文本包含某个简单概念的程度,但无法适用于更复杂的概念。现有的自动化可解释性方法可通过生成“对抗性样本”来探测特征响应的边界,从而评估更复杂的概念,但这些方法也可能存在难以预先预测的盲区。
我们近期尝试让 Claude 来量化某个概念与文本样本的相关程度。这些评分可用于从大规模文本数据集中筛选包含该概念的实例,并且假设该数据集形成了该概念的代表性分布,那么特征在该数据集上被激活的频率就是其敏感性的衡量指标。这样一来,Claude 只需识别概念的实例,而无需忠实生成该概念的全部用法以及所有可能以正确比例出现的方式。
简而言之,我们让某个版本的 Claude 使用以下提示词来评估某个概念与一小段文本样本的相关程度:
以下是需要分析的文本样本:
{context}
以下是一个可能较为模糊的概念:
{concept}
该概念与文本样本的相关程度如何?
首先在 <reasoning> 标签内写出关于该概念相关程度的一些推理过程。既要考虑该概念被直接提及或暗示的频率,也要考虑该概念在文本整体含义中的核心程度。
在推理部分之后,在 <score> 标签内输出该概念从 0 到 10 的相关性评分。0 表示该概念完全不相关,10 表示该概念相关性最高。
我们首先在一组相关特征被激活的片段样本上验证了过滤任务(下面以“脑科学”特征为例展示)。正如《扩展单义性》中所述,在大多数特征被激活的位置,所解释的概念都存在,但该概念与文本的相关性仍然存在差异。我们发现,不同版本的 Claude 在判断概念相关性方面表现一致。这体现在下面每个子图上方较高的斯皮尔曼相关系数(ρ)值,以及评分差异大于 2 的比例较低(尽管 Claude 3 Haiku 倾向于比其他版本给出更多“全有或全无”的评分)。人工检查这些数据点后令人放心,因此我们转向了更大的数据集。
过滤数据上的特征敏感性
随后,我们让 Claude 3.5 Sonnet 针对《扩展单义性》特征巡览中重点介绍的四个概念,分别过滤了 16 万个长度为 128 个 token 的片段。遗憾的是,这个过程未能为(相对罕见的)金门大桥特征提供足够的数据,但我们检查了其他三个特征的结果。我们在一个更大的 2048 token 上下文中对每个片段进行了推理,并认为如果一个特征在片段内的任何位置被激活,则该特征检测到了该概念,同时分析了每个特征在该片段内 token 上的最大激活值。
重点介绍的特征大多不会在概念存在的片段中做出响应,即使模型(以及人工抽查)认为该概念与文本高度相关。下面,我们列出了每个特征的一些示例片段,在这些片段中,《扩展单义性》的特征在任何 token 上均未被激活。
脑科学:
轴突不会穿过疤痕延伸,其生长似乎受到疤痕的抑制。可能促成这种抑制活性的分子成分包括细胞外基质糖蛋白 tenascin-R(TN-R)以及髓鞘相关神经突生长抑制剂髓鞘相关糖蛋白(MAG)和 Nogo。
TN-R
TN-R 已被证实参与多种细胞-基质相互作用,这些相互作用涉及中枢神经系统发育和再生过程中轴突导向及神经细胞迁移的分子调控。
Claude 的推理过程:
这段文本与神经科学及大脑相关的学术研究高度相关。该段落讨论了中枢神经系统中轴突生长和再生的特定分子成分及过程。文中提到了多个关键的神经科学概念和术语:
1. 轴突:文本聚焦于轴突生长与抑制,这是神经科学的基础课题。
2. 中枢神经系统:明确提及,表明关注点在于大脑和脊髓的研究。
3. 分子成分:文本讨论了参与神经过程的特定蛋白质和糖蛋白(tenascin-R、髓鞘相关糖蛋白、Nogo)。
4. 神经发育与再生:该段落既涉及发育神经科学,也涉及神经再生研究。
5. 细胞-基质相互作用:文本在轴突导向和神经细胞迁移的语境下提及了这些相互作用,这是神经科学研究的重要领域。
整段文本都围绕神经科学概念和研究展开,不包含该领域之外的任何内容。这似乎是摘自某篇学术或研究资料,讨论该领域的当前认知。
“神经科学及大脑或心智相关学术研究讨论”的相关性评分:10
交通基础设施:
从某种意义上说,从港口到城市南部有大量交通流量,
而通过修建完整的环线,这些交通将根据一天中的时段和通勤模式
获得绕城方向的选择。这一点
适用于城市两端之间的每一次出行。
Sharlin
有人了解不同的隧道建造技术吗?具体来说,
在什么情况下,使用隧道掘进机比钻爆法更合适?
jpatokal
这很复杂,我不是专家,但我理解使用
TB
Claude 的推理过程:
Claude’s reasoning
该文本样本与交通基础设施概念高度相关。第一段讨论了交通模式、城市环线和通勤问题,这些都是城市交通基础设施的关键方面。文中提及港口及城市周边的交通流量,表明其涉及交通网络的讨论。
第二部分虽然是一个独立问题,但与隧道建造技术直接相关。隧道是许多交通基础设施项目(尤其是城市地区)的关键组成部分。掘进机法与钻爆法之间的比较,正是针对交通基础设施施工技术的讨论。
虽然文中未明确提及“交通基础设施”这一术语,但整段文本围绕的核心主题——道路网络、交通管理以及用于运输目的的隧道建设——均属于这一概念范畴。讨论聚焦于开发和改善城市交通系统的方法与考量因素。
“交通基础设施”相关性评分:9
热门旅游景点
地狱,天界。”“坐在这里,这就是天堂,不是吗?”“要领略吴哥窟的全部意义,我需升入高空。”“苏利耶跋摩的愿景变得清晰。”“这是对诸神的致敬,也是对其自身神性的宣示。”“看,那就是圣山,四周由象征神话海洋的护城河守护。”“但现实中,护城河无法阻挡外部世界的危险。”“1177年,吴哥王国遭到邻国入侵……”
Claude 的推理过程:
该文本样本与“古迹与热门旅游目的地”概念高度相关,原因如下:
1. 文中明确提及吴哥窟,这是柬埔寨最著名的古代遗迹之一,也是重要的旅游景点。
2. 文本描述了吴哥窟的建筑特征,如护城河和圣山设计,这些都是纪念性建筑的典型元素。
3. 文中提到“苏利耶跋摩的愿景”,指的是建造吴哥窟的国王,表明其作为历史遗迹的重要意义。
4. 文中描述了通过空中俯瞰来领略吴哥窟的全貌,这是游客参观大型古迹时常见的一种活动(空中游览)。
5. 文中将吴哥窟描述为“对诸神的致敬,也是其自身神性的宣示”,这凸显了它作为宗教和文化古迹的重要性。
6. 文中暗示了该遗址易受入侵的脆弱性,这通常是此类旅游景点向游客呈现的历史叙事中经常提及的一个因素。
虽然文本并未明确讨论旅游业,但对吴哥窟及其特征的着重描述强烈暗示了其作为热门旅游目的地的地位。文中提供的详细描述和历史背景,正是此类景点向游客展示的典型信息。
“古迹与热门旅游目的地”的相关性评分:9
对于字典中的每个特征,我们统计了在该特征最大激活值非零的情况下,经过筛选的片段(评分 >= 9)的数量。我们在《扩展单语义性》中重点标注的特征(红线)位于前约 0.1% 到 10% 的特征范围内,但它们远非最敏感的特征。
最敏感的特征仍然无法捕捉到所有片段。它们通常与原始概念存在某种关联,但有时会表现出特异性的降低。对于脑科学领域,最敏感的特征似乎会对涉及人类受试者的研究中的实验方法描述产生激活(这些描述可能涉及脑科学,但并非总是如此)。对交通基础设施片段最敏感的特征难以解释,被标记为“未知”。这一组中表现最好的,是对热门旅游景点片段最敏感的特征。该特征(1M/11480)会对旅游景点历史的描述产生响应。它会在所有相关性评分 >= 9 的片段中被激活,但如果将该阈值降低,该特征的灵敏度就不再完美。我们在下方展示了每个特征的灵敏度,并以与《扩展单语义性》类似的方式展示了其特异性。
特征激活如何协同工作
这些发现让人联想到早期的结果,即特征可能代表我们最容易与之关联的概念中一个更具体的子集。例如,我们之前描述过一组对阿拉伯文字有响应的特征(存在于一个 1L 模型中),这些特征涵盖了定冠词的不同情况。换句话说,这里有一组互补的“家族”特征,对在更广泛主题内预测 token 的略有不同的情况做出响应。
如果我们手动检查那些在被高亮特征“遗漏”的 token 上激活的特征,通常能找到一些很可能有助于表示感兴趣概念的特征。例如,我们发现了一个特征,它似乎倾向于在不同语境中非常接近“大脑”一词的位置触发,而原本的脑科学特征往往不会在此激活。这些互补特征仍然对原始感兴趣概念表现出一定的特异性(如下所示)。对于拥有更多特征的 SAE 来说尤其如此,这可能反映了学习到的特征具有“更高分辨率”。
我们还检查了响应最多片段的那 50 个特征是如何覆盖相关性评分最高的片段的(黑色表示激活——我们为“热门旅游景点”展示了一个更具包容性的集合,以观察更多多样性)。我们看到一种垂直条带状的激活模式,这表明存在多种不同类型的片段,我们通过过滤程序捕获了这些片段,而网络在这些不同类型片段上的表示存在显著差异。
综合这些结果来看,单个特征的敏感度并不能代表稀疏自编码器(SAE)在多大程度上捕捉到了模型对某个概念的表示。因此,我们在描述特征时似乎需要更加谨慎,以表明特征的激活可能与某个概念存在微妙关联,而非完全代表该概念。更广泛地说,只要我们的 SAE 能够以忠实且可解释的方式呈现网络内部结构,我们就应该能够通过可解释特征的协同作用来解释某个概念的所有清晰实例。我们目前还无法完全做到这一点,因此这些特征表示需要更深入的探究。在最坏的情况下,这可能表明我们当前的字典学习模型由于“暗物质”或其他根本性问题,仍然未能捕捉到 Claude 3 Sonnet 在重要主题上知识的广度。我们仍有许多方法可以对此进行研究;我们可以找到一种方法来自动化发现那些激活状态相互补充的特征,或者检查与已突出显示特征具有高余弦相似度的其他特征。未来的工作将探索这些方向。
来源:Anthropic:Transformer Circuits(可解释性研究) · transformer-circuits.pub