Circuits 更新 — 2025年10月
Circuits Updates — October 2025
Anthropic可解释性团队分享了多项研究进展。研究发现,从Haiku 3.5到Sonnet 4.5等模型中存在跨模态视觉特征,能够识别ASCII艺术和SVG代码中编码的语义概念,如眼睛、嘴巴、狗、猫等。这些特征依赖于视觉描绘的上下文环境,例如,SVG圆形元素只有在位于激活“面部”特征的更大结构中时才会激活“眼睛”特征。在生成过程中对部分特征进行引导,可以对应修改文本艺术的语义,例如将ASCII表情从皱眉转为微笑,或为SVG面部添加皱纹。研究还发现模型存在类似“人脸幻想”的倾向,会将形状解释为动物绘图的组成部分。这些特征对人类手绘的SVG同样有效。
为AI可解释性研究提供新实验方法,启发跨模态模型设计。
Transformer Circuits 线程更新——2025年10月 我们报告了Anthropic可解释性团队的一些发展中的想法,这些想法可能对活跃在该领域的研究人员有参考价值。其中一些是新兴的研究方向,我们预计在未来几个月内会发布更多相关内容。另一些则是我们希望分享的零散观点,因为我们不太可能就此专门撰写论文。我们恳请您将这些结果视为同事在实验室会议上花几分钟分享的一些想法或初步实验,而非一篇成熟的论文。 **新文章** 跨模态的视觉特征:SVG与ASCII艺术揭示跨模态理解 字典模型的数据点初始化 **跨模态的视觉特征:SVG与ASCII艺术揭示跨模态理解** 作者:Julius Tarng, Purvi Goel, Isaac Kauvar;编辑:Joshua Batson 和 Adam Jermyn **引言** 我们最近的论文探讨了大语言模型为感知文本的低层视觉属性(如换行约束和表格格式)而发展的机制。我们想知道模型是否也能感知文本中视觉编码的高层语义概念。例如,模型能否识别ASCII人脸中的眼睛?那用SVG代码渲染的眼睛呢?我们发现,在ASCII人脸上激活眼睛的同一个特征,也会在多种基于文本的模态(包括SVG代码和多种语言的散文描述)中为眼睛激活。这并不仅限于眼睛——我们发现了许多识别特定概念的跨模态特征:从ASCII或SVG人脸中的嘴巴、耳朵等小组件,到狗、猫等完整的视觉描绘。这些跨模态特征存在于从Haiku 3.5到Sonnet 4.5的模型中,位于在中间层训练的稀疏自编码器中。这些特征依赖于视觉描绘中的周围上下文。例如,一个SVG圆形元素只有在被激活“人脸”特征的更大结构包围时,才会激活“眼睛”特征。此外,在生成过程中对其中一部分特征进行引导,可以以与该特征语义含义相对应的方式修改基于文本的艺术作品,例如将ASCII的哭脸变成笑脸,或给SVG人脸添加皱纹。这项工作为模型用于处理和生成基于文本的视觉内容的内部表征提供了洞见。 **视觉描绘的特征表征** 我们首先让Claude生成ASCII和SVG笑脸,然后检查Haiku 3.5的特征激活情况。在所有情况下,我们都移除了所有注释或描述,包括那些可能识别出单个身体部位或整个图像为人脸的内容。我们发现的一个特征代表了“跨语言和描述的眼睛”这一概念,它在ASCII和SVG的笑脸插图中对应的形状上激活,也在多种语言中描述眼睛的散文上激活。这两个笑脸中的右眼都强烈激活了这个代表跨语言“眼睛”概念以及眼睛一般描述的特征。这些特征的激活依赖于周围上下文。一个单独的@符号不会激活“眼睛”特征,除非它前面有构成ASCII艺术的线条。在SVG中,“眼睛”特征只有在它们跟随一个确立人脸形状的圆形之后才会激活。我们发现,该特征的激活对各种上下文线索都很敏感,例如每行ASCII的字符数、SVG圆形的颜色以及父级SVG元素的宽度和高度。 第1行:我们测试了激活所需的最小上下文。一旦有足够的上下文让模型预测它们是脸部的一部分,眼睛特征就会亮起。在ASCII中,我们只需要头部的顶部两行;在SVG中,我们只需要一个圆形作为脸部。第2行:我们给模型尽可能多的上下文(例如完整人脸、黄色填充),以观察将眼睛移到上下文之外后特征是否还会激活。我们发现激活消失了,这证明了框架上下文的重要性。只需要一个下划线、带斜线的额头和两个@符号,就能提供足够的上下文让眼睛特征激活。 随后,我们使用来自更先进的Sonnet 4.5基础模型的特征,研究了一个更复杂的SVG示例。给定这个狗的SVG,我们发现了许多身体部位的特征,其中许多也在我们之前研究的ASCII人脸上激活。我们还发现了一些“运动神经元”特征,其特点是顶层logit效应与特定概念相关,例如一个“说‘微笑’”特征会在最常跟随“微笑”的token上激活。同一个特征在ASCII人脸上也激活了,如下图所示右下角所示。虽然随着模型对形状含义的置信度变化,许多特征在代码中有所重叠,但每个特征的最强激活都出现在正确的位置。值得注意的是,这里相同的眼睛、嘴巴和鼻子特征在SVG和ASCII上都激活了。在ASCII人脸上,我们还发现了一个“说‘微笑’”的运动神经元特征在微笑之前激活(我们稍后会再次提到),以及一个在定义额头的斜线上激活的大小感知特征。与较不先进的Haiku 3.5上的特征类似,这些特征对颜色或半径等表面属性变化也表现出相当的鲁棒性。当我们重新排列定义狗SVG眼睛的4行代码时,我们发现只有被移到SVG顶部的眼睛激活减弱了,这很可能是因为此时模型没有足够的上下文来确定该圆形代表一只眼睛。只要类似眼睛的形状出现在插图的初始定义之后(在此例中是作为躯干的第一个椭圆),模型就开始将形状解释为动物绘画的一部分,这是一种大语言模型版本的人脸空想性错视(人类倾向于在不存在的地方看到有意义的物体/模式,比如云中的动物,或麦片里的脸)。左眼被移到躯干上方后不再激活,但另一只眼睛和瞳孔继续激活。在两个样本中,耳朵和鼻子也作为潜在的眼睛激活。这种空想性错视效应在我们发现的同一插图的另一个特征中也有所体现,该特征代表“嘴巴和嘴唇”。它在跟随眼睛定义之后的最像嘴巴的元素上激活。形成嘴巴的左下颌激活最强。请注意,这个SVG中共有4个元素。虽然该特征在形成主要尾巴的第一个路径上略有激活,但一旦路径数据开始,激活就消失了,表明模型可以通过其属性区分尾巴和嘴巴。如果我们把定义嘴巴和尾巴的路径从定义眼睛的4个圆形移开,那么红色的项圈现在作为嘴巴/嘴唇激活最强。与尾巴不同,激活在整个项圈定义中都很高,甚至延续到了铃铛上!这是因为红色圆角矩形在另一幅插图中很可能就是一张嘴巴吗?还是仅仅因为(在代码和空间上的)邻近性?诸如此类的问题留待未来工作解决。当所有曲线都从眼睛移开(左曲线移到顶部,右曲线移到底部)时,嘴巴在项圈上激活,项圈是一个红色的圆角矩形,可以说非常像嘴巴。 我们还好奇,如果使用人类创建的SVG,是否会看到相同类型的激活。结果发现——是的!对于这个定制的、手绘的狗,我们发现了类似的“眼睛”、“嘴巴”、“腿”、“头部”……特征。像之前大语言模型生成的狗一样,这里的激活对顺序很敏感。这个人类创建的狗最初绘制时鼻子元素在眼睛之前,并没有激活任何与鼻子相关的特征。将SVG代码中的鼻子元素移到眼睛之后,就揭示了潜在的特征!作为额外收获,我们还检查了一个由Simon Willison首次推广的、用于测试模型艺术能力的“骑自行车的鹈鹕”SVG的特征。我们发现代表“自行车”、“轮子”、“脚”、“尾巴”、“眼睛”和“嘴巴”等概念的特征在SVG代码的相应部分激活。一个“柔软/蓬松纹理”特征在翅膀上激活。我们还发现了“鸟”的运动特征,尽管激活程度非常低。 **利用语义特征进行视觉引导** 我们已经证明,特征可以代表SVG和ASCII艺术中具有语义意义的元素。但是,除了感知之外,特征是否也能塑造视觉描绘的生成呢?这些能力并不一定等同。一个在“微笑”出现时可靠激活的感知特征,可能包含也可能不包含生成类似微笑几何形状所需的运动信息。为了研究这一点,我们创建了一个特征引导任务。我们给Sonnet 4.5基础模型以下提示词: 人类:制作一个与此风格相似的简单SVG。 助手: 该提示词向模型提供了下方简单SVG人脸的代码作为风格参考,并要求它制作一个类似的。 提示词中提供给模型的原始SVG 与之前的例子一样,代码中不包含任何明确的注释或标签来提示模型它是什么。在没有引导的情况下,模型生成了如下所示的基线输出,它忠实地遵循了示例的结构——一个居中的圆形人脸,带有简单的特征——仅在与风格参考的几何形状上有细微变化,即生成的笑脸在脸上位置更低。 以强度0引导特征时的模型响应。它复制了原始的笑脸SVG,尽管有一个细微的变化:笑脸在脸上位置更低。 然后,我们用不同的特征对模型进行引导,发现它可以产生有意义的语义变化。我们通过寻找与特定概念(如“微笑”、“眼睛”或“猫”)相关的纯文本句子上的激活来发现这些特征。对“微笑”特征进行负向引导,结果生成了一个带有哭脸的SVG。同一个特征也类似地使我们之前研究的ASCII笑脸产生了哭脸。 对运动神经元特征“说‘微笑’”进行负向引导时的模型响应。这些运动特征通常在增加引导强度时显示出平滑的渐变。在默认的笑脸和上面的哭脸之间,模型生成了一个嘴巴呈直线的“中性脸”😐作为过渡。对“说‘猫’”特征进行正向引导,会添加耳朵、胡须和口鼻部;对特定身体部位特征进行正向引导,则会引入或强调这些元素(例如,“说‘皱纹’”特征会给人脸添加皱纹)。生成的SVG保持了示例的整体风格,例如大胆的颜色和圆形几何形状,但包含了新的或改变的元素以匹配特征的语义上下文。 **结论** 总之,我们的发现表明,许多为概念的纯文本描述而激活的特征,也会为这些概念的基于文本的视觉描绘而激活,并且能够生成这些描绘。我们通过以下方式证明了这一点:(1) 利用特征识别基于文本的视觉格式(如ASCII和SVG)中的实体,以及 (2) 引导特征以转换视觉描绘,例如将笑脸变成哭脸,将人脸变成独角兽。这些实验引出了几个问题。首先,我们的实验主要集中在具体实体上。模型是否包含捕捉更高层、更抽象语义(如美学或艺术风格)的特征?对这些特征进行引导是否能产生有意义的输出?……
来源:Anthropic:Transformer Circuits(可解释性研究) · transformer-circuits.pub