OLMo Hybrid vs Transformer:混合模型在实义词上优势明显,但重复短语上几无优势
Which tokens does a hybrid model predict better?
通过对比7B参数的OLMo 3(Transformer)与OLMo Hybrid(混合架构),实验发现混合模型在大多数token上预测损失更低:对名词、动词、形容词等实义词优势明显(loss gap约0.04),功能词上gap约0.02,且在需上下文推理的代词指代上更好。但在重复出现的n-gram和闭合括号(如`}`)上,混合模型的优势几乎消失,Transformer凭借注意力机制更擅长从输入中直接检索精确信息。
OLMo 团队的 token 级别分析让人看清混合模型到底强在哪里,优势在名词动词等意义词,但在重复 token 上接近消失,这份洞察对做模型架构的人很有启发性。
模型对哪些类型的 token 预测得好,哪些又预测得不好?这个问题在混合架构的语境下尤其引人关注——这是一种已开始挑战标准 Transformer 的语言模型架构,我们一直在通过 Olmo Hybrid 对它进行研究。
混合模型在标准基准上可以媲美甚至超越 Transformer,但这些头条数字并不能揭示混合模型相对于 Transformer 究竟有哪些具体优势。
为了尝试揭示这些 token 层面的行为,我们最近开展了实验,将我们自己最强的 7B Transformer——Olmo 3——与混合模型 Olmo Hybrid 进行了正面比较。具体而言,我们以细粒度的方式比较了模型在不同类型 token(即作为 LLM 输入出现的信息单元)上的预测差异。
由于 Olmo 3 和 Olmo Hybrid 在架构之外被尽可能地打造得相似——在数据、tokenizer 和训练配方上都紧密匹配——它们预测上的任何差异在很大程度上反映的是架构本身。在 token 层面审视这些差异,使我们能够洞察混合模型相对于 Transformer 的具体优势。
我们的结果表明,这种混合架构的优势在许多 token 上是真实存在的,但并非所有 token 都如此。Olmo Hybrid 在承载语义的 token 上表现最强,比如名词、动词和形容词,以及在只能通过跟踪上下文才能预测的 token 上,比如代词指代的是哪个人。但混合架构的优势在那些仅仅重复输入中已有内容的 token 上几乎消失——即逐字复现前文出现的某个词或短语,答案就摆在那里可以直接查找。而这正是 Transformer 的强项所在。
注意力与循环,以及衡量二者的差异
语言模型由层层堆叠的重复层构成,每一层都利用周围的 token 来精炼对每个 token 的表示。
Transformer 在每一层都使用注意力。模型可以一次性直接调用所有先前的 token,权衡每个 token 与当前预测的相关程度。这使得注意力擅长精确回忆某个特定的先前 token,即使该 token 出现在输入的很远位置。问题在于,每个 token 都要与所有先前的 token 进行比较,因此注意力的开销随着输入增长而急剧攀升。此外,尽管注意力在回忆和聚合信息方面很强,但它在表示随时间顺序演变的信息方面也存在困难。
混合模型保留少量注意力层,但将其余部分替换为循环层。与注意力层不同,循环层从左到右读取 token,并携带一个固定大小的记忆,在读取过程中将每个新 token 折叠进记忆中,因此无论输入变得多长,处理每个 token 的成本都保持恒定。该记忆是压缩且有损的,因此循环层无法像注意力那样回溯获取某个精确的早期 token。但它非常适合持续记录模型在读取 token 过程中任何发生变化的内容,为注意力提供了一种互补的优势。
为了厘清注意力层和循环层各自的优势与劣势领域,我们向 Olmo 3 和 Olmo Hybrid 输入了多段文本:文章、维基百科条目、书籍和科学论文,以及 Python、HTML 和 LaTeX 等结构化文本。我们根据每个模型在给定样本中依据前序 token 预测每个 token 的表现进行评分。
两个模型看到相同的早期 token,并为每一个可能的下一个 token 分配概率。我们记录了它们各自对实际出现的下一个 token 所赋予的概率。随后,我们通过计算损失差(即两个模型之间的损失差异),逐 token 总结两个模型之间的差异。正损失差意味着混合模型更好地预测了真实的下一个 token。负损失差意味着 Transformer 预测得更好。
为了找出损失差可能集中的位置,我们进行了多项分析。首先,我们将每个 token 归入一个类别,并对这些类别内的损失差取平均值。由于原始平均值可能受到其他因素的干扰,例如某个类别的稀有程度或 token 在文本样本中的重复频率,我们用回归分析重新检验了每一种模式,在控制其他因素不变的情况下估计该类别自身的影响。
真实文本揭示了什么
我们发现,在大多数类型的 token 上,Olmo Hybrid 的损失都低于 Olmo 3,不过降低的幅度并不一致。
在散文文本中,最清晰的分界线存在于实词——承载意义的名词、动词和形容词——与虚词(如“the”“of”“is”)之间。混合模型对实词的预测优于 Transformer,损失差距约为 ,而在虚词上的差距则接近 。
尤其值得注意的是,在副词和形容词这类实词类别上,混合模型的优势格外显著,不过某些虚词类别,比如存在词(如“there”),也显示出混合模型的较大优势。简而言之,混合模型的优势在那些说明句子谈论什么的词上最大,而在任何模型都能几乎从语法中猜出的语法词上最小。
相比之下,我们发现了一些特定语境,在这些语境中混合模型相对于 Transformer 的优势消失了。首先是闭合括号,而非开启括号,这一模式在语言、代码和标记语言的各类括号中都稳定成立。为什么?众所周知,注意力足以表示括号匹配,这表明仅靠注意力就足以预测闭合括号。
混合模型优势几乎消失的第二个场景,是下一个 token 仅仅重复了段落中已经出现过的内容。我们通过查找重复的 n-gram 来识别这些情况:即一段文本中,完成某个序列的 token 此前已在同一段落中原样出现过。重复片段越长,混合模型的领先幅度就越小,直至趋近于零。
最后,受这些发现的启发,我们探索在预训练实验中对特定类型的 token 使用过滤损失作为评估手段,以更好地比较不同架构。我们使用了此前 Olmo Hybrid 工作中的三个 1B 参数模型:一个 transformer、一个混合模型,以及一个完全不含注意力机制的纯循环模型。
在非重复的承载语义的 token 上,混合模型和纯循环模型超过了 transformer,其中混合模型表现最佳。在重复的 token 上,纯循环模型——由于没有注意力机制可以回溯进行复制——落后于混合模型和 transformer。
因此,这些过滤后的 token 损失揭示了架构之间不同的细粒度差异,包括复制能力以及在实词上的差异,而且在训练早期就能显现出来,这是其他方式无法看到的。
这让我们处于何种境地
过滤后的 token 损失在 1B 预训练期间揭示了架构差异。transformer、混合模型和纯循环神经网络(RNN)在 WSD 退火检查点上的 token 损失曲线。
这项工作带来两点启示。
第一,单一的总体损失——即模型在所有 token 上的平均误差——过于粗糙,无法用来比较 transformer 和混合架构。仅针对那些检验特定模型能力的 token 来评估损失,才能揭示关键差异。
其次,具体到混合模型,我们发现了在开放类 token 上具有特定优势的证据,这或许与 RNN 层的状态跟踪能力有关。
作为下一步,我们正将这些发现纳入我们正在进行的混合建模工作。我们相信,最好的混合架构将来自于逐 token 地理解模型的每个组件擅长什么。我们希望这样的研究能帮助整个 AI 社区加深这种理解。
我们鼓励你阅读我们的完整报告,探索Olmo 3,试用Olmo Hybrid,并深入了解其相关的开放产物。
来源:Hugging Face:Blog(RSS) · huggingface.co