跳到正文
北京时间
原文
HuggingFace Daily Papers(社区热门论文)·· 2026-05-21精选AI 评分70

Gated DeltaNet-2:解耦线性注意力中的擦除与写入

Gated DeltaNet-2: Decoupling Erase and Write in Linear Attention

AI 导读

线性注意力通过固定循环状态替代无界缓存,但面临精确编辑压缩记忆的挑战。现有模型如Delta-rule与KDA使用单一标量门同时控制“擦除”与“写入”两个操作。本文提出Gated DeltaNet-2,引入独立的通道级擦除门和写入门,实现了这两个操作的解耦,从而泛化并改进了前代模型。该模型在1.3B参数规模、100B tokens训练下,在语言建模、常识推理等任务中表现优异,尤其在长上下文RULER多键检索基准上优势显著。

推荐理由

把线性注意力里擦除和写入的解耦,像给模型装了独立刹车和油门,在长上下文检索上直接拉开差距,做架构的值得细读。

正文 · AI 翻译

线性注意力机制用固定大小的循环状态替代了 softmax 注意力的无限缓存,将序列混合复杂度降至线性时间,并将解码过程的内存消耗降为常数。难点不仅在于遗忘什么,更在于如何编辑这个压缩后的记忆而不打乱已有的关联。Delta 规则模型在写入新值之前会先读取当前值,而 Kimi Delta 注意力(KDA)则通过逐通道衰减来强化遗忘。但主动编辑仍然使用单个标量门控来控制两个不同的事情:在键(key)侧擦除多少旧内容,以及在值(value)侧提交多少新内容。我们提出了 Gated DeltaNet-2,它通过继承自适应遗忘和逐通道衰减来泛化 Gated DeltaNet 和 KDA,同时解决了它们共同的局限性——擦除与写入之间的标量绑定。Gated Delta Rule-2 通过逐通道擦除门控 b_t 和逐通道写入门控 w_t 将这两个角色分离,当两个门控坍缩为同一标量时退化为 KDA,当衰减也坍缩时退化为 Gated DeltaNet。我们推导了快速权重更新视角、一种将逐通道衰减吸收为非对称擦除因子的分块 WY 算法,以及一种保留高效并行训练能力的门控感知反向传播。在 100B FineWeb-Edu token 上训练的 1.3B 参数规模下,Gated DeltaNet-2 在语言建模、常识推理和检索任务中,相比 Mamba-2、Gated DeltaNet、KDA 和 Mamba-3 变体取得了最强的综合结果。其优势在长上下文 RULER 大海捞针基准测试中最为显著,在评估的多键检索设置上有所提升,并且在循环和混合两种设置下均保持强劲表现。代码已开源在 https://github.com/NVlabs/GatedDeltaNet-2。

来源:HuggingFace Daily Papers(社区热门论文) · arxiv.org