Zero-Mem:为 LLM 智能体实现零 token 记忆操作
Zero-Mem: Zero-Token Memory Operations for LLM Agents
Zero-Mem 提出零 token 记忆操作,除最终问答外,记忆构建、检索与校准等所有环节均不调用 LLM 或消耗其输入输出 token,仅用编码器计算。该方法保留原始交互轨迹,通过实体-上下文图与时间层级双视图组织证据,在长记忆与长上下文问答基准上达到竞争性表现,并将记忆操作时间成本较最快基线降低 57.6%。代码将在同行评审后公开。
Zero-Mem将记忆操作与LLM完全解耦,通过实体图和时序层级互补检索,在LoCoMo和HotpotQA上全面超越生成式记忆基线,效率提升明显,对Agent记忆系统设计有直接借鉴意义。
肖一林
、朱哲涵
、张玉静
、陈锦
、洪子晋
、庄璐瑶
张庆刚
、陈圣远
欧阳晓草
、任凌飞
、黄啸
摘要
大语言模型智能体需要记忆才能在长时间交互中保持行为一致性,然而许多系统依赖额外的LLM调用来操作这些记忆。生成中间记录并协调其检索会带来持续的token和时间开销,而省略或合并细节则可能掩盖原始证据。我们质疑:结构化记忆访问是否真的需要生成过程?Zero-Mem 提出了零token记忆操作:除最终问答环节外,没有任何步骤调用LLM或消耗LLM输入/输出token;编码器计算单独核算。Zero-Mem 保留原始交互轨迹作为其记录来源,并以两种互补方式组织这些轨迹:实体-上下文图揭示跨交互的连接,而时间层级结构则保留对话的局部性和会话状态。对于每个查询,Zero-Mem 权衡这两种视图,从两者中检索,并遵循其结构来恢复支持性关系或周围上下文。确定性校准首先丢弃冲突证据,然后确保阅读器的答案基于检索到的轨迹。只有最终问答阅读器会调用LLM。在长记忆和长上下文问答基准测试中,Zero-Mem 在消除记忆操作中的LLM调用和LLM token消耗的同时,实现了具有竞争力的性能。在相同的最终问答阅读器和上下文预算下,相对于最快的对比基线,它将记忆操作的时间成本降低了57.6%。消融实验支持了这两种视图及其查询依赖协调的贡献。总体而言,结果表明结构化智能体记忆无需生成过去的中间表示。同行评审后,代码和实现细节将在 https://github.com/TheMoon0815/Zero-mem 提供。
引言
大语言模型(LLM)智能体越来越多地运行在长时间交互场景中,不断积累对话内容、操作行为、工具观测结果以及任务产出(Luo et al. 2025; Du et al. 2026; Xi et al. 2025)。因此,其可靠性不仅取决于对当前输入的推理能力,还取决于能否从不断增长的交互历史中恢复出正确的证据。记忆系统必须在跨会话保留信息的同时,防止无关或过时的痕迹主导当前决策。核心挑战因此不再仅仅是存储更多上下文,而是当与正确实体、会话和时间状态相关的证据变得相关时,如何将其恢复出来(Zhang et al. 2025b; Hu et al. 2026b; Yang et al. 2026; Wu et al. 2025)。
在智能体记忆与智能体化结构化检索系统中,语言模型已被用于对经验进行总结或反思、构建层级化抽象与图索引,以及生成或演化相互关联的记忆记录(Zhong et al. 2024; Salama et al. 2025; Sun et al. 2026; Gutierrez et al. 2024; Anokhin et al. 2025; Zhang et al. 2025a)。这些转换虽然能使大规模历史记录更易于访问,但也将记忆管理变成了一种反复出现的生成式工作负载。当生成的抽象表示介入后续检索时,被省略的细节、被合并的主体或被模糊化的时间更新,都可能削弱对原始交互的可追溯性。相反的策略则是保留完整历史,直接从原始痕迹中进行检索(Yan et al. 2025; Xu et al. 2022)。尽管这种方式保留了源证据,但扁平化的词法检索或稠密检索可能会混淆来自不同用户、会话或时间状态下语义相似的痕迹,并且当支撑证据分散在多次交互中时,检索也可能失效。因此,有效的记忆既需要忠实的保存,也需要结构化的、以查询为条件的证据选择。
近期系统只是降低了这种依赖,而非彻底消除。SimpleMem(Liu 等人,2026)通过语义结构化压缩、在线语义综合和意图感知检索规划来提升 token 效率,而 LightMem(Fang 等人,2026)则将多项记忆操作从大型 LLM 转移到专门的轻量级语言模型上,并将在线检索与离线整合分离。这些方法降低了生成开销,但并未针对“最终问答是唯一依赖 LLM 的阶段”这一记忆流水线进行优化。因此我们提出疑问:智能体记忆系统能否在最终问答之外的每一个操作环节中消除 LLM 调用,同时保留超越平面相似性检索的结构化访问能力?我们将这种运行模式称为零 token 记忆操作:记忆构建、组织、路由、检索、证据闭合,以及读前证据校准和读后答案校准均不调用 LLM,也不消耗任何 LLM 输入或输出 token。编码器计算和最终 QA 推理单独核算。
我们提出 Zero-Mem,它将记忆操作重新定义为对带有溯源信息的交互轨迹进行结构化证据选择。Zero-Mem 并非用生成的抽象内容取代历史记录,而是保留原始轨迹作为权威记录来源,并在此基础上衍生出两种互补的、非生成式的视图。实体-上下文图捕获观察到的共现关系和轨迹邻接性,用于关系型访问;而按时间排序的层级结构则保留对话局部性和会话级状态。两种视图都解析到相同的、带有溯源信息的源单元。在查询时,一个轻量级配置文件根据查询的结构需求协调这两种视图。它们的排序结果被融合,证据闭包用关系连接和周围轨迹上下文补充主要候选。随后,确定性证据校准生成紧凑的证据集,用于最终问答。阅读器是唯一依赖 LLM 的阶段;之后,确定性答案校准应用证据支持、类型和格式检查,而无需调用另一个模型。因此,在原始轨迹与暴露给阅读器的证据之间,没有任何生成的记忆介入。R(q)
在长上下文和长记忆问答基准测试中,Zero-Mem 在实现有竞争力性能的同时,将记忆操作的 LLM 调用和 token 消耗降至零。在采用相同的最终问答阅读器和等效上下文预算的情况下,与最高效的基线相比,Zero-Mem 将记忆操作延迟降低了 57.6%,消融研究进一步验证了每个核心模块的有效性。我们的贡献有三点:
-
我们定义了零 token 智能体记忆,这是一种运行机制,其中最终问答之外的每项操作都使用零 LLM 调用和零 LLM 输入或输出 token,从而将记忆操作成本与最终阅读器推理分离。
-
我们引入 Zero-Mem,这是一个保留溯源的框架,它协调关系型和按时间排序的视图,直接在原始交互轨迹上进行结构化证据选择。
-
我们在多个长时记忆基准上评估了 Zero-Mem,证明了其在零记忆操作 LLM 成本下具有竞争力的性能,并分析了其互补核心模块的贡献。
相关工作
智能体记忆系统负责组织、更新和检索不断增长的交互相史(Yao 等,2023;Schick 等,2023;Wang 等,2024;Park 等,2023;Shinn 等,2023)。Zep(Rasmussen 等,2025)构建了一个具有时间感知的知识图谱记忆层,包含情景子图、语义实体子图和社区子图,并采用双时间模型跟踪事件时间和摄入时间。Mem0(Chhikara 等,2025)通过 LLM 工具调用增量式提取和更新记忆,支持添加、更新、删除和无操作等操作;Mem0g 使用有向标记图对实体关系进行建模。A-Mem(Xu 等,2025)遵循 Zettelkasten 笔记法,构建带有关键词、标签和上下文描述的结构化记忆笔记,同时动态关联相关记忆。MemoryOS(Kang 等,2025)采用受操作系统启发的架构,包含短期、中期和长期存储,支持分页和基于流行度的更新。GAM(Yan 等,2025)在即时记忆范式下将轻量级离线记忆与在线深度研究相结合,以更高的查询时成本构建任务特定上下文。CompassMem(Hu 等,2026a)将经验组织为以事件为中心的记忆图,并为复杂问题提供显式关系。LightMem(Fang 等,2026)将记忆更新与在线推理解耦,应用预压缩和主题分割来降低延迟和 token 成本。SimpleMem(Liu 等,2026)结合语义结构化压缩、在线语义综合和意图感知检索规划来减少 token 消耗。这些系统共同提升了记忆效率,但其中许多系统仍在记忆生命周期内保留了生成式处理。
预备知识
一个 LLM 智能体会积累一段过往交互的历史记录,其中每条轨迹单元可能包含用户消息、助手回复或动作、工具观察结果、时间戳、发言者以及会话元数据。给定当前查询时,智能体记忆系统会从历史记录中检索相关信息,以构建证据集。ℋ=(s1,…,sT)siq
| R(q)=Memory(q,ℋ). | (1) |
随后,一个阅读型 LLM 会利用检索到的证据来生成答案:
| a=Reader(q,R(q)). | (2) |
在本研究中,Zero-Mem 通过非生成式的记忆构建、组织、检索、路由和校准来实现记忆功能。
方法
Zero-Mem 概览
Zero-Mem 通过零 token 证据选择来实现记忆功能。它保留原始交互轨迹作为权威记忆来源,并在此基础上构建非生成式检索结构。Zero-Mem 由四个组件构成:保留溯源信息的零 token 记忆基座、查询条件证据路由、双视图证据检索与闭合,以及确定性证据校准。图视图恢复关系型证据,而层级视图则保留局部、时间及会话上下文。路由控制两者的相对优先级,闭合操作用结构相关的证据补充检索候选集,校准则移除不一致或缺乏支持的内容。所有记忆操作均为零 token 消耗,只有最终的阅读器生成答案。
保留溯源信息的零 token 记忆基座
Zero-Mem 并不会用生成的抽象内容来替代原始历史记录。每个派生单元都保留其原始文本,以及来源标识符、会话时间、边界标识符和其他可用元数据。因此,检索到的证据始终可追溯到实际观察到的交互,而非模型生成的记忆陈述。
关系追踪图。
Zero-Mem 对每个上下文单元应用非生成式命名实体识别(NER)模型(如 spaCy),并根据检测到的实体构建一个基于观察结果的实体–上下文图:
| G=(Vd∪Ve,Ede∪Edd), | (3) |
其中 和 分别表示上下文节点和实体节点。 包含实体–上下文共现边, 包含相邻上下文单元之间的邻接边。当实体 在上下文单元 中被检测到时,即添加一条实体–上下文边,其权重为:VdVeEdeEddedi
| w(di,e)=c(e,di)∑e′∈ℰ(di)c(e′,di). | (4) |
其中 是 在 中的出现频率。 表示在 中检测到的实体集合。相邻的上下文单元也会被连接起来,以保留局部连续性。该图记录的是观察到的共现关系和可追踪的邻接关系,而非生成语义三元组或推断出的关系。c(e,di)ediℰ(di)di
分层追踪单元。
仅靠图结构无法保留交互的局部顺序和时间状态。Zero-Mem 在多个粒度上组织追踪记录:
| 𝒯(ℋ)=Uturn∪Uwindow∪Uepisode∪Ulocal. | (5) |
轮次(Turn)保留原子话语,窗口(Window)保留短程上下文,片段(Episode)则根据语义连续性以及可用的时间或会话边界,将相邻窗口分组为连贯的事件区域。局部跨度(Local span)保留候选轮次的紧邻上下文,在所选证据需要周围语境时使用。所有单元都继承其底层原始追踪记录的来源信息。
词法与稠密访问信号。
Zero-Mem 还使用词法统计(BM25)和稠密嵌入向量(BGE-M3)对追踪单元建立索引。词法信号用于识别精确的名称、日期、数字、标题和短语,而稠密信号则在表面重叠较弱时提供语义锚点。这些表示仅用于索引、种子化和评分;它们不会生成或改写记忆内容。
查询条件化证据路由
对于每个查询,Zero-Mem 都会构建一个轻量级画像
| ϕ(q)={ | subject,keywords,answer-type, | (6) | ||
| temporal-cues,boundary}. |
主题和关键词提供内容锚点,而答案类型和时间线索则刻画了所请求证据的结构性要求。在可用的情况下,边界限定了允许的交互范围。这些信号从查询和可用元数据中获取,不使用金标准答案,并由路由和后续证据选择共享。该画像决定哪个证据视图获得优先权:
| Route(q)∈{relational,local}. | (7) |
关系路径表示图优先,而局部路径表示层级优先。路由决策基于确定性的查询结构信号,包括问题形式、时间或聚合要求,以及主题锚点的可用性。两种视图都在完整模型中执行;路由主要控制它们在融合过程中的相对权重。设 表示全局共享的主视图权重。关系型查询分别将权重 和 分配给图视图和层级视图,而局部型查询则反转这些权重。ρρ1−ρ
双视图证据检索
图证据传播。
图视图首先将从查询中提取的每个实体与其最相似的已观测图实体 对齐。其初始激活为:e^e
| η0(e∣q)=cos(𝐞,𝐞^),e=argmaxe′∈Vecos(𝐞′,𝐞^), | (8) |
其中 和 是它们的稠密表示。当对齐实体可用时,稠密上下文匹配提供上下文先验;当未检测到任何对齐实体时,则提供直接的回退排序,而词汇和短语信号则细化所得的上下文排序。Zero-Mem 随后通过相关的共现句子,将这些匹配图实体的激活进行扩展。设 表示包含实体 的句子集合。实体 的传播激活为𝐞𝐞^Z(e)ee′
| ηt+1(e′)=∑e∈ℰtηt(e)∑z∈Z(e)∩Z(e′)sim(q,z), | (9) |
其中 是传播步数, 是第 步的活跃图实体集合,其中 由匹配实体组成, 表示查询与句子 之间的稠密相似度。因此,当一个实体在与查询相关的句子中与已激活的图实体共现时,它会获得高分。传播后的实体激活和稠密上下文先验被组合成一个查询特定的重置向量 。个性化 PageRank 随后将该证据在关系图上进行分布:tℰttℰ0sim(q,z)qz𝐫q
| 𝝅q=(1−γ)𝐫q+γP⊤𝝅q, | (10) |
其中 是查询条件下的平稳节点分数向量, 是结合了传播后的实体激活与稠密上下文先验的归一化重置分布, 是行归一化的图转移矩阵, 是阻尼因子。上下文节点上的 PageRank 值构成了图视角的排序结果。最后,精确的词法与短语匹配被用于细化该排序,以处理名称、日期、数值、标题和引述表达。𝝅q𝐫qPγ∈(0,1)
层级化证据检索。
层级化视图通过从粗到细的搜索来检索证据。每个单元都通过联合考量其与查询的语义相关性及其与查询画像的结构兼容性来进行评估。兼容性信号包括主题一致性、时间有效性、边界一致性、预期答案类型以及词法或短语支持。这些信号被用于细化语义排序,而非被视为独立生成的证据。检索过程从事件片段推进到时间窗口,再到单个对话轮次:
| Uepisode→Uwindow→Uturn→Ulocal. | (11) |
事件片段识别相关的事件区域,时间窗口将搜索范围缩小到局部上下文,对话轮次则揭示原始证据。当所选对话轮次依赖于邻近信息时,其局部片段会被添加进来,以保留直接的叙述或对话状态。与图传播不同,该视图明确维护了顺序性、时间局部性和会话级上下文。
| 模型 | 方法 | LoCoMo | |||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|
| 单跳 | 多跳 | 时间 | 开放域 | 平均 | |||||||
| F1 | BLEU-1 | F1 | BLEU-1 | F1 | BLEU-1 | F1 | BLEU-1 | F1 | BLEU-1 | ||
| GPT-4o-mini | LONG-LLM | 46.68 | 37.54 | 29.23 | 22.76 | 25.97 | 19.42 | 16.87 | 13.70 | 37.31 | 29.57 |
| RAG | 52.45 | 47.94 | 27.50 | 20.13 | 46.07 | 40.35 | 23.23 | 17.94 | 44.73 | 39.40 | |
| HippoRAG | 54.84 | 48.84 | 33.59 | 25.46 | 48.17 | 39.32 | 28.59 | 23.89 | 47.92 | 41.02 | |
| A-Mem | 44.65 | 37.06 | 27.02 | 20.09 | 45.85 | 36.67 | 12.14 | 12.00 | 39.65 | 32.31 | |
| Mem0 | 47.65 | 38.72 | 38.72 | 27.13 | 48.93 | 40.51 | 28.64 | 21.58 | 45.10 | 35.90 | |
| MemoryOS | 48.62 | 42.99 | 35.27 | 25.22 | 41.15 | 30.76 | 20.02 | 16.52 | 42.84 | 35.54 | |
| LightMem | 41.79 | 37.83 | 29.78 | 24.80 | 43.71 | 39.72 | 16.89 | 13.92 | 38.44 | 34.36 | |
| SimpleMem | 53.48 | 47.59 | 36.93 | 28.80 | 51.30 | 45.29 | 21.78 | 15.67 | 48.02 | 41.68 | |
| CompassMem | 57.36 | 49.79 | 38.84 | 27.98 | 57.96 | 50.51 | 26.61 | 20.01 | 52.18 | 44.09 | |
| GAM | 57.75 | 52.10 | 42.29 | 34.44 | 59.45 | 53.11 | 33.30 | 26.97 | 53.75 | 47.51 | |
| Zero-Mem | 66.65 | 60.53 | 41.61 | 32.92 | 61.97 | 57.45 | 35.52 | 30.47 | 59.15 | 52.96 | |
| Qwen2.5-14B | LONG-LLM | 46.05 | 39.56 | 32.08 | 24.46 | 30.51 | 24.45 | 14.89 | 11.41 | 38.31 | 31.90 |
| RAG | 47.87 | 42.79 | 26.38 | 19.54 | 30.78 | 25.97 | 14.16 | 10.52 | 38.27 | 33.01 | |
| HippoRAG | 42.45 | 37.14 | 27.57 | 20.62 | 30.66 | 26.33 | 19.74 | 15.81 | 35.85 | 30.53 | |
| A-Mem | 33.75 | 30.04 | 22.09 | 15.28 | 27.19 | 22.05 | 13.49 | 10.74 | 28.98 | 24.47 | |
| Mem0 | 42.58 | 35.15 | 31.73 | 24.82 | 28.96 | 26.24 | 15.03 | 11.28 | 36.04 | 29.91 | |
| MemoryOS | 46.33 | 41.62 | 38.19 | 29.26 | 32.24 | 27.86 | 20.27 | 15.94 | 40.28 | 34.89 | |
| LightMem | 34.92 | 31.22 | 25.45 | 19.61 | 32.03 | 27.70 | 15.81 | 11.81 | 31.39 | 27.15 | |
| SimpleMem | 51.11 | 45.47 | 34.04 | 25.65 | 48.46 | 36.07 | 23.41 | 21.45 | 45.71 | 38.39 | |
| CompassMem | 61.02 | 55.93 | 42.32 | 32.66 | 47.18 | 39.69 | 25.88 | 22.01 | 52.52 | 46.17 | |
| GAM | 58.93 | 53.74 | 42.96 | 34.48 | 51.52 | 44.43 | 30.63 | 26.04 | 52.70 | 46.55 | |
| Zero-Mem | 64.09 | 58.19 | 44.06 | 35.13 | 58.34 | 53.61 | 37.57 | 32.46 | 57.57 | 51.41 | |
双视图证据闭合
Zero-Mem 首先通过查询级分数归一化来对齐图视图与层级视图的排序。对于每个视图,v∈{g,h}
| S^v(d)={0,d is absent from view v,Sv(d)−SvminSvmax−Svmin,Svmax>Svmin,1,Svmax=Svmin, | (12) |
其中 和 是在视图 返回的候选项上计算得到的。归一化后的排序通过双视图路由系数进行融合:SvminSvmaxvρ
| Sfuse(d)=ρS^primary(d)+(1−ρ)S^secondary(d). | (13) |
图视图主要面向关系型查询,而层级视图主要面向局部查询。设 表示融合后保留的主要证据。Zero-Mem 用来自两个视图的有界、查询条件化的支持信息对其进行增强:M(q)
| C(q)=Dedup(M(q)∪𝒩g(M(q))∪𝒩h(M(q))). | (14) |
此处, 提供具有关系或桥接支持的额外图排序上下文,而 则恢复相邻轮次或局部片段;当无需额外补充时,任一支持集均可为空。重复项通过共享单元标识符或可用的来源溯源信息进行合并,最终得到一个兼具关系支持与局部支持的紧凑证据集。𝒩g𝒩h
确定性证据校准
Zero-Mem 在证据层面和答案层面均应用确定性校准。在证据闭合之后,它会移除违反溯源或查询边界约束的候选项,并按主题、时间及答案类型兼容性对剩余证据进行排序:
| R(q)=Rankϕ(q)(Filter(C(q),ϕ(q))). | (15) |
在这里,`enforces` 强制执行硬约束,而 `orders` 则在不改变其内容的前提下对可采纳的证据进行排序。阅读器根据 `orders` 产生初始答案。对于允许确定性检查的答案形式,Zero-Mem 会提取证据局部候选并校准输出:FilterRankϕ(q)a0R(q)
| A(q) | =Extract(R(q),ϕtype(q)), | (16) | ||
| a | =Calibrate(a0,q,A(q),R(q),ϕ(q)). |
校准在输出受支持且格式良好时予以保留;否则,它会应用保留证据的归一化、抽取式缩短或逐项列表修剪。标量答案仅在被唯一且类型兼容的候选替换时才会发生;如果没有可用的确定性修正,则保留原答案。a0A(q)a0
| 方法 | 答案质量 | 记忆操作开销 | ||||
|---|---|---|---|---|---|---|
| F1 分数 | BLEU-1 | Tokens | Tokens / 查询 | 时间(秒) | 时间 / 查询(秒) | |
| SimpleMem | 48.02 | 41.68 | 14,096,246 | 9,153.41 | 8,365.38 | 5.43 |
| LightMem | 38.44 | 34.36 | 877,086 | 569.54 | 788.76 | 0.51 |
| GAM | 53.75 | 47.51 | 28,570,674 | 18,552.39 | 9,237.25 | 6.00 |
| Zero-Mem(我们的方法) | 59.15 | 52.96 | 0 | 0 | 334.77 | 0.22 |
| 相对增益/降幅 | 10.0%↑ | 11.5%↑ | 100.0%↓ | 100.0%↓ | 57.6%↓ | 57.6%↓ |
实验
实验设置
数据集。
我们在两个互补的基准上评估 Zero-Mem。1) LoCoMo(Maharana 等人,2024)是一个广泛采用的基准,用于评估对话智能体在跨越多会话的长期交互中的长期记忆能力。遵循先前工作(Yan 等人,2025),我们评估其单跳、多跳、时间推理和开放域任务。2) HotpotQA(Yang 等人,2018)是一个基于维基百科的多跳问答基准。遵循 MemAgent(Yu 等人,2026),我们采用精选的记忆评估变体,该变体将黄金支持文档与干扰段落相结合。改变干扰项的数量可产生 56K、224K 和 448K tokens 三种上下文长度设置。
基线。
我们将对比方法分为两组。1) 无记忆基线包括 LONG-LLM 和 RAG。LONG-LLM 使用滑动窗口将交互历史划分为多个文本块,独立处理每个块,并返回置信度最高的候选答案。RAG 将历史记录划分为 2,048 个 token 的块,并通过语义相似性检索前五个块作为答案生成的支撑上下文。2) 基于记忆的基线包括 A-Mem (Xu et al. 2025)、Mem0 (Chhikara et al. 2025)、MemoryOS (Kang et al. 2025)、LightMem (Fang et al. 2026)、SimpleMem (Liu et al. 2026)、CompassMem (Hu et al. 2026a) 和 GAM (Yan et al. 2025)。这些方法在历史信息上维护专门的记忆结构,并在推理期间访问它们以支持基于记忆的任务。其他基线描述见附录。
实现细节。
我们使用 GPT-4o-mini 和 Qwen2.5-14B-Instruct 作为 Zero-Mem 和所有基线的主干大语言模型,分别代表闭源和开源设置。在每种设置中,所有方法都使用相同的最终问答读取器和等效的上下文预算,因此比较隔离了它们记忆管道的差异。阻尼因子和双视角路由系数均设置为 0.6。所有实验都在配备 NVIDIA RTX 4090 GPU 的通用硬件环境中执行。为了进行受控比较,我们将每种方法的检索项数量上限设为五个。我们遵循先前工作中建立的评估指标和协议 (Yan et al. 2025; Liu et al. 2026)。γρ
| 方法 | GPT-4o-mini | Qwen2.5-14B | ||||
|---|---|---|---|---|---|---|
| 56K | 224K | 448K | 56K | 224K | 448K | |
| LONG-LLM | 56.56 | 54.29 | 53.92 | 49.75 | 46.82 | 43.17 |
| RAG | 52.71 | 51.84 | 54.01 | 51.81 | 46.72 | 48.36 |
| A-Mem | 33.90 | 30.22 | 31.37 | 27.04 | 25.65 | 22.92 |
| Mem0 | 32.58 | 31.74 | 27.41 | 30.12 | 32.44 | 26.55 |
| MemoryOS | 26.47 | 23.10 | 24.16 | 24.58 | 30.25 | 23.13 |
| LightMem | 40.93 | 35.28 | 30.02 | 37.30 | 27.72 | 28.25 |
| GAM | 63.22 | 64.56 | 59.81 | 64.07 | 55.99 | 57.87 |
| Zero-Mem | 72.07 | 66.43 | 65.04 | 68.58 | 65.47 | 61.02 |
主要结果
LoCoMo。
表1报告了在LoCoMo上的结果,该基准评估跨多轮会话的记忆能力,并强调对实体特定信息、时间信息及跨会话信息的恢复。Zero-Mem在两种LLM阅读器下均取得了最佳的平均F1和BLEU-1分数。与整体最强的基线模型GAM相比,在使用GPT-4o-mini时,Zero-Mem的平均F1和BLEU-1分别提升了5.40和5.45个百分点;在使用Qwen2.5-14B时,则分别提升了4.87和4.86个百分点。在使用GPT-4o-mini时,Zero-Mem在单跳、时间性和开放域问题上表现领先,同时在多跳问题上与GAM保持竞争力。在使用Qwen2.5-14B时,Zero-Mem在各类问题和各项指标上均排名第一。与LONG-LLM和RAG相比,Zero-Mem在时间性和开放域问题上的显著优势表明,仅依靠长上下文访问或平面相似性检索不足以实现对状态敏感和边界敏感的回忆。这种在不同LLM阅读器和记忆需求下的一致性表现证明,Zero-Mem能够在无需任何LLM调用或token用于记忆操作的情况下,恢复相关的对话证据,同时保留其关系性和时间性上下文。
HotpotQA。
表3报告了HotpotQA在上下文长度从56K token增加到448K token时的结果。通过逐步添加干扰性段落,该基准测试考察了方法在日益增长的上下文长度下定位并连接分散支持证据的能力。Zero-Mem在所有阅读器和上下文长度下均取得了最高的F1分数,包括具有挑战性的448K token设置,相较于最强基线平均提升了5.52个百分点。综合LoCoMo和HotpotQA上的结果可以看出,Zero-Mem对于长期对话记忆和长上下文多跳检索均有效,证明了其在零token记忆操作下结构化证据选择框架的通用性。
效率对比
表 2 评估了降低内存操作开销是否以牺牲答案质量为代价。我们将 Zero-Mem 与主实验中表现最强的基线 GAM,以及 SimpleMem 和 LightMem 这两个具有代表性的面向效率的内存系统进行了比较。所有方法均在相同的并发设置和硬件环境下使用 GPT-4o-mini 进行评估。我们报告了答案质量,以及共享最终问答阶段之外的内存操作所产生的总开销和每次查询的开销。Zero-Mem 取得了最高的 F1 和 BLEU-1 分数,在这两项指标上分别比排名第二的 GAM 提高了 10.0% 和 11.5%。因此,消除基于 LLM 的内存操作并不会损害答案质量。在开销方面,Zero-Mem 在内存处理过程中不调用任何 LLM,因此消耗的 LLM 输入或输出 token 为零,而即便是 token 效率最高的基线 LightMem,也消耗了超过 87 万个 token。零 token 操作并不意味着零计算,因为编码器推理、内存组织、检索和确定性校准仍会产生处理成本。尽管如此,Zero-Mem 总共仅需 334.77 秒,每次查询仅需 0.22 秒,相比最快的基线 LightMem,内存操作延迟降低了 57.6%。这一结果表明,移除生成式内存调用并不会将成本转移到更慢的非生成式流水线上。在统一设置下,Zero-Mem 在答案质量上优于所有对比基线,同时实现了最低的内存操作 token 消耗和开销。这些结果证明,其效率提升并非以牺牲答案质量为代价。
消融研究
图3报告了在HotpotQA上使用56K token上下文和GPT-4o-mini进行的消融实验结果。我们将完整模型与单视图变体以及移除证据闭合或校准的变体进行了比较,同时保持所有其他设置不变。完整模型达到了72.07的F1分数和69.66的BLEU-1分数。仅保留图视图将分数降至62.50和59.90,而仅保留层级视图则得到54.88和51.40。仅图视图表现更强,这与HotpotQA强调关系推理和跨文档推理的特点一致。然而,两种变体都仍远低于完整模型,这表明这两种结构提供了互补的证据:图连接了分布在多个文档中的信息,而层级结构则保留了解释这些连接所需的局部和多粒度上下文。移除证据闭合导致F1分数为67.90,BLEU-1分数为65.43,而移除证据校准则分别得到70.13和66.45。这些一致的下降支持了它们在完善和优化双视图检索返回证据方面的作用。总体而言,结果证明了结合图检索和层级检索的重要性,而证据闭合和证据校准则为进一步支撑检索到的证据提供了支持。
检索预算的影响
图4考察了Zero-Mem对检索预算的敏感性,检索预算定义为证据闭合前保留的主要候选最大数量。从1增加到5时,平均F1和BLEU-1分数分别从52.59和46.79显著提升至59.15和52.96。性能在预算为5时达到整体最高水平,而更大的预算仅带来微小波动,表明额外证据的边际收益递减。各任务的结果呈现不同的饱和点:单跳问题所需候选较少,而多跳、时间性和开放域问题通常受益于更广泛的证据覆盖。总体而言,Zero-Mem在中等检索预算下保持稳定。我们在主实验中使用预算5以匹配所有基线的检索设置;该配置仅落后0.65 F1和0.83 BLEU-1,同时保留的主要候选数量减半。M(q)Top−KTop−10Top−5Top−10
结论
我们提出了Zero-Mem,并形式化了零token记忆操作——一种在最终问答之外的每个操作都不调用LLM、不消耗LLM输入或输出token的运行机制。Zero-Mem保留原始交互轨迹,并通过互补的关系视图和时间排序视图检索证据,无需生成中间记忆表征。综合实验表明,该方法在长期对话记忆和长上下文多跳推理中均展现出具有竞争力的性能。消融实验进一步证实了两种证据视图的互补性。在采用相同的最终问答阅读器和等效上下文预算的条件下,Zero-Mem消除了记忆操作的token消耗,并相对于最高效的基线将延迟降低了57.6%。这些结果表明,有效的智能体记忆并不需要生成中间表征,并确立了保留来源的证据选择作为生成式记忆管道的实用替代方案。
参考文献
- P. Anokhin、N. Semenov、A. Sorokin、D. Evseev、A. Kravchenko、M. Burtsev 和 E. Burnaev(2025)《AriGraph:利用情景记忆为 LLM 智能体学习知识图谱世界模型》。收录于第三十四届国际人工智能联合会议论文集,IJCAI '25。外部链接:ISBN 978-1-956792-06-5,链接,文献。被引用:引言。
- P. Chhikara、D. Khant、S. Aryan、T. Singh 和 D. Yadav(2025)《Mem0:构建具备可扩展长期记忆的生产级 AI 智能体》。外部链接:2504.19413,链接。被引用:相关工作、基线。
- S. Du、J. Zhao、J. Shi、Z. Xie、X. Jiang、Y. Bai 和 L. He(2026)《基于大语言模型的智能体优化综述》。ACM 计算调查,58(9)。外部链接:ISSN 0360-0300,链接,文献。被引用:引言。
- J. Fang、X. Deng、H. Xu、Z. Jiang、Y. Tang、Z. Xu、S. Deng、Y. Yao、M. Wang、S. Qiao、H. Chen 和 N. Zhang(2026)《LightMem:轻量高效的记忆增强生成》。收录于第十四届国际学习表征会议。外部链接:链接。被引用:引言、相关工作、基线。
- B. J. Gutierrez、Y. Shu、Y. Gu、M. Yasunaga 和 Y. Su(2024)《HippoRAG:受神经生物学启发的长时记忆用于大语言模型》。收录于第三十八届神经信息处理系统年度会议。外部链接:链接。被引用:引言。
- Y. Hu、J. Liu、J. Tan、Y. Zhu 和 Z. Dou(2026a)《记忆更重要:以事件为中心的记忆作为智能体搜索与推理的逻辑地图》。外部链接:2601.04726,链接。被引用:相关工作、基线。
- Y. Hu、S. Liu、Y. Yue、G. Zhang、B. Liu、F. Zhu、J. Lin、H. Guo、S. Dou、Z. Xi、S. Jin、J. Tan、Y. Yin、J. Liu、Z. Zhang、Z. Sun、Y. Zhu、H. Sun、B. Peng、Z. Cheng、X. Fan、J. Guo、X. Yu、Z. Zhou、Z. Hu、J. Huo、J. Wang、Y. Niu、Y. Wang、Z. Yin、X. Hu、Y. Liao、Q. Li、K. Wang、W. Zhou、Y. Liu、D. Cheng、Q. Zhang、T. Gui、S. Pan、Y. Zhang、P. Torr、Z. Dou、J. Wen、X. Huang、Y. Jiang 和 S. Yan(2026b)《AI 智能体时代的记忆》。外部链接:2512.13564,链接。被引用:引言。
- J. Kang、M. Ji、Z. Zhao 和 T. Bai(2025)《AI 智能体的记忆操作系统》。收录于 2025 年自然语言处理实证方法会议论文集,C. Christodoulopoulos、T. Chakraborty、C. Rose 和 V. Peng 主编,中国苏州,第 25961–25970 页。外部链接:Link、Document,ISBN 979-8-89176-332-6。被引用:相关工作、基线方法。
- J. Liu、Y. Su、P. Xia、S. Han、Z. Zheng、C. Xie、M. Ding 和 H. Yao(2026)《SimpleMem:面向 LLM 智能体的高效终身记忆》。收录于第四十三届国际机器学习大会,外部链接:Link。被引用:引言、相关工作、基线方法、实现细节。
- J. Luo、W. Zhang、Y. Yuan、Y. Zhao、J. Yang、Y. Gu、B. Wu、B. Chen、Z. Qiao、Q. Long、R. Tu、X. Luo、W. Ju、Z. Xiao、Y. Wang、M. Xiao、C. Liu、J. Yuan、S. Zhang、Y. Jin、F. Zhang、X. Wu、H. Zhao、D. Tao、P. S. Yu 和 M. Zhang(2025)《大语言模型智能体:方法、应用与挑战综述》。外部链接:2503.21460、Link。被引用:引言。
- A. Maharana、D. Lee、S. Tulyakov、M. Bansal、F. Barbieri 和 Y. Fang(2024)《评估 LLM 智能体的超长期对话记忆》。收录于第 62 届计算语言学协会年会论文集(第 1 卷:长文),L. Ku、A. Martins 和 V. Srikumar 主编,泰国曼谷,第 13851–13870 页。外部链接:Link、Document。被引用:数据集。
- J. S. Park、J. O’Brien、C. J. Cai、M. R. Morris、P. Liang 和 M. S. Bernstein(2023)《生成式智能体:人类行为的交互式模拟》。收录于第 36 届 ACM 用户界面软件与技术年会研讨会论文集,UIST ’23,美国纽约州纽约市。外部链接:ISBN 9798400701320、Link、Document。被引用:相关工作。
- P. Rasmussen、P. Paliychuk、T. Beauvais、J. Ryan 和 D. Chalef(2025)《Zep:面向智能体记忆的时序知识图谱架构》。外部链接:2501.13956、Link。被引用:相关工作。
- R. Salama、J. Cai、M. Yuan、A. Currey、M. Sunkara、Y. Zhang 和 Y. Benajiba(2025)《MemInsight:面向 LLM 智能体的自主记忆增强》。载于《2025年自然语言处理经验方法会议论文集》,C. Christodoulopoulos、T. Chakraborty、C. Rose 和 V. Peng(编),中国苏州,第 33136–33152 页。外部链接:Link、Document,ISBN 979-8-89176-332-6。引用位置:引言。
- T. Schick、J. Dwivedi-Yu、R. Dessi、R. Raileanu、M. Lomeli、E. Hambro、L. Zettlemoyer、N. Cancedda 和 T. Scialom(2023)《Toolformer:语言模型可以自学使用工具》。载于《第三十七届神经信息处理系统会议》,外部链接:Link。引用位置:相关工作。
- N. Shinn、F. Cassano、A. Gopinath、K. Narasimhan 和 S. Yao(2023)《Reflexion:具有语言强化学习的语言智能体》。载于《第三十七届国际神经信息处理系统会议论文集》,NIPS '23,美国纽约州红钩。引用位置:相关工作。
- H. Sun、S. Zeng 和 B. Zhang(2026)《H-MEM:面向 LLM 智能体高效长期推理的分层记忆》。载于《第十九届欧洲计算语言学协会会议论文集(第 1 卷:长文)》,V. Demberg、K. Inui 和 L. Marquez(编),摩洛哥拉巴特,第 341–350 页。外部链接:Link、Document,ISBN 979-8-89176-380-7。引用位置:引言。
- G. Wang、Y. Xie、Y. Jiang、A. Mandlekar、C. Xiao、Y. Zhu、L. Fan 和 A. Anandkumar(2024)《Voyager:基于大语言模型的开放式具身智能体》。《机器学习研究汇刊》。注:外部链接:ISSN 2835-8856,Link。引用位置:相关工作。
- Y. Wu、S. Liang、C. Zhang、Y. Wang、Y. Zhang、H. Guo、R. Tang 和 Y. Liu(2025)《从人类记忆到 AI 记忆:LLM 时代记忆机制综述》。外部链接:2504.15965,Link。引用位置:引言。
- Z. Xi、Y. Ding、W. Chen、B. Hong、H. Guo、J. Wang、X. Guo、D. Yang、C. Liao、W. He、S. Gao、L. Chen、R. Zheng、Y. Zou、T. Gui、Q. Zhang、X. Qiu、X. Huang、Z. Wu 和 Y. Jiang(2025)《AgentGym:在多样化环境中评估和训练基于大语言模型的智能体》。载于《第 63 届计算语言学协会年会论文集(第 1 卷:长文)》,W. Che、J. Nabende、E. Shutova 和 M. T. Pilehvar 主编,奥地利维也纳,第 27914–27961 页。外部链接:Link、Document,ISBN 979-8-89176-251-0。被引用处:引言。
- J. Xu、A. Szlam 和 J. Weston(2022)《超越金鱼记忆:长期开放域对话》。载于《第 60 届计算语言学协会年会论文集(第 1 卷:长文)》,S. Muresan、P. Nakov 和 A. Villavicencio 主编,爱尔兰都柏林,第 5180–5197 页。外部链接:Link、Document。被引用处:引言。
- W. Xu、Z. Liang、K. Mei、H. Gao、J. Tan 和 Y. Zhang(2025)《A-mem:面向 LLM 智能体的智能体记忆》。载于《第三十九届神经信息处理系统年度会议》,外部链接:Link。被引用处:相关工作、基线。
- B. Y. Yan、C. Li、H. Qian、S. Lu 和 Z. Liu(2025)《通过深度研究实现通用智能体记忆》。外部链接:2511.18423、Link。被引用处:引言、相关工作、数据集、基线、实现细节。
- C. Yang、C. Zhou、Y. Xiao、S. Dong、L. Zhuang、Y. Zhang、Z. Wang、Z. Hong、Z. Yuan、Z. Xiang、S. Chen、H. Zhou、Q. Zhang、N. Liu、J. Su、X. Wang、Y. Chang 和 X. Huang(2026)《基于图的智能体记忆:分类体系、技术与应用》。外部链接:2602.05665、Link。被引用处:引言。
- Z. Yang、P. Qi、S. Zhang、Y. Bengio、W. Cohen、R. Salakhutdinov 和 C. D. Manning(2018)《HotpotQA:一个用于多样化、可解释多跳问答的数据集》。载于《2018 年自然语言处理经验方法会议论文集》,E. Riloff、D. Chiang、J. Hockenmaier 和 J. Tsujii 主编,比利时布鲁塞尔,第 2369–2380 页。外部链接:Link、Document。被引用处:数据集。
- S. Yao、J. Zhao、D. Yu、N. Du、I. Shafran、K. R. Narasimhan 和 Y. Cao(2023)《ReAct:在语言模型中协同推理与行动》。载于第十一届国际学习表征会议,外部链接:链接,被引用:相关工作。
- H. Yu、T. Chen、J. Feng、J. Chen、W. Dai、Q. Yu、Y. Zhang、W. Ma、J. Liu、M. Wang 和 H. Zhou(2026)《MemAgent:基于多轮强化学习的记忆智能体重塑长上下文大语言模型》。载于第十四届国际学习表征会议,外部链接:链接,被引用:数据集。
- G. Zhang、M. Fu、K. Wang、G. Wan、M. Yu 和 S. YAN(2025a)《G-memory:为多智能体系统追踪分层记忆》。载于第三十九届神经信息处理系统年度会议,外部链接:链接,被引用:引言。
- Z. Zhang、Q. Dai、X. Bo、C. Ma、R. Li、X. Chen、J. Zhu、Z. Dong 和 J. Wen(2025b)《基于大语言模型的智能体记忆机制综述》。ACM 信息系统汇刊,第 43 卷第 6 期。外部链接:ISSN 1046-8188,链接,文献标识码,被引用:引言。
- W. Zhong、L. Guo、Q. Gao、H. Ye 和 Y. Wang(2024)《MemoryBank:以长期记忆增强大语言模型》。载于第三十八届 AAAI 人工智能会议暨第三十六届人工智能创新应用会议暨第十四届人工智能教育进展研讨会论文集,AAAI'24/IAAI'24/EAAI'24。外部链接:ISBN 978-1-57735-887-9,链接,文献标识码,被引用:引言。
来源:HuggingFace Daily Papers(社区热门论文) · arxiv.org