智能体记忆并非越多越好:八款模型评测显示剂量需按能力校准
How Much Memory Does Your Agent Actually Need?
智能体记忆并非可随意开启的功能,而是需按模型能力校准的剂量。强模型适合注入完整指南集,DeepSeek-V3.2(671B MoE)任务完成率提升+9.5个百分点;较弱模型采用精选检索效果最佳,gpt-oss-120b(117B MoE)提升+16.1pp且仅增加+5% token。该方法无需更新权重或人工标注,通过从智能体过往轨迹中蒸馏指南并在推理时注入实现。
把智能体记忆的配置从越多越好修正为按模型能力校准,弱模型用检索核心比全量更准且成本更低,为上下文预算提供量化依据。
Jayaram Radhakrishnan jayaramkr 关注
Ashwath Vaithinathan Aravindan ashwath-vaithina 关注
Evelyn Duesterwald evduester 关注
在上一篇文章中,我们将ALTK-Evolve与ACE进行了对比,并展示了如何交付智能体的自蒸馏指南——每个任务检索少量指南还是注入全部指南——会同时影响准确率和成本。本文退回到更靠前的问题:应该给它多少?为智能体配备智能体记忆听起来很简单:从它过去的工作中蒸馏经验教训,把它们放回上下文,更多的经验就应该意味着更好的表现。但事情并不总是这样。当我们将评估扩展到八个模型——从 30B 稠密模型到前沿专有系统——时,有一个发现格外突出:
智能体记忆不是一个打开就行的功能。它是一剂需要根据模型来校准的剂量。
TL;DR
ALTK-Evolve让智能体从自己过去的轨迹中学习:蒸馏出可复用的指南,并在推理时将它们注入回去,无需更新权重,也无需人工标注。
合适的剂量因模型层级而异:有提升空间的强模型需要完整的指南集,较弱的模型在紧凑核心集加每任务检索时表现最佳,而已经饱和的模型则没有可测量的增益。
精选检索既可能是最准确的选择,也可能是成本最低的选择: gpt-oss-120b 在仅增加 5% token 的情况下,任务完成率提升了 +16.1pp——而提示词缓存让即使完整的指南集在生产环境中也保持可负担。
关键洞察:剂量取决于能力
并非每个模型都能从相同数量的记忆中获益。在横跨能力谱系的八个模型中,我们观察到三种反复出现的模式:
拥有充足余量的强模型需要完整的准则集——每一条准则,包括罕见的边缘案例经验。它们有能力吸收并应用全部内容。DeepSeek-V3.2(671B MoE)在获得完整的自挖掘准则集后,任务完成率提升了9.5 个百分点。
较小或较弱的模型会被庞大的准则集淹没。对于这些模型,一个紧凑的高置信度核心集,加上每个任务检索到的少量任务相关准则,效果最佳。gpt-oss-120b(117B MoE)采用这种选择性方法获得了+16.1pp的提升——而使用完整准则集获得的提升更少且消耗的 token 多出约 50%。
已经饱和的模型没有显示出可测量的增益。我们将此称为饱和模式——这个标签描述的是我们观察到的现象,而非已证实的成因。模型可能在这些任务上已经接近其上限,准则可能没有解决其剩余的失败问题,或者它可能没有有效地应用这些指导。GLM-5(745B MoE)在我们的运行中处于这一模式。
决定一个模型落入某种模式而非另一种模式的,并不只是参数量。基准测试的余量、上下文窗口大小、架构、准则质量以及任务分布,似乎都会影响模型最终所处的状态,而将这些因素区分开来仍是一项正在进行的工作。无论哪种情况,实用的结论都成立:恰当的记忆剂量取决于模型,而我们可以对它进行校准。
学习发生在模型周围,而非模型内部
这里的“记忆”并不意味着重放过去的对话记录。它指的是一套准则集——从智能体自身先前的轨迹中提炼出的有效策略、应避免的错误以及边缘情况。这个循环很直接:
智能体尝试任务并产生轨迹。
ALTK-Evolve 从其成功和失败的运行中提取行为准则。
它将这些准则整合成一套可复用的集合。
在推理时,智能体要么接收完整的准则集,要么接收其中与任务相关的部分。
模型权重不会更新。这个学习循环改变的是智能体可用的指导,而非底层模型——这正是它采用成本低、且在我们测试的八个模型之间可移植的原因。
全谱系的结果
我们在 AppWorld 上进行了评估——涵盖 9 个模拟应用(日历、消息、支付等)中的 585 个多步骤任务(168 个 test_normal + 417 个 test_challenge)。任务按两种方式评分:智能体是否完整完成每个任务(TGC——任务目标完成度),以及某个场景的每一个变体是否都通过(SGC——场景目标完成度,一个更严格的全有或全无标准)。完整定义见附录。
我们比较的三种配置
因为任何记忆研究中令人困惑的部分是上下文窗口里实际有什么,所以我们先定义这些配置。
两种记忆配置都来自同一套准则集,仅从 AppWorld 的训练集中挖掘一次(通过上述循环)。它们之间唯一的变化是这套准则如何被传递——完整准则集在每一步都注入全部内容,而精选检索则传递一个选定的子集——绝不涉及准则如何产生,也绝不会有测试集数据进入其构建过程。
| 配置 | 智能体上下文中包含的内容 |
|---|---|
| 基线 | 无记忆——即出厂状态的智能体。 |
| 完整指南集 | 每一条挖掘出的指南,在每一个 ReAct 步骤中都会注入。 |
| 精选检索 | 由这些相同指南中一个固定的、高置信度的核心部分,加上针对每个任务检索到的少量任务相关指南组成(一个固定部分 + 一个可变部分)。 |
一个模型挖掘出的指南数量取决于其自身能力,因此我们按策略——"完整指南集"与"精选检索"——来报告配置,而不是按原始数量,因为原始数量在不同模型之间不可比较。
三种模式,一图总览
来自八模型扫描的代表性模型,以 test_normal 上的任务完成度(TGC)衡量:
图 1. 三种观察到的模式中的代表性模型。柱状图显示 AppWorld test\_normal 上基线对比最佳记忆配置的 TGC;x 轴从 40% 开始,以便让差异可见。仅 TGC 会低估更大的 SGC 增益——见下表 SGC 列。
图中绘制 TGC 是为了保持可读性;表格则加入了更严格的 SGC 指标,其增益往往更大:
| 模型 | 模式 | 基线 TGC / SGC | 最佳记忆 TGC / SGC | 最佳配置 | Δ TGC | Δ SGC |
|---|---|---|---|---|---|---|
| gpt-oss-120b(117B MoE) | 弱 / 选择性 | 39.9 / 21.4 | 56.0 / 37.5 | 精选检索 | +16.1 | +16.1 |
| DeepSeek-V3.2(671B MoE) | 强,仍有提升空间 | 79.8 / 64.3 | 89.3 / 80.4 | 完整指南集 | +9.5 | +16.1 |
| Claude Opus 4.6 | 强,仍有提升空间 | 90.5 / 87.5 | 94.6 / 94.6 | 完整指南集 | +4.1 | +7.1 |
| GPT-5.5 | 强(接近上限) | 92.3 / 82.1 | 95.2 / 89.3 | 完整指南集 | +2.9 | +7.2 |
| GLM-5(745B MoE) | 已饱和 | 87.5 / 80.4 | 87.5 / 80.4 | 完整指南集 | 0.0 | 0.0 |
阅读 SGC 这一列,更严格的指标通常比 TGC 变动更大——DeepSeek 的 SGC 跃升了 +16.1pp,而 TGC 的增幅为 +9.5pp——因为好的指南尤其能帮助智能体通过某个场景的每一个变体,而不仅仅是平均情况。而且这种效应在区间顶部也没有消失:GPT-5.5 和 Opus 在 TGC 上都已接近上限,但仍分别获得了 +7.2 和 +7.1pp SGC。只要模型还有剩余的失败模式可供针对,记忆就会持续带来回报。
最便宜的记忆策略也可能是最好的
一个实际顾虑:注入完整的指南集会膨胀每一个 ReAct 步骤的输入,因为指南每一轮都会被重新发送。以下是我们观察到的情况:
| 模型 | 配置 | Tokens/任务(基线) | Tokens/任务(+ 记忆) | 开销 |
|---|---|---|---|---|
| DeepSeek-V3.2 | 完整指南集 | 148K | 263K | +78% |
| gpt-oss-120b | 完整指南集 | 110K | 166K | +51% |
| gpt-oss-120b | 精选检索 | 110K | 116K | +5% |
表 1. 每个任务的平均 token 使用量,跨智能体步骤累计,以无记忆基线为基准测量。
两点结论:
精选检索使成本保持在基线附近。对于较弱的模型,选择在准确率上取胜的同时,也在成本上取胜——两全其美(gpt-oss-120b 在仅增加 +5% token 的情况下实现了 +16.1pp TGC)。在这里,更好的表现并不需要更高的推理成本。
记忆并不会让推理循环爆炸式膨胀。 DeepSeek 在有记忆和无记忆时运行的 ReAct 步数大致相同(平均约 18–19 步),因此增加的成本来自输入 token 的膨胀,而非更长的轨迹。
生产环境中真正的效率杠杆是提示词缓存:指南集中的静态部分在各步骤之间完全相同,可以被缓存,从而大幅削减实际成本。缓存感知的提示词设计——保持共享的指南集前缀稳定,使其始终可被缓存——值得投入工程去实现。我们还推测上下文窗口大小也起着作用:窗口更大的模型可能更有效地吸收完整的指南集,而上下文较小的模型则更能从保持注入内容紧凑的检索中获益。我们尚未开展隔离这一因素的对照实验。
记忆应当被校准,而非仅仅被累积
教训并不是要把智能体学到的一切都塞给它,而是给它真正能够用得上的经验量。
对于弱模型而言,这意味着一个紧凑的核心加上少量针对特定任务的教训——而这恰好也是最便宜的选项。
对于仍有余力的强模型而言,这意味着保留完整的指南集,并通过提示词缓存在生产环境中保持其成本可负担。
对于饱和模型,这意味着在更好地理解其剩余的失败模式之前,不额外消耗上下文。
这些收益是全面且真实的——自动、无泄漏、无需人工标注——但前提是剂量与模型相匹配。
下一步
这是一个起点,而非终点:
学习型选择器。我们当前的检索按余弦相似度对指南进行排序,而我们已经证明,余弦相似度并不能完美预测哪些指南对给定任务有帮助。基于结果信号训练的选择器是自然的下一步。
面向极弱模型的记忆。低于最低能力基线时,自蒸馏缺乏信号。面向极弱模型的教师蒸馏记忆是我们正在探索的一个独立问题。
超越 AppWorld。这些结果在 AppWorld 上得到了验证——这是一个严格的多步基准,但仅此一个。更广泛的智能体基准和真实世界部署正在进行中。
隔离上下文窗口。如上所述,我们希望进行受控实验,将上下文窗口大小与原始能力分离开来。
试试 ALTK-Evolve 库——其中包含此处使用的提取、整合与检索流水线——或者阅读完整技术报告,了解完整方法和消融实验。
附录:理解各项指标
AppWorld 任务由两项指标评分,二者均以百分比表示(越高越好):
TGC——任务目标完成率。智能体完全且正确完成的单个任务所占比例。这是最核心的“它是否把活干成了”指标。
SGC——场景目标完成率。一项更严格的全有或全无指标。每个场景捆绑了同一任务的多个变体(同一请求,但数据、措辞或边界条件不同)。只有当智能体在每一个变体上都成功时,SGC 才将该场景计为通过。它衡量的是可靠性——一个大多数时候能解决任务但在某个变体上失败的智能体,会在 TGC 上得分,但不会在 SGC 上得分。
来源:Hugging Face:Blog(RSS) · huggingface.co