跳到正文
北京时间
原文
HuggingFace Daily Papers(社区热门论文)·· 2026-06-09精选AI 评分73

DeLM:去中心化多智能体系统框架

Decentralized Multi-Agent Systems with Shared Context

AI 导读

DeLM是一种去中心化多智能体系统框架,通过并行智能体、共享已验证上下文和任务队列避免中央控制器瓶颈。智能体异步认领子任务、读取累计进展、执行局部推理并写回紧凑的已验证更新。在SWE-bench Verified上,DeLM在Avg.@1、Pass@2和Pass@4指标中均取得最佳性能,相比最强基线提升最多10.5个百分点,每任务成本降低约50%。在LongBench-v2多文档问答上,DeLM在四个前沿模型家族中取得最高平均准确率,提升最多5.7个百分点。代码已开源。

推荐理由

去中心化MAS把中心调度换成共享黑板,SWE-bench一口气提10.5个点还省一半成本,这个思路值得所有搞agent的团队认真看。

正文 · AI 翻译
摘要

多智能体系统(MAS)能够通过将复杂问题分解为并行子任务,在测试时扩展大语言模型的推理能力。然而,现有的大多数MAS依赖于集中式编排,即由一个主智能体分配任务、收集输出并合并结果。随着子任务数量的增长,这个控制器会成为通信与集成的瓶颈。我们提出了去中心化语言模型(DeLM),这是一种通过并行智能体、共享已验证上下文和任务队列来实现协调去中心化的MAS框架。智能体异步认领子任务,读取累积的进展,执行局部推理,并写回紧凑的已验证更新。共享上下文充当了通用的通信基板,使智能体能够基于彼此的已验证进展进行构建,而无需通过中央控制器路由每一次更新。实验表明,DeLM在软件工程测试时扩展和长上下文推理方面均取得了改进。在SWE-bench Verified上,DeLM在Avg.@1、Pass@2和Pass@4指标上均取得了最佳性能,相比最强基线提升了最多10.5个百分点,同时每个任务的成本降低了约50%。在LongBench-v2多文档问答任务上,DeLM在四个前沿模型家族中取得了最高的平均准确率,相比最强基线提升了最多5.7个百分点。代码已发布在我们的项目网站上:https://yuzhenmao.github.io/DeLM/。

1 引言

Refer to caption
图1:SWE-bench Verified与LongBench-v2多文档问答任务上的对比。我们的方法DeLM在智能体与长上下文两类基准测试中均取得了最佳平均性能。

多智能体系统(MAS)为大语言模型在测试时扩展推理能力提供了一种自然的方式。MAS 并非依赖单次模型调用来端到端地解决复杂任务,而是将问题分解为子任务,并行调度多个智能体,并汇总它们的中间进展(Hong 等人,2023;Feng 等人,2026;Ruan 等人,2026;Zhang 等人,2025;OpenAI,2025;Anthropic,2026a;Kimi 等人,2026)。这一范式在两种典型场景中日益重要。其一是测试时扩展,多个智能体可以并行探索不同的假设或追寻不同的推理路径,同时仍能共享中间进展。其二是长上下文推理,例如多文档问答,智能体可以同时处理不同的证据簇。在这两种场景中,MAS 的价值不仅仅在于发起更多的模型调用,而是将额外的测试时计算转化为有用的并行进展。这两个场景也捕捉了新兴自动化研究工作流中的核心挑战(Liu 等人,2026;AlphaEvolve 团队,2025),在这些工作流中,智能体既需要在假设间扩展探索,也需要对大量论文、代码、实验和中间发现进行推理。

Refer to caption
图 2:集中式与去中心化多智能体系统。集中式 MAS 依赖一个主智能体来分配子上下文、生成子智能体,并通过同步的分散-收集循环整合返回的结果,这造成了瓶颈,即进展受限于中央合并步骤和最慢的工作者。相比之下,DeLM 通过并行智能体、共享上下文和任务队列来实现去中心化协调,允许智能体通过共享状态交换进展,异步认领就绪的任务,并随着子任务数量的增长而更具适应性地扩展。

然而,要发挥这一潜力,关键在于智能体如何协调。现有的大多数多智能体系统(MAS)框架,包括 Claude Code Subagents(Anthropic,2026a)、Kimi Agent Swarm(Kimi 等人,2026)和 AOrchestra(Ruan 等人,2026),都依赖于集中式编排:一个主智能体分解问题,将子任务及相应的子上下文分配给子智能体,等待它们的输出,然后整合结果或启动另一轮子任务,如图 2(左)所示。其局限性在于,集中式 MAS 实现了子智能体的并行执行,但并未实现围绕协调的并行化。在测试时扩展中,增加智能体的收益取决于能否高效且忠实地在工作者之间共享有用的进展。集中式编排通过两种方式削弱了这一收益。首先,它的扩展性很差:每一个有用的发现、失败或部分解决方案都必须返回给主智能体,然后由主智能体决定如何合并这些信息并将其广播给其他子智能体。随着智能体数量的增长,进展共享变成了一个串行化的通信瓶颈。其次,在此路由过程中,主智能体可能会稀释、遗漏或扭曲有用的细节,导致重要的进展丢失。我们在第 4.2.1 节中提供了更详细的分析。这种瓶颈也出现在长上下文推理中:主智能体通常必须在知道哪些证据相关或不同证据片段应如何组合之前,就预先将证据簇分配给子智能体(Anthropic,2026a;Zhang 等人,2025)。如果子智能体接收到的上下文不足,它会将控制权交还给主智能体,从而触发额外的检索或另一轮委派。随着子任务或证据簇的增长,这种来回往复使得协调变得更慢、迭代性更强,并且越来越受限于一个超负荷的主智能体。

为了解决这些瓶颈,我们提出了去中心化语言模型(DeLM),这是一个将协调机制从中央控制器转移到共享问题状态的多智能体系统框架。如图2(右)所示,DeLM围绕三个核心组件构建:并行智能体、共享上下文和任务队列。智能体并非通过主智能体路由每一次交互,而是异步地从队列中获取任务,从共享上下文中读取已累积的进展,执行本地推理,并写回紧凑的已验证更新。这种设计也不同于智能体之间直接交换消息的点对点通信。相反,DeLM将经过验证的共享上下文作为通用的通信基础:一旦某个更新被采纳,它就会对所有智能体可见,成为可复用的问题状态。因此,DeLM支持两种激励场景:在测试时扩展中,有用的发现、失败和部分解决方案可以通过共享上下文传播,而无需由主智能体反复合并和重新广播。在长上下文推理中,智能体可以并发处理不同的证据簇,同时维护语料库和已累积证据的紧凑全局视图。

我们在三种强调不同形式多智能体协调的场景中评估了DeLM:(1)SWE-bench Verified(Jimenez等人,2024)上的软件工程测试时扩展,这考验了不同推理轨迹上的并行探索能力;(2)LongBench-v2(Bai等人,2025)上的长上下文多文档问答,这考验了任务内并行性,即智能体并发检查不同证据簇的能力;(3)OOLONG(Bertsch等人,2025)上的聚合密集型长上下文推理,这凸显了DeLM的去中心化验证上下文与RLM(Zhang等人,2025)的代码中介执行之间的互补性。我们的主要发现是:

  • •

    DeLM 将并行的软件工程尝试转化为共享式探索。在 SWE-bench Verified(§ 4.2)上,如表 1 所示,DeLM 在测试时扩展指标中取得了最强性能,pass@4 达到 77.4%,同时将每个任务的成本降低至 0.12 美元,仅为基线模型的大约一半。§ 4.2.1 节通过追踪级示例进一步解释了这些增益,展示了紧凑的共享上下文如何帮助智能体重用已有发现。

  • •

    DeLM 支持在长上下文上进行迭代式共享状态推理。在 LongBench-v2(§ 4.3)上,如表 2 所示,DeLM 在四个前沿模型中取得了最高的平均准确率,相比最佳基线提升了多达 5.7 个百分点。§ 4.3.1 节进一步表明,准入时验证和分层摘要共同促成了这些增益。

  • •

    DeLM 充当程序化推理系统的协调层。在 OOLONG(§ 5)上,如表 3 所示,原始 DeLM 的表现不如 RLM,因为该基准测试要求精确的行级聚合,而代码驱动的执行在此场景下尤为有效;然而,将 RLM 与 DeLM 相结合,既取得了最佳准确率,也实现了最低成本,这表明 DeLM 的应用范围已超越对话式智能体,延伸至基于代码的推理工作流。

2 动机与设计原则

2.1 从提示词路由到共享状态

第 1 节指出集中式协调是现有多智能体系统(MAS)的瓶颈。在此,我们通过聚焦其通信机制来进一步细化这一观察。集中式 MAS 在很大程度上是提示词路由式的:中间进展通过主智能体传递,被重写进后续提示词,并有选择性地暴露给其他智能体。因此,并行执行本身并不能保证并行进展的共享。

这一视角催生了一种不同的通信基础。DeLM 并非反复将协调决策编码到提示词中,而是让中间进展变得持久化:智能体将紧凑且经过验证的更新写入共享上下文,后续智能体可直接读取。因此,协调转变为基于状态的方式,有用的发现、失败和约束作为共享问题状态不断累积,而非通过中央控制器传递。

2.2 紧凑、全局、可展开的共享上下文

基于状态的通信只有在共享上下文随着问题规模增长而保持可用时才有价值。共享原始文档或完整的智能体轨迹可以保留最大信息量,但会迅速超出每个智能体的上下文窗口并增加成本。仅共享紧凑摘要成本较低,但有可能丢失细节、限定条件或跨文档证据,而这些对于可靠的推理至关重要。

DeLM 通过一种展开机制来解决这一权衡问题。智能体默认读取高度紧凑的要点,并在需要时选择性地将其展开为详细摘要或原始证据。这种从粗到细的访问模式使得能够在整个问题范围内进行协调,同时仅对相关证据产生详细检查的成本。

2.3 准入前验证

由于共享上下文是所有智能体的通信基础,该状态中的错误可能会广泛传播。一旦被接纳,一个未经支持的声明就可能成为可复用的问题状态,误导后续的智能体并影响下游推理。事后答案检查是不够的,因为此类错误可能已经影响了中间决策。

DeLM 通过准入时验证来降低这一风险。在将更新添加到共享上下文之前,会对照其底层证据(包括源上下文和推理轨迹)进行检查。未经支持或失真的更新会被拒绝或重新生成,从而将共享上下文从原始消息缓冲区转变为经过筛选的共享状态。

3 去中心化语言模型(DeLM)

Refer to caption
图 3:DeLM 概览。一次性初始化步骤将输入分解为初始子任务,并将其放入共享任务队列。多个并行智能体异步认领任务(),读取经过验证的共享上下文,并执行局部推理。完成的更新被压缩、验证,并作为紧凑摘要()被接纳,使可复用的进展对所有智能体可见。当任务队列为空时,最近完成任务的智能体会检查现有子任务状态和共享上下文,以决定是否需要额外的子任务。如果需要,它会生成新任务并将其加入队列,进行另一轮并行执行;否则,它会生成最终答案。
媒体内容 · 前往原文查看
算法 1 DeLM 流水线。DeLM 维护一个共享上下文和一个任务队列。智能体并行执行队列中的子任务,将其结果压缩并验证为紧凑摘要,将验证通过的摘要纳入共享上下文,根据累积状态可选地生成额外子任务,并最终从经过验证的共享上下文中生成答案。

1:任务;可选源上下文

2:最终答案

3:共享上下文

4:

5:重复

6:并行执行子任务

7:

8:接纳验证通过的摘要

9:如果为空,则

10:

11:结束条件

12:直到为空

13:

14:返回

DeLM 通过两个全局结构实现这些设计原则:一个共享上下文和一个任务队列。给定一个输入任务和可选的源上下文,存储累积进展的紧凑、已验证摘要,而存储待并行执行的子任务。

如图 3 和算法 1 所示,DeLM 分五个阶段进行:根据输入初始化任务队列,并行执行就绪的子任务,将更新压缩、验证并纳入共享上下文,当当前共享上下文不足时生成额外子任务,以及在不再需要子任务时生成最终答案。接下来我们描述该流水线背后的两个核心机制:第 3.1 节介绍共享上下文和任务队列,第 3.2 节描述中间更新如何被压缩、验证和接纳。

3.1 共享上下文与任务队列

DeLM 维护两种全局结构:一个共享上下文和一个任务队列。共享上下文存储紧凑、可复用的问题状态,包括源证据、已完成的子任务结果、失败的假设以及中间约束条件。任务队列存储待处理的子任务,可供可用智能体并行认领。两者共同定义了协调接口:智能体从任务队列中选择工作,并通过共享上下文中已接纳的条目来沟通进展。

关键设计选择在于,共享上下文包含的是要点条目而非原始轨迹。每个要点总结了可供后续智能体使用的信息,并指向可通过选择性展开来检索的更详细证据。因此,每个工作节点既能读取当前问题状态的轻量级全局视图,又不会丢失对底层细节的访问能力。

任务队列决定了智能体如何作用于共享状态。智能体异步地从任务队列中认领已就绪的子任务;当一个要点被接纳进共享上下文后,后续智能体可以基于该发现继续推进、避开已被证伪的假设,或复用部分解决方案,而无需等待中央控制器重新分配。当队列耗尽时,最近完成任务的智能体会利用当前的子任务状态和共享上下文,判断是否需要进一步的子任务。如果需要,它会基于共享上下文和任务队列生成新的子任务并将其加入队列;否则,它会根据累积的共享状态最终确定答案。附录 A.4 提供了关于依赖感知队列、并行执行和系统优化的更多细节。

3.2 压缩与验证性接纳

DeLM 将每次共享上下文更新视为一个接纳问题。它不会将智能体的原始输出或未经验证的摘要直接写入共享上下文,而是先将每个已完成的结果压缩为可复用的要点,然后根据其支撑证据对该要点进行验证。只有通过这一验证的更新才会对其他智能体可见。

具体而言,给定一个已完成的结果,DeLM 会根据所接纳内容的类型选择压缩路径。如果该内容是推理轨迹,它可能包含成功发现、被证伪的假设、执行反馈或对后续智能体的约束。由于后续智能体通常需要提炼后的结论而非完整轨迹,DeLM 会直接将此内容压缩成一条要点摘要。如果该内容是长源单元,则直接由要点摘要展开为原始内容可能并不可靠:要点摘要可能无法保留足够细节来识别需要展开的准确原始片段,而展开大量候选块来弥补这一缺陷又代价高昂。因此,DeLM 采用分层路径:它首先构建一个基于引用的摘要,然后将该摘要压缩成可被接纳的紧凑要点摘要。摘要和原始内容都保留在后备存储中,并可通过选择性展开进行恢复。附录 A.1 和 A.2 给出了完整的分层结构和展开流程,第 4.3.1 节通过“无分层摘要”消融实验验证了该设计。

从操作系统角度来看,要点摘要层充当了每个智能体都能看到的小型常驻工作集,而摘要层和原始存储层则作为后备存储。选择性展开类似于按需分页,仅在当前子任务需要时,才将更细粒度的证据加载到智能体的上下文中。

验证遵循相同的两条路径。对于推理轨迹,DeLM 使用大语言模型验证器检查要点摘要是否忠实捕捉了其中的相关发现、失败、反馈或约束。对于长源单元,验证在两个层级上进行:摘要必须得到原始来源的支持,而要点摘要必须保留摘要中有依据的声明和重要限定词。通过验证的要点摘要会被追加到工作集中,并对后续智能体可见;未通过验证的要点摘要则被拒绝,并附带反馈重新生成。附录 A.3 给出了完整的接纳时验证流程。

4 实验

4.1 实验设置

我们首先在两个代表性基准上评估 DeLM,这两个基准分别侧重多智能体协调的不同方面:软件工程测试时扩展和长上下文多文档推理。第 5 节将进一步研究 DeLM 如何与 RLM(Zhang 等人,2025)结合使用。

(1)SWE-bench Verified(Jimenez 等人,2024)。这是一个基于真实世界 GitHub 问题构建的软件工程基准,包含人工验证的任务规范和测试。我们用它来评估智能体在真实仓库环境中的编码能力,智能体必须检查代码库、识别相关文件、实现修复并通过测试进行验证。该基准特别适合我们的场景,因为其任务需要在大规模代码库上进行迭代探索和协调,而非检索单个局部答案。

(2)LongBench-v2(Bai 等人,2025)。这是一个长上下文基准,旨在评估对真实任务的深度理解和推理能力。我们重点关注其多文档问答设置,该设置包含 125 个样本,涵盖多个领域:金融(15 个样本)、政府(23 个样本)、多新闻(23 个样本)、法律(14 个样本)和学术(50 个样本)。该设置同样适合我们的评估,因为其问题需要对分布在长上下文中的证据进行多跳推理,而非提取单个局部片段。

我们将 DeLM 与不同的基线方法进行了比较。Base 方法直接对整个输入调用一次大语言模型来生成答案,不进行任何分解或多智能体编排。Claude Code(Anthropic,2026a)是一个工具增强的智能体基线方法,它通过程序化检查和上下文压缩来处理长输入。mini-SWE-agent(Yang 等人,2024)是一个轻量级软件工程智能体,它使用简单的线性智能体循环,并以 Bash 作为其主要接口。AOrchestra(Ruan 等人,2026)是一个集中式多智能体系统,其中主编排器按需动态创建专门的子智能体,每个子智能体被实例化为指令、上下文、工具和模型的元组,以执行单个子任务。ReadAgent(Lee 等人,2024)是一个智能体长上下文基线方法,它将输入压缩为简短的要点记忆,并在子任务需要要点中省略的细节时查找原始段落。对于基础模型,我们在 SWE-bench 实验中使用 Gemini 3 Flash(Doshi,2025)和 Claude Opus 4.6(Anthropic,2026b);在 LongBench-v2 实验中使用 GPT-5.4(OpenAI,2026)、Claude Sonnet 4.6(Anthropic,2025)、Gemini 3 Flash 和 DeepSeek-V4-Pro(DeepSeek-AI,2026)。

所有基础模型均通过 OpenRouter 进行评估,使用默认的推理和采样参数。对于 Claude Code,我们通过 OpenRouter 路由 CLI,以支持替代基础模型,并允许访问 Read、Grep 和 Bash 等工具。对于 AOrchestra,按照原始配置,我们将编排器的最大尝试次数(max-attempts)设置为 10,每个子智能体的最大步数(max-steps)设置为 50。对于 ReadAgent,我们将最小查找页数(min-lookup-pages)设置为 1,最大查找页数(max-lookup-pages)设置为 6,并使用 100 token 的要点预算,与 DeLM 使用的要点预算相匹配。

4.2 SWE-bench Verified

SWE-bench Verified 评估了 DeLM 能否改善智能体软件工程任务中的测试时扩展。这些任务大多是顺序性的:每个动作都依赖于前一个动作的结果,在单条轨迹内几乎没有并行化的空间。因此,我们在不同轨迹之间进行扩展:我们对每个任务运行多次(使用 ),如果其中任意一次尝试生成了正确的补丁,就认为该任务被解决。我们报告三个指标:Avg.@1 是每次试验的平均成功率,即单次尝试的预期准确率;而 Pass@2 和 Pass@4 则衡量 2 次或 4 次尝试中是否至少有一次解决了任务。

不同的方法以不同的方式使用相同的测试时扩展预算。对于 Base、mini-SWE-agent、Claude Code 和原始 AOrchestra,我们对每个任务运行独立的尝试。每条轨迹都从头开始,不会重复利用其他尝试中的中间发现。我们还引入了 AOrchestra-Parallel,这是基于 AOrchestra 的一个变体。它每个任务只启动一次,但允许主智能体在每一步并行生成子任务和子智能体,汇总它们的输出,并利用合并后的信息来决定下一步。因此,这些并行线程通过主智能体相互耦合。DeLM 使用与 AOrchestra 相同的智能体框架,同样允许并行线程相互传递信息,但智能体之间通过一个经过验证的共享上下文进行通信,而不是通过一个中央控制器。

媒体内容 · 前往原文查看
表 1:在两个基础模型上对 SWE-bench Verified 的比较。最佳值以粗体显示。
方法 Avg.@1 Pass@2 Pass@4 成本/任务
Gemini 3 Flash
mini-SWE-agent 54.7% 65.6% 75.1% $0.26
Claude Code 49.3% 57.1% 66.3% – a
AOrchestra 55.2% 64.5% 73.2% $0.24
AOrchestra-Parallel 56.4% 63.2% 71.8% $0.25
DeLM 65.7% 72.9% 77.4% $0.12
Claude Opus 4.6
mini-SWE-agent 76.9% 79.8% 81.7% $0.61
Claude Code 76.1% 79.5% 81.3% $0.69
AOrchestra 74.7% 78.3% 80.1% $0.70
AOrchestra-Parallel 75.2% 78.1% 79.7% $0.73
DeLM 78.0% 80.7% 82.5% $0.63
  • a

    Claude Code CLI 会以 Anthropic API 格式发送 cache_control 块,因此缓存重用仅在上游提供商识别这些块时才有效。对于 Gemini-3-Flash,没有缓存重用的实际成本约为每个任务 $1。

表1显示,DeLM在两个基础模型上均取得了最佳性能。使用Gemini 3 Flash时,DeLM的Avg.@1达到65.7%,Pass@2达到72.9%,Pass@4达到77.4%,在所有指标上均优于所有基线方法。最大的提升出现在Avg.@1上,DeLM比最强基线方法AOrchestra-Parallel高出9.3个百分点。同时,DeLM将每个任务的成本降低至0.12美元,约为最强智能体基线方法成本的一半。这表明性能提升来自于更有效地利用相同的测试时计算预算,而非启动更多轨迹或消耗更多模型token。

AOrchestra-Parallel相比原始AOrchestra提升了Avg.@1,但在Pass@2和Pass@4上表现更差。这表明通过主智能体耦合并行线程可以使尝试更加一致,但也可能降低探索的多样性。

使用Claude Opus 4.6时性能提升较小,很可能是因为该基础模型本身已经很强,留给协作优化的空间较小。即便如此,DeLM在Avg.@1、Pass@2和Pass@4上仍然取得了最高准确率,同时成本接近最低的方法,仅比mini-SWE-agent每个任务高出0.02美元。

总体而言,这些结果支持我们的核心论点:当并行智能体通过共享状态进行通信时,测试时扩展更为有效。通过让紧凑的进展在多个轨迹中可见,DeLM使后续智能体能够避免重复探索,基于已有发现继续推进,并专注于任务中未解决的部分。第4.2.1节通过轨迹级示例分析了这些机制。

4.2.1 为什么DeLM在SWE-bench上既准确又高效

三个轨迹级机制解释了为什么DeLM同时提升了准确率和成本效率。在下面的DeLM轨迹中,每条共享条目都是一个线程的已验证笔记,标记有其线程ID(t0、t1……)以及类型,如FACT、FAIL或PATCH_SUMMARY。

(1) 并行智能体通过共享失败信息相互补充。

第一种机制是,失败的假设会变成可复用的状态,而非私有的死胡同。在孤立的探索分支中,负面结果仅局限于单一路径,因此其他尝试可能会花费自身预算重新发现同样的失败。而在 DeLM 中,一旦这样的失败被纳入共享上下文,后续的智能体就可以将其视为一种约束,并重新引导搜索方向。

这种机制出现在下面的追踪记录中。任务是为单元素元组修复 lambdify 函数。自然的猜测——Python 打印层——是一个误导;真正的 bug 位于 sympy/utilities/lambdify.py 中一条独立的元组构建路径上:

t0

t1

事实

sympy

utilities

lambdify

py

_recursive_to_string

t0

起关键作用的更新是第一行中的负面结果:线程 t0 表明修改打印层并不会影响输出。在读取了这一失败信息后,t1 避免了重复同样的弯路,并将真正的绕行路径定位到了 _recursive_to_string 中;随后 t0 记录了具体的缺陷——缺失的尾随逗号。因此,DeLM 将失败的假设转化为共享的进展,提升了后续智能体的搜索效率。

(2) 已确认的约束保持为具有约束力的共享状态。

第二种机制是,DeLM 将重要的约束作为共享状态加以保留,而不是通过中央控制器来路由它们。在集中式协调中,主智能体可能会弱化、忽略或重新打开子智能体发现的约束,使其无法指导后续工作。

这种机制出现在下面的追踪记录中。将多个搜索过滤器合并到单个 .filter() 调用中,对于多值关系是不安全的,因为 .filter(A).filter(B) 和 .filter(A, B) 是不同的。在 AOrchestra-Parallel 中,一个子智能体恰好发现了这一风险,但该约束必须经过主智能体,而主智能体重新打开了优化选项,并将其弱化为一个关于“对许多用例”减少联表的权衡;最终运行失败。相关事实已被发现,但并未作为具有约束力的状态被保留。相比之下,DeLM 保持了约束的明确性和可复用性:

t3

M2M

多

条件

搜索

t3

事实

Django

ORM

filter

Q1

Q2

vs

filter

Q1

filter

Q2

不同

对于

多

值

关系

t3

事实

lookup_spawns_duplicates

t1

事实

lookup_spawns_duplicates

保留

M2M

搜索

语义

同时

优化

外键

线程 t3 记录了不安全的情况(失败)、语义原因以及谓词 `lookup_spawns_duplicates`,该谓词用于判断优化何时有效。随后,线程 t1 在此状态基础上构建,在对外键情况进行优化的同时,保留了 M2M 语义。因此,后续线程继承了这一绑定约束,而不会重新打开一个全局无效的简化方案。

(3) 紧凑的补丁摘要承载了有价值的发现。

第三种机制是紧凑共享,它通过防止对等通信变成另一份冗长的原始记录来降低成本。共享完整的追踪记录可以保留信息,但也会让每个工作节点都接触到命令历史、文件转储、失败的编辑以及中间推理过程。DeLM 转而共享有用发现的压缩版本,这样后续的工作节点就可以复用该结果,而无需阅读整个执行轨迹。

这种机制出现在下面的追踪记录中。共享和非共享设置都能解决该任务,但紧凑共享将成本从 0.399 美元降低到了 0.125 美元。区别不在于 DeLM 共享了更多上下文;而在于它共享了有用搜索结果的压缩版本(标记为 PATCH_SUMMARY),该结果由一个大语言模型摘要生成器生成。一个线程首先排除了普通的元组打印路径,并定位了 `lambdify.py` 中的实际绕过点:

t1

事实

StrPrinter

_print_tuple

t1

t1

补丁摘要

_recursive_to_string

reproduce_issue

py

通过

这个补丁摘要将多步调试轨迹转化为一个简短、有证据支持的交接信息。后续的工作节点不需要完整的命令历史、文件转储、失败的编辑或中间推理过程。因此,紧凑共享保留了可复用的发现,同时避免了让每个对等节点都接触原始追踪记录的成本,这解释了为什么 DeLM 能够以低得多的成本解决该任务。

综合来看,这些例子解释了表 1 中的趋势:DeLM 让所有对等节点都能看到可复用的事实、失败情况、约束条件和补丁摘要,同时避免了冗余的孤立搜索和原始追踪记录共享带来的高 token 成本。这提高了每个线程的成功率,同时降低了成本。

4.3 LongBench-v2 多文档问答

媒体内容 · 前往原文查看
表 2:在 LongBench-v2 多文档问答任务上,四种基础模型的准确率(%)对比。结果为 3 次独立运行的均值±标准差。括号内数字表示各领域的样本数量。最佳值以粗体显示。
方法 金融(15) 政府(23) 多语新闻(23) 法律(14) 学术(50) 平均
GPT-5.4
基础 62.2±9.3 39.1±1.7 50.5±8.6 62.0±4.4 56.0±1.2 53.9±4.9
Claude Code 65.0±8.3 36.2±2.0 50.7±2.0 59.5±3.4 60.7±0.9 54.4±3.1
ReadAgent 57.8±3.9 34.8±5.0 52.2±8.7 61.9±4.4 58.0±1.2 53.0±3.3
DeLM 71.1±3.1 43.5±2.0 65.2±2.0 64.3±5.8 56.0±2.8 60.1±1.2
Claude Sonnet 4.6
基础 68.9±3.9 34.8±1.1 46.4±2.0 52.4±3.4 64.0±0.9 53.3±1.9
Claude Code 66.7±1.1 42.0±2.0 47.8±4.4 50.0±3.4 52.0±3.4 51.7±2.4
ReadAgent 62.2±3.9 44.9±4.4 43.5±4.4 57.1±4.1 64.7±2.3 54.5±3.8
DeLM 73.3±3.1 46.4±2.0 55.1±2.0 59.5±3.4 64.7±0.9 59.8±1.5
Gemini 3 Flash
基础 80.0±0.0 30.4±0.0 43.5±0.0 71.4±0.0 60.0±2.3 57.1±3.3
Claude Code 73.3±3.1 26.1±1.5 39.1±0.0 57.1±2.1 52.0±1.9 49.5±2.2
ReadAgent 75.6±2.3 21.7±4.4 46.4±2.9 69.0±3.4 62.0±2.3 54.9±1.1
DeLM 82.2±3.1 37.8±1.6 52.2±1.5 71.4±0.0 64.0±0.0 61.5±0.6
DeepSeek-V4-Pro
基础 86.7±3.1 47.8±2.0 44.9±2.0 76.2±3.4 64.0±0.9 63.9±1.3
Claude Code 84.4±3.1 36.2±2.0 56.5±4.4 64.3±2.1 48.7±0.9 58.0±0.9
ReadAgent 71.1±3.9 43.5±4.4 30.4±2.3 38.1±4.1 50.7±1.2 46.8±1.8
DeLM 86.7±5.4 52.2±2.0 59.4±4.4 73.8±3.4 65.3±0.9 67.5±1.2

LongBench-v2 多文档问答评估了 DeLM 能否改善跨长文档的证据聚合。与 SWE-bench Verified 不同(该基准中单条轨迹内的进展基本是顺序性的),此设置暴露了显著的任务内并行性:不同的智能体可以检查不同的文档、识别互补证据,并共同贡献到一个共享的答案状态。

如表 2 所示,DeLM 在所有四个模型系列中均取得了最高的平均准确率:GPT-5.4 为 60.1%,Claude Sonnet 4.6 为 59.8%,Gemini 3 Flash 为 61.5%,DeepSeek-V4-Pro 为 67.5%。与每个模型系列的最强基线相比,这些结果分别对应 5.7、5.3、4.4 和 3.6 个百分点的提升。DeLM 还在大多数领域-模型组合中取得了最佳或并列最佳的结果,这表明其优势来源于证据选择与复用能力的普遍提升,而非单一模型或领域。

这些性能提升首先源于构建了一个经过验证的文档集分层视图,从而能够进行更具针对性的详细检查。DeLM 首先将输入分割成多个块,并默认使用轻量级摘要生成器 DeepSeek-V4-Flash(DeepSeek-AI,2026)来生成分层摘要。经过验证的要点随后被纳入共享上下文,使所有智能体在决定详细检查哪些内容之前,能够获得语料库的紧凑视图。这种前置的全局视图有助于智能体识别跨文档关联、有选择地展开证据,并避免目标不明确的阅读。

相比之下,集中式和程序化检查基线方法在观察到相关内容之前,往往基于元数据、文件名或关键词匹配做出更局部的检查决策。因此,早期的错误可能会累积:控制器可能检查了错误的证据、遗漏了跨文档链接,或者需要额外的委派轮次。ReadAgent 也使用要点,但其查找过程直接依赖于有损摘要,没有分层展开和准入时的验证。因此,这些基线方法在长上下文场景中可能成本更低,因为它们避免了构建和验证整个上下文结构化视图的前期成本。DeLM 做出了不同的权衡:它在分层摘要和验证上投入了额外的计算,但换来了对语料库更可靠的理解,从而实现了更具针对性的证据选择和更高的预测准确率。

4.3.1 哪些组件使 DeLM 在 LongBench-v2 上有效

Refer to caption
图 4:在 LongBench-v2 多文档问答上的消融与鲁棒性分析。所有柱状图报告的是使用 GPT-5.4 在五个领域上的平均准确率。(a) 模块消融:移除验证步骤或分层摘要均会降低准确率。(b, c) DeLM 对其要点配置基本不敏感:一旦要点足够长,准确率即保持稳定 (b);并且在不同成本的摘要生成器下也保持稳定 (c)。在每个子图中,颜色较深的柱状图标记了表 2 中使用的默认配置。
模块消融。

为了分离 DeLM 两个核心组件的贡献,我们依次移除准入时验证和层级摘要,并在图 4(a) 中报告五个领域的平均准确率。移除验证导致最大降幅,从 60.1% 降至 55.2%,这表明未经核实的声明一旦进入共享上下文而未加检查,会污染下游推理。移除层级摘要同样损害性能,将准确率降至 57.7%,因为仅凭要点路由从全局导航到原始证据的路径较为粗糙。因此,两个组件都很重要,其中验证带来的增益更大。

轨迹证据解释了为何“无层级摘要”消融实验会降低性能。缺少中间层后,DeLM 要么必须从有损的要点直接路由到原始数据块,要么展开大量原始数据块以恢复缺失的细节。PUMA EBIT 查询展示了这种失败模式。文档中包含相互矛盾的 2024 年 EBIT 展望:一份来自年度报告的早期区间,以及一份来自 2024 年中期报告的后期收窄区间。要点层识别出候选数据块,但摘要层才能确定哪个来源时间更晚、定位相关子数据块,并标记出确切的 EBIT 区间必须从原始证据中恢复:(S72.2 表示数据块 72 的第二段,通过扫描摘要 S72 检索得到。)

t1

更晚

在

时间

来源

是

H1

S72

t1

只有在这种由粗到精的定位之后,工作节点才会请求原始证据。深度展开随后检索出精确锚定的子数据块,而非完整报告(RAW 表示通过展开恢复的对应原始文本):

S72

这个例子说明了层级结构为何至关重要。要点层支持低成本的全局导航,摘要层定位相关的原始文本范围并检测摘要级证据是否不足,原始展开层则恢复精确数值。因此,移除该层会同时削弱证据定位和成本可控的推理,这与图 4(a) 中的性能下降相符。

轨迹证据也解释了为什么移除验证会损害性能。在 DeLM 中,智能体的输出不会立即被纳入共享上下文;它们必须首先根据其引用的证据进行核查。这可以防止那些看似合理但缺乏依据的陈述成为可复用的共享状态。在一个比较 Lucy v. Zehmer 案与 Texaco v. Pennzoil 案的法律问题中,某个智能体引入了一项具体的损害赔偿主张,但该主张并未得到其引用的摘要的支持:

t2

S5

然而,所引用的要点仅说明该案件涉及一项附条件维持原判并附有 remittitur(减少赔偿金)的裁定;其中并不包含具体的损害赔偿金额。因此,验证器(一个 LLM)拒绝了这次更新:

t2

S5

重试之后,在结果被提交到共享上下文之前,那个缺乏依据的数字主张被移除了。如果没有这个准入时的把关环节,这个虚假细节就会像有据可查的证据一样,被后续的工作者和最终汇总者获取,这解释了图 4(a) 中“无验证”消融实验下性能下降的原因。

要点长度。

我们将每个源单元的目标要点长度分别设为 50、100 和 150 个 token(图 4(b))。准确率从 50 个 token 时的 58.3% 提升至 100 个 token 时的 60.1%,随后在 150 个 token 时趋于平稳,达到 60.3%。这表明存在一个阈值效应:一旦要点长度足以捕捉源单元的相关性,增加更多长度带来的收益就很小。因此,我们在主要实验中使用 100 个 token。选择性展开可能有助于这种稳定性,因为当要点不足时,智能体可以从原始源中恢复更精细的细节。

摘要模型。

我们还更换了要点摘要器(具体定义见 § A.1),分别使用 DeepSeek-V4-Flash、DeepSeek-V4-Pro 和 GPT-5.4,同时保持流水线的其余部分不变(图 4(c))。三个摘要器的准确率几乎保持不变(分别为 60.1%、60.4% 和 59.9%),其中最便宜的模型 DeepSeek-V4-Flash(我们的默认选择)与更强的替代方案表现相当。因此,一个轻量级的摘要器足以构建共享上下文,这使得 DeLM 能够将更强的模型保留用于子任务推理,而无需牺牲准确率。

5 将 DeLM 与 RLM 结合

递归语言模型(RLMs)(Zhang 等人,2025)通过递归选择上下文片段、发起子调用并组合生成的局部答案来处理长上下文。关键在于,RLM 通过一种代码驱动的读取-求值-打印循环(REPL)来执行此过程:长输入被存储为一个外部变量,模型可以以编程方式检查、解析和聚合该变量。这使得 RLM 天然适合 OOLONG(Bertsch 等人,2025)——一个高度依赖聚合的基准测试,其中每个样本由带时间戳和用户归属的条目组成,回答一个问题通常需要在计算分布性答案之前对许多条目进行分类。

媒体内容 · 前往原文查看
方法 准确率 每任务成本
OOLONG
RLM 56.0% $0.43
DeLM 53.3% $0.47
DeLM+RLM 64.0% $0.40
LongBench-v2 多文档问答
RLM 55.8% $0.29
DeLM 57.9% $0.30
DeLM+RLM 60.3% $0.24
表 3:在 LongBench-v2 多文档问答和 OOLONG 上,使用 GPT-5 对 RLM、DeLM 及其混合方法的比较。

我们首先在 LongBench-v2 多文档问答和 OOLONG 上,分别使用中等推理强度的 GPT-5(RLM 使用 GPT-5-mini 进行子调用,递归深度=1)对 DeLM 和 RLM 进行单独评估。如表 3 所示,这两种方法具有互补优势。在 LongBench-v2 上,DeLM 在每任务成本大致相同的情况下,平均准确率高于 RLM。然而在 OOLONG 上,DeLM 在平均准确率和成本两方面均不如 RLM。这是因为 OOLONG 更接近结构化数据处理基准,而非对话式推理基准(如 LongBench-v2):许多问题需要精确计数、过滤、比较和并列处理。在这种场景下,DeLM 使用的自然语言共享上下文并不可靠。RLM 表现更佳,因为其核心接口是通过代码中介的:借助 REPL 环境,模型可以使用可执行程序和程序化子调用来检查、解析、转换和聚合输入。然而,RLM 仍然依赖集中式协调,递归调用向根进程报告,根进程必须协调并聚合它们的输出。这种集中式聚合不太适合自然语言多文档推理,这有助于解释 RLM 在 LongBench-v2 上表现较弱的原因。这些结果促使我们设计一种混合方案,将 RLM 基于 REPL 的精确执行与 DeLM 的去中心化协调结合起来。

因此,我们将两种方法结合起来,保留 RLM 作为底层推理器,同时添加两个 DeLM 组件:一个经过验证的共享上下文和一个去中心化任务队列。在这种混合设置中,不存在主智能体/子智能体的层级结构;所有智能体都是同等地位的 RLM 实例,通过共享状态进行协调。初始的 RLM 调用会生成一个紧凑的工作计划,之后子任务被放入任务队列,并由并行的 RLM 工作节点认领。每个工作节点的输出只有在通过验证门之后才会被纳入共享上下文。然后,系统根据当前问题状态生成任何额外的子任务,并在不再需要子任务时,根据经过验证的共享上下文计算出最终答案。这种设计保留了 RLM 在精确的代码中介执行方面的优势,同时增加了 DeLM 的去中心化协调能力。如表 3 所示,这种结合方法在两个基准测试上都实现了最高的准确率和最低的成本,表明 RLM 和 DeLM 是互补而非竞争的方法。

6 相关工作

多智能体系统。

近期基于大语言模型的多智能体系统通过将问题分解至专门化或交互式智能体来提升任务性能。早期框架如 CAMEL(Li 等人,2023)实例化了角色扮演型智能体以研究自主协作。MetaGPT(Hong 等人,2023)与 ChatDev(Qian 等人,2024)进一步通过受软件工程启发的角色、通信协议及标准化工作流来结构化协作,证明了专业化能够降低多步骤任务中的协调复杂度。AOrchestra(Ruan 等人,2026)通过实例化指令、上下文、工具和模型来动态创建任务特定的子智能体;ToolOrchestra(Su 等人,2025)训练了一个轻量级编排器,在准确性、效率和用户偏好奖励的约束下协调模型与工具;Squeeze Evolve(Maheswaran 等人,2026)将进化推理的不同阶段路由至不同成本与能力的模型;RecursiveMAS(Yang 等人,2026)则用跨智能体的递归潜状态传递取代了文本级通信。Combee(Li 等人,2026)同样指出在高并行度下集中式聚合是瓶颈,但其重点在于扩展并行提示学习而非去中心化的智能体协调。近期黑板式多智能体系统(Han 与 Zhang,2025;Salemi 等人,2025)利用共享黑板让智能体交换信息或主动提供信息,既可用于通用推理,也可用于数据发现。

这些系统表明,智能体间的协调可以通过动态委派、学习型编排、模型路由、递归协作以及共享黑板机制来实现规模化。然而,基于编排的方法主要优化的是智能体的创建、路由或组合方式,而通信底层本身并未得到验证:中间输出被传递、总结或聚合,但在下游复用之前,并未将每条记录与其底层证据进行核对;基于黑板的方法则向黑板写入原始或轻度结构化的消息,并且仍然通过选择步骤或中央发布者来路由协调。相比之下,DeLM 将共享上下文视为经过整理和验证的状态:智能体通过任务队列完全异步地进行协调,无需中央控制器,每条记录只有在经过其支持证据验证后才被允许写入,并且记录以紧凑的摘要形式存储,可按需展开为更详细的细节,从而在智能体数量增长时保持共享状态的可靠性和可扩展性。

编程式智能体系统。

有一类密切相关的系统为语言模型配备了与外部环境交互的编程接口,使其能够检查状态、调用工具、操作工件以及递归地委派计算任务。递归语言模型(RLMs)(Zhang 等人,2025)将这一范式应用于长上下文推理,通过将提示词视为外部环境,并递归地选择片段进行检查。它通过一个代码驱动的读取-求值-打印循环(REPL)来执行此过程。诸如 Claude Code(Anthropic,2026a)和 Codex(OpenAI,2025)等智能体编码系统将这一思想扩展到软件环境中,使模型能够读取代码仓库、编辑文件、执行命令并整合工具反馈。这些方法表明,将语言模型与可执行环境相结合,能够显著增强其超越单次生成的能力。

然而,仅靠程序化访问并不能解决协调问题。在许多系统中,规划仍然通过主智能体或本地工具循环进行路由,中间结果被复用为原始观测结果或散文式摘要,而没有经过准入时间接地步骤。因此,有用的发现可能局限于单条轨迹,而无根据的声明或放宽的约束则可能通过后续推理传播。DeLM 是对这些系统的补充:它不取代工具、代码执行或 REPL 式检查,而是提供一个去中心化的协调层,在该层中,工具得出的发现、失败和部分解决方案可以被压缩、验证并在各智能体之间共享。这种互补性体现在我们的 OOLONG 实验(§5)中,其中将 DeLM 与 RLM 相结合的效果优于单独使用任何一种方法。

长上下文语言模型系统。

另一条研究路线通过存储、压缩或检索超出模型当前上下文窗口的信息来解决长上下文推理问题。Mu 等人(2023)引入了一种基于训练的方法,将长提示词压缩为紧凑的“要旨”表示。Context-Folding(Sun 等人,2025)通过定期压缩对话历史,将长交互保持在上下文窗口内。这些方法减少了上下文长度,但一旦细粒度信息被丢弃,当后续推理需要精确细节时,就无法可靠地恢复。ReadAgent(Lee 等人,2024)则将压缩与检索相结合:它将多页文本总结为简短的要旨记忆,并在任务需要要旨中遗漏的细节时查找原始段落。然而,由于查找是从有损的要旨触发的,ReadAgent 可能会遗漏那些相关性未在压缩表示中保留的证据。

诸如 LongMem(Wang 等人,2023)、MemGPT(Packer 等人,2023)、Mem0(Chhikara 等人,2025)和 MemOS(Li 等人,2025)等记忆增强系统,为大语言模型引入了外部记忆机制,使其能够在长时间交互或任务历史中保留信息。例如,MemGPT(Packer 等人,2023)提出了一种受操作系统启发的虚拟上下文机制,用于决定哪些内容保留在活动上下文中,哪些内容移入外部记忆。这些系统使记忆具有持久性,但检索通常是扁平的:一条记忆项要么被选入上下文,要么被忽略。而 DeLM 则根据抽象层级来组织共享信息。智能体首先在整个问题范围内对紧凑的、经过验证的要点进行推理,然后选择性地将相关条目展开为详细摘要和原始证据。这种层级结构使得共享上下文既具有全局性,又具有可恢复性。

7 局限性与未来工作

尽管我们的结果证明了 DeLM 的有效性,但仍有一些方向有待未来探索。首先,准入时刻验证以适度的开销换取了更强的可靠性保证;更轻量级的验证器,包括针对常见声明类型的习得模型或基于规则的检查,可以在保持我们所观察到的依据优势的同时,进一步提高效率。其次,DeLM 继承了智能体的分解质量。过于粗略的分解会使智能体面临子任务定义不明确的问题,而过于激进的分解则可能产生不必要的智能体,并使推理过于复杂。一个有前景的方向是训练自适应智能体,使其能够根据共享上下文决定何时拆分、合并或终止子任务。第三,正如先前工作(Zhang 等人,2025)所指出的,不存在跨模型普遍最优的提示词;不同的模型系列可能需要量身定制的提示词才能引出预期的行为。将 DeLM 与诸如 GEPA(Agrawal 等人,2025)等提示词进化方法相结合,可以进一步使其分解、摘要和验证提示词适应每个模型系列。

超越本文所研究的基准测试,DeLM 为自动化研究系统指明了一个有前景的方向(AlphaEvolve 团队,2025;Liu 等人,2026)。研究工作流程天然地将测试时扩展与长上下文推理结合在一起:智能体必须探索替代性假设、查阅大量论文或实验日志、跨来源比对证据,并迭代地完善结论。去中心化的共享上下文可以通过防止智能体重复阅读相同论文或反复运行相同的失败分析,使此类系统更高效;通过允许有用的发现跨并行研究线程传播,使其更有效;通过仅将经过验证的声明纳入共享状态,使其更稳健。因此,我们将自动化研究视为未来去中心化多智能体系统(MAS)的一个天然应用领域。

8 结论

我们提出了 DeLM,这是一个去中心化的多智能体系统,其中智能体通过共享上下文和任务队列进行协调,而非依赖中央控制器。通过仅将紧凑且经过验证的更新纳入共享状态,DeLM 将中间进展转化为可复用的问题状态:智能体可以基于先前的发现进行构建,避免重复失败,保留约束条件,并仅在需要时恢复详细的证据。在 SWE-bench Verified 上,DeLM 通过使发现和失败在并行尝试中可复用,从而改进了测试时扩展,在降低成本的同时实现了更高的通过率。在 LongBench-v2 多文档问答任务上,DeLM 通过构建一个经过验证的、层次化的语料库视图,提高了长上下文推理能力,从而实现了更高的准确率。我们进一步证明,DeLM 与 RLM 是互补的,其中去中心化的验证状态改进了程序化聚合。这些结果表明,可扩展的多智能体系统不仅需要更多的并行智能体,还需要一个可靠的通信基础,以便在它们之间共享进展。

9 致谢

我们感谢 Shayan Talaei、Jon Saad-Falcon、Jacky Kwok、Hermann Kumbong、Ishan Khare、Miria Feng、Qizheng Zhang、Swapnil Gandhi、Michael Y. Li、Chun Deng、Chong Zeng、Rui Li、Ke Li、Marquita Ellis、Hangoo Kang、Adrian Gamarra Lafuente、Charles Ding、Tarun Suresh、Ziyu Chen、Zhuohan Gu、Yize Liu 和 Ligeng Zhu。我们还要感谢我们在斯坦福人工智能实验室(SAIL)和斯坦福 HAI 的合作者。

我们衷心感谢来自联邦机构的支持:美国国家科学基金会(NSF)项目编号 24-554(AIMing)以及美国国防高级研究计划局(DARPA)项目编号 HR00112520038(Fallingwater)。我们也衷心感谢斯坦福 HAI、IBM(代码生成)、Lightspeed、Google 和 Google DeepMind 的支持。

参考文献

  • L. A. Agrawal, S. Tan, D. Soylu, N. Ziems, R. Khare, K. Opsahl-Ong, A. Singhvi, H. Shandilya, M. J. Ryan, M. Jiang, 等人 (2025) Gepa:反思性提示词进化可以超越强化学习。arXiv 预印本 arXiv:2507.19457。引用自:§7。
  • AlphaEvolve 团队 (2025) AlphaEvolve:一个由 Gemini 驱动的、用于设计高级算法的编码智能体。说明:Google DeepMind 博客。访问日期:2026-06-03。外部链接:链接。引用自:§1, §7。
  • Anthropic (2025) Claude Sonnet 4.6。说明:https://www.anthropic.com/news/claude-sonnet-4-6。访问日期:2026-05-06。引用自:§4.1。
  • Anthropic (2026a) Claude Code。说明:https://claude.ai/。引用自:§1, §1, §4.1, §6。
  • Anthropic (2026b) 介绍 Claude Opus 4.6。说明:Anthropic。访问日期:2026-06-01。外部链接:链接。引用自:§4.1。
  • Y. Bai, S. Tu, J. Zhang, H. Peng, X. Wang, X. Lv, S. Cao, J. Xu, L. Hou, Y. Dong, 等人 (2025) LongBench v2:迈向对真实长上下文多任务的更深层次理解与推理。收录于:第63届计算语言学协会年会论文集(第1卷:长论文),第3639–3664页。引用自:§1, §4.1。
  • A. Bertsch, A. Pratapa, T. Mitamura, G. Neubig, 和 M. R. Gormley (2025) Oolong:评估长上下文推理与聚合能力。arXiv 预印本 arXiv:2511.02817。引用自:§1, §5。
  • P. Chhikara, D. Khant, S. Aryan, T. Singh, 和 D. Yadav (2025) Mem0:构建具备可扩展长期记忆的生产级 AI 智能体。arXiv 预印本 arXiv:2504.19413。引用自:§6。
  • DeepSeek-AI(2026)DeepSeek-v4:迈向高效百万级 token 上下文智能。引用自:§4.1, §4.3。
  • T. Doshi(2025)Gemini 3 Flash:为速度而生的前沿智能。注:Google — The Keyword。访问日期:2026-06-01。外部链接:Link。引用自:§4.1。
  • Z. Feng, L. Su, Z. Zhang, X. Wang, X. Zhang, X. Wang, R. Fang, Q. Zhang, B. Li, S. Cai, 等(2026)AgentSwing:面向长周期 Web 智能体的自适应并行上下文管理路由。arXiv 预印本 arXiv:2603.27490。引用自:§1。
  • B. Han 和 S. Zhang(2025)基于黑板架构的高级大语言模型多智能体系统探索。arXiv 预印本 arXiv:2507.01701。引用自:§6。
  • S. Hong, M. Zhuge, J. Chen, X. Zheng, Y. Cheng, J. Wang, C. Zhang, Z. Wang, S. K. S. Yau, Z. Lin, 等(2023)MetaGPT:面向多智能体协作框架的元编程。载于第十二届国际学习表征会议。引用自:§1, §6。
  • C. E. Jimenez, J. Yang, A. Wettig, S. Yao, K. Pei, O. Press, 和 K. R. Narasimhan(2024)SWE-bench:语言模型能否解决真实世界的 GitHub 问题?载于第十二届国际学习表征会议。外部链接:Link。引用自:§1, §4.1。
  • Kimi, T. Bai, Y. Bai, Y. Bao, S. Cai, Y. Cao, Y. Charles, H. Che, C. Chen, G. Chen, 等(2026)Kimi k2.5:视觉智能体智能。arXiv 预印本 arXiv:2602.02276。引用自:§1, §1。
  • K. Lee, X. Chen, H. Furuta, J. Canny, 和 I. Fischer(2024)一种受人类启发的、具备超长上下文要点记忆的阅读智能体。arXiv 预印本 arXiv:2402.09727。引用自:§4.1, §6。
  • G. Li, H. Hammoud, H. Itani, D. Khizbullin, 和 B. Ghanem(2023)Camel:面向大语言模型社会“思维”探索的沟通型智能体。神经信息处理系统进展 36, 第 51991–52008 页。引用自:§6。
  • H. Li, R. He, Q. Zhang, C. Ji, Q. Mang, X. Chen, L. A. Agrawal, W. Liao, E. Yang, A. Cheung, 等(2026)Combee:扩展提示学习以实现自我改进的语言模型智能体。arXiv 预印本 arXiv:2604.04247。引用自:§6。
  • Z. Li, S. Song, H. Wang, S. Niu, D. Chen, J. Yang, C. Xi, H. Lai, J. Zhao, Y. Wang 等人 (2025) 《Memos:面向大语言模型中记忆增强生成(MAG)的操作系统》。arXiv 预印本 arXiv:2505.22101。引自:§6。
  • S. Liu, M. Cemri, S. Agarwal, A. Krentsel, A. Naren, Q. Mang, Z. Li, A. Gupta, M. Maheswaran, A. Cheng, M. Pan, E. Boneh, K. Ramchandran, K. Sen, M. Zaharia, A. G. Dimakis 和 I. Stoica (2026) 《SkyDiscover:面向 AI 驱动的科学与算法发现的灵活自适应框架》。收录于《ACM 人工智能与智能体系统会议论文集》,CAIS '26,第 1223–1227 页。外部链接:文档,链接。引自:§1,§7。
  • M. Maheswaran, L. Lakhani, Z. Zhou, S. Yang, J. Wang, C. Hooper, Y. Hu, R. Tiwari, J. Wang, H. Singh 等人 (2026) 《Squeeze Evolve:面向无验证器进化的统一多模型编排》。arXiv 预印本 arXiv:2604.07725。引自:§6。
  • J. Mu, X. Li 和 N. Goodman (2023) 《利用要点 token 学习压缩提示词》。《神经信息处理系统进展》36,第 19327–19352 页。引自:§6。
  • OpenAI (2025) 《Codex》。注释:https://openai.com/codex/。引自:§1,§6。
  • OpenAI (2026) 《推出 GPT-5.4》。注释:https://openai.com/index/introducing-gpt-5-4/。访问日期:2026-05-06。引自:§4.1。
  • C. Packer, V. Fang, S. Patil, K. Lin, S. Wooders 和 J. Gonzalez (2023) 《MemGPT:将大语言模型视为操作系统》。引自:§6。
  • C. Qian, W. Liu, H. Liu, N. Chen, Y. Dang, J. Li, C. Yang, W. Chen, Y. Su, X. Cong 等人 (2024) 《ChatDev:面向软件开发的通信智能体》。收录于《计算语言学协会第 62 届年会论文集(第一卷:长论文)》,第 15174–15186 页。引自:§6。
  • J. Ruan, Z. Xu, Y. Peng, F. Ren, Z. Yu, X. Liang, J. Xiang, Y. Chen, B. Liu, C. Wu 等人 (2026) 《AOrchestra:面向智能体编排的子智能体自动创建》。arXiv 预印本 arXiv:2602.03786。引自:§1,§1,§4.1,§6。
  • A. Salemi, M. Parmar, P. Goyal, Y. Song, J. Yoon, H. Zamani, T. Pfister 和 H. Palangi (2025) 《基于大语言模型的多智能体黑板系统用于数据科学中的信息发现》。arXiv 预印本 arXiv:2510.01285。引自:§6。
  • H. Su, S. Diao, X. Lu, M. Liu, J. Xu, X. Dong, Y. Fu, P. Belcak, H. Ye, H. Yin 等 (2025) 《Toolorchestra:通过高效模型与工具编排提升智能》。arXiv 预印本 arXiv:2511.21689。引用自:§6。
  • W. Sun, M. Lu, Z. Ling, K. Liu, X. Yao, Y. Yang 和 J. Chen (2025) 《通过上下文折叠扩展长周期大语言模型智能体》。arXiv 预印本 arXiv:2510.11967。引用自:§6。
  • W. Wang, L. Dong, H. Cheng, X. Liu, X. Yan, J. Gao 和 F. Wei (2023) 《用长期记忆增强语言模型》。Advances in Neural Information Processing Systems 36, 第 74530–74543 页。引用自:§6。
  • J. Yang, C. E. Jimenez, A. Wettig, K. Lieret, S. Yao, K. R. Narasimhan 和 O. Press (2024) 《SWE-agent:智能体-计算机接口实现自动化软件工程》。收录于第三十八届神经信息处理系统年度会议,外部链接:Link。引用自:§4.1。
  • X. Yang, J. Zou, R. Pan, R. Qiu, P. Lu, S. Diao, J. Jiang, H. Tong, T. Zhang, M. J. Buehler 等 (2026) 《递归式多智能体系统》。arXiv 预印本 arXiv:2604.25917。引用自:§6。
  • A. L. Zhang, T. Kraska 和 O. Khattab (2025) 《递归式语言模型》。arXiv 预印本 arXiv:2512.24601。引用自:§1, §1, §1, §4.1, §5, §6, §7。

补充材料

Refer to caption
图 5:(a) 长源单元被压缩为基于引用的摘要,然后进一步压缩为紧凑的要旨,存储在共享上下文中。(b) 智能体默认读取要旨,在需要时选择性地展开为摘要或原始证据,并且 (c) 仅在验证后才允许条目进入。

附录 A 方法细节

A.1 分层摘要

对于带有标签的长源单元,DeLM 使用三级表示。共享上下文仅存储紧凑的要旨条目,为每个智能体提供语料库的轻量级全局视图。详细的支撑内容存储在外部:包含基于引用的摘要,而包含对应的原始源单元。

这种层级结构避免了依赖有损的要点摘要来直接选择原始证据,同时也避免了直接展开宽泛的原始上下文。智能体首先对要点摘要进行推理,仅在需要更细粒度的支持时,才展开到要点摘要或原始证据。对于推理轨迹,DeLM 通常允许直接使用要点摘要,因为后续智能体通常需要的是提炼后的发现、失败信息、反馈或约束条件,而非完整的轨迹;原始轨迹在需要时仍然可用。

我们现在描述针对长源单元的层级化摘要路径。

阶段 1:(基于参考的证据映射)。

给定一个源单元,第一阶段的摘要生成器会生成一个证据映射,该映射由一组简短的要点组成,每个要点表达一个单一的原子性主张。每个要点都包含一个引用标签,用于标识其在原始文本中的支持性片段:

(1)

其中 和 分别表示支持性片段的第一个词和最后一个词,并逐字复制。形式上,

(2)

其中 是第 个要点, 是其引用标签。 以问题为条件,从而以更高保真度提取与问题相关的内容。要求对源单元进行全覆盖,因为任何部分都可能包含回答问题所需的关键证据。生成的 存储在 中,每个要点可通过其本地索引 进行寻址。

阶段 2:(紧凑的共享上下文条目)。

第二阶段的摘要生成器将 压缩成一个简短、高度紧凑的要点摘要:

(3)

该要点摘要捕捉了 与查询的相关性,其密度足以让下游智能体一眼判断是否需要进一步检查。只有 被纳入 ,而 和原始内容则保留在 和 中,仅通过选择性展开(§A.2)进行访问。

A.2 选择性展开

智能体默认使用紧凑条目对共享上下文进行推理。当需要更多细节时,它们会调用选择性展开,这是一种从粗到细、按需获取更详细信息的可选机制。我们分两个阶段实现展开:首先,从 到基于参考的摘要 ;然后,如有必要,再从 到原始源内容。

阶段 1:(展开)。

在任意推理步骤中,智能体可通过 UNFOLD: 指令请求获取一小批标签。编排器会检索对应的摘要,并将其要点级证据图内联到该次调用的智能体提示词中。这使得智能体能够基于有据可查的证据进行推理,而非依赖压缩后的要点概括。

第二阶段:(深度展开)。

在对摘要进行推理后,智能体可能判定需要更细粒度的细节——例如,为了解析微妙的限定词或核实确切的措辞。此时,它可以发出 DEEP_UNFOLD: 指令,指定需要原始内容的标签。编排器会发起一次后续调用,将原始任务、共享上下文、先前已展开的摘要以及新请求的原始内容整合在一起。

展开过程遵循从粗到细、按需调用的方式,可进行多轮直至达到固定上限,每轮都允许智能体根据需要请求额外内容或原始内容。此外,原始检索还具有邻域感知特性:请求子片段时也会返回其相邻内容,这有助于吸收因引用偏差导致的错位错误。重要的是,展开后的内容仅局限于发起请求的调用,不会写回共享上下文,因此后续智能体仍然只能观察到要点层。这种设计防止了详细的中间内容污染共享上下文,同时在必要时保留了对细粒度证据的访问权限。因此,详细审查的成本与实际所需的信息量成正比,而非与可用上下文的总量相关。

A.3 准入时刻验证

验证遵循压缩路径。对于一条推理轨迹,DeLM 会检查要点是否忠实地保留了原始结果中的相关发现、失败、反馈或约束。对于一个长源单元,DeLM 会验证层级结构的两个层面:首先将第一阶段的摘要锚定到原始来源,然后对照原始来源检查第二阶段的要点。

具体而言,每个带有引用的第一阶段要点,仅当其在原始源单元中按顺序、逐字出现首尾部分时,才会被采纳。未通过此条件的要点将被转入定向重写步骤,该步骤要么提供有效引用,要么删除该主张。

通过此关卡后,一个迭代覆盖循环会识别出未被任何已采纳要点引用的大片未覆盖区域(定义为连续的文本跨度),并为每个缺口请求额外的要点。新生成的要点必须通过相同的引用和语义支持检查,才能被添加到 中。当不存在大片缺口或达到固定的迭代次数上限时,该循环终止。

随后,第二阶段摘要由经过验证的 生成。由于 仅包含有依据的主张, 在粗粒度层面继承了这种依据性。为防止抽象错误, 会使用一个成本较低的 LLM(例如 DeepSeek-V4-Flash)进行轻量级验证步骤,该步骤检查相对于 是否存在模型幻觉、语义漂移以及缺失关键限定词。只有通过此检查的摘要才会被纳入 ;否则,更新将被拒绝、重新生成,或附带拒绝原因返回任务队列,直至达到固定的重试次数上限。

A.4 并行执行与系统优化

DeLM 使用三种轻量级机制来支持安全高效的并行执行:带有严格读写规范的并发准入、依赖感知的任务队列,以及跨调用的 KV 缓存复用。

并发准入与读写规范。

压缩与验证在已完成的结果上并行执行。每个完成的智能体根据自身局部结果独立提出更新,相应的摘要生成和验证调用可以同时运行。唯一需要同步的步骤是准入环节。一旦更新通过验证,DeLM 首先将其支撑内容写入 `和`,然后通过原子写入将可见条目追加到 `中`。智能体在分派时读取 `的无锁快照`;后续提交的条目仅在下一次快照时变为可见。这种先写入后发布的顺序确保了每个可见标签都能无竞态地展开,后续智能体只能观察到完全验证通过的条目,并且缓慢的摘要生成或验证调用不会造成全局同步屏障。

依赖感知的任务队列。

初始阶段,给定一个输入任务后,DeLM 首先构建一个任务拓扑结构:一个编号列表,其中每个任务都带有一个标签,指明其上游依赖关系。无依赖的任务首先被分派;后续任务在其依赖完成后变为可执行状态。当队列耗尽时,单个智能体获取队列锁,并利用当前共享上下文、原始计划以及已执行任务列表调用 GenerateMoreSubtasks。如果原始计划已完成,且预计不会再有新的展开操作改变任何子声明的状态,则该函数可能返回。此步骤在实践中还能防止依赖死锁:当没有待处理任务可执行时,系统不会无限等待,而是调用 GenerateMoreSubtasks 来创建缺失的先决子任务、修正被阻塞的依赖关系,或者在当前共享上下文已足够时终止。

基于稳定共享上下文的 KV 缓存复用。

共享上下文设计还提升了 KV 缓存的复用效率。由于该部分内容高度稳定且具有累积性,并且始终位于每次模型调用的开头,它便构成了跨多次调用的持久前缀。这在多步推理场景中尤为有用——许多大语言模型调用共享相同的全局状态,仅任务特定的后缀部分有所不同。因此,对共享前缀的重复计算可以被分摊,随着推理步骤数量的增加,效率提升也会更加显著。

来源:HuggingFace Daily Papers(社区热门论文) · arxiv.org