跳到正文
北京时间
原文
HuggingFace Daily Papers(社区热门论文)·· 2026-07-30精选AI 评分71

BM25 在大规模语料中胜出:检索增强生成范式的规模扩展研究

BM25 Wins at Scale: A Scaling Study of Retrieval-Augmented Generation Paradigms

AI 导读

一项受控研究在约450倍跨度、28个严格嵌套的语料规模层级上比较多种RAG范式,发现存在规模依赖的交叉点而非绝对赢家。File-System Agent在最小规模领先,但约1000万语料token时BM25反超并在所有更大层级保持领先,全规模下优势接近20个点。BM25还锚定了无需LLM构建的低成本帕累托前沿。

推荐理由

这篇论文把词法、稠密、图检索和代理搜索放在同一个尺度下对比,发现数据规模越大,BM25越强,这很反直觉,做RAG应用的选型逻辑可能要变。

正文 · AI 翻译

中国科学技术大学,合肥,中国 2] 迈石科技,北京,中国 3] 北京市农林科学院信息技术研究中心,北京,中国 \contribution[†]项目负责人

BM25 在大规模下胜出:检索增强生成范式的扩展性研究

王鹏宇

徐本峰

王绍涵

杜明轩

曾鑫

吴华瑞

张磊

张立成

zlczlc@mail.ustc.edu.cn

摘要

检索增强生成(RAG)涵盖词法检索与稠密检索、基于图的索引以及智能体式搜索,但这些范式通常是在单一语料规模下、基于不同基准进行评估,导致其准确率与成本之间的扩展关系尚不明确。为弥补这一空白,我们开展了一项受控研究:在保持问题集以及一组固定的相关文档与对抗性文档基岩不变的前提下,将语料规模沿 28 个严格嵌套的层级进行变化,跨度约为 450 倍。在统一的阅读器模型和统一的评判协议下,我们测算了官方准确率、构建与查询 token 数以及延迟。结果揭示了一种随规模变化的交叉现象,而非某一范式无条件胜出。文件系统智能体(File-System Agent)在最小的共享层级上领先,但其顺序式探索在基岩规模下消耗的查询 token 多达 39 倍,且随着搜索空间扩大,其效果逐渐下降。当语料 token 数达到约 1000 万时,BM25 反超并在此后所有更大的共享层级上保持领先,在完整规模下优势接近 20 个百分点。BM25 还锚定了帕累托前沿的低成本端,且无需基于 LLM 的构建过程。稠密检索依然高效但准确率较低;基于图的 RAG 在部署规模之前便遭遇构建瓶颈,其可扩展变体在共享层级上仍低于 BM25。总体而言,语料规模的增长越来越有利于全局候选排序:词法检索是最强的可扩展默认方案,而智能体式推理在排序发现之后发挥作用效果最佳,而非替代排序发现。

张立成,脚注:本工作于迈石科技实习期间完成。

1 引言

检索增强生成将大语言模型的输出锚定在外部语料库中,从而缓解模型幻觉(Lewis 等人,2021)。其方法已分化为多种范式,各自的成本产生于不同阶段、以不同形式出现。词法检索(Robertson 和 Zaragoza,2009)与稠密检索(Karpukhin 等人,2020)几乎不需要前期准备:索引构建最多只需对语料库做一次嵌入向量遍历。基于图的 RAG,包括 MS-GraphRAG(Edge 等人,2025)、LightRAG(Guo 等人,2025)和 HippoRAG 2(Gutiérrez 等人,2025a, b),在索引阶段投入巨大:它对每个文本块运行一次 LLM 以抽取实体和关系,从而在查询阶段可以利用所构建的结构;LinearRAG(Zhuang 等人,2025)则改用轻量级命名实体识别器加嵌入向量来构建同类图结构。

文件系统智能体(File-System Agent)将成本花在查询阶段,通过迭代式文件系统工具调用来让 LLM 搜索语料库(Yao 等人,2023)。每次调用都以前一次结果作为条件,使工具循环成为一种顺序检索策略。同样的文件加命令接口在编码智能体系统中也已确立(Jimenez 等人,2024;Yang 等人,2024a;Wang 等人,2025),并被 Claude Code 和 Codex 等领先的工业级智能体所采用。我们在语料库原始的按来源划分的文件树上实例化这一接口,无需任何检索索引。基于图索引运行的智能体则由我们的访问层实验覆盖。

然而,关于这些范式如何随规模扩展,我们所知甚少。每种范式通常都在单一语料库规模下、于各自的基准上进行评估,而实际部署的语料库——例如企业知识库——往往包含数十万份文档且仍在持续增长。我们所说的“规模扩展”,指的是在负载保持不变的情况下,语料库不断增大时各范式的表现变化。

[Uncaptioned image]

媒体内容 · 前往原文查看
图 1:观测到的规模扩展交叉点示意图。各点估计值在大约 1000 万语料库 token 处发生交叉,此后在每一个更大的共享规模层级上,BM25 均领先。图 3 报告了实测曲线与置信带。

从最小层级开始,与问题相关的证据和对抗性干扰证据也是固定的。我们从三个维度进行衡量:答案准确率、构建 token(生成和嵌入)的离线成本,以及查询 token 和延迟的在线成本。准确衡量这一点很困难,因为准确率差异很容易被阅读器模型、评判模型、问题集和语料库难度等因素混淆。现有的比较通常将语料库固定在单一规模,并自由变化这些因素,因此扩展性问题一直悬而未决。

为弥补这一空白,我们在 EnterpriseRAG-Bench(Sun 等人,2026)上开展了一项受控的语料库扩展研究。该基准包含 511,959 篇文档的企业语料库,配有 500 个问题以及每个问题对应的对抗性干扰项。规模沿 28 个严格嵌套层级的阶梯变化,每级按 1.25 倍增长,从 1,144 篇文档扩展到 511,959 篇文档(对应 1.7M 到 601M token),同时与问题相关的文档和干扰项保持固定。额外文档按照固定的、按来源和噪声分层排序的顺序加入。每种范式都使用相同的底层阅读器模型回答相同的问题,并进行 token 级成本计量,所有预测均按照该基准的官方协议进行评分,同时使用独立的评判模型和二元协议来检验稳健性。核心发现(如图 1 所示)是存在一个随规模变化的交叉点,而非在所有语料库规模下都无条件胜出。在可比较的最小共享层级上,文件系统智能体(File-System Agent)的官方点估计值更高。在约 10M token 规模时,BM25 追平了它;此后在每一个更大的共享层级上,BM25 均保持领先,同时其查询成本几乎与规模无关,而文件系统智能体则为顺序探索付出了越来越高的代价。在 601M token 的完整语料库上,差距达到近 20 个百分点。稠密检索始终低于这两者,而基于图的 RAG 要么过早达到构建上限,要么在其完成的共享层级上仍低于 BM25。

  • 一个可复用的 28 层级、450 倍规模的语料库阶梯,从 1,144 篇文档扩展到 511,959 篇文档,同时保持问题、证据和干扰项固定不变。

  • 对跨越四种 RAG 范式的七条流水线进行统一评估,包含 token 级成本计量和匹配的对照组。

  • 一种随规模变化的交叉现象:文件系统智能体在初期领先,而 BM25 在语料库 token 数达到约 1000 万时反超。

2 相关工作

2.1 检索增强生成

RAG 通过已学习或固定的阅读器,将生成过程建立在检索到的文本之上(Lewis 等,2021;Guu 等,2020;Ram 等,2023);自适应变体进一步决定何时检索或批判性评估证据(Asai 等,2023;Jiang 等,2023)。检索方式涵盖从词法 BM25(Robertson 和 Zaragoza,2009;Lin 等,2021)到已学习的稀疏、稠密及后期交互模型(Formal 等,2021;Karpukhin 等,2020;Khattab 和 Zaharia,2020)。我们使用 BM25 和紧凑的块嵌入向量作为具有代表性的词法与稠密接口,同时保持阅读器固定不变。

2.2 基于图的 RAG

这些方法在回答问题之前构建显式结构。MS-GraphRAG 构建分层实体社区及报告(Edge 等,2025);LightRAG 对实体和关系进行索引(Guo 等,2025);HippoRAG 2 通过查询关联事实和个性化 PageRank 进行检索(Gutiérrez 等,2025a,b)。LinearRAG 则利用轻量级 NER 和嵌入向量构建实体共现图,无需生成式构建调用(Zhuang 等,2025)。这一家族还包括基于树、人工构建知识图谱和 GNN 的索引方法(Sarthi 等,2024;Chen 等,2024;Mavromatis 和 Karypis,2024;Peng 等,2024),但已发表的评估通常仍停留在固定且相对较小的语料库规模上。

2.3 智能体检索

第三个方向是用一个LLM智能体取代单次流水线,该智能体将推理与工具调用交错进行(Yao et al., 2023; Schick et al., 2023; Qin et al., 2023),搜索开放网络(Nakano et al., 2022),在多步推理过程中自适应检索(Trivedi et al., 2023; Press et al., 2023),对失败进行反思(Shinn et al., 2023),或通过强化学习学习搜索策略(Jin et al., 2025)。这些系统在控制器和检索基底上都有所变化,而我们的扩展性问题要求控制器保持固定。因此,我们以编码智能体所确立的形式来实例化这一范式:一个相同的工具循环,通过纯文件系统操作在语料库中导航(Jimenez et al., 2024; Yang et al., 2024a; Wang et al., 2025)。我们的文件系统智能体将该接口应用于原始企业语料库;随后,基底实验在保持其策略模型、提示词、工具循环和预算固定的情况下,将原始文件替换为图索引。

Refer to caption
图2:评估方法。四种范式访问相同的嵌套语料库阶梯(),该阶梯每级增长1.25倍,同时保留固定的1,144篇文档基座。500个问题分为470个源文档支撑问题、10个脚手架支撑的高层问题和20个未找到问题。每种范式使用相同的阅读器,并在构建/查询token、延迟和官方准确率上进行计量。T0⊂⋯⊂T27

2.4 基准测试与评判

现有的RAG基准测试在固定语料库规模下评估答案质量,且很少计量离线成本(Yang et al., 2024b)。我们通过嵌套扩展、统一成本核算和跨范式比较,扩展了EnterpriseRAG-Bench的多源语料库和官方评估(Sun et al., 2026)。我们通过双协议和实测的跨评判一致性来约束评判依赖性(Zheng et al., 2023)。

3 方法

本节描述语料库、嵌套扩展阶梯,以及统一的作答与计量框架。图2总结了完整流水线。

3.1 语料库与问题

EnterpriseRAG-Bench 模拟了一家提供 LLM 推理服务的虚构公司。该语料库包含 511,957 份文档,总计 6.008 亿个 token,来源于九个渠道,包括维基页面、聊天记录、工单、电子邮件、会议记录、CRM 记录和代码审查。连同基准测试中作为脚手架提供的两个组织概览页面,完整评估层级共包含 511,959 份文档。该基准测试提供了 10 种类型的 500 个问题,涵盖从基础查询到完整性、冲突信息和高层次问题等各类场景。每个问题都标注了黄金文档、黄金答案以及原子答案事实列表,黄金文档总计 722 份。语料库原生地将 7.7% 的文档标记为噪声,这些文档被错误归档到错误的来源或路径下,或与过时事实近乎重复,以此模拟真实的归档噪声。根据问题类型的不同,问题要么由源文档生成,要么由探索语料库的智能体生成。已发布的黄金集随后通过汇集 BM25、稠密检索和文件智能体搜索的候选证据进行了精炼;因此,标签构建并非仅依赖于 BM25。

3.2 Bedrock

最小层级以确定性方式构建,由以下部分的并集组成:基准中为500个问题中的任意一个标注为黄金答案的722篇文档、326个挖掘出的陷阱、99个诱饵,以及语料库自身的两个组织性页面——公司概览和项目索引,这两页作为支撑结构。剔除五个跨类别重复项后,得到1,144篇文档。陷阱通过方法无关的过滤流程挖掘:对于每个目标问题,BM25贡献其全语料库前10名结果,而稠密检索对BM25前200名候选池(对于“未找到”类问题则为前1,000名)进行重排序,并贡献十个候选。一个LLM过滤器会保留所有与黄金文档涉及同一实体或主题、但报告了错误版本、日期或决策的候选。该流程在单一“主题相关且事实错误”标准下产出326个陷阱。诱饵服务于“信息未找到”类问题:每个问题取过滤器验证过无法回答该问题的五个最相似候选,这样无法回答的问题就不能仅凭检索文本的缺失来解决。BM25前10名和BM25前200名候选池的稠密重排序各贡献十个候选;任何被评测系统的得分或答案判断都不参与选择。一次直接的全语料库DenseRAG审计独立测试了对该候选池的敏感性。由于每篇对抗性文档都位于基底层而非逐步引入,随着语料库通过新增非基底层文档而增长,问题特定的证据和对抗性集合始终保持固定。

3.3 嵌套层级

设 表示非基底层语料库的一个单一播种的、按来源和噪声分层的顺序。层级 由基底层加上 的前 篇文档组成。每个新增前缀的来源和噪声分布近似于全局背景语料库。规模遵循 ,产生28个层级。前缀构建通过清单校验和精确保证,并允许增量构建者将索引从一个层级扩展到下一个层级,这也是衡量边际构建成本的方式。我们以语料库token而非文档数量来报告规模,因为不同来源的文档长度各不相同。πtnt−1,144πnt+1≈1.25​ntT1⊂T2⊂⋯

4 实验

4.1 实验设置

4.1.1 范式

我们的主要扩展阶梯评估了七条原生流水线。BM25 使用一个在无 LLM 参与下构建的倒排索引。DenseRAG 对分块嵌入向量执行稠密检索。HippoRAG 2 构建一个开放词汇三元组图,并通过将查询与事实关联、运行 Personalized PageRank 来回答问题。MS-GraphRAG 构建一个带有层级社区报告的实体图,并通过其局部搜索模式回答问题。LightRAG 维护实体和关系的双层索引,并通过其混合模式回答问题。LinearRAG 使用一个轻量级命名实体识别器和共享嵌入模型构建实体共现图,不调用生成式 LLM。文件系统智能体(File-System Agent)在没有任何索引的情况下运行:该智能体使用只读列表、搜索和读取工具,在每问题 80 次 LLM 调用的预算内探索原始的按来源划分的文件树。每个暴露检索深度的方法都使用 top-5 分块。BM25、DenseRAG 和 HippoRAG 2 在相同的分块切分上运行,因此它们的检索质量可直接比较。MS-GraphRAG 和 LightRAG 在内部进行分块,它们检索到的证据会映射回共享的切分以计算召回率。

4.1.2 读取器与计量

所有范式都使用相同的读取器,即温度为 0 的 Qwen3.6-27B,由 vLLM(Kwon 等人,2023)提供服务。文件系统智能体使用相同的模型作为其策略,所有主流水线的嵌入调用都通过一个共享的 Qwen3-Embedding-0.6B 模型进行。一个共享的计量层拦截每一次 LLM 调用,并将提示词和完成 token 归属于构建阶段或查询阶段,按范式和按问题分别统计。嵌入调用与生成式调用分开核算:由于嵌入请求不携带提示词模板,其 token 成本根据分词器输入进行计数。DenseRAG 的计数是精确的;LinearRAG 对其不可用的实体名称流包含一个已记录的 3% 估算值。延迟是在空闲服务器上的单流条件下端到端测量的。

4.1.3 评判

每个家族的每一次预测,都使用该基准的官方协议进行评分:候选答案与标准答案的整体对齐程度、候选答案所蕴含的原子答案事实的比例、以正确性为门槛的综合得分,以及检索证据的文档级召回率。主阶梯(main ladder)的所有单元格均在一次评分会话中由一个评判模型完成。每个匹配的对照组同样在单一共享会话中,使用相同的提示词和评判模型进行评分;对照组的估计值不会混入主阶梯。每个系统对每个问题运行一次;不确定性通过重采样问题而非随机重跑来实现。为证明结果不依赖于这一选择,我们使用一个独立的评判模型以及一个更简单的二元协议对预测结果进行了重新评分。二元协议在全部九个共享尺度上保持了排名不变,而独立评判模型在汇总的对齐判定中与原有结果的一致性达到 96.2%;详情如下。

4.2 主要结果

表 1 和图 3 展示了一个随规模变化的交叉现象。在基础层(bedrock),File-System Agent 和 BM25 以 77.4 和 74.7 领先,它们的 95% 置信区间(73.9–80.8 和 71.4–77.9)相互重叠。在最小的共享层级上,File-System Agent 仍保持更高的点估计值;大约在语料库达到 1000 万 token 时曲线发生交叉,此后在每一个更大的共享层级上 BM25 均领先。在完整规模下,BM25 保持 50.5 分,而 File-System Agent 为 30.7 分,DenseRAG 为 29.9 分。在本文使用的固定 80 次调用预算下,尽管迭代式原始文件搜索消耗了更多的模型调用次数,但其对语料库增长的抵抗能力不如全局词法排序;而稠密检索的表现则始终低于这两者。

媒体内容 · 前往原文查看
按语料库层级划分的官方综合得分(%) @ 基础层(%)
方法 构建 token/查询 N=1144 2254 6980 21614 42587 131876 511959 完整性 文档召回率
BM25 0 5.8K 74.7 71.4 70.1 64.9 61.2 55.2 50.5 80.4 90.3
File-System Agent 0 226K 77.4 75.4 69.9 62.6 58.9 50.9 30.7 81.6 86.4
DenseRAG 嵌入‡ 4.9K 58.1 55.7 51.0 44.2 40.7 36.0 29.9 65.4 73.4
基于图的检索
HippoRAG 2 7.5M 6.5K 66.2 63.1 58.6 53.8 50.5 41.0 — 72.0 81.3
LinearRAG 嵌入‡ 5.8K 46.2 44.1 38.8 34.3 31.3 29.8 — 52.0 62.6
MS-GraphRAG 35.1M 10.4K 45.9 44.0 38.4 — — — — 54.1 57.9
LightRAG 34.6M 8.5K 48.0 42.5 — — — — — 54.7 不适用§
表 1:官方主要结果。构建/查询 token、完整性和文档召回率是基础指标。综合得分以正确性为门槛对完整性进行加权。破折号表示未构建或未评估的层级;图 3 展示了所有已测量的层级。‡ 表示非生成式构建:DenseRAG 使用嵌入向量,LinearRAG 使用局部 NER 加嵌入向量。§ 标记了未记录检索证据标识符的 LightRAG 运行。LinearRAG 的 tok/q 是其固定的、分层抽样的 100 题计量运行的平均值。

HippoRAG 2 和 LinearRAG 在 131,876 篇文档处停止,MS-GraphRAG 在 8,750 篇处停止,LightRAG 在 2,254 篇处停止。因此,大规模图谱结果反映的是构建可行性,而非外推的准确性:不支持的层级在主曲线中保持缺失,仅在覆盖率调整的跨规模汇总中计为零。

4.3 构建成本与扩展瓶颈

图 4(左)和表 2 表明构建过程是图谱家族的扩展瓶颈。HippoRAG 2 近似线性(),外推到全规模需要 2.9B 生成 token 和大约三个单实例日。然而,在 155M 语料 token 规模下,其 724M token 的构建得分仅为 41.0,比 BM25 低约十五分。b=1.01

[Uncaptioned image]

媒体内容 · 前往原文查看
图 3:嵌套阶梯上的官方综合得分,带 95% 置信带。曲线在约 10M token 处交叉;图谱曲线在其最大可行层级处结束。
媒体内容 · 前往原文查看
b 测量至 拟合 @全量 tok/s 估计实例
HippoRAG 2 1.01 724M @ 154.7M 2.9B 11.9k ≈3 天
MS-GraphRAG 0.92 190M @ 10.6M 7.9B 1.8k ≈50 天
LightRAG 1.36 73M @ 3.0M ≈102B 0.8k ≈4 年
LinearRAG — 仅嵌入 0 生成 — ≈1 天
表 2:构建成本对语料 token 的拟合,外推到 600.8M token 的全量语料。“测量至”报告最大已完成语料处的构建 token,tok/s 是测量的单实例吞吐量;最后两列是拟合的全规模估计值。C​(x)=a​xbx

LightRAG 是超线性的(),在我们的资源范围内无法在 2,826 篇文档处完成,外推需要 102B token 或四个实例年。即使采用乐观的 也使其估计值接近 42B token。b=1.36b=1.2

基于 token 的拟合将构建工作与硬件吞吐量分离开来。LightRAG 反复的实体合并重写导致超线性增长;即使吞吐量达到实测值的三倍,其预计的全量构建仍超过一个实例年。仅使用嵌入向量的构建成本要低得多:DenseRAG 以 659.4M 嵌入向量 token 完成整个语料库。LinearRAG 报告生成式构建 token 为零,但仍需承担本地 NER 和嵌入向量工作。

MS-GraphRAG 也符合近线性增长,并在 8,750 篇文档处完成;其全量规模估计为 7.9B token,约 50 个实例天。并行化可以缩短日历时间,但无法减少总构建工作量或由此产生的准确性影响。

4.4 查询成本与延迟

Refer to caption

Refer to caption

图 4:构建与查询阶段的成本扩展。左图:构建 token 及拟合的幂律曲线;空心标记报告两个非生成式构建器的嵌入向量 token,而 BM25 和文件系统智能体无需索引。右图:单流查询延迟;线条报告中位数,文件系统带的范围为 P10–P90。

图 4(右)报告端到端延迟。对于单次流水线,查询成本几乎与规模无关:BM25、DenseRAG 和 HippoRAG 2 每个问题分别使用 5.8K、4.9K 和 6.5K token,主要由共享的读取器提示词主导。文件系统智能体则从基岩层的 226K 增长到 的 343K,随着探索深入,分别是 BM25 的 39 倍和 60 倍。其中位数 LLM 调用次数从 5 次增长到 8 次;在该层级中预算耗尽率低于 7%,但在 时达到 15%,在全量规模下达到 31%。预算内问题的准确性也在下降,因此仅靠截断无法解释这种崩溃。N=21,614N=42,587N=131,876

摊销到 500 个问题上,BM25 以 2.9M token 获得 74.7 分,而文件系统智能体以 112.8M token 获得 77.4 分。HippoRAG 2 以 10.7M token 达到 66.2 分,而 MS-GraphRAG 和 LightRAG 在约 40M token 处仍处于劣势。在 10 到 10,000 的摊销范围内,BM25 点仍处于前沿。

这些发现跨越了完整的 28 级、约 450 倍的阶梯,而非单一语料库规模。固定问题、黄金证据和干扰项,可以隔离新增背景文档带来的影响。统一的计量方式揭示了成本是在离线图构建阶段支付,还是通过逐问题的文件探索在线支付。在七种原生管线中,交叉核对的评判、匹配的检索与框架控制,以及类型化图访问层,将候选发现、框架和底层基座的影响分离开来。这使得交叉对比成为一种可测量的规模效应,而非在孤立规模下对独立调优系统的比较。

图 5(左)使用了六级阶梯和固定的 150 题样本。不支持的图层级仅在覆盖率调整时计为零;成本则是对已完成层级上的构建成本和归一化的 500 查询工作负载取平均值。

媒体内容 · 前往原文查看
层级 文件数 HippoRAG 2 LightRAG MS-GraphRAG
N=1144 76.181 75.2 (66.7) 70.8 (48.6) 40.9 (47.4)
1434 83.094 75.2 (65.9) 75.5 (50.7) 44.7 (44.3)
1798 76.315 81.2 (66.7) 72.8 (45.5) 46.6 (46.3)
2254 81.927 75.0 (65.2) 75.6 (45.7) 38.7 (45.4)
6980 75.111 70.6 (62.2) — 36.9 (38.2)
21614 71.242 59.6 (56.0) — —
42587 64.755 54.2 (54.8) — —
表 3:同一智能体框架在每种检索基座上的官方得分,括号内为相同问题上的原生管线得分。Bedrock 使用全部 500 个问题,而后续层级对每对成员均使用固定的 150 题子集。文件数没有原生管线;破折号表示没有可用的匹配评估。这些得分来自一次独立的匹配评分会话,未与表 1 混合。

4.5 按问题类型划分的行为

图 5(右)显示,在 时,File-System Agent 在文档内、项目相关、完整性和信息冲突类问题上优于 BM25,包括在完整性问题上以 56 比 27 领先。N=42,587

BM25 在其他五种类型上表现最佳或持平。饱和的未找到得分主要衡量的是弃答行为:单次读取模型在缺乏支持证据时会拒绝回答,而迭代式探索则可能给出无依据的答案。图系统仅在杂项问题上领先。

Refer to caption

Refer to caption

图5:互补性规模分析。左图:在固定的150道题样本上,六个层级的跨规模准确率-成本汇总。右图:按题型划分的官方综合得分;标签给出题目数量,MS-GraphRAG和LightRAG无法在该层级构建。N=42,587

4.6 跨协议鲁棒性

在九个共享规模上,二元重新评分保持了每个家族排名不变;官方正确率平均低2.60个百分点(单元格范围至)。一个独立的官方评判者在汇总对齐判定上达成96.2%的一致率(每个单元格94.4–98.0%),综合得分变化范围从至。因此,相近配对可能有所差异,但广泛的家族区分仍然保持。在基础层,BM25在470道可回答题目中为94.7%的题目检索到任意标注的金标准片段,为56.4%的题目检索到全部金标准片段,并在前五结果中平均达到75.1%的金标准片段召回率;其90.3%的文档召回率表明许多残余错误位于文档内部或证据综合环节。−4.60+0.69−3.56+1.18

5 将智能体能力与结构分离

5.1 先检索,后智能体

全规模BM25与文件系统之间的差距是候选发现失败,而非证据综合薄弱。我们在相同固定的分层150道题上,于基础层和全语料层级隔离检索原语——即300个题目-规模配对,而非300道独立题目。Agent+BM25保持模型、工具框架、答案约束、题目集、评判者和80次调用预算不变;它将原始树工具替换为排序词法搜索和片段读取,并配以针对该接口调整的工具专用指令。其首次搜索强制使用原始问题;审计确认其有序前五结果在每个配对上都与原生BM25完全一致。

媒体内容 · 前往原文查看
综合 在511,959N=
方法 1,144 511,959 DocR 调用次数 Token/题
原生BM25 81.3 54.8 65.6 1.00 5.8K
文件系统 87.1 36.9 36.8 36.12 895K
Agent+BM25 90.1 69.4 72.4 5.79 101K
表4:在每种规模下相同150道题上的检索原语对照实验。综合得分和全规模文档召回率(DocR)来自一次共享的重新评判。全规模调用次数和每题token数包含重试的失败尝试。原生BM25的每题token数为描述性的全500条平均值。

表 4 显示,在基础语料规模下,原生 BM25 与文件系统智能体在统计上打成平手:BM25 落后 5.73 分,配对自助法 95% 置信区间为 。在全量语料规模下,BM25 反而领先 17.97 分 。其机制在于“发现能力”。在每种方法至少找到一份黄金文档的查询子集(一个描述性的、基于选择条件的切片)中,文件系统智能体得分为 85.9,而 BM25 为 73.8;但前者“任一黄金文档命中率”骤降至 39.0%,相比之下 BM25 为 71.6%。[−11.57,0.15][9.68,26.14]

仅更换检索原语即可逆转这一崩溃。在全量规模下,Agent+BM25 得分为 69.4,比原始文件智能体高出 32.52 分,比原生 BM25 高出 14.56 分 。其“任一黄金文档命中率”达到 78.0%,而每问题 101K token 的消耗量约为原始文件探索方式的九分之一。因此,智能体能力在全球排序的候选发现之后是有帮助的;反复的局部搜索并不能替代这种全局排序。我们将这种双尺度干预视为一种机制对照,而非 28 层原生流水线阶梯上的第八个系统。[24.07,40.90][9.22,20.12]

媒体内容 · 前往原文查看
检索 / 框架 综合
文件系统(本文方案) 86.3
文件系统(Pi-Agent) 82.3
文件系统(Codex) 43.9
原生 BM25 82.1
表 5:在相同的 150 道问题、策略模型、原始语料和评判器下,于 1,144 规模进行的同会话框架对照。每个框架保留其原生循环与停止限制;得分不与表 4 混用。N=

表 5 显示,在这一匹配后的重新扫描中,框架选择至关重要,而本文方案在三个文件智能体中取得了最高得分。因此,Agent+BM25 是在最强实测原始文件实现的基础上评估检索替换的效果。

5.2 图结构底物上的智能体能力

文件系统这一结果将智能体行为与其原始文件基底混为一谈。我们通过一个范式无关的访问层将二者分离:每个驻留图索引都暴露了类型化的只读工具,用于语义搜索、邻域扩展、个性化 PageRank 和分块读取,同时将其原生的一次性排序器也作为工具暴露。相同的工具调用框架与固定的模型、预算和评判器一起使用;特定于基底的工具和指令构成干预手段。图智能体无法访问原始文件,因此性能提升反映的是策略对索引内容的访问。工件中包含一个命令行界面。

表 3 报告了配对比较结果。智能体访问使 LightRAG(4 个层级)的原生得分变化了 22.2–29.9 分,HippoRAG2(7 个层级)变化了 –14.5 分,MS-GraphRAG(5 个层级)变化了 –0.4 分。因此,同一个索引在智能体及其原生一次性排序器下可以支持不同的结果。−0.6−6.7

6 讨论

6.1 词汇优势

企业问题包含精确的词汇锚点,而陷阱在语义上相似但在事实上是错误的;因此精确匹配具有优势。表 6 评估了排序对问题措辞和检索深度的敏感性。

媒体内容 · 前往原文查看
对照组 N BM25 FS 稠密检索 Hippo2 MS-GR
改写 1,144 63.9 73.3 51.8 – –
2,254 60.1 67.2 49.9 54.9 36.3
Top-10 1,144 83.0 – 70.0 – –
2,254 81.9 – 66.5 73.0 –
表 6:措辞和深度控制:–150 上的官方综合得分(%);破折号表示未配对的组合。n=148

这些控制在相当的检索深度下使 BM25 保持在稠密检索和图检索之上。在一项 90 个问题的提案敏感性审计中,直接的全语料库 DenseRAG top-10 检索与历史 BM25 预过滤的稠密候选平均重叠 1.2 个文档,恢复了 431 个已确认条目中的 57 个,并识别出 115 个陷阱以及 100 个未找到的诱饵。综合来看,这些控制表明 BM25 的优势在措辞改变和匹配检索深度下依然存在,同时对抗性候选也可以通过直接的稠密提案路径恢复。

6.2 图失败模式

三个因素可以解释这一差距。构建过程会引入抽取噪声——基岩数据集中抽取出的 32K 个实体中包含残缺片段——以及高昂的规模化成本。图检索还倾向于返回语义相关但事实错误的邻域,而这些陷阱会对此进行惩罚,同时 HippoRAG 2 丢弃了抽取出的谓词文本,从而丢失了关系语义。LinearRAG 不进行生成式构建调用,在基岩数据集上与 MS-GraphRAG 和 LightRAG 的差距在 1.8 分以内,这表明在此场景下,LLM 抽取带来的成本增长快于其带来的信号增益。

6.3 扩展机制

决定性因素是全语料库范围的候选发现。BM25 和 DenseRAG 将全局排序分摊到索引中;词法匹配还能更有效地拒绝该语料库中事实错误的语义陷阱。文件系统智能体(File-System Agent)则按顺序遍历局部树结构,随着语料库规模增长,相关分支越来越难以触达。图方法需要全语料库范围的抽取,而成本、噪声和信息丢失在此成为瓶颈。在完整规模下,Agent+BM25 隔离了这一机制:更换检索方式后,每个问题的调用次数从 36.12 降至 5.79,token 数从 895K 降至 101K,同时文档召回率从 36.8 升至 72.4,得分从 36.9 升至 69.4。迭代在全局排序之后作用最大,而非替代全局排序。

6.4 评测启示

单一语料库规模可能掩盖这一交叉点,而图系统只有在索引构建完成的情况下才能进行比较。跨范式评测应报告嵌套规模下的准确率、构建/查询成本以及索引覆盖率。已测单元格描述的是在完成前提下的质量;图 5(左)中的覆盖率调整汇总描述的是可部署性,仅对不可用的层级赋零值。同时报告两者可以避免将未构建的索引误判为观测到的答案失败。

6.5 实践指导

对于企业级语料库,BM25 是合适的默认选择;聚合密集型问题更适合 Agent+BM25,它利用词法排序进行候选发现,并在收窄后的候选项上执行智能体调用。LLM 构建的图索引在文档规模达到一定程度后很难有充分理由采用——除非构建成本接近线性且关系型问题占主导地位。105106

7 结论

我们展示了一项针对四种 RAG 范式的受控规模扩展研究,该研究在一个 28 级企业语料库阶梯上进行,在统一阅读器模型、评判器和成本计量的同时,固定了问题、相关证据和对抗性干扰项。匹配的访问层和检索交换控制进一步将底层基座与智能体策略分离开来。结果呈现出一个随规模变化的交叉点:在最小的共享层级上,原始文件智能体表现领先;BM25 在约 1000 万语料库 token 处追平;其领先优势在 6.01 亿 token 时扩大到近 20 个百分点,同时在没有基于 LLM 的构建的情况下仍保持帕累托最优。用 BM25 替换原始搜索将全规模智能体从 36.9 提升至 69.4,而其查询 token 消耗约为原来的九分之一,而基于图的 RAG 则遭遇了构建瓶颈。因此,随着企业语料库规模的扩大,全局词法排序成为更强大的默认选择,而智能体推理最好在候选排序之后应用。

参考文献

  • Asai 等人 (2023) Akari Asai, Zeqiu Wu, Yizhong Wang, Avirup Sil, 和 Hannaneh Hajishirzi. Self-RAG: 通过自我反思学习检索、生成和批判,2023. https://arxiv.org/abs/2310.11511.
  • Chen 等人 (2024) Liyi Chen, Panrong Tong, Zhongming Jin, Ying Sun, Jieping Ye, 和 Hui Xiong. Plan-on-Graph: 知识图谱上大语言模型的自校正自适应规划,2024. https://arxiv.org/abs/2410.23875.
  • Edge 等人 (2025) Darren Edge, Ha Trinh, Newman Cheng, Joshua Bradley, Alex Chao, Apurva Mody, Steven Truitt, Dasha Metropolitansky, Robert Osazuwa Ness, 和 Jonathan Larson. 从局部到全局:一种用于查询聚焦摘要的 Graph RAG 方法,2025. https://arxiv.org/abs/2404.16130.
  • Formal 等人 (2021) Thibault Formal, Benjamin Piwowarski, 和 Stéphane Clinchant. SPLADE:用于第一阶段排序的稀疏词法和扩展模型,2021. https://arxiv.org/abs/2107.05720.
  • Guo 等人 (2025) Zirui Guo, Lianghao Xia, Yanhua Yu, Tu Ao, 和 Chao Huang. LightRAG:简单快速的检索增强生成,2025. https://arxiv.org/abs/2410.05779.
  • Gutiérrez 等人(2025a)Bernal Jiménez Gutiérrez、Yiheng Shu、Yu Gu、Michihiro Yasunaga 和 Yu Su。HippoRAG:受神经生物学启发的用于大语言模型的长期记忆,2025a。https://arxiv.org/abs/2405.14831。
  • Gutiérrez 等人(2025b)Bernal Jiménez Gutiérrez、Yiheng Shu、Weijian Qi、Sizhe Zhou 和 Yu Su。从 RAG 到记忆:大语言模型的非参数持续学习,2025b。https://arxiv.org/abs/2502.14802。
  • Guu 等人(2020)Kelvin Guu、Kenton Lee、Zora Tung、Panupong Pasupat 和 Ming-Wei Chang。REALM:检索增强的语言模型预训练,2020。https://arxiv.org/abs/2002.08909。
  • Jiang 等人(2023)Zhengbao Jiang、Frank F Xu、Luyu Gao、Zhiqing Sun、Qian Liu、Jane Dwivedi-Yu、Yiming Yang、Jamie Callan 和 Graham Neubig。主动检索增强生成,2023。https://arxiv.org/abs/2305.06983。
  • Jimenez 等人(2024)Carlos E Jimenez、John Yang、Alexander Wettig、Shunyu Yao、Kexin Pei、Ofir Press 和 Karthik Narasimhan。SWE-bench:语言模型能否解决真实的 GitHub 问题?,2024。https://arxiv.org/abs/2310.06770。
  • Jin 等人(2025)Bowen Jin、Hansi Zeng、Zhenrui Yue、Jinsung Yoon、Sercan Arik、Dong Wang、Hamed Zamani 和 Jiawei Han。Search-R1:通过强化学习训练 LLM 进行推理并利用搜索引擎,2025。https://arxiv.org/abs/2503.09516。
  • Karpukhin 等人(2020)Vladimir Karpukhin、Barlas Oğuz、Sewon Min、Patrick Lewis、Ledell Wu、Sergey Edunov、Danqi Chen 和 Wen-tau Yih。面向开放域问答的稠密段落检索,2020。https://arxiv.org/abs/2004.04906。
  • Khattab 和 Zaharia(2020)Omar Khattab 和 Matei Zaharia。ColBERT:通过基于 BERT 的上下文晚期交互实现高效有效的段落检索,2020。https://arxiv.org/abs/2004.12832。
  • Kwon 等人(2023)Woosuk Kwon、Zhuohan Li、Siyuan Zhuang、Ying Sheng、Lianmin Zheng、Cody Hao Yu、Joseph E. Gonzalez、Hao Zhang 和 Ion Stoica。使用 PagedAttention 实现大语言模型服务的高效内存管理,2023。https://arxiv.org/abs/2309.06180。
  • Lewis 等人(2021)Patrick Lewis、Ethan Perez、Aleksandra Piktus、Fabio Petroni、Vladimir Karpukhin、Naman Goyal、Heinrich Küttler、Mike Lewis、Wen-tau Yih、Tim Rocktäschel 等人。面向知识密集型 NLP 任务的检索增强生成,2021。https://arxiv.org/abs/2005.11401。
  • Lin 等人(2021)Jimmy Lin、Xueguang Ma、Sheng-Chieh Lin、Jheng-Hong Yang、Ronak Pradeep 和 Rodrigo Nogueira。Pyserini:一个易于使用的 Python 工具包,支持基于稀疏和稠密表示的可复现信息检索研究,2021。https://arxiv.org/abs/2102.10073。
  • Mavromatis 和 Karypis(2024)Costas Mavromatis 和 George Karypis。GNN-RAG:面向大语言模型推理的图神经检索,2024。https://arxiv.org/abs/2405.20139。
  • Nakano 等人(2022)Reiichiro Nakano、Jacob Hilton、Suchir Balaji、Jeff Wu、Long Ouyang、Christina Kim、Christopher Hesse、Shantanu Jain、Vineet Kosaraju、William Saunders 等人。WebGPT:基于浏览器辅助且带有人类反馈的问答,2022。https://arxiv.org/abs/2112.09332。
  • Peng 等人(2024)Boci Peng、Yun Zhu、Yongchao Liu、Xiaohe Bo、Haizhou Shi、Chuntao Hong、Yan Zhang 和 Siliang Tang。图检索增强生成:综述,2024。https://arxiv.org/abs/2408.08921。
  • Press 等人(2023)Ofir Press、Muru Zhang、Sewon Min、Ludwig Schmidt、Noah A Smith 和 Mike Lewis。衡量并缩小语言模型中的组合性差距,2023。https://arxiv.org/abs/2210.03350。
  • Qin 等人(2023)Yujia Qin、Shihao Liang、Yining Ye、Kunlun Zhu、Lan Yan、Yaxi Lu、Yankai Lin、Xin Cong、Xiangru Tang、Bill Qian 等人。ToolLLM:帮助大语言模型掌握 16000+ 真实世界 API,2023。https://arxiv.org/abs/2307.16789。
  • Ram 等人(2023)Ori Ram、Yoav Levine、Itay Dalmedigos、Dor Muhlgay、Amnon Shashua、Kevin Leyton-Brown 和 Yoav Shoham。上下文内检索增强语言模型,2023。https://arxiv.org/abs/2302.00083。
  • Robertson 和 Zaragoza(2009)Stephen Robertson 和 Hugo Zaragoza。概率相关性框架:BM25 及其扩展。Foundations and Trends in Information Retrieval,3(4):333–389,2009。10.1561/1500000019。
  • Sarthi 等人(2024)Parth Sarthi、Salman Abdullah、Aditi Tuli、Shubh Khanna、Anna Goldie 和 Christopher D. Manning。RAPTOR:用于树状组织检索的递归抽象处理,2024 年。https://arxiv.org/abs/2401.18059。
  • Schick 等人(2023)Timo Schick、Jane Dwivedi-Yu、Roberto Dessì、Roberta Raileanu、Maria Lomeli、Luke Zettlemoyer、Nicola Cancedda 和 Thomas Scialom。Toolformer:语言模型可以自学使用工具,2023 年。https://arxiv.org/abs/2302.04761。
  • Shinn 等人(2023)Noah Shinn、Federico Cassano、Edward Berman、Ashwin Gopinath、Karthik Narasimhan 和 Shunyu Yao。Reflexion:具有语言强化学习的语言智能体,2023 年。https://arxiv.org/abs/2303.11366。
  • Sun 等人(2026)Yuhong Sun、Joachim Rahmfeld、Chris Weaver、Weijia Chen、Roshan Desai、Wenxi Huang 和 Mark H. Butler。EnterpriseRAG-Bench:面向企业内部知识的 RAG 基准测试,2026 年。https://arxiv.org/abs/2605.05253。
  • Trivedi 等人(2023)Harsh Trivedi、Niranjan Balasubramanian、Tushar Khot 和 Ashish Sabharwal。将检索与链式推理交错用于知识密集型多步问题,2023 年。https://arxiv.org/abs/2212.10509。
  • Wang 等人(2025)Xingyao Wang、Boxuan Li、Yufan Song、Frank F. Xu、Xiangru Tang、Mingchen Zhuge、Jiayi Pan、Yueqi Song 等人。OpenHands:面向作为通用型智能体的 AI 软件开发者的开放平台,2025 年。https://arxiv.org/abs/2407.16741。
  • Yang 等人(2024a)John Yang、Carlos E. Jimenez、Alexander Wettig、Kilian Lieret、Shunyu Yao、Karthik Narasimhan 和 Ofir Press。SWE-agent:智能体-计算机接口实现自动化软件工程,2024a。https://arxiv.org/abs/2405.15793。
  • Yang 等人(2024b)Xiao Yang、Kai Sun、Hao Xin、Yushi Sun、Nikita Bhalla、Xiangsen Chen、Sajal Choudhary、Rongze Daniel Gui 等人。CRAG——综合性 RAG 基准测试,2024b。https://arxiv.org/abs/2406.04744。
  • Yao 等人(2023)Shunyu Yao、Jeffrey Zhao、Dian Yu、Nan Du、Izhak Shafran、Karthik Narasimhan 和 Yuan Cao。ReAct:在语言模型中协同推理与行动,2023 年。https://arxiv.org/abs/2210.03629。
  • Zheng 等人(2023)Lianmin Zheng、Wei-Lin Chiang、Ying Sheng、Siyuan Zhuang、Zhanghao Wu、Yonghao Zhuang、Zi Lin、Zhuohan Li 等。使用 MT-Bench 和 Chatbot Arena 评判 LLM-as-a-Judge,2023 年。https://arxiv.org/abs/2306.05685。
  • Zhuang 等人(2025)Luyao Zhuang、Shengyuan Chen、Yilin Xiao、Huachi Zhou、Yujing Zhang、Hao Chen、Qinggang Zhang 和 Xiao Huang。LinearRAG:面向大规模语料的线性图检索增强生成,2025 年。https://arxiv.org/abs/2510.10114。

附录 A 范围

本补充材料为主论文提供了额外的实验细节、结果表格和可复现性说明。主论文内容自足;本文档扩展了实验方案并提供了额外的审计材料。所有标识符均已匿名化,所有本地机器路径均已省略。

附录 B 语料阶梯

本研究使用 EnterpriseRAG-Bench,这是一个公开的合成企业级基准,包含略多于 50 万篇文档和 500 个问题。缩放阶梯的构建方式是:首先固定一个基础层,其中包含所有与问题相关的文档、困难负样本和“未找到”诱饵。每个更大的层级都会追加剩余语料库中一个按来源和噪声分层、带种子的前缀。因此,问题集、相关证据和对抗性文档保持不变,只有背景语料库的规模在增长。清单检查验证了严格的嵌套关系。表 7 总结了每个层级。

媒体内容 · 前往原文查看
N 语料库 token 数。 分块数 平均文档 token 数。 N 语料库 token 数。 分块数 平均文档 token 数。
1,144 1.7M 2,018 1472.7 27,097 32.1M 39,374 1182.9
1,434 2.0M 2,435 1411.1 33,970 40.1M 49,252 1181.2
1,798 2.4M 2,955 1361.3 42,587 50.2M 61,615 1177.7
2,254 3.0M 3,606 1324.0 53,389 62.8M 77,142 1176.4
2,826 3.6M 4,425 1288.2 66,932 78.6M 96,635 1174.8
3,543 4.5M 5,454 1264.3 83,909 98.6M 121,123 1174.7
4,441 5.5M 6,737 1242.4 105,193 123.5M 151,751 1174.4
5,568 6.8M 8,374 1227.4 131,876 154.7M 190,096 1173.4
6,980 8.5M 10,419 1217.1 165,327 194.0M 238,321 1173.4
8,750 10.6M 12,974 1208.6 207,263 243.2M 298,783 1173.4
10,970 13.2M 16,169 1202.2 259,837 304.9M 374,576 1173.4
13,753 16.4M 20,185 1195.2 325,746 382.2M 469,677 1173.4
17,241 20.5M 25,203 1190.0 408,373 479.1M 588,566 1173.3
21,614 25.6M 31,475 1186.6 511,959 600.8M 737,878 1173.6
表 7:28 个严格嵌套的语料层级。语料 token 使用共享分词器进行计量;对于使用共享分块的系统,分块由共享的 1,200-token 分块器生成,重叠量为 100 token。

附录 C 方法配置

所有原生流水线均在统一的阅读器与评判协议下进行评估。共享阅读器为 Qwen3.6-27B,以温度为零且禁用思考模式运行。共享嵌入模型为 Qwen3-Embedding-0.6B。BM25、DenseRAG 和 HippoRAG 2 使用相同的共享分块。MS-GraphRAG 和 LightRAG 使用其原生内部切分方式,在可获取文档召回率时,检索到的证据会映射回共享分块标识符。表 8 列出了共享设置。

媒体内容 · 前往原文查看
组件 设置
分块大小 1,200 个分词器 token
分块重叠 100 个分词器 token
检索器深度 适用时取前 5 个分块
阅读器温度 0.0
阅读器 top-p 1.0
智能体预算 每个问题 80 次 LLM 调用
评判单元 每个方法/问题/层级一个预测
不确定性 问题自助法,10,000 次重采样
表 8:原生流水线与匹配对照组共用的共享设置。

C.1 阅读器提示词

所有非智能体流水线使用相同的阅读器提示词。系统消息为:

用户消息模板为:

C.2 文件系统智能体提示词与工具

文件系统智能体使用相同的 Qwen3.6-27B 模型作为其策略模型。提示词仅授予对语料树结构的只读访问权限:

表 9 列出了三个暴露的操作。

媒体内容 · 前往原文查看
工具 参数 返回值
list_dir 相对路径 最多 200 个子项名称
grep 固定字符串 最多 30 个匹配路径
read_doc 相对路径 前 8,000 个字符
表 9:暴露给原始文件系统智能体的只读工具。路径解析会拒绝超出语料根目录的遍历。

C.3 Agent+BM25 提示词与控制保证

Agent+BM25 使用相同的智能体框架和预算,但将原始树搜索替换为排序后的 BM25 搜索工具。其系统消息为:

第一次 bm25_search 调用在程序上被强制使用原始问题,无论工具参数如何。这使得首次返回的前 5 个结果恰好是原生 BM25 的前 5 个结果。后续调用可以使用智能体改写的问题,这是该干预方案中智能体化的部分。

C.4 官方评判提示词

官方综合得分包含两个由 LLM 评判的组成部分和一个非 LLM 的文档召回组成部分。首先,一个整体答案对齐提示词接收查询、标准答案和候选答案,并要求返回一个 JSON 对象,其中包含一句理由和一个值为 yes 或 no 的 aligned 字段。该提示词指示评判者接受风格差异和额外的相关上下文,但拒绝矛盾、错误数量或查询核心部分的缺失。其次,每个原子答案事实都通过一个 yes/no 提示词进行验证,询问候选答案是否包含该陈述并与其一致。某个问题的综合得分计算方式为:

combined​(q)={completeness​(q),aligned​(q)=1,0,aligned​(q)=0.

报告的单元格得分是所评估问题的平均综合得分。文档召回率通过可回答问题中检索到的文档标识符与标准文档标识符之间的精确集合重叠来计算。

附录 D 图表指标

主阶梯仅报告实际构建和评估的层级对应的原生流水线得分。因此,表格中的破折号表示缺失的原生结果,而非推断出的失败。

图 1 是观察到的 BM25–文件系统智能体交叉点的示意图。其约 10M-token 的标记概括了相邻已测层级之间的区间,在该区间内它们的点估计排序发生变化;这是一个四舍五入的机制标记,而非拟合阈值或显著性边界。图 3 报告了实测曲线和置信带。

图 5(左)总结了固定 150 题样本上的六个固定层级()。其纵坐标经过覆盖率调整:仅在此摘要中,不支持的图谱层级被赋值为零。其横坐标是已完成层级的构建成本加上归一化的 500 查询工作负载的平均值。嵌入 token 在与 27B 阅读器或生成式 token 结合时,按参数权重加权。该图的点数据账目包含在代码/数据补充材料中的 figures/teaser_crossscale_points.csv 文件中。N=1,144,2,254,6,980,42,587,131,876,511,9590.6/27

主论文中的表1报告了基础构建/查询token以及基础完整度/召回率,同时附带了部分阶梯得分。表2基于实测构建token与语料token的对应关系,拟合了构建token的规模定律,并外推至包含6.008亿token的完整语料库。这些外推结果并未用作隐藏的准确率估计;准确率曲线仅展示实测数据点。y=a​xb

附录E Token计量

计量层记录每次LLM调用的提示词、补全和总token数,并将调用归入构建阶段或查询阶段。对于暴露OpenAI兼容响应的系统,用量字段直接从响应中读取。对于HippoRAG 2,构建token从其LLM缓存元数据中恢复。对于MS-GraphRAG,构建token从其索引日志中恢复。嵌入调用根据分词器输入计数,并与生成式LLM调用分开报告。因此,LinearRAG的零生成式构建条目意味着零生成式LLM构建token,而非零CPU工作、存储、本地NER或嵌入工作。表10总结了各计量来源。

媒体内容 · 前往原文查看
方法族 构建token来源 查询token来源
BM25 零模型token构建 阅读器用量
DenseRAG 嵌入分词器输入 阅读器用量
HippoRAG 2 LLM缓存元数据 阅读器用量
MS-GraphRAG 索引日志 阅读器用量
LightRAG 包装器用量日志 阅读器用量
LinearRAG 嵌入回填 阅读器用量
文件系统 零模型token构建 智能体调用用量
表10:按方法族划分的token计量来源。“零”表示零模型token构建成本,而非零CPU、存储或索引工作。

附录F 完整原生阶梯得分

表12和表12扩展了主论文中展示的结果矩阵子集。破折号表示该原生流水线未构建或未评估的层级。

媒体内容 · 前往原文查看
方法 1144 1434 1798 2254 2826 3543 4441 5568 6980 8750 10970 13753
BM25 74.7 – – 71.4 – – – – 70.1 – – –
文件系统智能体 77.4 – – 75.4 – – – – 69.9 – – –
DenseRAG 58.1 – – 55.7 – – – – 51.0 – – –
HippoRAG 2 66.2 – – 63.1 – – – – 58.6 – – –
LinearRAG 46.2 45.3 46.1 44.1 42.0 42.5 40.3 39.0 38.8 35.5 35.0 34.8
MS-GraphRAG 45.9 43.4 44.4 44.0 42.5 40.4 38.5 38.7 38.4 35.5 – –
LightRAG 48.0 46.5 44.3 42.5 – – – – – – – –
表11:较小原生阶梯层级的官方综合得分(%)。
方法 17241 21614 27097 33970 42587 53389 66932 83909 105193 131876 259837 511959
BM25 – 64.9 – – 61.2 – 59.5 – – 55.2 53.0 50.5
文件系统智能体 – 62.6 – – 58.9 – 56.7 – – 50.9 – 30.7
DenseRAG – 44.2 – – 40.7 – 38.1 – – 36.0 32.8 29.9
HippoRAG 2 – 53.8 – – 50.5 – – – – 41.0 – –
LinearRAG 33.2 34.3 32.2 32.2 31.3 30.5 30.9 28.7 28.5 29.8 – –
MS-GraphRAG – – – – – – – – – – – –
LightRAG – – – – – – – – – – – –
表 12:更大原生阶梯层级的官方综合得分(%)。

附录 G 匹配对照

检索原语对照用 BM25 搜索替代原始文件树探索,同时保持智能体模型、提示词、工具和 80 次调用预算不变。首次搜索强制使用原始问题,并且审计确认在进一步智能体推理之前,返回的前 5 条顺序与每个匹配对上的原生 BM25 前 5 条一致。这便将全局候选发现从策略循环中隔离出来。

图基座对照通过类型化的只读工具暴露每个图索引:实体/事实/关系搜索、邻域扩展、支持情况下的个性化 PageRank,以及分块读取。基于图基座的智能体无法读取原始文件,因此相对于原生单次图排序器的增益,来自策略对已存储索引的访问,而非对额外语料文本的访问。表 14 总结了每个匹配对照固定了什么、改变了什么。

对照 问题集 固定内容 变更内容
智能体+BM25 相同 150 条(bedrock/full 层级) 模型、提示词、80 次调用预算、评判器 原始搜索 BM25 前 5 条工具→
运行框架 相同 150 条(bedrock 层级) 策略模型、原始文件、预算、评判器 智能体运行框架实现
图基座智能体 匹配层级样本 智能体模型、预算、评判器 已存储基座/工具
前 10 条 可用匹配单元格 阅读器、评判器、问题 检索深度 5 10→
改写 固定改写子集 语料、标准答案、评判器 问题措辞
表 13:用于分离检索基座、智能体策略、问题措辞和检索深度效应的匹配对照。
媒体内容 · 前往原文查看
对照 N BM25 文件系统 稠密 图
改写 1,144 63.9 73.3 51.8 –
改写 2,254 60.1 67.2 49.9 54.9 / 36.3
前 10 条 1,144 83.0 – 70.0 –
前 10 条 2,254 81.9 – 66.5 73.0
表 14:措辞与检索深度对照。图条目为 HippoRAG 2,以及可用情况下的 MS-GraphRAG。

附录 H 稳健性检验

官方评判器采用“正确性门控的完整性”作为综合得分。一个更简单的二元协议在九个共享的原生流水线规模上保留了所有广泛的家族排名。一位独立的官方评判员与主要评判员在96.2%的合并对齐决策上意见一致,各单元格的一致率在94.4%到98.0%之间。相近的配对可能会有几分之差,但BM25、稠密检索、大规模原始文件智能体以及图构建家族之间的主要区分是稳定的。

词汇重叠控制使用改写后的问题和前十检索预算,在方法足够多的两个最小层级上进行。在相当的检索深度下,BM25仍优于稠密检索和图检索。一项提案敏感性审计还对90个问题进行了直接的全语料库DenseRAG前十检索,确认陷阱提案并非只能通过基准构建期间使用的BM25预过滤稠密池来触达。精确匹配的单元格数值见表14。

附录I 失败与停止标准

对于LLM构建的图方法,只有当构建产物可用于所有计划内问题且其token账本可用时,该层级才被视为完成。如果构建超出资源上限、在实体/关系抽取或合并过程中失败,或产生无法回答计划单元格的不完整索引,则该层级在主阶梯中被报告为“不可用”,而非分配推断的准确率。跨规模汇总表是唯一将不可用图层级转换为零值的地方,其图注将结果标注为覆盖率调整后。

文件系统智能体的失败在问题层面处理。失败或重试的尝试计入全规模调用和token总数。预算耗尽与答案正确性分开记录。正文报告指出,在预算内的问题中准确率也有所下降,因此全规模损失不仅仅是截断造成的假象。

附录J 数据模式

原生预测文件每个问题使用一个JSON对象,字段如下:

官方评判文件通过SHA256哈希将评判与答案及检索到的证据绑定,并记录:

Token 账本是按阶段分离的:

附录 K 自助法置信区间

原生阶梯重采样中的置信区间,在每个方法-层级单元格内对问题进行有放回抽样。每个区间使用 10,000 次自助法重采样,并报告第 2.5 和第 97.5 百分位数。匹配对照组使用相同问题 ID 上的配对重采样,使置信区间覆盖配对分数差值。

附录 L 工件到论断映射表

主要实证论断映射到以下代码/数据工件。

  • 原生阶梯准确率与置信带:results/judge_official_canonical_20260724/。

  • 构建规模扩展:results/*scaling_ledger.csv 和 results/build_cost_authoritative.csv。

  • 查询 token:results/token_usage/。

  • Agent+BM25:results/judge_agent_bm25_control/ 和 results/agent_bm25_control_report.md。

  • 图基座智能体:results/judge_official_table3_20260724/。

  • 词汇控制:results/judge_paraphrase_* 和 results/judge_topk10_*。

  • 跨规模汇总:figures/teaser_crossscale_points.csv。

附录 M 工件内容

代码/数据补充材料组织如下。

  • scripts/:用于构建层级、运行原生流水线、计量 token、评判输出以及生成论文图表的净化脚本。

  • results/:用于论文表格、图表和机制控制的聚合 CSV/JSON 账本。

  • figures/:图表生成输入和最终 PDF;README.md:环境变量和复现顺序。

来源:HuggingFace Daily Papers(社区热门论文) · arxiv.org