HAKARI-Bench:统一条件下比较检索架构与效率设置的轻量级基准
HAKARI-Bench: A Lightweight Benchmark for Comparing Retrieval Architectures and Efficiency Settings under Unified Conditions
HAKARI-Bench 是一个轻量级检索基准,将现有检索套件重建为小型数据集(Nano-sets),涵盖 35 个基准、551 个任务和 43 种语言,采用统一格式实现模型无关比较。它支持 BM25、稠密、稀疏、晚交互和重排序五种检索家族及其效率变体(降维、量化等)在同一条件下对比。在 55 个模型上,整体排名与 MTEB retrieval v2、MMTEB v2 retrieval 及 English BEIR(完整版)的 Spearman 相关系数均高于 0.97。HAKARI-Bench 不取代全面评测,而是用于快速模型选择、回归检测和探索质量-效率帕累托前沿。代码、数据和排行榜以 MIT 许可证开源。
有了这个轻量级基准,做检索的开发者不用再跑整套 MTEB 就能快速筛选嵌入模型和效率配置,而且排名与完整评测高度一致,是工程选型的高性价比工具。
摘要
随着检索增强生成(RAG)和语义搜索的迅速普及,选择合适的文本嵌入向量和检索配置变得既重要又困难。大规模检索基准测试虽然全面,但在开发过程中反复运行过于沉重,并且缺乏在相同条件下跨多个模型比较生产环境设置(如降维、量化和重排序)的基础设施。我们提出了 HAKARI-Bench,这是一个轻量级评估基础设施,它将现有的检索基准测试重构为小型评估数据集(Nano-sets),并以统一格式处理跨语言的基准测试和检索任务。每个任务共享语料库、查询、相关性标签和固定候选集的通用格式,从而实现对五种检索家族(BM25、稠密检索、稀疏检索、后期交互和重排序器)及其效率变体(套娃降维、int8/二值量化和浮点重打分)进行相同条件下的、与模型无关的评估。在评估模型(稠密、稀疏、后期交互、重排序器、BM25)时,HAKARI-Bench 充当了一个高保真度的排名代理:在每次比较的共同模型和交叉任务上,其整体排名分别以 Spearman 相关系数(、、、)复现了官方 MTEB 检索 v2、MMTEB v2 检索和英文 BEIR(完整版)的结果。HAKARI-Bench 并非要取代完整的评估;相反,它支持快速模型选择、回归检测以及在相同条件下读取质量-效率帕累托前沿。Nano-sets、评估流程以及一个多轴排行榜已作为开源软件在 MIT 许可下发布。
关键词:信息检索;文本嵌入向量;评估基准;多语言检索;量化。
引言
随着检索增强生成和相似性搜索的普及,检索模型(包括文本嵌入向量模型)的开发日益活跃。文本检索可视为两大阶段。首先是候选生成阶段,即从整个语料库中检索出候选相关文档;除 BM25 等词汇匹配方法外,该阶段还使用将查询和文档表示为稠密或稀疏向量的模型,以及采用 token 级表示的延迟交互模型(Khattab 和 Zaharia,2020)。其次是重排序阶段,即对顶部检索候选结果进行更精确的重新排序;重排序器服务于该阶段(Nogueira 和 Cho,2019)。实际的检索系统有时仅由候选生成阶段构成,有时则采用结合候选生成与重排序的两阶段配置。
为比较此类检索模型,业界开发了 MTEB(Muennighoff 等人,2023)和 MMTEB(Enevoldsen 等人,2025)等大型评估基准,使得能够在统一框架下衡量跨多种任务的性能。在信息检索领域,BEIR 将 TREC 标准化并大规模推广的测试集格式(语料库、查询、相关性标签)扩展至多领域零样本评估(Thakur 等人,2021)。BEIR 将分散的检索数据集整理为统一格式,并使得在单一模型无关框架(即给定相同任务格式和指标,任何检索模型均可替换接入进行比较的框架)下,能够一致地比较五种检索架构——词汇匹配、稀疏向量、稠密向量、延迟交互和重排序。
在多语言检索领域,MIRACL(Zhang 等人,2023)评估了跨语言的单语检索(查询和语料库使用同一种语言),而源自必应搜索日志的 MS MARCO(Bajaj 等人,2016)则被广泛用于段落检索。近年来,特定领域的基准测试迅速涌现:代码检索 CoIR(Li 等人,2024)、长文档检索 LongEmbed(Zhu 等人,2024)以及专家领域指令遵循检索 IFIR(Song 等人,2025)。如下文所述,所有这些基准测试都是我们的基准测试以 Nano 集形式纳入的目标(§3.1)。
另一方面,仅通过衡量大型基准测试上的整体性能来评估检索模型是不够的。在生产环境中,检索质量需要通过降维或量化候选生成嵌入向量,以及对顶部候选集进行重排序,来与计算量、内存使用和延迟进行权衡。特别是,基于 Matryoshka 表示学习(Kusupati 等人,2022)进行输出维度缩减后,或从浮点量化到 int8/二进制(Shakir 等人,2024)后的检索性能,是基础模型性能本身之外最受关注的领域之一。因此,除了基础模型性能之外,了解在使用这些效率设置时,或采用候选生成后对其候选集进行重排序的两阶段配置时,性能如何变化也至关重要。
然而,现有的大规模基准测试涵盖了众多任务且数据规模庞大,因此在更改某个模型的降维或量化方式后,要在相同条件下重新评估所有其他模型并非易事。特别是,扩展后的 MMTEB(Enevoldsen 等人,2025)基础设施原则上可以处理基于 Matryoshka 表示(Kusupati 等人,2022)的降维和量化嵌入(Shakir 等人,2024),但在实践中,这些效率设置很少针对每个模型进行一致地报告,并且几乎没有在相同条件下比较多个模型的结果。此外,能够在相同条件下并根据各自角色,系统性地比较从整个语料库生成候选集的架构与对顶级候选集进行重排序的架构的框架也十分有限。出于同样的动机,在英文领域,NanoBEIR 对每个 BEIR 数据集进行了轻量化处理,并被广泛用作固定数据集排序代理(Câmara,2024;Aarsen,2024)。
在本文中,我们构建了 HAKARI-Bench,这是一个用于评估多语言、多领域检索模型的轻量级基准测试。评估与可视化实现已在 MIT 许可下开源:https://github.com/hakari-bench/hakari-bench。已评估模型的排行榜公开于 https://huggingface.co/spaces/hakari-bench/leaderboard;评估数据(Nano 数据集)已在 Hugging Face Datasets 上发布(附录 G)。“HAKARI” 这个名称源自日语中表示天平的词汇(hakari,“测量”),反映了该基准测试旨在衡量和比较检索模型的目标。
具体来说,我们从现有检索基准中构建了小型评估数据集(以下简称 Nano-sets),并开发了一套能够统一处理基准测试与检索任务的基础设施。每个任务都以统一格式处理,包含语料库、查询、相关性标签和候选集,使得候选生成方法和重排序方法能够根据各自角色使用相同指标进行评估。我们进一步实现了在相同条件下评估候选生成方法(如 BM25、稠密检索、稀疏检索和延迟交互),以及对候选集进行重排序评估、嵌入向量降维、int8 量化和二值量化。
在本文中,“轻量级”仅指降低评估成本(即通过 Nano-set 构建实现重复测量的便捷性)。降维、量化和稀疏剪枝作为存储与检索成本(嵌入向量维度、量化精度、非零维度数量)的可复现代理指标进行评估;我们并未评估各模型的推理速度本身,因为公平测量存在困难(§7.5)。
我们基准测试的定位可概括为三点。第一,它遵循 BEIR(Thakur 等人,2021)建立的一致评估方法论,即基于统一格式对多种检索架构进行同条件比较。第二,它将此方法扩展到众多模型以及多种语言和领域。第三,通过缩小每个任务的数据规模,使检索任务能够以实际可行的速度进行重复测量,并在此基础上对所有支持模型在相同条件下应用降维、int8 量化和二值量化。这意味着以一致的方式为所有目标模型提供效率设置的比较——这些比较在评估基础设施上是可行的,但此前实际上仅针对个别模型进行过零散测量。
我们还验证了 Nano 集在多大程度上复现了原始大规模评估的模型排名。将 HAKARI-Bench 的 Nano 集结果与 MTEB retrieval v2、MMTEB v2 retrieval 以及英文 BEIR(完整版)进行对比,斯皮尔曼秩相关系数分别为 、 和 ,皮尔逊相关系数则分别为 、 和 。除了秩相关本身之外,在聚合每项任务胜/负情况的 Borda 分数上也获得了高度相关性,这表明 HAKARI-Bench 虽然不能替代完整评估,但它能以高保真度复现模型排名,并作为一种轻量级评估指标发挥作用。
鉴于神经检索模型在分布外场景下性能会显著下降这一既定事实(Thakur 等人,2021),多领域基准测试的真正价值并非最大化整体分数,而是揭示“模型在哪些领域尚未学习到位”,并为按需选择合适的模型提供依据。我们的基准测试设计使得任务可以沿着语言、领域和查询长度等维度进行切片和比较,从而支持这一视角(§5.7, §6.2)。
基于上述内容,本文的贡献体现在三个方面。
- 1.
一个轻量级的多语言、多领域检索评估基础设施。我们将现有的检索基准测试重构为 Nano 集,并构建了一个基础设施,能够在统一格式下,于相同条件下跨基准测试和任务比较 BM25、密集检索、稀疏检索、后期交互以及重排序器这五类模型(§3, §4)。
- 2.
对轻量级评估排名可复现性的实证验证。我们通过三项独立的比较表明,由 Nano 集得出的整体排名,在每次比较的共同模型和交叉任务上,均能以斯皮尔曼相关系数复现官方的 MTEB retrieval v2 / MMTEB v2 retrieval 以及 BEIR(完整版)结果(§5.6, §6.1)。
- 3.
跨模型效率设置与重排序评估。我们对所有支持模型在相同条件下应用了降维、int8/二值量化以及重新评分,并在所有任务上对固定候选集进行了重排序评估。这些设置原则上可在现有基础设施上测量,但在实践中仅针对单个模型零星报告过。我们的贡献并非首次开启新的可测量性,而是通过将其统一应用于所有支持模型,实际提供了这种测量,使得效率和重排序性能能够在相同基础上跨模型进行比较。这具体揭示了仅在设置固定时才会出现的差异——例如,对二值量化的鲁棒性由模型的训练特性决定(而非由规模或维度解释),以及重排序器是否优于稠密检索取决于任务类型和架构(§5.3–§5.5,附录F)。
相关工作
检索评估基准与检索架构
文本嵌入模型的评估格式在MTEB(Muennighoff等人,2023)统一了包括检索、重排序、分类和聚类在内的八项任务时得以标准化。MMTEB(Enevoldsen等人,2025)将范围扩展至多种语言和多项任务,并引入了质量审查与基于相关性的降采样。聚焦于信息检索领域,BEIR(Thakur等人,2021)汇集了一套零样本IR数据集套件,使得在单一与模型无关的框架下,能够一致地评估五种检索架构——词法检索、稀疏检索、稠密检索、延迟交互与重排序。这种“在相同条件下比较不同检索架构”的设计,正是我们评估方法论的直接来源(§4)。
在多语言单语检索方面,MIRACL(Zhang 等人,2023)被广泛使用;在短查询段落检索方面,MS MARCO(Bajaj 等人,2016)是常用基准;而在领域专业化方面,则开发了代码检索 CoIR(Li 等人,2024)、长文档检索 LongEmbed(Zhu 等人,2024)、指令遵循检索 FollowIR(Weller 等人,2024)以及专家领域 IFIR(Song 等人,2025)。
最近,官方 MTEB 排行榜引入了一个以 RTEB(检索嵌入基准;Liu 等人,2025)为核心的检索专用板块。RTEB 是一个专注于检索的基准,用于衡量法律、金融、代码和医疗等生产领域中的多语言检索质量;它结合了公开数据集与私有(非公开)数据集,以增强对训练数据污染和排行榜过拟合的鲁棒性。然而,与 MTEB 类似,RTEB 在固定协议下评估嵌入模型,其主要目标并非进行跨架构比较(词法、稠密、稀疏、后期交互、重排序),也不涉及降维和量化等效率设置的比较。我们的 HAKARI-Bench 顺应了这一聚焦检索的趋势,但与之互补,它在通过 Nano-sets 进行轻量级测量的基础上,执行跨架构比较和效率设置评估。
所评估的检索架构大致分为两个阶段:候选生成(从整个语料库中检索候选结果)和重排序(对排名靠前的候选结果进行重新排序)。候选生成通常使用词汇匹配的 BM25(即使在零样本信息检索中也是一个稳健的基线;Robertson 和 Zaragoza,2009;Thakur 等人,2021)、基于双编码器的稠密检索(Reimers 和 Gurevych,2019;Karpukhin 等人,2020)、学习型稀疏 SPLADE 系列模型(Formal 等人,2021)以及 token 级延迟交互(ColBERT 系列;Khattab 和 Zaharia,2020;Santhanam 等人,2021)。重排序始于两阶段检索(即使用 BERT 交叉编码器对 BM25 候选结果进行重新排序;Nogueira 和 Cho,2019),它是对已检索到的排名靠前的候选结果进行重新排序,而非在整个语料库中进行检索。由于两者角色不同,应根据各自角色分别进行评估,而不应在同一角色下进行比较。
这些基准测试极大地促进了检索模型的全面比较,但它们越全面、规模越大,在开发过程中重复完整评估就越困难。我们之所以将范围限定在检索和重排序,正是因为需要一个轻量级、条件一致的基础设施,以便迭代地检查检索特有的比较维度,例如候选生成、重排序和效率设置。
轻量级评估与 Nano 集构建
为了降低在大型基准上重复评估的成本,评估数据已被轻量化处理。MMTEB(Enevoldsen 等人,2025)通过基于相关性的下采样来缩减任务规模,展示了一种以低成本获得接近完整评估结论的策略。作为规模更小的轻量化方案,NanoBEIR 是一个将每个 BEIR 数据集缩减至最多 K 个文档的查询集合;它由 Zeta Alpha 引入以降低评估成本(Câmara,2024),并由 Sentence Transformers 统一为单一格式,即 NanoBEIREvaluator(Aarsen,2024)。负样本文档使用 Pyserini 的 BM25 和一个通用稠密模型进行采样。为了进行轻量化的重排序评估,还准备了一个衍生集合,其中包含附加到 Nano 集合上的 BM25 候选分数(Sentence Transformers,2024)。多语言扩展版本已由 LightOn AI(Sourty,2025)、Liquid AI(Liquid AI,2025)和 Sionic AI(Sionic AI,2025)作为翻译/改进版本发布。
我们的 Nano 集合构建遵循了这种“在小集合上进行排序代理”的思路以及固定 BM25 候选的做法,其独特之处在于将网络扩展到了非英语语言、专业领域,以及包括降维和量化在内的效率设置的比较。
评估嵌入效率设置
在生产环境中,嵌入向量的维度缩减与量化被广泛用于平衡检索质量与计算、内存及延迟之间的关系。套娃表示学习(Matryoshka representation learning,Kusupati 等人,2022)是一种训练嵌入向量的方法,使得维度可以被截断,同时保留前导维度,从而为比较维度缩减后的检索性能提供一个衡量轴。嵌入向量量化(Embedding Quantization,Shakir 等人,2024)将 int8/二值量化与浮点重打分相结合,以降低存储和检索成本。特别是“使用二值编码高效生成候选集,再使用连续向量进行精确重排序(重打分)”这种两阶段配置,其源头可追溯到二值段落检索器(Binary Passage Retriever,Yamada 等人,2021)。生产环境中的近似最近邻(ANN)搜索使用了更先进的量化技术,例如乘积量化(Product Quantization,Jégou 等人,2011)、优化乘积量化(Optimized PQ,Ge 等人,2013)、具有理论误差界的 RaBitQ(Gao 和 Long,2024)、带修正项的更好二值量化(Better Binary Quantization with correction terms,Trent,2024)、优化标量量化(Optimized Scalar Quantization,Veasey,2026),以及结合了哈达玛旋转、重归一化与校准的 TurboQuant(Pijpelink,2026)。
然而,能够在相同条件下比较这些效率设置对多个模型检索质量影响的评估基础设施十分有限。像 MTEB / MMTEB(Muennighoff 等人,2023;Enevoldsen 等人,2025)这样的大规模基础设施原则上可以处理维度缩减,但量化或维度缩减后的性能变化通常局限于每个模型的初始化设置,跨模型且在相同条件下的比较很少被报告。我们将这些效率设置视为评估结果的一等记录,并在同一张表格中并排比较质量与效率(§4.3,§5.3)。
与现有基准的定位关系
我们在表1中总结了上述现有基准与HAKARI-Bench之间的关系。表中,= 在检索任务中始终作为一等特性提供,= 有限支持(基础设施层面可行,但未在各模型间统一报告,或仅限于特定任务/单独发布的数据),= 超出范围。
| 维度 | BEIR | MTEB | MMTEB | NanoBEIR | HAKARI-Bench |
|---|---|---|---|---|---|
| 检索任务规模 | 18个数据集 | 检索类15个 | 500+任务 | 13个数据集 | 551个任务 / 35个基准 |
| 语言 | 以英语为中心 | 以英语为中心 | 250+种语言 | 英语(多语言衍生版本) | 多语言(43种) |
| 跨架构一致性 | 5个系列 | 稠密型 | 稠密型 | 稠密型+BM25 | 5个系列 |
| 重排序器评估(基于任务候选集) | 临时BM25 | 仅限专用任务 | 仅限专用任务 | 独立BM25集合 | 固定集合,覆盖所有任务 |
| 维度缩减(Matryoshka) | |||||
| 量化(int8/二进制) | |||||
| 排行榜 | (数据集集合) | (多维度) | |||
| 重复测量成本 | 高 | 中高 | 中等(下采样) | 低 | 低 |
关于重排序器评估:BEIR的重排序描述为对第一阶段BM25命中的前序结果进行重排序(Thakur等人,2021),并非像本文那样设计为向所有模型分发单一固定候选集进行重新评分。MTEB/MMTEB的重排序由少量专用任务组成,并非对检索任务本身的候选集进行重新排序(Muennighoff等人,2023;Enevoldsen等人,2025),而NanoBEIR则需要一个单独发布的、经BM25候选集增强的衍生集合(Sentence Transformers,2024)。相比之下,HAKARI-Bench为所有检索任务提供固定的混合候选集,并在与候选生成相同的候选集上一致地评估重排序器(§3.3,§4.2)。关于重复测量成本,MTEB检索最初使用BEIR的完整语料库(数十万到数百万篇文档),成本较高;MTEB v2检索部分采用了源自MMTEB的难负例下采样方法来缩小语料库(我们在§5.6中对比的正是v2版本),在该范围内成本为中等偏低。
总体而言,BEIR 确立了跨架构一致性比较的评估设计,但它是基于英文且全量规模的,效率设置的跨模型评估不在其范围内。MTEB / MMTEB 将评估扩展到多语言、多任务场景,并通过下采样降低了测量成本(Enevoldsen 等人,2025),但降维和量化虽然基础设施层面可以处理,却并未针对每个模型进行一致报告,且重排序仅限于特定任务。NanoBEIR 在英文领域实现了轻量化(Câmara, 2024; Aarsen, 2024),但效率设置不在其范围内。HAKARI-Bench 继承了这些优势——BEIR 的一致方法论、MMTEB 的多语言能力、NanoBEIR 的轻量化——同时将检索任务候选集上的重排序器评估以及效率设置的跨模型评估整合到同一个评估基础设施中。
HAKARI-Bench 的设计
HAKARI-Bench 不仅仅是一个数据集集合,而是一个将任务集、候选生成评估、重排序评估和效率设置作为一个整体来处理的评估基础设施。它是一个五阶段流水线。
- 1.
任务规范。数据集位置和版本(提交 SHA)、语言以及领域类别被编写为声明式配置文件(§3.2)。
- 2.
通用任务格式。每个任务都与一个语料库、查询、相关性标签(qrels)以及一个固定的顶部候选集(默认情况下是通过 RRF 融合 BM25 和稠密检索得到的混合顶部结果)对齐(§3.1, §3.3)。
- 3.
评估。BM25、稠密检索、稀疏检索、延迟交互和重排序器这五大家族,连同效率变体(降维、int8、二值化、重新评分、稀疏剪枝),都在相同的任务上运行(§4)。
- 4.
结果记录。所有运行结果都存储在一个统一的模式中(每个查询的顶部排序、各种 @k 分数、变体、已解析版本、诊断记录)。
- 5.
聚合与展示。结果被聚合到一个 DuckDB 数据仓库中,并以包含宏观/微观平均值和多轴筛选器的排行榜形式展示(§4.5)。
本节描述了该设计。
任务集与 Nano 集
该基准测试的基本单元是一个检索任务。每个任务采用 TREC 大规模标准化并推广的测试集格式(语料库、查询、相关性标签 qrels;Voorhees 和 Harman,2005),并增加了一个固定的候选集(默认采用 BM25 与稠密检索融合的混合 top 结果,§3.3)。正如 BEIR 将分散的信息检索数据集统一为这种格式(Thakur 等人,2021),我们的基准测试也采用相同格式作为通用接口,并持续推动多语言、专家领域和 Nano 集的发展。
每个任务都被构建为一个小型评估数据集(Nano 集),从原始基准测试中缩减至约——个查询和约 K–K 个文档。这种缩减方法受 MMTEB 的下采样(Enevoldsen 等人,2025)和 NanoBEIR 的 Nano 集(Câmara,2024;Aarsen,2024)启发,旨在降低重复评估的成本。
Nano 集的构建依据来源分为两类。首先,对于已发布的 Nano 集合(如 NanoBEIR 系列),直接在 Hugging Face Hub 上按名称和版本引用,无需重新实现各自的缩减逻辑。其次,对于我们从官方 MTEB / MMTEB 完整评估中重建的系列(NanoMTEB-v2、NanoMMTEB-v2 等),通过统一的缩减流程生成 Nano 集:(i)选择最多去重后的查询,这些查询至少有一个正相关 qrel;(ii)对于语料库,在包含所选查询的所有正相关文档后,将其上限设为约 K 个文档,优先以跨查询轮询方式添加原始数据中存在的硬负例(明确标记为不相关的文档,即得分为 0 的 qrels),剩余部分按原始语料库顺序填充文档。
对于原始数据中不存在困难负样本的任务,填充文档构成了候选空间的大部分,因此检索空间变得相对简单(不相关文档不太可能成为偶然的困难负样本),从而更容易从查询中区分正样本。这种构造方式可以低成本地统一应用于许多任务,但在提升 Nano 集的判别能力方面仍有改进空间,例如通过添加困难负样本(§8)。即便如此,按此方式重构的 NanoMTEB-v2 / NanoMMTEB-v2 仍与官方评测保持了足够的秩相关性,这一点已在 §5.6 中得到确认。在数据集侧存储固定的 BM25 前 k 候选集,与 Sentence Transformers 的 BM25 候选增强派生集合(Sentence Transformers, 2024)思路一致,将重排序和稀疏学习评估与每次运行的 BM25 计算差异解耦。
该基准包含基准测试和检索任务。任务选择遵循 BEIR 确定的四项标准(任务多样性、领域多样性、任务难度、标注策略共存;Thakur 等人,2021),并扩展至多语言和专家领域。任务集包含以下五个类别。这种分类是基于基准来源和目标的便捷组织方式,而非评估实现上的区分。此处给出每个 Nano 集的主要来源基准;版本、来源和语言数量的详细信息整理在附录 A.1(表 LABEL:tab:a1)中。
- •
BEIR 系列:MNanoBEIR,一个多语言集合,整合了 Sentence Transformers 从 Zeta Alpha 原始 NanoBEIR 集合(Câmara, 2024)重新格式化的英文版本(Aarsen, 2024),以及 LightOn AI(Sourty, 2025)、Liquid AI(Liquid AI, 2025)和 Sionic AI(Sionic AI, 2025)提供的翻译/扩展多语言衍生版本(原始数据集为 BEIR;Thakur 等人,2021),包含 BEIR 数据集的各种语言版本。在聚合时,按语言和数据集进行分层分组,并像其他基准一样作为一个整体处理(§4.5)。
- •
官方 MTEB 系列:与官方 MTEB / MMTEB v2(Muennighoff 等人,2023;Enevoldsen 等人,2025)保持一致,并按官方系列分别划分:NanoMTEB-v2、NanoMMTEB-v2、NanoCMTEB、NanoJMTEB-v2、NanoFaMTEB-v2、NanoRuMTEB、NanoVNMTEB、NanoMTEB-Misc,以及按语言划分的 NanoMTEB-{荷兰语、法语、德语、韩语、波兰语、斯堪的纳维亚语、西班牙语、泰语}。每个系列所引用的按语言划分的源基准(C-MTEB、MTEB-NL、MTEB-French、SEB、ruMTEB、VN-MTEB 等)见附录表 LABEL:tab:a1。
- •
多语言通用:NanoMIRACL(Zhang 等人,2023)、NanoMLDR(Chen 等人,2024)、NanoIndicQA(Doddapaneni 等人,2023)、NanoMuPLeR(由 MTEB 基于欧盟 DGT 多语言平行语料库构建;附录表 LABEL:tab:a1)。每个基准均涵盖多种语言。
- •
长文档、指令遵循、专家领域、推理:NanoLongEmbed(Zhu 等人,2024)、NanoIFIR(Song 等人,2025)、NanoChemTEB(Shiraee Kasmaee 等人,2024)、NanoR2MED(Zhang 等人,2025a,R2MED)、NanoBIRCO(Wang 等人,2024b)、NanoBRIGHT(Su 等人,2024)、NanoRARb(Xiao 等人,2024a)、NanoRTEB(RTEB;Liu 等人,2025,此处为英文生产领域检索(法律、金融、代码等),非多语言)、NanoBuiltBench(BuiltBench;附录表 LABEL:tab:a1)、NanoDAPFAM(DAPFAM;附录表 LABEL:tab:a1),以及复合任务 NanoLaw(法律信息检索复合任务;AILA、LegalBench 等,附录表 LABEL:tab:a1)和 NanoMedical(医学信息检索复合任务;CURE 等,附录表 LABEL:tab:a1)。
- •
代码:NanoCoIR(Li 等人,2024)、NanoCodeRAG(Wang 等人,2025)。
该任务集包含源自同一原始数据集但跨系列重复的任务(例如 scidocs、trec_covid)。由于 Nano 集的采样方式因系列而异,同一原始任务可能成为不同的评估面,因此我们将重复任务保留为独立任务,而非合并或删除。在全部任务等权重的微观平均中,重复任务可能被重复计算,但此影响在我们分析中作为主要依据的按基准宏观平均中得到了缓解(跨基准微观/宏观平均及默认展示方式在第 4.5 节讨论)。重复任务的列表及详细信息见附录 A.3。
基准测试/任务的整体概况、语言分布以及文档数量统计见第5.1节;每个Nano数据集的来源和版本信息整理在附录A中。
通用评估格式
所有任务均统一为语料库、查询、相关性标签和候选集顶部的通用格式。这种统一使得能够根据各自的作用(第4节),使用相同的指标来比较候选生成方法(BM25、密集检索、稀疏检索、后期交互;从整个语料库中检索顶部结果)和重排序方法(对候选集重新排序)。评估结果存储在单一模式中,以便通过通用流程处理模型、评估方法、提示词和效率变体的替换;任务规范作为声明式配置文件进行管理,其必需的元数据包括数据集位置和版本、语言、领域类别以及引用信息(一组任务规范即构成排行榜上的一个基准测试)。
候选集顶部
重排序并非对整个语料库进行检索,而是对候选集进行重新排序。为明确这一前提,我们针对每个任务固定并共享候选集。候选集默认采用混合候选集(前N个),通过RRF(倒数排序融合)将BM25前N个结果与稠密检索前N个结果融合而成,重排序模型与候选生成基线共享同一候选集。具体构建方式如下:对于每个查询,我们使用BM25从整个语料库中检索前N个结果,并使用固定稠密模型(microsoft/harrier-oss-v1-270m,采用专用提示词web_search_query)检索前N个结果,然后通过RRF(每个文档得分按公式计算)融合两个排序结果,取前N个。我们使用固定稠密模型进行稠密检索,目的是将候选集构建与待评估模型解耦,并在所有任务中建立可复现的固定候选池。数据集侧还存储了仅基于BM25的候选集(前N个)作为词汇基线,可根据需要切换。在数据集侧固定候选集,使得重排序模型的改进更少依赖于候选生成偏差。特别地,由于混合候选集不仅包含BM25结果,还包含稠密检索前N个结果,因此它是一个共享的重排序目标,不会偏向单一候选生成方法(仅BM25或仅稠密检索);不过,它仍然依赖于具体的混合构建方式(BM25/稠密检索前N个结果、RRF以及正例追加保护机制),详见第7.3节讨论。
这个固定的候选集设有一条保障规则:仅当顶部结果中完全没有相关文档时,我们才在末尾追加一个相关文档(排名位置),确保每个查询在候选集中至少有一个相关文档(查询覆盖率)。由于将不含任何相关文档的候选集传递给重排序器无法产生有意义的评估信号,因此这一设计决策优先考虑将重排序器评估隔离为“候选集上的排序准确性”。并不保证包含所有相关文档(相关文档覆盖率)(密集检索平均约;§5.5),并且候选集生成失败被视为独立于重排序评估的一个维度(§5.5,附录E.4)。这也是因为一个特殊情况:除了候选集生成会遗漏部分相关文档外,对于每个查询包含多个相关文档的任务,原则上不可能将所有相关文档都纳入一个容量上限为 的候选集中(保障规则仅追加一个)。该设计的影响,包括其与真实世界两阶段检索的差异,将在§7.3中讨论。此外,为了在多语言单语检索中公平对待 BM25,候选集的 BM25 计算使用了按语言分词的 tokenizer(中文、日文、韩文、泰文和越南文使用形态分析器;其他部分语言使用 Unicode 正则表达式加词干提取)。候选集构建的细节,包括无保障规则的指标以及 tokenizer 的细分情况,见附录E.3。
评估目标
该基准测试在同一任务集上评估候选生成、重排序、降维、量化和稀疏表示剪枝。候选生成方法(BM25、稠密、稀疏、延迟交互)被评估为从整个语料库中检索候选的方法。重排序器被评估为对顶部候选集进行重新排序的方法。对于稠密嵌入,我们推导出保留主成分的降维、int8量化、二值量化及其组合等变体,并并排比较其质量和效率。对于稀疏表示,我们评估查询端和文档端表示各自可以被剪枝到何种程度。在评估中,数据集版本(commit SHA)可以被明确指定,且解析后的SHA会被记录在结果中,因此即使数据集被更新,也能保持与历史数值的对应关系(附录A.2)。
评估方法
本节描述哪些模型被评估为候选生成模型、哪些被评估为重排序模型,以及使用哪些指标。该基准测试提供的评估模式与BEIR所识别的五种检索架构(词法/稀疏/稠密/延迟交互/重排序;Thakur等人,2021)保持一致;每种模式都接收相同的任务规范作为输入,并输出相同的结果模式。
评估检索模型
检索模型被评估为从整个语料库中检索候选相关文档的方法。BM25 是一种词汇匹配方法;默认情况下评估的是存储的 BM25 顶部结果(也可切换为本地计算)。稠密检索使用嵌入向量模型对查询和文档进行编码,并从整个语料库的精确相似度中检索顶部结果。对于每个模型-任务对,我们同时计算余弦相似度和内积相似度,并报告其中能带来更高任务 nDCG@10 的那一种;这是对这两个函数在每项任务上的最佳相似度上限(即相似度选择的理想情况),并统一应用于所有稠密模型(附录 C.3)(降维和量化变体见第 4.3 节)。稀疏检索通过学习得到的稀疏表示的内积进行评分(剪枝设置见第 4.4 节);延迟交互评分则通过 ColBERT 系列 token 级嵌入的 token 到 token MaxSim 进行。在每种方法中,每个查询的顶部检索结果都可以存储,因此无需重新计算嵌入向量即可进行下游重排序和错误分析。
评估重排序器
重排序器的评估方式并非与候选生成环节进行同等比较,而是作为对顶部候选集进行重新排序的方法。在本文中,重排序器是一种将查询-文档对作为输入、直接对其相关性进行评分,并对候选集进行重新排序的模型。典型示例是 BERT/XLM-R 交叉编码器(Nogueira 和 Cho,2019),但我们也包括基于大语言模型(解码器)的 LLM 风格重排序器,这类模型使用“是/否” token 的预测 logit 作为相关性分数。我们统称这些为重排序器,无论它们是交叉编码器还是 LLM 风格。重排序器对固定的候选集(默认是混合顶部结果)进行重新排序,并计算重排序后的指标。由于在保障规则(第 3.3 节;查询覆盖率)下,候选集为每个查询至少包含一个相关文档,因此重排序器的评估侧重于候选集上的排序准确性。
不仅是专门的排序模型,检索模型(密集检索、稀疏检索、延迟交互检索)也可以通过重新评分同一固定候选集来作为排序模型进行评估。因此,可以在相同条件下衡量专门排序模型和检索模型的排序性能。特别地,当检索模型重新评估自身候选集时的改进,以及排序模型重新排序候选集时的性能,可以在同一候选集上分别读取(§5.5)。
密集嵌入向量的降维与量化
密集嵌入向量的效率配置是通过在计算一次基础嵌入后进行编码后变换,生成派生变体。这可以在相同条件下从单次推理中衍生出多种效率配置,并比较质量与效率。这些变体包括:
- 1.
降维(截断):保留前导维度的维度切片(假设采用 Matryoshka 系列;Kusupati 等人,2022)。我们比较截断到例如指定维度时的性能。
- 2.
量化:int8 和二进制量化。int8 并非类型转换为 float16,而是一种标量量化,将每个维度线性量化到 8 位整数(共 256 个级别)。具体来说,我们从语料库侧的嵌入向量中获取每个维度的最小值/最大值,并将每个值映射到覆盖该范围的 256 个桶之一(逐维度仿射量化)。校准仅在分布稳定的语料库侧进行;查询不用于校准(以避免为评估查询拟合桶),超出范围的值会被截断。不进行单独的校准采样或训练(与 Shakir 等人,2024 的量化属于同一系列)。二进制量化仅保留每个维度的符号(1 位)。
- 3.
重新评分:最简单的两阶段检索,即使用原始浮点嵌入向量对通过量化搜索检索到的顶部结果进行重新评分。
- 4.
组合:降维、量化与重新评分的笛卡尔积。
每个变体都作为同一任务的独立记录并列存储,排行榜的“与基准的差异”列直接显示质量下降程度。这使得排行榜不再被解读为单一分数列,而是质量和效率的帕累托前沿。这里的帕累托前沿是指在质量与效率(嵌入维度、量化精度等)两个轴上的设置集合,这些设置无法在不恶化其中一轴的情况下被超越;即,在给定效率下可达到的最佳质量轨迹,以及反过来,在保持给定质量下可达到的最低成本轨迹。
请注意,我们的量化是一种简单的后验量化,用于衡量模型自身的量化鲁棒性;与先进的生产级 ANN 方法(§2.3)之间的差距在 §6.4 中讨论。各变体的技术细节整理在附录 E.1 中。
稀疏表示剪枝设置
由于学习到的稀疏表示本质上是稀疏的,通常的做法是每行只保留绝对值最大的维度(最大活跃维度数限制)。我们在相同的评估面上,测量了独立指定查询端和文档端最大活跃维度数的单一变体,以及它们的组合变体。查询端值决定了搜索时非零维度的数量,并直接与搜索延迟相关。文档端值除了与延迟相关外,还直接与倒排索引和嵌入矩阵的大小相关,即生产环境下的内存/磁盘占用。将两者独立列出,使我们能够针对给定的运行环境(延迟预算、内存/存储预算)解读剪枝设置与检索质量之间的关系(§5.4,附录 E.2)。
指标与聚合
该基准测试的主要指标是 nDCG@10,沿用了 BEIR 采用的主要指标(Thakur 等人,2021 年)。一个关键设计点是:在每项任务的评估过程中,每个查询的顶部排序结果会作为工件存储。由于顶部排序结果已存储,在构建排行榜(DuckDB 数据仓库)时,可随时根据存储的排序结果重新计算各种检索指标(nDCG、召回率、准确率、MRR、MAP 等)。查看器/排行榜的默认显示项是主要指标 nDCG@10,记录于 ;同时将 recall@ 作为次要指标进行联合报告,这遵循了 BEIR 的惯例。指标定义详见附录 B.1。
为了稳健地聚合任务数量和规模分布不均的基准测试组,我们遵循以下规则。对于每个基准测试,我们显示任务间的简单平均值()。对于跨基准测试的聚合,我们同时报告所有任务间的等权微观平均值和每个基准测试等权重的宏观平均值。排行榜/查看器的默认显示项是微观平均值,同时可切换为宏观平均值。我们默认使用微观平均值,因为结合语言/类别筛选器或 Nano 子集缩小范围后,“显示范围内所有任务的等权平均值”是一个简单易懂的解释。采用哪种聚合方式取决于“人们想以何种粒度查看哪些数据”,因此两者并列显示并可切换。然而,在我们的分析中,为了避免总体得分被任务数量和规模分布不均的基准测试组(尤其是包含大量任务的 MNanoBEIR 和跨族系的重复任务)主导,我们将每个基准测试的宏观平均值作为主要聚合依据。在宏观聚合中,BEIR 族系的 MNanoBEIR(包含多个 BEIR 数据集和多种语言)首先在每个 BEIR 数据集内对各语言取平均值,然后将各数据集的平均值再平均为一个基准测试得分(按语言和数据集的层级聚合)。这可以防止行数较多的 MNanoBEIR 按任务数量权重主导聚合结果。排名仅针对在所选显示范围内拥有全部预期任务集的模型。聚合细节及缺失任务的处理方式见附录 B.2、B.3。
结果可通过基于任务和模型元数据的多轴筛选进行展示。代表性筛选轴包括:(i) 语言标签(例如,将日语专用模型与多语言通用模型进行并排比较);(ii) 领域类别(代码/自然语言、专业领域);(iii) 每项任务的平均查询长度和平均文档长度(例如,当未在长上下文上训练的模型产生极低分数从而扭曲整体排名时,排除长文档任务);以及 (iv) 模型嵌入向量维度和参数量。这些方法能够根据实际使用场景对排行榜进行重构,从而区分模型在强项与弱项领域上的表现,而这一点在单一的全任务集分数中难以体现(§6.2)。
结果
下文报告的评估值基于截至 2026-06-09 的固定 HAKARI-Bench 快照(DuckDB 数据仓库 hakari-bench/leaderboard_database,提交版本 1f0d59d,构建于 2026-06-09,schema v8);用于排名相关性比较(§5.6,附录 D)的官方 mteb/results 固定于提交版本 1e8ab5d,截至 2026-06-08。这两个快照是本文的固定参考基准。此后,“当前快照”即指此数据快照(构建于 2026-06-09),使用时不再另行说明。
本节最重要的结果在此先行说明:由 Nano-sets 得出的整体排名在斯皮尔曼相关性(§5.6)上复现了官方完整评估(MTEB retrieval v2 / MMTEB v2 retrieval 和 BEIR),证实轻量化处理并未损害排名代理的有效性。本节中的整体数值以每个基准的宏平均作为主要依据,以抑制任务数量偏差(排行榜/查看器的默认显示为微平均;当两者差异影响解读时,我们会明确标注;§4.5)。下文首先展示评估目标和任务分布(§5.1),然后是模型性能与效率设置结果(§5.2–§5.5)、支撑其有效性的排名相关性(§5.6),以及真实数据用例(§5.7)。
评估目标包括基础模型行222固定的 DuckDB 快照本身包含模型(密集模型);我们从所有池、聚合结果和图表/表格中排除了两个未发布的密集模型,仅保留此处分析的(密集模型)(附录 C.1)。基准测试任务。这些模型作为候选生成方法,包括密集嵌入、学习型稀疏表示、延迟交互(ColBERT 系列)以及词汇基线 BM25,外加用于对顶部候选集重新排序的重排序器(交叉编码器、LLM 风格)。除 BM25 外,所有模型均为参数约 B 或更少的小型到中型模型;该基准测试主要针对 MMTEB 排行榜上参数分布约 B 或更少的模型区间。这使得所有五个 BEIR 定义的方法族(词汇/稀疏/密集/延迟交互/重排序)能够在同一任务集上进行对比。模型组成及参考文献见附录 C.1。
任务集分布
该基准测试并非单一领域的轻量版本,而是一个多语言、多领域的评估平台。类别分布包括自然语言任务(查询、文档)和代码任务(查询、文档)。其中五个基准测试包含代码任务,NanoCoIR 和 NanoCodeRAG 为纯代码任务,NanoBRIGHT、NanoRTEB 和 NanoRARb 则与自然语言任务混合(各基准测试的任务数量见表 LABEL:tab:a1)。任务元数据中标记的语言共涵盖 种语言。按每种语言的任务数量统计(当一个任务涉及多种语言时,分别计入各语言),排名靠前的语言依次为:英语 、越南语 、德语 、法语 、荷兰语 、日语 、西班牙语 、泰语 、韩语 ,以及阿拉伯语/波斯语各 个;非英语语言的累计任务数量超过 。请注意,这是任务数量,而非语言数量;不同目标语言的数量为 。所有任务均包含完整的元数据,包括查询数量、文档数量以及平均字符长度。
模型性能概览
各基准测试的每项任务平均得分(基于稠密模型)差异显著。高分基准包括 NanoCodeRAG、NanoRuMTEB、NanoChemTEB、NanoCoIR 和 NanoMIRACL;低分基准包括 NanoRARb、NanoR2MED、NanoDAPFAM、NanoBIRCO 和 NanoBRIGHT。即使在 Nano 集任务集合上,各基准测试间的得分差异也超过 分。这反映的并非单个模型的胜负,而是现有嵌入模型在专家领域、指令遵循和复杂推理任务上的弱点暴露,以及模型不支持的纯语言任务(例如仅支持英文的模型在多语言任务上表现大幅下降)上的问题:性能差异因任务、领域和支持语言的不同而差异巨大(§6.2)。
从稠密模型按基准测试宏观平均得分()的整体排名来看,排名靠前的分别是 jinaai/jina-embeddings-v5-text-small(jina-embeddings-v5;Akram 等人,2026)、jinaai/jina-embeddings-v5-text-nano、microsoft/harrier-oss-v1-0.6b、perplexity-ai/pplx-embed-v1-0.6b 和 google/embeddinggemma-300m(等权微观平均得分分别为 、、、、,头部构成稳定)。由于宏观平均受大规模基准测试的影响较小,我们将其作为主要的整体排名依据(排行榜默认显示微观平均,可切换为宏观平均;§4.5)。词法基线 BM25 在全语料检索下的宏观得分为 (微观得分为 ),虽然低于头部稠密模型组,但在所有任务上均作为跨架构同条件对比的基线共同报告。相邻模型之间的细微差异无法通过查询数量有限的单一 Nano 集来判定,应将其视为排名参考指标(§7.2)。
维度压缩与量化带来的性能变化
int8量化、二值量化及其重打分变体在稠密模型任务上均已完整覆盖。将这些变体与同一任务的基础行进行匹配,并计算所有模型相对于基础行的平均差值(即点数),二值量化为点数,int8量化为点数,binary_rescore为点数,int8_rescore为点数。也就是说,单独使用二值量化质量下降最大,int8量化影响较轻,而加入重打分后,int8量化几乎恢复至无损水平(),二值量化恢复至水平。此处的重打分是指:利用量化前保留的原始浮点(如fp16)嵌入向量,对量化向量检索出的顶部结果重新打分,然后重新排序(§4.3)。生产级搜索引擎通常会保留原始向量值;此时重打分仅针对少量顶部候选结果,因此额外计算量很小(甚至可以用原始模型的未降维、未量化向量重新计算)。重打分带来的恢复效果表明,以这一微小代价几乎可以完全恢复质量。这一趋势只有在对所有支持模型在相同条件下应用效率设置后,才能跨模型得到确认。
支持降维(保留主导维度)的模型数量因维度而异:(个模型)、()、()、()、()、()、(),每个维度均覆盖所有任务。量化与降维的组合变体在支持模型上也实现了对所有任务的相同覆盖。由于这些变体行在结果表中并列存放,“相对于基础行的差值”列直接显示了质量下降程度,并且可以在相同条件下比较哪些模型在降维方面表现更强,以及int8/二值量化对性能的削弱程度。一张跨所有模型比较量化质量下降(int8/二值量化的每模型宏观差值)与降维保留率(以原生维度比例表示)的图表,见附录F.4(图8)。变体命名/对应关系及重打分细节见附录E.1。
稀疏表示剪枝带来的性能变化
评估目标包括学习型稀疏模型(naver/splade-v3 (SPLADE-v3; Lassance 等人, 2024)、prithivida/Splade_PP_en_v2、ibm-granite/granite-embedding-30m-sparse、opensearch-project/opensearch-neural-sparse-encoding-multilingual-v1)。对于 SPLADE 系列(Formal 等人, 2021),我们通过查询端和文档端最大活跃维度的组合进行剪枝,并测量了性能变化。对于 naver/splade-v3,平均分数从 到 单调递减。文档端在超过 维度后几乎没有改善(– 对应 ),而查询端缩减则更为敏感(在相同 下,– 对应 )。这表明了实际的压缩空间:激进的文档端剪枝(减少内存和倒排索引大小)几乎不影响质量,而将查询端削减至 以下则会造成较大的质量损失。关于基础比率的完整剪枝网格以及保持质量( 和 )的运行区间,详见附录 F.6(表 10)。请注意,SPLADE 系列以英语为中心(源自 MS MARCO),因此其在包括多语言任务在内的所有任务上的平均得分较低,绝对比较应在语言固定的前提下进行解读。剪枝细节见附录 E.2。
重排序与候选集分析
每项任务的评估都包含用于分析重排序器和候选集行为的诊断记录。默认候选集是混合候选集(top ,§3.3),通过 RRF 融合 BM25 和稠密检索的 top 结果,并带有一项保护措施:对于任何不包含相关文档的查询,在末尾追加一个相关文档。这些记录包括基础分数和重排序器分数及改进幅度、候选集来源、查询覆盖率(至少有一个相关文档的查询占比)、相关文档覆盖率(top 候选集中相关文档的占比)以及运行时分解。在 -稠密模型平均情况下,查询覆盖率为 ,相关文档覆盖率为 。虽然保护措施确保每个查询至少有一个相关文档,但约有 的相关文档未能进入 top 候选集。
检索模型重新评估自身的候选集。
当稠密模型重新评估其自身的混合候选集时,改进幅度很小:稠密平均得分(不含保护指标)上的点。改进幅度小,是因为混合候选集已经包含了稠密检索的顶部结果,因此模型几乎是在重新评分它在全语料检索中排在最前面的那些文档。剩余的小幅改进来自 BM25 生成的候选(稠密模型在全语料检索中遗漏的词汇匹配文档)进入搜索目标,以及保护指标始终包含一个正例。共享混合候选集的一个优势是,当候选集仅由 BM25 构成时,BM25 候选集与稠密模型之间因兼容性而产生的较大表观改进不太可能被混入其中。
重排序器评估。
重排序器(交叉编码器、LLM 风格;§4.2)在所有任务上均对固定候选集上的重排序结果保持一致。这些重排序器——尤其是编码器型交叉编码器——主要针对短查询寻找语义相近文档的通用检索任务进行训练,并且在符合该假设的任务上效果最佳(LLM 风格的重排序器,如 Qwen3-Reranker,是例外,如下所示)。事实上,仅考虑查询和文档均较短的任务(查询字符数和文档字符数),多语言交叉编码器 BAAI/bge-reranker-v2-m3(BGE-M3 base;Chen 等人,2024)在多语言短文本任务上达到宏观平均得分,高于直接在候选集上作为重排序器评分的最佳稠密模型;而纯英文交叉编码器 cross-encoder/ettin-reranker-400m-v1(Ettin;Weller 等人,2025)在英文短文本任务上达到宏观平均得分,高于最佳稠密模型。也就是说,在重排序器所假设的“短查询/文档检索”用例中,使用适合多语言或英文的重排序器分别能提升质量。
另一方面,在涵盖代码、推理、指令遵循、长文档和语言在内的所有任务中,唯一在候选集上的重排序宏平均指标上超越最佳稠密模型(jinaai/jina-embeddings-v5-text-small)的重排序器,是采用 LLM 风格的 Qwen/Qwen3-Reranker-0.6B(Zhang 等人,2025b,Zhang Y. 等);而经典的多语言交叉编码器(BAAI/bge-reranker-v2-m3、Alibaba-NLP/gte-multilingual-reranker-base(mGTE;Zhang 等人,2024)等)均略低于最佳稠密模型。这是因为许多此类重排序器通常专门针对上述短语义搜索查询进行训练,其泛化能力不如最佳稠密模型,无法覆盖该基准测试的全部多样性。
排名最高的重排序器也超越了排名最高的全语料稠密模型,这表明在固定候选重排序协议下(附带安全机制;这并非端到端的生产环境检索对比,详见 §6.4),对混合候选集进行重排序是一种能够超越全语料稠密检索的配置方案。按类型、范围和查询类型划分的重排序器详细分解(-score 对比;表 8、图 3、图 4)见附录 E.4。请注意,这些重排序器得分是在安全机制确保每个查询的候选集中都包含相关文档的前提下计算的,因此实际两阶段检索中“候选集不含正例时的性能下降”问题已被隔离。
我们在表 2 中总结了各范围的最佳模型。在相同候选集上作为重排序器评分时,超越最佳稠密模型(jinaai/jina-embeddings-v5-text-small)的模型包括:在所有任务上,仅有 LLM 风格的 Qwen/Qwen3-Reranker-0.6B;在短多语言范围(查询字符和文档字符,非英语)内,多语言交叉编码器 BAAI/bge-reranker-v2-m3(Qwen3-Reranker 在该范围也略微超越它);在短英语范围(相同条件,英语)内,纯英语交叉编码器 cross-encoder/ettin-reranker-400m-v1。因此,重排序器能否超越稠密模型,并不取决于“重排序器本身”,而取决于具体范围和重排序器类型。
| 模型 | 类型 | 全部 551 项 | 短查询多语言 | 短查询英语 |
|---|---|---|---|---|
| Qwen3-Reranker-0.6B | 大语言模型重排序器 | 68.03 | 66.48 | 66.59 |
| bge-reranker-v2-m3 | 多语言交叉编码器 | 63.07 | 67.41 | 63.29 |
| ettin-reranker-400m | 仅英语交叉编码器 | 60.82 | 58.91 | 70.23 |
| jina-v5-small | 稠密模型(参考) | 65.51 | 65.91 | 68.59 |
按基准测试的优劣势分析。
“重排序器最优与稠密模型最优”之间的差距在多语言、专家领域和推理类基准测试(例如 NanoMLDR)上较大,即使在重排序器最优值低于稠密模型最优值的基准测试上,其劣势也很小。按基准测试的详细分解以及按类型(交叉编码器/大语言模型风格)、作用域和查询类型对重排序器的分类整理见附录 E.4,其中我们展示了多语言交叉编码器在短事实查询上表现强劲,但在长查询上性能骤降,而大语言模型风格的重排序器则对查询长度具有鲁棒性。
与 MTEB / MMTEB 检索任务的排名相关性
为了实证展示 Nano 子集在多大程度上复现了原始基准测试的排名,我们独立地将 NanoMMTEB-v2、NanoMTEB-v2 和 NanoBEIR-en 分别与官方 mteb/results(提交 1e8ab5d,数据截止至 2026-06-08)中的 MMTEB v2 检索、MTEB 检索 v2 以及英文 BEIR(完整版)进行了对比。该分析仅使用第 5 节结果中 Nano 侧的相同基础行,并从共同模型集中排除了官方侧未将所有任务作为单次修订单次测量来提供的任何模型,从而隔离出纯粹的排名可复现性。聚合方法是在每个任务内按分数降序分配排名(并列情况取平均排名),并通过计算每个模型在所有任务上的 Borda 分数(= 模型数量)的平均值来得出总体排名。结果见表 3,官方排名与 Nano 排名的散点图见图 1。
| 指标 | MMTEB | MTEB-v2 | BEIR-en |
|---|---|---|---|
| 共同模型数 | 24 | 18 | 19 |
| 任务数 | 18 | 10 | 13 |
| 斯皮尔曼等级相关系数 | 0.975 | 0.983 | 0.973 |
| 斯皮尔曼相关系数 95% 置信区间(模型自助法) | [0.915, 0.995] | [0.912, 0.998] | [0.882, 0.997] |
| 皮尔逊相关系数(Borda 分数) | 0.969 | 0.981 | 0.974 |
| 平均绝对排名差 | 1.208 | 0.722 | 0.895 |
| 中位数排名差 | 1.000 | 1.000 | 0.500 |
| 最大排名差 | 4.000 | 2.000 | 3.000 |
对于所有三组对比,斯皮尔曼秩相关系数均超过 ,平均秩次差异约为 ,最大差异为 (MMTEB)、(BEIR-en)和(MTEB-v2)。由于共同模型数量(//)有限,我们通过自助法(对共同模型集进行 次有放回重采样)获得了斯皮尔曼相关系数的置信区间(表 3)。即使在区间下限处,MMTEB 和 MTEB-v2 的相关性仍保持在 ,BEIR-en 的相关性为 ,均处于高位。Borda 分数的皮尔逊相关系数也为 ,因此即使从聚合每项任务胜负的角度来看,每个 Nano 集也都忠实地再现了官方的整体排名。特别地,对于 MMTEB v2 检索和 MTEB 检索 v2,官方侧和 Nano 侧的顶级模型排名均为第 位(秩次差异为 ),这代表了顶级排名再现方面具有代表性的一致性。存在秩次交换的情况,但未观察到跨越上/中/下组边界的较大移动,且其规模不足以改变模型选择的判断。
每个模型的排名表、每项任务的均值/方差差异,以及差异背后因素的讨论,均汇总于附录 D。
根据这些结果,Nano 集并非取代官方完整检索的最终评估,也不能保证绝对分数的一致性。然而,对于迭代排名判断(如模型选择、区分中上组、以及发布前的回归检测),它们能够作为代理,以低成本提供接近官方完整评估的结论——这一点已通过三项独立对比得到证实。对于相近模型之间的细微区分以及依赖于特定任务的结论,仍需参考官方的完整任务集。
真实数据使用案例
整体排名只能回答“哪个模型平均表现最好”,但实际模型选型是在目标语言、文档长度、延迟预算和索引规模等条件下进行的。由于该基准测试在相同条件下衡量了众多模型、任务、架构和效率设置,因此它能够直接回答这类条件性选型决策。例如,在第一阶段检索系统池(稠密型、学习型稀疏型、BM25)中,将每个范围的前几名系统与其整体宏观排名进行对比:对于代码RAG、指令遵循和医学推理,整体排名第一的(jinaai/jina-embeddings-v5-text-small)同时也是该范围的第一名;而对于多语言语义搜索(NanoMIRACL),整体排名第一的是BAAI/bge-m3;对于两个长文档系列(NanoMLDR、NanoLongEmbed),整体排名第一的是BM25;对于日语(NanoJMTEB-v2),整体排名第一的是日语专用模型cl-nagoya/ruri-v3-310m(Ruri;Tsukagoshi和Sasano,2024)。整体得分能提供良好指导的范围与整体得分会给出错误指导的范围并存,而哪些范围属于哪种情况,只能通过按范围进行测量来确定。各范围排名的完整情况见附录F.1(图5)。
“整体最佳模型并不一定具有指示性,最佳模型/架构会随目标范围而变化”这一观察结果可归纳为三个问题,每个问题在附录F中都有真实数据用例的详细说明。
首先,选择哪种模型/架构取决于目标范围(附录F.1、F.2)。改变范围不仅会在稠密模型之间调换最佳模型,还会在不同架构(稠密型/稀疏型/后期交互型等)之间调换。例如,在限定于英文BEIR时,后期交互型——而非整体排名第一的模型——占据了首位,而学习型稀疏型则进入了前四分之一。
其次,不同架构可以在同等条件下进行比较(附录 F.3)。将所有模型作为重排序器,在同一个固定候选集上进行评分,使得嵌入向量模型和重排序器能够并排比较。从整体宏观指标来看,仅有一款现代通用重排序器超越了稠密模型的顶尖水平,而多语言交叉编码器的优势主要集中在多语言语义搜索领域(§5.5,附录 E.4)。
第三,效率设置的成本可以与质量分开评估(附录 F.4–F.6)。降维和 int8 量化是可预测的小成本,对二值量化的鲁棒性取决于模型的训练特性,浮点数重评分几乎能保持跨模型比较的一致性,而稀疏剪枝则有一个廉价的文档端调节旋钮和一个昂贵的查询端调节旋钮——每种设置的成本都可以单独评估。
以上三点对于采用决策至关重要,而这些信息无法从单一的总体评分中获取,只有当使用统一的测试框架、单一的任务格式、相同条件下的测量以及一致的聚合基准(本文以宏观指标为主要基准;§3,§4.5)时,才能提取出来。
来源:HuggingFace Daily Papers(社区热门论文) · arxiv.org