跳到正文
北京时间
原文
HuggingFace Daily Papers(社区热门论文)·· 2026-06-08精选AI 评分76

精确性不等于忠实度:完整Oracle下的覆盖感知接地生成评估

Precision Is Not Faithfulness: Coverage-Aware Evaluation of Grounded Generation with a Complete Oracle

AI 导读

无参考忠实度度量仅衡量精确率(陈述是否被支持),鼓励模型少说甚至不说以获得高分。本研究利用F1遥测(确定性完整ground truth)和NOAA天气预报两个完整Oracle领域,证明此盲点:在多语言(EN/ES/PT)共7253个决策实例(覆盖150场比赛)的基准上,最精确的前沿模型仅覆盖不到一半相关事实,按F1排名垫底。引入覆盖度(召回率)后系统排序改变;显式要求详尽也无法弥补差距。作者提出将忠实度与覆盖度合并为单一分数,并给出无参考验证器引导生成方法,同时提升精确率和召回率。相关基准、标注、度量、基线及交互演示已开源。

推荐理由

这个研究戳破了自动评估里 Faithfulness 的泡沫,指标只看模型「说对多少」不看「说全没有」,沉默的模型反而拿高分,以后评测不能只看精确度了,做评估的得补上覆盖度这一环。

正文 · AI 翻译

作者是 Globant 公司的 DevOps 工程师;学术单位待定。

摘要

无参考忠实度指标会逐一验证模型生成的每个原子声明是否与真实依据相符,并越来越多地被用于评估有依据生成。我们发现这些指标存在一个共同盲点:它们只衡量精确率——即所陈述的声明是否得到支持?——因此会奖励“弃权”行为,因为模型几乎什么都不说就能获得近乎完美的忠实度得分。我们利用一级方程式赛车遥测数据使这一问题变得可量化,在该领域中,策略性真实依据可以通过确定性方式推导得出,而且关键的是,这种推导是完整的:对于每个决策,我们都能知道所有相关的事实集合。这种完整性——在开放领域的忠实度基准测试中是不存在的——使我们能够在衡量精确率的同时,也衡量召回率(即对相关事实的覆盖程度)。在一个涵盖 157 场比赛、包含 7253 个决策实例的多语言(英语/西班牙语/葡萄牙语)基准测试中,精确率最高的前沿模型(grok-4.3,精确率 0.89)仅覆盖了 0.46 的相关事实,并在综合评分中排名垫底,因此要求覆盖度会重新排列系统排名;同样的效果在第二个具有完整真实依据的领域(天气预报)中也再次出现。我们将忠实度与覆盖度结合成一个单一评分,对该指标进行了验证(受控扰动;无模型正则表达式提取器与跨族系大语言模型提取器之间的一致性,系统级斯皮尔曼相关系数为 1.00),并提出了一种无需参考即可提升精确率和召回率的验证器引导生成方法。我们发布了该基准测试、结构化标注、指标、基线以及一个交互式演示。

精确率不等于忠实度:基于完整真实依据的有依据生成覆盖度感知评估

Juan S. Santillana††感谢:作者是 Globant 公司的 DevOps 工程师;学术单位待定。juan.salas@globant.com

1 引言

无参考忠实度指标——将生成文本分解为原子化断言,并逐一与真实信息进行核验(Min 等人,2023;Fabbri 等人,2022)——已成为在无黄金参考文本情况下评估有依据生成的标准化方法。这类指标报告的是精确率:模型所做出的断言中,有多少是有依据的?我们认为这只是"忠实"应有含义的一半。模型可以通过极度谨慎来最大化精确率——只陈述一个安全的事实,而省略其他所有内容。仅基于精确率的指标会将此类输出评为近乎完美,尽管它毫无信息量。仅以精确率衡量的忠实度,实际上是在奖励"回避作答"行为。

缺失的另一半是召回率:在那些重要的事实中,模型正确陈述了多少?开放域忠实度基准无法衡量这一点,因为不存在一个完整、可枚举的相关事实集合供召回核验——真实信息完全取决于检索器或标注者恰好呈现了什么。因此,我们转向一个拥有完整"神谕"(即完备真实信息源)的领域。一级方程式赛车(F1)会产生丰富、公开的计时与遥测数据,从中可以确定性地、穷尽地推导出策略层面的真实信息(进站圈数、轮胎配方、undercut 策略、防守策略、比赛结果):对于每一个决策,我们都能知道全部可核验的事实集合。这使我们能够衡量召回率,并将其与精确率配对,这是开放域场景在结构上无法做到的。

利用这个"神谕",我们证明了"回避作答"问题并非假设:在一个多语言基准测试中,忠实度(精确率)最高的前沿模型仅覆盖了 0.46 的相关事实,而一旦要求覆盖率,模型排名就会发生变化(第 7 节)。我们将 F1 策略解释定位为忠实、基于数据的自然语言生成任务——而非比赛结果预测,后者已趋饱和且不属于语言研究范畴——因为它为这一度量问题提供了最清晰可用的测试平台。

我们的贡献:

  1. 1.

    我们证明,无参考忠实度指标会奖励"回避作答"行为,并且当拥有完整"神谕"时,一旦要求覆盖率,模型排名会发生反转——这一结论在两个不相关的领域(F1 和天气)中得到了复现(第 7 节、第 9 节)。

  2. 2.

    一个包含完整真实答案、多语言(英语/西班牙语/葡萄牙语)的基准测试集,涵盖 7253 个基于事实的 F1 决策实例,以及一个精确率加召回率的忠实度评估指标,该指标通过受控扰动实验以及无模型提取器与跨模型族提取器之间的一致性验证得到验证(第 4、5 节)。

  3. 3.

    一种验证器引导的生成方法,仅使用结构化验证器作为信号,即可同时提升精确率和召回率(第 6 节)。

该基准测试集、评估指标、基线模型以及一个交互式演示均已公开。¹¹¹ 演示地址:https://huggingface.co/spaces/jsantillana/faithful-strategy-engineer-f1

2 相关工作

数据到文本生成领域在体育和结构化记录方面已有大量研究,例如 RotoWire(Wiseman 等人,2017)、SportSett:Basketball(Thomson 等人,2020)、基于记录的天气预报生成(Liang 等人,2009),以及受控的表格到文本生成如 ToTTo(Parikh 等人,2020);在此背景下,Thomson 和 Reiter(2020)提出了一种人工标注的金标准准确性评估方法,对生成文本中的每个事实进行评分,这是与我们自动检查方法最接近的先前实践。

忠实度即精确率。

模型幻觉/忠实度评估——包括忠实与事实的基础区分(Maynez 等人,2020)、FActScore(Min 等人,2023)、基于问答的一致性评估(Fabbri 等人,2022)、基于自然语言推理的不一致性检测(Laban 等人,2022;Kryściński 等人,2020)、一致性基准测试(Honovich 等人,2022)、基于采样的检测方法(Manakul 等人,2023),以及归因与修正(Gao 等人,2023);综述可参见 Ji 等人(2023)——这些方法都侧重于精确率:它们评估模型所做出的陈述,而非模型遗漏的陈述,因此不会惩罚信息量不足的回答。这正是我们研究的“弃权盲区”。

事实的召回率。

与我们工作最接近的是互补性召回评估方向。表格到文本的 PARENT 方法(Dhingra 等人,2019)衡量对源表格的覆盖程度,但需要参考文本和一份(可能不完整的)表格;针对长篇幅开放域文本,SAFE(Wei 等人,2024)报告事实性精确率和召回率(),而 RAG 评估(RAGAS)则根据检索到的上下文对忠实度进行评分(Es 等人,2024)。关键在于,这些方法评估的是针对检索到或采样到的事实(本质上是一个不完整的分母)的召回率,而我们的 oracle 是确定性推导且完整的,提供了精确的召回率分母而非估计值——这正是使得精确率/召回率排序反转可被量化的原因。我们的验证器引导生成与自我精炼(Madaan 等人,2023)相关,但反馈信号是对结构化数据进行确定性校验,而非模型自身的评判。我们采用紧凑型领域专用模型的做法,延续了近期关于面向西班牙语技术领域、具备原生工具使用能力的小型高效模型的研究(Santillana,2026)。

3 任务

每个实例提供结构化上下文(车手进站时段、轮胎配方与使用圈数、进站策略、时间差距、安全车/虚拟安全车状态)以及英文/西班牙文/葡萄牙文的决策提示词。模型必须解释一项策略决策,使得每一项事实性陈述都能在上下文中得到验证。该基准涵盖五种决策类型:轮胎策略、进站超车、反超策略、赛道防守(将速度更快的追赶者压制数圈——即“后车掩护”战术),以及比赛总结(对赛果和关键时刻的基于事实的回顾)。

4 数据集

我们使用 FastF1(Oehrly 及其贡献者,2024)提取计时数据和遥测数据(该工具为官方实时计时 API,无需广播权限),并通过确定性规则推导策略事件。每个车手的赛段按绿旗圈(排除进站圈、出站圈以及黄旗、安全车或虚拟安全车下的圈数)进行分段,并在段内拟合轮胎退化斜率,以确保速度估算不受中立化影响。进站通过赛段转换识别,并在安全车/虚拟安全车下发生时进行标记。超车策略中的“早进站”和“晚进站”通过成对检测识别,但仅保留给那些真正在赛道上相互竞争的车手——即两车间距较小,使得进站顺序(而非累积的速度差)主导间距变化——从而产生高精度事件(已通过已知比赛叙事进行抽查验证,例如 2024 年意大利大奖赛获胜的一次进站策略)。赛道防守被检测为连续多圈中,速度更快的追赶者被压制在特定秒数内的序列,并在前方有队友受到保护时进行标记;该方法能还原经典案例(例如 2021 年匈牙利大奖赛,阿隆索防守汉密尔顿多圈)。赛季积分榜(正赛积分加冲刺赛积分)支持基于事实的冠军总结。

每个实例将序列化的结构化上下文、英语/西班牙语/葡萄牙语的决策提示以及用于验证的结构化真实数据配对。从 8 个赛季(2018–2026)的 157 场比赛中,我们获得了 8486 个赛段、5358 次进站和 3337 次进站攻防,从而产生 7253 个实例(1500 个轮胎策略、2034 个早进站、1125 个晚进站、2444 个防守、150 个比赛总结)。为避免数据泄露,我们按赛季划分:6004 个训练实例(2018–2024)和 1249 个保留测试实例(2026);下面的模型对比使用了一个包含 207 个实例的分层测试样本。我们不重新分发原始 FOM 数据;我们发布推导出的结构化真实数据、标注和代码(第 10 节)。

一个完整的全能模型。

我们利用的关键特性在于,这种真实情况不仅是确定性的,而且是完整的:对于每个决策实例,我们可以列举出一个好的解释应该涵盖的全部可核查事实集——例如,对于一段驾驶 stint,包括车手的进站次数、维修区圈数、轮胎配方更换以及最终完赛名次;对于一次 undercut/overcut 策略,则包括两次进站圈数、战术动作及其结果,以及所获得的时间优势。这个可列举的事实集就是召回率的分母(第 5 节),而这正是开放域忠实度评估场景所缺失的。

5 指标:精确率与召回率

我们将解释分解为带类型标签的原子化声明(进站圈数、轮胎配方更换、进站次数、stint 轮胎配方、最终名次、undercut/overcut、结果、获得的时间优势),并针对结构化真实情况逐一进行验证,将其标注为“支持”、“矛盾”(上下文包含相关事实但内容不同)或“无法验证”(上下文缺少该事实)。该指标是无参考的:它从不与标准答案文本进行比较,仅与提供给模型的结构化数据进行比对。

精确率(忠实度)。

模型所做出的声明中被支持的比例,即为模型的忠实度,也就是精确率;我们同时报告硬性幻觉(矛盾)率。这是标准的无参考忠实度指标——但单独来看,它会奖励“弃权”行为:一个只陈述单一安全事实的模型也能获得高分。

召回率(覆盖率)。

由于 oracle 是完整的(第 4 节),我们还可以衡量召回率:在某个实例中所有相关且可列举的事实里,模型正确陈述(即生成了被支持的声明)的比例。一个过于简略、遗漏了大部分事实的模型现在会受到惩罚。我们通过两者的调和平均数()来综合评估。一个忠实的解释应当既准确(高精确率)又信息丰富(高召回率);仅报告精确率而不报告召回率,正是我们在第 7 节中量化的盲点。

两种提取后端。

声明提取有两个可互换的后端,它们共享同一套模式。一个无依赖的正则表达式提取器(带有轻量级指代消解)针对英语,速度快且透明;我们将其用于离线验证。一个 LLM 提取器读取任意语言的自由格式输出,并输出相同类型的声明,我们用它来公平地对西班牙语和葡萄牙语进行评分,并在跨语言比较中跨语言保持单一提取器。两种情况的验证方式相同。我们通过两种方式验证该指标本身。首先,通过受控扰动:一个仅输出真实陈述的模板获得了完美的支持分数(验证器没有产生错误的矛盾),而注入的错误则按比例受到惩罚(表 1)。其次,通过与一个独立的 LLM 评判器(gpt-5.5,与提取器不同)在跨越一定忠实度范围的混合解释样本上的相关性:自动评分与评判器呈正相关(皮尔逊相关系数,斯皮尔曼相关系数),我们的指标是两者中更严格的那个。与人类评判者的相关性是未来的工作。

媒体内容 · 前往原文查看

gpt-5.4-mini 简报(摘录)。VER 对 RUS 的**超车尝试并未成为决定性动作**,因为进站时间数据显示实际上是 **RUS 先进站**。数据显示:- **VER 在第 12 圈进站**,从 MEDIUM 胎换为 HARD 胎,而 **RUS 在第 13 圈进站**,从 MEDIUM 胎换为 HARD 胎。- 在第一个循环中,VER 比 […] **多跑了一圈**。忠实度审计。矛盾:动作实际上成功了。支持:VER 在第 12 圈进站;RUS 在第 13 圈进站。得分:8 项中 6 项支持,1 项矛盾。

图 1:一份真实的前沿简报,其中验证器标记了一项针对遥测数据的无依据声明,同时确认了其余部分。

6 方法:验证器引导生成

我们生成一个解释,运行验证器,然后将矛盾的声明(修正这些)和未覆盖的真实事实(添加这些)作为有针对性的编辑指令反馈回去,迭代若干轮。由于信号包含了模型遗漏的事实——这仅因为 oracle 是完整的才可用——该循环同时针对精确率和召回率,而不仅仅是精确率。它仅使用结构化验证器(无参考文本),并且适用于任何 LLM 后端。

7 实验

指标验证(离线)。

我们通过一项受控扰动研究来验证该指标:一个仅输出真实陈述的确定性模板,与一个注入了事实错误的模板。表1显示,该指标为基于事实的文本赋予了完美的忠实度(无虚假矛盾),并对扰动文本进行了严厉惩罚。

媒体内容 · 前往原文查看
系统 忠实度 幻觉率 声明数
template_faithful(忠实模板) 1.000 0.000 961
template_noisy(噪声模板) 0.593 0.407 901
表1:受控扰动验证中的初步忠实度(207个实例,语言=en)。忠实模板得分为1.0(验证器未发现虚假矛盾);扰动模板受到了正确惩罚。
Refer to caption
图2:(a) 在2025年留存测试集上的覆盖率(相对于完整标准答案的精确率+召回率):微调后的小模型(绿色,1B–7B)达到了 ,远超所有零样本前沿系统,包括Claude Sonnet( EN)和grok-4.3( EN)。(b) 按语言(EN/ES/PT)划分的前沿模型精确率;Claude是唯一在英语之外精确率保持稳定或有所提升的模型。

我们研究:RQ1——仅基于精确率的忠实度是否会奖励“弃权”行为,而要求覆盖率是否会改变哪些模型表现最佳?;RQ2——忠实度是否因语言而异?;RQ3——微调后的小模型能否达到或超越前沿水平?我们对五个模型家族的零样本最新前沿模型进行了评估:OpenAI gpt-5.5和gpt-5.4-mini(Azure)、xAI grok-4.3、Google gemini-2.5-pro(Vertex AI)、Anthropic claude-sonnet-4-6(AWS Bedrock)以及DeepSeek-V3.2,每个模型均使用语言无关的LLM声明提取器进行评分。即使这些模型,其生成的声明中仍有相当一部分缺乏依据,并产生了硬性矛盾(表2):流畅、听起来很专业的叙述并不自动等同于忠实。

精确率奖励弃权;覆盖率重新排序了排名(RQ1)。

表 2 报告了精确率(忠实度)、召回率(覆盖度)以及与完整 oracle 的对比结果。精确率高的模型并非覆盖度最全:在葡萄牙语中,精确率最高的模型 grok-4.3(精确率 ),仅覆盖了 相关事实,因此按 排名垫底,而 claude-sonnet-4-6 则领先。相反,更冗长的模型(例如 claude-sonnet-4-6、DeepSeek-V3.2)精确率略低,但覆盖度远高,因此在 指标下排名大幅上升。精确率排名与 排名在每种语言中都不一致。因此,仅依赖精确率的忠实度指标不仅会错误评分输出结果,还会改变系统间的比较排序。这是本文的核心发现,且只有在 oracle 完整的情况下才能被测量。

多语言(研究问题 2)。

精确率以及精确率/ 的差异在英语/西班牙语/葡萄牙语中保持稳定(表 2);覆盖度排名的变化在三种语言中均成立。大多数模型在非英语环境下表现下降:DeepSeek 的召回率从(英语)降至(葡萄牙语);grok 从(英语)降至(葡萄牙语)。例外是 claude-sonnet-4-6,其召回率在西班牙语/葡萄牙语中反而上升(/ 对比英语),原因是生成了更冗长的输出( 个主张/实例 对比 ),使其成为跨语言覆盖度最稳定的前沿模型。显著的跨语言基础设施效应是 AIServices 安全过滤器,该过滤器对两个 AIServices 模型(上文已排除)的相同英语输入进行拦截,但在西班牙语/葡萄牙语中几乎无影响——这提醒我们,平台层面的过滤机制(而不仅仅是模型本身)决定了多语言评估实际测量的内容。

小型微调模型与验证器引导方法(研究问题 3)。

表5比较了一个开源小模型(Qwen2.5-3B(Team,2025))在零样本和经过LoRA微调后,在基于模板的解释任务上,于相同精确率+召回率指标下的测试样本表现。从研究问题1的角度来看,经过微调的3B模型是一个令人鼓舞的案例:它既准确又完整——在本研究中属于最高水平之列——因为它忠实地复现了确定性的基于模板的模板。这在该数据分布上是真实的,但正是我们指出的模板模仿陷阱:精确率和召回率看起来都近乎完美,因为模板陈述了关键事实,因此脱离模板的评估才是真正的考验(局限性)。这仍然印证了证据,即小型专用模型在聚焦领域具有竞争力(Santillana,2026)。我们在不同的基础模型族和规模上重复了这一结果(表2):经过LoRA微调的Llama-3.2-1B、Phi-4-mini和Mistral-7B均达到了(精确率,召回率),每一项都击败了所有零样本前沿系统,同时保持了实质性内容(每个实例5.6个主张,无弃权)——这一提升并非某个模型或规模的偶然现象(在1B规模上依然成立)。一次多任务微调(策略+评论)与其单任务对应版本表现相当(对比),即没有可测量的任务干扰。另外,将验证器引导的自我修正(第6节)应用于gpt-5.4-mini,可将精确率从提升至(英文正则验证器),这表明结构化验证器是一种可用的、无需训练的优化信号。

提取器的鲁棒性。

使用大语言模型评分的指标存在一个担忧:提取器(gpt-5.x)与其中一个被评估的系统(gpt-5.5)属于同一模型家族,这可能会抬高其评分。我们使用两个独立的提取器对相同的生成结果重新评分。(i)一个无模型、确定性的正则表达式提取器(英文):它在系统排名(斯皮尔曼相关系数)和实例级别(皮尔逊相关系数)上与LLM提取器一致。(ii)一个跨模型家族的LLM提取器(DeepSeek-V3.2,与gpt-5.x无共同血统),覆盖所有三种语言:在系统级别上一致性近乎完美(斯皮尔曼相关系数),在实例级别上相关性较强(皮尔逊相关系数),高于该指标与独立LLM评判者的相关性。在两种检验下,同一家族的系统gpt-5.5均未被其自身家族的提取器评为最高,因此该指标并未对其有所偏袒。

开放式摘要。

同一指标也扩展到了开放式比赛摘要任务(回顾结果和关键时刻),我们的评判者根据胜者、最终排名、战斗和防守情况进行评分。这里失败模式发生了反转:自由形式的摘要内容冗长但不够精确——DeepSeek-V3.2的召回率达到,但精确率仅为(许多叙述性声明数据无法证实)——因此按精确率和按召回率排序再次出现分歧。精确率和召回率共同捕捉了两种失败模式;单独使用其中任何一个都无法做到。

媒体内容 · 前往原文查看
模型 语言 精确率 召回率 F1 声明/实例
DeepSeek-V3.2-71 英文 0.818 0.763 0.790 9.6
DeepSeek-V3.2-3 西班牙语 0.841 0.719 0.776 9.3
DeepSeek-V3.2-3 葡萄牙语 0.855 0.495 0.627 6.4
gemini-2.5-pro 英文 0.824 0.469 0.598 5.2
gemini-2.5-pro 西班牙语 0.845 0.451 0.588 4.9
gemini-2.5-pro-1 葡萄牙语 0.855 0.483 0.617 4.6
gpt-5.4-mini 英文 0.820 0.420 0.555 5.0
gpt-5.4-mini 西班牙语 0.863 0.473 0.611 4.7
gpt-5.4-mini 葡萄牙语 0.850 0.493 0.624 5.3
gpt-5.5 英文 0.861 0.528 0.654 5.9
gpt-5.5 西班牙语 0.867 0.499 0.634 5.3
gpt-5.5 葡萄牙语 0.886 0.511 0.648 5.4
grok-4.3-71 英文 0.878 0.838 0.858 8.9
grok-4.3-3 西班牙语 0.901 0.710 0.794 6.8
grok-4.3-3 葡萄牙语 0.887 0.462 0.608 4.3
claude-sonnet-4-6 英文 0.897 0.730 0.805 8.2
claude-sonnet-4-6 西班牙语 0.801 0.832 0.817 10.6
claude-sonnet-4-6 葡萄牙语 0.815 0.844 0.829 11.7
在完整评判者数据上使用LoRA微调的小模型(本研究)
Llama-3.2-1B (FT) 英文 0.994 0.968 0.981 5.6
Phi-4-mini (FT) 英文 0.994 0.965 0.979 5.6
Mistral-7B (FT) 英文 0.994 0.967 0.981 5.6
Phi-4-mini (FT, 多任务) 英文 0.993 0.968 0.980 5.6
表 2:精确率(忠实度)可通过弃权来操纵:在完整 oracle 下,我们还测量了召回率(对重要事实的覆盖度)。精确率最高的模型并非信息量最大的;要求覆盖度()会重新排序系统(例如在 PT 中,精确率最高的模型 grok-4.3 按 排名垫底)。只有完整的结构化 oracle 才能使召回率可测量。在完整 oracle 上进行微调缩小了差距:每个微调模型——即使是 1B 模型——都达到 ,超越了所有前沿系统,同时保持了实质性内容。-n:由平台内容过滤丢弃的英文实例(AIServices 模型间实例相同;非模型行为)。
媒体内容 · 前往原文查看
默认提示词 全覆盖提示词
模型 P R F1 P R F1
DeepSeek-V3.2 0.82 0.76 0.79 0.84 0.57 0.68
gemini-2.5-pro 0.82 0.47 0.60 0.85 0.56 0.68
gpt-5.4-mini 0.82 0.42 0.56 0.87 0.52 0.65
gpt-5.5 0.86 0.53 0.65 0.89 0.43 0.58
grok-4.3 0.88 0.84 0.86 0.88 0.27 0.41
表 3:提示词敏感性消融实验(英文):中性的默认提示词与明确要求模型陈述每个可支持事实的全覆盖提示词对比。要求完整性并未缩小覆盖度差距(平均召回率 vs. ;仅 的模型有所改善)——额外的冗长并未增加关键事实。因此,低覆盖度并非提示词不足的产物,仅基于精确率的忠实度报告完全未体现这一点。
媒体内容 · 前往原文查看
模型 语言 精确率 召回率 F1 声明/实例
DeepSeek-V3.2 EN 0.864 0.850 0.857 5.5
DeepSeek-V3.2 ES 0.906 0.728 0.808 4.7
DeepSeek-V3.2 PT 0.824 0.407 0.544 2.8
gemini-2.5-pro EN 0.911 0.485 0.633 3.0
gemini-2.5-pro ES 0.915 0.458 0.611 2.9
gemini-2.5-pro PT 0.938 0.522 0.670 3.2
gpt-5.4-mini EN 0.931 0.498 0.649 3.1
gpt-5.4-mini ES 0.927 0.488 0.640 3.1
gpt-5.4-mini PT 0.947 0.667 0.782 4.2
gpt-5.5 EN 0.941 0.510 0.661 3.2
gpt-5.5 ES 0.922 0.547 0.686 3.4
gpt-5.5 PT 0.937 0.503 0.655 3.1
grok-4.3 EN 0.945 0.508 0.661 3.1
grok-4.3 ES 0.941 0.477 0.633 3.0
grok-4.3 PT 0.975 0.503 0.664 3.1
表 4:第二个领域(天气,NOAA 预报;完整记录 oracle)。该效应在 F1 之外重现:精确率最高的模型并非最完整的模型,因此精确率和 在排序上存在分歧。该效应比在 F1 中温和,因为天气记录包含的可遗漏事实较少。
媒体内容 · 前往原文查看
系统(EN) 精确率 召回率 F1 声明/实例
Qwen2.5-3B(零样本) 0.825 0.666 0.737 7.0
Qwen2.5-3B(微调) 0.995 0.968 0.982 5.6
表5:开放小模型(Qwen2.5-3B)在基于事实的解释任务上的零样本与LoRA微调对比,使用2025年保留测试样本,采用相同的精确率+召回率指标。微调得到的模型既准确又完整(本研究中F1分数最高),能够复现确定性的基于模板的解释——这是该数据分布上的优势,但也是该分布之外的模板模仿陷阱。不存在测试数据泄露(2018–2024)。
媒体内容 · 前往原文查看
模型 正则表达式(英文) 大语言模型(英文)
DeepSeek-V3.2 0.735 0.838
gemini-2.5-pro 0.925 0.901
gpt-5.4-mini 0.742 0.819
gpt-5.5 0.753 0.843
grok-4.3 0.749 0.855
表6:在无模型正则表达式提取器与大语言模型提取器(gpt-5.x)下的英文忠实度对比。两种提取器在系统级排名上一致(斯皮尔曼相关系数;相同的最佳模型),并在实例级上相关(皮尔逊相关系数,),表明英文结果并非大语言模型提取器家族带来的伪影。正则表达式提取器的西班牙语/葡萄牙语模式故意设计得较为宽松,因此它充当了以英文优先的交叉验证工具。

8 这仅仅是提示词的问题吗?

一个常见的质疑是,覆盖率低是提示词不足造成的伪影。我们的默认提示词故意保持中立(它要求模型仅使用数据进行解释,没有长度指令);我们通过一个明确的覆盖全部内容的提示词直接检验这一质疑,该提示词要求模型陈述每一个有据可查的事实(进站圈数、轮胎配方、停站、超车动作及其结果、获得的时间、位置变化)。表3对两者进行了比较。要求完整性并未缩小差距:平均召回率没有上升——反而下降,,且只有的模型有所改善。额外的冗长表述并未增加那些关键事实(而增加的精确率代价则是权衡取舍,这一点已明确说明)。因此,低覆盖率并非提示词造成的伪影,而单维度的忠实度评分无法反映这种波动;精确率和召回率共同才能做到。

9 泛化:第二个评估基准

弃权问题是一个关于无参考精确度指标的普遍性论断,而非特指 F1 分数。我们在第二个拥有完整标准答案的领域——公共领域 NOAA 天气预报中复现了这一现象,其中每条记录(温度、风、降水概率、天空状况)都是预报应涵盖的可枚举事实集。我们使用相同的前沿模型,基于每条记录为每种语言生成预报,并用相同的精确度/召回率机制(表 4)进行评分。该效应再次出现:精确度最高的模型同样并非最完整的模型,因此按精确度排序与按不一致性排序的结果相左。该效应比 F1 分数中的效应更温和——一条天气记录只包含少量事实,因此遗漏的内容更少——这本身就具有信息量:覆盖度惩罚与忠实回答应包含的内容量成正比。精确度/覆盖度差距在两个不相关的完整标准答案领域中出现,表明这是仅使用精确度指标的固有属性,而非任何特定数据集的问题。

10 伦理与许可

F1/FOM 时序数据带有使用限制;我们仅发布代码、衍生的结构化数据和标注,而不发布原始广播/遥测数据流。该基准测试涉及策略解释,而非博彩或结果预测。

11 局限性

我们的召回率指标衡量的是确定性提取器所提取事实的覆盖范围;这些事实具有高精确度,但并非详尽无遗(事件检测使用了启发式方法),因此召回率是相对于这个可枚举的事实集合来定义的,而非针对每一个可能的重要细节——我们所依赖的完备性,是所推导出的“标准答案”的完备性。关于“弃权”的发现,是免参考精确度指标的普遍特性;我们在两个不相关的、拥有完整标准答案的领域(F1 和天气)中进行了论证和复现。声明提取器可能会遗漏或过度分割声明,因此绝对分数应结合受控扰动验证来解读。更根本地说,验证器仅检查我们模式所建模的事实类型:模式之外的、无依据的实体或因果插入内容永远不会被提取,因此也永远不会受到惩罚。例如,当要求解释一个两圈防守性阻挡,而其上下文仅提及两名车手和一个“队友保护”标志时,一个模型竟命名了受保护的车手(“维斯塔潘”),并将其归功于一次冠军争夺战的转折——这两点信息在给定上下文中均未出现——然而该模型却获得了完美的“支持比例”分数。因此,忠实度覆盖范围受限于声明本体论;扩展该本体论是未来的工作。我们通过一个无模型的 regex 提取器和一个跨模型族的 LLM 提取器(两者与 gpt-5.x 提取器的结果高度一致,见第 7 节)来缓解另一个担忧,即 gpt-5.x 提取器与 gpt-5.5 属于同一模型族,但人工提取器/评判员仍是未来的工作。批量化的 LLM 提取器评分本身也是一种测量风险:在 API 速率限制下,失败的提取可能会静默地默认为零,从而降低批次中后续项目的覆盖范围,并且在我们的运行中,这曾短暂地颠倒模型排名,直到我们通过重试和限制并发度重新评分。一个低的覆盖数字可能是一个评分伪影,而非模型生成质量更差的表现;因此,覆盖率的评估必须保护其自身的测量流程——我们自己的论点也反身性地应用了这一原则。微调监督使用的是确定性(基于忠实模板)的数据,这存在奖励模板模仿行为的风险;更强的监督和模板外的评估是未来的工作。模型比较为了控制成本而使用了分层测试样本,覆盖了英语、西班牙语和葡萄牙语,而留出的测试集是一个单一赛季(2022 年因时间数据不可用而省略)。部署在托管 AIServices 端点后的两个模型,其英语输入中有固定的一部分(三分之一)被平台的默认内容过滤器拒绝——这两个模型被拒绝的是相同的实例,因此是由输入触发的,而非模型行为——我们将这些实例排除在评分之外,并在表 2 中进行了标记;受影响较小的西班牙语和葡萄牙语数据单元则得出了相同的结论。我们还注意到,要从一个推理模型获得可用的输出,需要提高其输出 token 预算,以防止内部推理过程截断答案——这提醒我们,测量流程本身,而不仅仅是模型,也必须接受审计。

我们的核心模型对比聚焦于三种主要决策类型(策略、压价超车、抬价超车);此外,我们还评估了开放式比赛总结任务(第7节),而赛道防御类型的完整评估——包括新恢复的简短、超车结束保持检测器——则留待未来工作。更广泛地说,要求一个完整的预言机限制了该方法在可枚举全部事实集的领域中的适用性。一种自然的放宽方案是检索差异指标:衡量模型在拥有基础上下文与仅依赖参数知识生成时,其忠实度的变化。如果该差异与预言机测量的召回率相关(我们的设置可以验证这一点),那么它就能将覆盖感知评估推广到开放领域场景,而无需依赖完整性——这是我们将留待未来探索的方向。

参考文献

  • Dhingra 等人 (2019) Bhuwan Dhingra, Manaal Faruqui, Ankur Parikh, Ming-Wei Chang, Dipanjan Das, 和 William Cohen. 2019. 评估表格到文本生成时处理分歧参考文本的方法. 收录于《第57届计算语言学协会年会论文集》(ACL), 第4884–4895页.
  • Es 等人 (2024) Shahul Es, Jithin James, Luis Espinosa-Anke, 和 Steven Schockaert. 2024. RAGAS: 检索增强生成的自动化评估. 收录于《计算语言学协会欧洲分会会议论文集》(EACL): 系统演示.
  • Fabbri 等人 (2022) Alexander Fabbri, Chien-Sheng Wu, Wenhao Liu, 和 Caiming Xiong. 2022. QAFactEval: 改进的基于问答的摘要事实一致性评估. 收录于 NAACL.
  • Gao 等人 (2023) Luyu Gao, Zhuyun Dai, Panupong Pasupat, Anthony Chen, Arun Tejasvi Chaganty, Yicheng Fan, Vincent Zhao, Ni Lao, Hongrae Lee, Da-Cheng Juan, 和 Kelvin Guu. 2023. RARR: 使用语言模型研究和修正语言模型的输出. 收录于《第61届计算语言学协会年会论文集》(ACL).
  • Honovich 等人(2022 年)或 Honovich、Roee Aharoni、Jonathan Herzig、Hagai Taitelbaum、Doron Kukliansy、Vered Cohen、Thomas Scialom、Idan Szpektor、Avinatan Hassidim 和 Yossi Matias。2022 年。TRUE:重新评估事实一致性评估。载于《北美计算语言学协会会议论文集》(NAACL)。
  • Ji 等人(2023 年)Ziwei Ji、Nayeon Lee、Rita Frieske、Tiezheng Yu、Dan Su、Yan Xu、Etsuko Ishii、Yejin Bang、Andrea Madotto 和 Pascale Fung。2023 年。自然语言生成中的模型幻觉综述。《ACM 计算调查》。
  • Kryściński 等人(2020 年)Wojciech Kryściński、Bryan McCann、Caiming Xiong 和 Richard Socher。2020 年。评估抽象式文本摘要的事实一致性。载于 EMNLP。
  • Laban 等人(2022 年)Philippe Laban、Tobias Schnabel、Paul N. Bennett 和 Marti A. Hearst。2022 年。SummaC:重新审视基于 NLI 的摘要不一致性检测模型。载于 TACL。
  • Liang 等人(2009 年)Percy Liang、Michael I. Jordan 和 Dan Klein。2009 年。在较少监督下学习语义对应关系。载于 ACL-IJCNLP 论文集,第 91–99 页。
  • Madaan 等人(2023 年)Aman Madaan、Niket Tandon、Prakhar Gupta 及其他 1 人。2023 年。自我精炼:基于自我反馈的迭代式改进。载于 NeurIPS。
  • Manakul 等人(2023 年)Potsawee Manakul、Adian Liusie 和 Mark JF Gales。2023 年。SelfCheckGPT:面向生成式大语言模型的零资源黑盒模型幻觉检测。载于《经验方法自然语言处理会议论文集》(EMNLP)。
  • Maynez 等人(2020 年)Joshua Maynez、Shashi Narayan、Bernd Bohnet 和 Ryan McDonald。2020 年。论抽象式摘要中的忠实性与事实性。载于《第 58 届计算语言学协会年会论文集》(ACL),第 1906–1919 页。
  • Min 等人(2023 年)Sewon Min、Kalpesh Krishna、Xinxi Lyu、Mike Lewis、Wen-tau Yih、Pang Wei Koh、Mohit Iyyer、Luke Zettlemoyer 和 Hannaneh Hajishirzi。2023 年。FActScore:长文本生成中细粒度原子级事实精确度评估。载于 EMNLP。
  • Oehrly 及贡献者(2024)Philipp Oehrly 及贡献者。2024。FastF1:用于访问一级方程式计时与遥测数据的 Python 包。https://github.com/theOehrly/Fast-F1。
  • Parikh 等人(2020)Ankur Parikh、Xuezhi Wang、Sebastian Gehrmann、Manaal Faruqui、Bhuwan Dhingra、Diyi Yang 和 Dipanjan Das。2020。ToTTo:一个受控的表格到文本生成数据集。EMNLP。
  • Santillana(2026)Juan S. Santillana。2026。VectraYX-Nano:一个 42M 参数的西班牙语网络安全大语言模型,采用课程学习与原生工具使用。预印本,arXiv:2605.13989。
  • 团队(2025)Qwen 团队。2025。Qwen2.5 技术报告。arXiv 预印本。
  • Thomson 和 Reiter(2020)Craig Thomson 和 Ehud Reiter。2020。评估数据到文本系统准确性的黄金标准方法论。载于第 13 届国际自然语言生成会议(INLG)论文集,第 158–168 页。
  • Thomson 等人(2020)Craig Thomson、Ehud Reiter 和 Somayajulu Sripada。2020。SportSett:Basketball——一个稳健且可维护的自然语言生成数据集。载于智能信息处理与自然语言生成研讨会。
  • Wei 等人(2024)Jerry Wei、Chengrun Yang、Xinying Song、Yifeng Lu、Le Hou、Denny Zhou 和 Quoc V. Le。2024。大语言模型中的长文本事实性。神经信息处理系统进展(NeurIPS)。
  • Wiseman 等人(2017)Sam Wiseman、Stuart Shieber 和 Alexander Rush。2017。数据到文档生成中的挑战。载于 EMNLP。

来源:HuggingFace Daily Papers(社区热门论文) · arxiv.org