跳到正文
北京时间
原文
Google Research:Blog(网页)·· 2026-06-10精选AI 评分63

Google Research提出审计机器遗忘新框架

New framework for auditing machine unlearning

AI 导读

Google Research 在 AISTATS 2026 发表正则化 f-散度核检验,用于高效审计 LLM 等模型的机器遗忘。该方法通过统计两样本检验判断模型是否真正“忘记”特定训练数据,避免完全重训的巨大成本。相比最大均值差异等现有工具,新框架理论上可在任意样本量下自然控制假阳性,且假阴性风险随可用样本增加可靠收敛至零,解决了大规模模型审计中计算成本过高的问题。

推荐理由

机器遗忘是AI合规的硬需求,但验证‘真忘了’一直是统计难题。谷歌这篇AISTATS论文提出了一套更灵敏的差异测试框架,做隐私审计的值得细看。

正文 · AI 翻译

我们提出了一种方法,能够自信地判定是否存在统计学上显著的证据,表明两组数据观测值来自完全不同的底层分布。

快速链接

机器遗忘使 AI 系统能够"遗忘"其训练数据中的特定部分,而无需承担从头重新训练模型的巨大成本。这对于合规监管(如 GDPR 的"被遗忘权")、AI 安全以及模型质量都至关重要。

随着模型处理的dataset规模越来越大且高度敏感,验证机器遗忘已从理论上的理想转变为严格的要求——开发人员如今必须在数学上证明隐私保护。然而,由于审计人员通常无法接触模型的内部运作机制或原始训练数据,他们必须严格通过查询系统并分析输出样本来完成验证。

数据科学家和研究人员所依赖的一种验证方法是 双样本检验,这是一种统计方法,用于判定两组数据观测值是否来自完全不同的底层分布。例如,为验证机器遗忘效果,审计人员可能会将一个从未见过特定记录的模型的输出,与一个据称已"遗忘"该记录的模型的输出进行比较。如果两者的输出在既定阈值内存在统计学上的差异,则说明遗忘失败。

随着模型规模和复杂度的不断增长,用于机器遗忘审计的双样本检验及其他统计工具变得难以实施,并且失去了统计效力。为了从大规模模型固有的随机噪声中识别出真实的违规,并达到足够的统计显著性,审计员需要提取大量样本。这使得真实场景下的测试在计算上完全变得非常昂贵。

为了应对这一日益严峻的挑战,我们提出了 Regularized f-Divergence Kernel Tests,并在 AISTATS 2026 上发表,这是一个旨在让机器学习模型审计更加灵敏、灵活和精确的新框架。我们从理论上证明,我们的检验方法在任何样本量下都能自然地控制假阳性,并且随着可用数据样本数量的增加,假阴性的风险会可靠地收敛到零。

挑战所在:为什么标准工具不够用

评估模型安全性通常需要衡量两个复杂数据集之间的距离或散度。不同的应用场景自然需要不同的“距离”概念。像 maximum mean discrepancy(MMD)这样流行的标准工具擅长检测数据中宽泛的全局变化(例如模型系统性地生成比对照模型更亮的图像),但往往缺乏捕捉复杂异常所需的针对性。例如,如果加入某个特定人物的数据,导致模型仅在被以非常精确的方式提示时才生成高度特定的异常输出——而在其他所有样本上分布保持相同——传统的 MMD 检验可能会完全忽略这种局部变化。

此外,大多数现有的测试框架迫使研究人员做出容易出错的人工选择,例如挑选最适合全局或局部偏移的特定统计量,或调整诸如 核带宽 和 正则化 参数等复杂设置。

Image 1: f-Divergence-1

在一个简单的两个二维分布之间的双样本检验中(上方的蓝色和红色),MMD 擅长检测均值差异这类全局偏移(左),但可能遗漏局部差异,例如离群点(中),或者需要超参数调优(例如设置带宽参数)的非平滑差异(右)。

除了在实践中难以操作外,双样本检验作为验证方法在验证机器学习模型的遗忘(unlearning)时也存在缺陷。考虑下面的例子,它展示了在完全相同的数据上从头训练的两个模型可能产生不同的分布。蓝色分布是在不含受损数据的情况下重新训练所得模型的分布。然而,由于使用了不同的 batch size 进行重新训练,其分布与标准分布(绿色)不同。这会导致假阳性,即判定被测试的模型是不安全的。

Image 2: f-Divergence-2

当被测试模型的分布与审计员所对比的标准分布不同时,使用双样本检验来验证遗忘会产生假阳性。

此外,近期研究表明,AI 模型仅靠调整当前参数设置永远无法完美地“遗忘”数据;除非它重新追溯原始训练的每一步,否则总会留下本应删除信息的永久痕迹。因此,对于标准的局部遗忘算法而言,实现完美的“重训练等价”在根本上是不可行的,而传统的双样本检验总能发现对“遗忘集”的依赖。

框架

我们通过提出一种相对距离检验来解决这一挑战,该检验用于测量一个已完成遗忘的模型在分布上更接近安全重训练的模型,还是更接近原始的受损模型。

我们的检验就像一套高度灵活的统计工具包,利用 f-散度 让审计人员能够精确定位高度特定的数据偏移类型,包括:

  • 卡方散度和 Kullback-Liebler(KL)散度:它们对于识别数据中平滑且局部的差异非常有效,例如物理模型中的异常值。

  • Hockey-stick 散度:这种散度专为隐私和遗忘的定义而设计,通过一个参数来控制统计不可区分性的程度。它实际上建立了一个可接受的阈值,忽略安全预算之下的微小差异,仅在发生有意义的隐私泄露时才触发警报。

在高维度的真实世界数据上计算这些散度是出了名的困难。为了让这些复杂的优化问题在不需要大量算力的情况下变得可解,我们使用 核正则化方法 来高效地估计差异。

我们的自适应检验方法会自动选择最优的散度和最佳超参数配置,以最大化检验的可靠性,完全消除了样本拆分的需要。

实验

由于我们提出的检验方法是通用的,我们在各种各样的问题上进行了实验。我们在 扰动均匀分布(合成的双样本基准)以及物理数据集中的 Expo1D 离群点检测任务 上评估了我们的框架——这是一个专门利用机器学习在粒子物理标准模型之外寻找新物理现象的领域。我们使用高能物理数据,是因为该领域需要世界上最精确的“差异探测器”——其思路是:如果该框架能够发现一个违背物理定律的稀有粒子,它也能发现 AI 模型中微小的隐私泄露。

随后,我们将主要关注点转向了两个关键的现实世界应用:审计差分隐私和评估机器遗忘:

  • 隐私审计:差分隐私提供了一种通过引入校准噪声来保护用户数据的框架,从而限制任何单个个体的影响。我们在两个仅相差一条记录的模拟数据集上,通过多次采样输出,测试了多种非隐私机制。如果某个机制真正保护隐私,那么两次采样结果应当不可区分;如果它存在缺陷,该测试就应标记出这一隐私违规。
  • 机器遗忘评估:我们没有依赖那种有缺陷的做法——简单地把黄金标准模型(在不包含待遗忘数据的情况下从头重新训练的模型)与遗忘后模型进行对比——而是采用了三样本相对检验,并将其应用于多种已有的遗忘算法,包括 Selective Synaptic Dampening、剪枝和 随机标签技术。我们的检验评估遗忘后模型的分布是更接近安全的黄金标准模型,还是更接近主动记住了敏感数据的原始完整训练模型。

Image 3: f-Divergence-3

提出的相对距离框架。如果被测模型比重新训练的黄金标准更接近被攻破的模型,检验将标记遗忘失败;如果被测模型更接近黄金标准,则检验不会标记任何失败。

结果

我们的框架成功恢复甚至超越了所有以往的基线方法,且所需的手动调优显著更少。

实验结果表明,没有任何单一检验能在所有可能场景中始终优于其他检验。相反,不同的 f-散度就像专门化的传感器,会针对不同类型的局部数据漂移“亮起”。通过采用跨多种统计量的聚合方法,我们的框架成功捕捉到了标准检验完全漏掉的细微错误和异常。

在隐私审计方面,曲棍球棒散度检验被证明是一个强大而有效的工具。由于它直接契合纯差分隐私的数学基础,审计人员能够严格控制可接受的数据偏移程度。我们的自适应测试框架成功捕捉到了隐私违规行为,而且与以往的基线测试器相比,所需的数据样本显著更少,超参数调优的工作量也大幅降低。

Image 4: f-Divergence-4

非私有机制的检测率([来自标准审计基准测试)。我们基于曲棍球棒形状的检测器以更少的样本超越了此前研究的技术(DP-Auditorium)。[

在一个值得注意的实例中,我们的框架仅用几千个样本就检测到了一个特定的 稀疏向量技术机制(SVT3)中的违规,而此前研究的 技术(如 DP-Auditorium)需要数百万个样本才能达到同样的违规检测率。

我们的发现还提示需要重新定义如何评估机器遗忘。如下表所示,我们观察到,我们评估的所有近似遗忘方法都不符合严格、标准的双样本遗忘定义。由于双样本检验只是寻找任何分布差异,它们错误地将完全安全的、重新训练过的模型标记为遗忘失败。

相比之下,我们提出的相对三样本检验成功地克服了这一缺陷。它正确且一致地将安全重新训练的模型识别为“安全”。在评估近似遗忘算法时,只有随机标签技术通过了评估。

其他流行的方法,如微调、剪枝和 Selective Synaptic Dampening,被发现无法真正遗忘目标数据。我们强调,我们在这些实验中的主要目标是评估遗忘方法本身,而不是设计这些算法。因此,我们使用了这些遗忘过程的简化实现;要在实际生产环境中对遗忘方法进行排序,还需要更严格的设置。

Image 5: f-Divergence-5

不同(简化版)遗忘算法的审计结果。精确遗忘机制在不接触遗忘数据的情况下从零开始重新训练,因此从定义上就是安全的。然而,双样本检验会因它们与“标准”分布之间的差异而错误地将其标记为不安全。三样本检验克服了这一问题。

结论

我们新提出的框架为审视机器学习行为提供了一个精确得多、适应性强且在数学上更严谨的视角。借助正则化 f-散度核检验,研究人员和审计人员现在可以在一大类问题以及复杂的分布偏移下,从统计上证明某个模型是否存在不安全行为或数据泄露。

随着这一领域的发展,从理论上为我们的实证观察提供依据,以确定在哪些其他新任务上哪种特定散度是最优的,仍然是一个令人兴奋的未来研究方向。建立更紧的样本复杂度界,也将是让这些审计更加高效的一个关键重点。

致谢

本文所述工作是与 Antonin Schrab 和 Arthur Gretton 共同完成的。我们感谢 Nicole Mitchell 和 Eleni Triantafillou 提供的深刻反馈,感谢 Kimberly Schwede 负责图形设计,以及 Mark Simborg 进行了有益的编辑。

Image 14

来源:Google Research:Blog(网页) · research.google