跳到正文
北京时间
原文
Anthropic:Alignment Science Blog(网页)·· 2025-06-01精选AI 评分66

Anthropic 提出无监督算法 ICM,在多项任务上匹敌甚至超越人类标注训练

Unsupervised Elicitation

AI 导读

Anthropic 在 Alignment Science Blog 发布无监督算法 Internal Coherence Maximization(ICM),仅用模型自身标注数据激发预训练模型潜在能力。

推荐理由

原文介绍了 ICM 无监督算法的原理、基准结果与两条局限,读者可以据此评估无监督对齐路线目前的实际边界。

正文 · AI 翻译

Jiaxin Wen, Zachary Ankner, Arushi Somani,

Peter Hase2, Samuel Marks, Jacob Goldman-Wetzler, Linda Petrini3, Henry Sleight4,

Collin Burns, He He5, Shi Feng6, Ethan Perez, Jan Leike

Anthropic; 2Schmidt Sciences; 3Independent; 4Constellation; 5New York University; 6George Washington University

tl;dr

我们提出了一种新的无监督算法,用于从预训练语言模型中激发技能。该算法在常见误解(TruthfulQA)、数学(GSM8k-verification)和有用性奖励建模(Alpaca)方面,与使用人类标签进行训练具有竞争力。在没有监督的情况下,我们从 Haiku 3.5 基础模型训练了一个有用的聊天助手,其表现优于类似训练的人类监督基线。

📄 论文, 💻 代码

对齐研究中的一个关键问题是如何对齐那些人类无法可靠监督其行为的超人类模型。如果我们使用当今标准的后训练方法(例如 RLHF)来使模型与人类指定的行为对齐,我们可能会训练模型告诉我们想听的内容,即使它是错的,或者做一些表面上看起来很好但实际上与我们意图非常不同的事情。

我们引入了一种新的无监督算法来解决这个问题。该算法仅通过在模型自身标记的数据上进行微调来激发预训练模型的潜在能力,无需任何外部标签。

我们的结果

对于 Llama 3 预训练模型,我们的无监督算法在三个基准测试(GSM8k-verification、TruthfulQA 和 Alpaca 奖励建模)上,与在数据集标签上微调的性能相当,并优于众包的人类标签。

使用 Llama 3 预训练模型的结果。GSM8K 使用 8B 模型,而 TruthfulQA 和 Alpaca 使用 70B 模型。

值得注意的是,我们的算法也优于官方 Llama RLHF 训练的聊天助手(上图中的“chat”),尽管据我们所知,该模型并未直接在我们评估的任务上进行训练。

我们的算法还可以进一步用于在商业规模上训练有用的聊天机器人助手:从用于训练公开发布的 Claude 模型的奖励建模数据集开始,我们使用无监督算法训练了一个基于 Claude 3 Haiku 的奖励模型,然后使用强化学习训练了一个基于 Claude 3.5 Haiku 的助手。该奖励模型在 Rewardbench 上优于其人类监督的对应模型,并且该助手被 Claude 3.5 Sonnet 偏好模型所偏好。

奖励模型的准确率(左)和助手策略模型相对于人类监督基线的成对胜率(右)。我们使用 Alpaca 数据或用于训练公开发布的 Claude 3.5 Haiku 的生产数据,训练了一个基于 Claude 3 Haiku 的奖励模型。接下来,我们针对我们的奖励模型优化 Claude 3.5 Haiku 预训练模型,以构建助手策略。

我们的算法

我们的算法 Internal Coherence Maximization(ICM)通过优化一组标签,使其同时具备逻辑一致性和相互可预测性来工作。

逻辑一致性施加简单约束来引导模型的标注过程:在 TruthfulQA 和 GSM8K-verification 上,我们施加约束,规定同一问题/题目的两个不同答案不能被标注为正确;在比较数据集上,我们施加约束,规定 A > B 与 B > A 互斥。

相互可预测性衡量模型在给定所有其他标签的条件下,认为每个标签的可能性有多大。这直观上鼓励所有标签反映一个根据模型来看连贯一致的单一概念。

\mathcal{P}_\theta(D) = \sum_{i=0}^{N} \log P_\theta(y_i | x_i, D \setminus (x_i, y_i))

其中 $$P_\theta$$ 是预训练模型,$$D$$ 是模型标注的数据集,$$x_i$$ 是任务输入,$$y_i$$ 是模型生成的标签。

我们的最终评分函数则是逻辑一致性与相互可预测性的加权组合。

由于精确找到使该评分函数最大化的最优标签集在计算上不可行,ICM 使用一种受模拟退火启发的搜索算法来近似最大化它。在高层次上,我们迭代地一次采样并标注一个新样本,并根据评分函数的提升来决定是否接受每个新标签。

局限性

我们的算法有两个重要局限:

  1. 它无法引出预训练模型不“显著”具备的技能。例如,如果我们对关于太阳的诗歌有一种独特的偏好,胜过其他诗歌,我们的算法无法发现这种偏好,因此其表现不会优于随机。
  2. 它不适用于长输入,因为它依赖于带有许多上下文示例的少样本学习。

结论

虽然先前的工作已在简单 设置或特定 任务中研究了无监督引出方法;我们的工作首次证明,对于各种清晰和模糊任务,包括在生产规模数据集上训练通用聊天助手时,都有可能达到或超过在人工监督下的训练效果。

我们的算法并不能消除对人类输入的需求,例如人类指定的任务描述或宪法,因为它对所得模型行为的控制有限。

尽管如此,我们的结果表明,无监督算法是从预训练模型中引出技能的一条有前景的途径,并且可能是最终对齐超人模型的关键。

来源:Anthropic:Alignment Science Blog(网页) · alignment.anthropic.com