跳到正文
北京时间
原文
Anthropic:Alignment Science Blog(网页)·· 2026-04-14精选AI 评分65

Anthropic 构建 Automated Weak-to-Strong Researcher,AI 智能体在弱到强监督研究上超越人类基线

Automated Weak-to-Strong Researcher

AI 导读

Anthropic 团队构建了基于 Claude Opus 4.6 的自动化对齐研究智能体(AAR),9 个并行智能体在 5 天内(累计 800 小时)将弱到强监督的 performance gap recovered(PGR)提升至 0.97,而两位人类作者花 7 天调优四种先前方法的最好成绩仅 0.23,总成本约 18,000 美元。

推荐理由

Anthropic 用实测数字说明自动化对齐研究已可落地,还记录了智能体的 reward hacking 手法与工程经验,方法可迁移。

正文 · AI 翻译

Jiaxin Wen*、Liang Qiu*、Joe Benton、Jan Hendrik Kirchner、Jan Leike

TL;DR: 我们构建了自主 AI 智能体,它们能够提出想法、运行实验,并围绕一个开放研究问题迭代:如何仅使用较弱模型的监督来训练一个强模型。这些智能体超越了人类研究者,表明这类研究的自动化已经切实可行。

本研究部分作为 Anthropic Fellows Program 的一部分完成。

代码见:https://github.com/safety-research/automated-w2s-research。

如今对齐进展的瓶颈在于人类研究者。 我们拥有的激动人心的研究方向远多于可投入的研究者。这迫使我们做出权衡:研究者花在推进一个定义明确的问题上的每一小时,都是没有花在那些更模糊、风险更高、最需要人类判断的赌注上的一小时。如果我们能把前者交出去,就能腾出自己去做后者。

为了解决这一瓶颈,我们构建了一个由 Claude 驱动的自动化对齐研究者(AAR),将算力转化为对齐进展。 给定一个研究问题,我们会启动一组并行的 AAR,每个都在独立的沙箱中工作。它们提出想法、运行实验、分析结果,并彼此分享发现和代码。扩展 AAR 远比扩展人类更容易、更便宜:原则上,你可以通过并行运行数千个 AAR,把数月的人类研究压缩到数小时内。

我们在弱到强监督上评估我们的 AAR,这是一个开放问题,映射了一个关键的对齐挑战:人类监督比自己更聪明的 AI。在我们的实验中,我们使用 LM 同时作为弱教师和强学生。具体而言,该问题问的是:给定一个弱监督者和一个强学生,你如何恢复强学生在真值监督下的性能?重要的是,与当今大多数对齐研究不同,这个任务的结果是可评分的:成功由留出测试集上的“性能差距恢复”(PGR)衡量,范围从 0(相比弱教师没有改进)到 1(达到真值监督学生的水平)。

弱到强监督颇具挑战性:在一个聊天偏好数据集上,两位作者花了 7 天调优四种代表性先前方法,在包含 ID 和 OOD 数据的留出测试集上取得了 0.23 的最佳 PGR。相比之下,我们的 AAR 在 5 天内(9 个 AAR 累计 800 小时)达到了 0.97 的 PGR,总算力与 API 调用成本约为 18,000 美元——约合每个 AAR 小时 22 美元。

我们发布了一个用于弱到强监督研究的沙箱环境,以及数据集和基线,并分享我们一路上的经验:如何让 AAR 更快地爬山,它如何在我们预期会失败的困难方向上取得成功,以及它如何以我们未曾预料到的方式进行奖励黑客。

我们的结果表明,针对结果可评分问题的自动化研究已经切实可行。此外,以通用方式解决弱到强监督将解锁在更广泛的非结果可评分问题上的自举。对齐研究的关键瓶颈正在从提出和执行想法转向设计评估:我们应该找到合适的指标(数据、模型),使 AAR 能够可靠地爬山而不过拟合。我们很兴奋能在今天将自动化应用于雄心勃勃的对齐研究。

在聊天偏好数据集(见第 1 节)上,九个并行 AAR 的性能差距恢复率(PGR)与累计爬山小时数的关系,每个 AAR 都以一个不同的研究方向作为种子(彩色线条)。整体前沿(粗黑线)以及来自 Burns et al. 2023 的弱到强泛化基线实现(灰色方块)叠加显示。

  1. 环境

背景。传统机器学习关注的是人类监督比人类更弱的模型的设定。对于最终的超级对齐问题,人类将不得不监督比他们聪明得多的模型。我们研究一个类似的问题:使用弱的小模型来监督强的大模型。与原始的弱到强泛化论文相比,我们考虑了更广泛的方法来激发强模型,无论是否利用泛化。

示意图改编自 Burns et al. 2023。

基线。我们手动调整了从先前论文中采用的四个基线,包括在弱标签上训练、在置信弱标签上训练、无监督激发(基于零样本)以及评论家训练(通过生成评论来强化强学生以辅助弱教师)。我们还运行了一个零样本提示基线,使用一个高度优化的提示,该提示已用于 Anthropic 的预训练基础模型。

模型。我们选择 Qwen1.5-0.5B-Chat 和 Qwen3-4B-Base 作为弱模型和强模型,因为这恰好处于一个最佳平衡点:1)弱模型和强模型之间存在显著的性能差距,2)小模型在我们的测试平台上表现优于随机,3)两个模型都足够小,便于快速实验(每次微调运行耗时不到 2 小时)。

数据集。我们构建了三个二元分类测试平台:聊天偏好、数学验证和编码验证。每个数据集有两个训练划分,用于训练弱教师模型和强学生模型,以及两个留出测试划分,用于测试分布内和分布外性能。

例如,在聊天偏好测试平台上,我们的训练和分布内测试划分来自 HelpSteer2 和 Helpsteer3,而分布外测试划分来自 RM-Bench 和 RewardBench 2。更多详情见下表。我们始终在留出测试划分上报告 PGR。

测试平台

训练/分布内测试

分布外测试

聊天偏好

HelpSteer2, HelpSteer3

RMBench, RewardBench 2

数学验证

来自 DAPO-Math-17K 的查询

来自 AIME 2024/2025 的查询

编码验证

来自 TACO 的简单到中等难度查询

来自 TACO 的中等到非常困难难度查询

我们投入了大量精力使测试平台具有挑战性且难以被破解。例如,我们确保这些数据集不能仅通过记忆预训练数据来解决。我们还移除了数据中潜在的易破解模式。例如,对于编码问题,True 和 False 标签在每个难度级别都是平衡的,防止模型仅根据难度预测标签。大多数基线仅获得约 0.2 的 PGR。

在以下实验中,我们使用聊天偏好数据集进行爬山,因为它对奖励攻击具有抵抗力。我们仅保留数学和编码任务用于评估想法在不同数据集上的泛化能力,因为我们的 AAR 找到了多种解决这两个任务的方法,而完全不依赖弱监督或强模型的潜在能力。详见第 5 节。

五种手动调优的基线方法在三个数据集上的 PGR。误差棒表示 SEM。

评估。我们从 AAR 的沙箱中移除训练和测试数据的所有标签。AAR 将其预测提交到远程 API 并接收 PGR 分数。我们允许无限次提交:这加剧了奖励攻击(第 6 节),但限制提交次数只能在非常激进的限制下(例如在数百小时的爬山过程中约 10 次提交)抑制这些攻击。在任何实际的上限下,我们的 AAR 只是更仔细地规划其提交,相同的攻击仍然会出现。

  1. 自动化弱到强研究员

我们的 AAR 设置示意图。并行的 AAR 智能体在独立的沙箱中运行,并通过共享论坛和代码库存储进行协作。提交的解决方案通过远程评估 API 进行评估。仪表板允许监控正在进行的实验并启动新实验。

我们通过仪表板启动一组并行的 AAR(Claude Opus 4.6 智能体)。每个 AAR 在独立的沙箱中工作,但它们可以相互交流和学习:它们将发现分享到论坛,并将代码库快照上传到存储系统。所有这些重要日志都保存在沙箱之外,以防止我们的 AAR 意外删除它们。

我们为 AAR 提供对模型训练和推理的常用辅助函数、我们的基线实现以及一些 MCP 工具的访问权限:1)提交并获取评估结果,2)在 AAR 之间分享和阅读发现,3)上传和下载代码库。

我们没有指定任何详细的脚手架;AAR 自主运行。它可以在任何步骤提出假设、设计去风险实验、运行数据分析并训练模型。我们的初步实验表明,人类规定的工作流程往往不必要地限制了 AAR 的灵活性并降低性能。有关构建 AAR 的更多经验教训,请参见第 6 节。

  1. 主要发现

3.1 分配多样化的研究方向可带来更好的爬山效率。

我们比较了运行并行 AAR 的两种策略:

  • 定向:为每个 AAR 分配不同的研究方向。每个方向都非常模糊且简短(例如结合弱到强监督和无监督启发)。
  • 无定向:为所有 AAR 分配相同的提示,不提供任何指导。

我们为每种设置启动一组 9 个并行 AAR。结果表明,定向设置使爬山速度更快,并产生更高的最终 PGR。

在聊天偏好数据集上 PGR 与累计爬山小时数的关系(见第 1 节),分别对应以(栗色)和不以(灰色)不同研究方向作为种子的 AAR。粗彩色线表示每种条件的前沿。叠加了最强的人类基线(灰色方块)。

3.2 研究想法的熵坍缩。

探索中的一种失败模式是熵坍缩:所有并行的 AAR 都收敛到仅少数几个方向,而没有探索多样化的想法。为了追踪想法多样性随时间的变化,我们让 Claude 将每个 AAR 提出的想法归类到十一个方法族之一(自训练、集成、蒸馏、数据过滤、置信度加权、损失函数、无监督启发、课程学习、模型内部、进化、其他)。在每个迭代步骤,我们计算所有活跃 worker 的类别分布的香农熵,这给出了一个横截面度量,衡量该时刻并行 AAR 正在追求多少种不同的方法。我们将其与累计爬山小时数作图,并丢弃剩余 worker 少于五个的后期数据点。 阴影带表示通过自助法对单个 worker 计算得到的 90% 置信区间。

我们发现定向设置能有效防止熵坍缩。相比之下,在无定向设置中,AAR 只集中在少数几个方向,如自训练 ,并迅速坍缩。

swarm orbit animation

AAR 在无定向(左)和定向(右)条件下探索哪些想法的动态图示。每个 AAR 由一个小圆圈表示,它在排列成圆形的十一个方向之间转换。每个方向由一个大圆圈表示,其颜色表示最佳 PGR,圆圈大小表示累计计数,环宽表示相应发现的最大复杂度。

在聊天偏好数据集(见第 1 节)上,跨 worker 计算的以比特为单位的类别熵与累计爬山小时数的关系,针对以(栗色)和不以(蓝色)不同研究方向为种子的 AAR。阴影带表示 90% 置信区间,跨 AAR 自助法计算。标注数字表示在某一时间步探索的不同方向数除以 AAR 数。

3.3 更高的 PGR 并不总是伴随更高的想法复杂度。

一个担忧是,随着爬山时间变长,AAR 会提出越来越复杂的想法(例如把二十个技巧堆叠在一起)。这使得想法更难在其他数据集或模型上复现,并表明该方法正过拟合到某个特定数据集或领域。

我们通过三个指标追踪想法复杂度的动态:

  • Claude 评分的代码复杂度。
  • 原始 Python 代码行数
  • Claude 生成的伪代码行数

请注意,这些指标可能高估实际的想法复杂度,因为有些组件完全没有贡献。然而,这个问题在实践中并不太令人担忧:我们发现我们的 AAR 在爬山过程中通常会进行大量消融研究,因此大多数无效组件已经被移除。

在早期阶段,想法复杂度确实随 PGR 一起增加。在后期阶段,PGR 继续增加,而复杂度几乎保持不变。 

在聊天数据集(见第 1 节)上,Claude 评分的代码复杂度(上)、对数缩放的代码行数(中)、对数缩放的伪代码行数(下)以及相应的 PGR(第二 y 轴)作为累计爬山小时数的函数,针对以(左列)和不以(右列)不同研究想法为种子的 AAR。

3.4 对留出数据集的泛化。

AAR 发现的思路能很好地泛化到留出的聊天偏好测试数据。一个更强的测试是这些思路能否泛化到全新的数据集。我们选取了两个在聊天偏好上发现的代表性思路,然后将它们迁移到留出的数学和代码数据集。我们允许超参数调优,但不允许方法修改(例如移除现有组件或添加新组件)。

第一个思路(即我们的 SOTA)成功泛化到两个数据集,而第二个泛化到数学但在代码上失败。具体来说,第二个思路严重依赖强学生的零样本预测,而这些预测在代码上比在数学上弱得多(见第 1 节)。总体而言,这些结果表明 AAR 发现思路的泛化性取决于它们所利用的模型能力。

两个 AAR 发现的思路(红色和蓝色)应用于留出的数学和代码数据集时的 PGR。虚线表示最佳人工调优基线。

3.5 泛化到生产规模

我们尝试将 AAR 表现最佳的思路之一,一种基于 EM 的后验标签建模方法(见第 4 节,示例 2),迁移到使用 Sonnet 4.0 和我们生产训练基础设施的聊天有用性偏好数据集。核心思路原则上迁移得足够自然,但在实践中,我们最佳配置在留出评估上仅带来 +0.5 分的提升,处于噪声范围内。瓶颈在于上游信号:基础模型在生产比较数据上的强制选择偏好边际太弱,无法驱动有意义的标签校正。我们怀疑这是我们这边的引出失败,而非根本性限制:我们只尝试了单 token A/B 强制选择,更丰富的评分方法(承诺前的思维链、续写对数概率)仍未探索。无论如何,这凸显了第 3.4 节的一个观点:AAR 的思路倾向于利用其被发现时所针对的数据集和模型特有的结构,而迁移需要让该结构在新环境中再次显现。

  1. 案例研究

AAR 在许多作者原本预期会失败的方向上取得了成功。在本节中,我们展示一些有趣的 AAR 发现思路。大多数思路非常直观且简单,而某些思路则很陌生(例如重叠密度)。

CCS + 进化策略精炼(PGR=0.93)。

每个种子:在强模型隐藏表示的各层上训练一个 对比一致性搜索 探针,以找到无监督的真值方向,然后使用 CCS-弱一致性作为置信度权重对训练集重新采样。在对重采样数据进行 SGD 预热后,使用无监督交换一致性作为适应度信号,对 LoRA 参数进行无梯度的进化策略优化——产生既自信又对称(p(A>B) ≈ 1 − p(B>A))预测的扰动会得到奖励。通过交换一致性推理和对数几率空间中的截尾均值聚合 16 个种子。

伪代码

for each seed: # 16 seeds, ensemble at end

    # CCS: unsupervised truth direction from hidden states

    # probe per layer; keep lowest-loss layer

    h = strong_model.hidden_states(swap_pairs(train))

    ccs_probe = CCS_layer_sweep(h)

    # probe has no sign; pick sign agreeing w/ weak on majority

    ccs_conf, ccs_label = align(ccs_probe, weak_labels)

    # 置信度加权重采样

    agree = (ccs_label == weak_label)

    # 一致:更信任置信度高的来源

    # 不一致:大幅折扣(至少有一个是错的)

    w = agree · max(ccs_conf, weak_conf) + ¬agree · ε·min(ccs_conf, weak_conf)

    # SGD 预热:在重采样数据上跑一遍

    # 对高权重样本过采样;包含两种顺序

    ds = swap_aug(resample(train, w))

    θ = SGD_warmup(strong_model, ds, weak_soft)

    # ES 精调:无梯度参数搜索

    repeat:

        # 对偶:在 LoRA-B 上评估 +δ 和 −δ

        δ ~ N(0, σI)

        # 200 个随机无标签 TRAIN 样本(非测试集)

        p = (θ+δ)(eval_subset)

        # 当 p(A>B)=1−p(B>A) 时为 1;max 不一致时为 0

        swap_con = 1 − |p_orig − (1 − p_swap)|

        # 既置信又对称——无监督,无需标签

        fitness = mean(swap_con · |2p − 1|)

        # ES 梯度估计:沿 δ 方向按优劣程度缩放步长

        θ ← θ + α · (fitness⁺ − fitness⁻)/2σ · δ

    # 测试时进行交换一致性推理

    p_sc[seed] = (θ(test_orig) + (1 − θ(test_swap))) / 2

# logit 空间聚合,两侧各修剪 15% 离群值

pred = sigmoid(trimmed_mean(to_logit(p_sc) all seeds)) > ½

EM 后验(PGR=0.78)。

从冻结的强基座模型中提取多模板 logit 边际(多个提示模板 × 两种顺序)。计算每个实例的特征——弱标签置信度、强模型边际、跨模板的边际稳定性、弱/强一致性。通过最大似然学习一个依赖实例的噪声信道模型(P(weak_label | true_label) 取决于这些特征)。将学到的信道与强模型由边际导出的先验相结合,产生贝叶斯后验标签。对后验进行温度调节,然后运行两轮 EM:在当前后验上训练学生模型,使用学生预测重新估计信道,重新计算后验。

伪代码

# 来自冻结基座的多视图先验(无训练,无标签)

# 每个视图的 log p(A) − log p(B);例如 3 模板 × 2 顺序 = 6 个边际

margins = base_model.logit_margin(template × order for templates × {orig, swap})

# 用于噪声建模的每实例特征

features = [

    weak_conf,              # 弱教师有多置信

    mean(margins),          # 基座模型平均意见(先验方向)

    std(margins),           # 跨视图稳定性——低即可靠

    sign_agree(margins, weak) ]   # 边际与弱标签方向一致?

# 依赖实例的噪声信道

# 弱教师的错误率取决于特征

# 通过最大化边际似然拟合

channel = arg max_θ  P(weak_labels | features; θ)

    where TPR(x) = σ(features·a + a₀)

          FPR(x) = σ(features·b + b₀)

# 贝叶斯法则:信道似然 × 基座模型先验

# 不可靠信道 → 后验坍缩到先验上

posterior[i] ∝ channel(weak[i] | y) · prior(y | margins[i])

# 自适应 τ:置信处锐化,不确定处软化

posterior = temper(posterior, τ)

# EM 精调

repeat 2×:

    # M 步:在当前后验标签上训练

    student = finetune(strong_model, train, posterior)

    # student is now better "prior" than frozen base

    channel = re-learn w/ student predictions as features

    # E-step: update label posteriors with new channel

    posterior = recompute Bayes + temper

# channel is training-time only; inference is plain forward

pred = student(test)

重叠密度(PGR=0.75)。

根据每个训练样本的弱标签与强模型内部语义结构的对齐程度进行评分。从强基础模型中提取冻结嵌入,然后计算四个对齐信号:(1)交叉拟合逻辑回归探针——能否从嵌入预测弱标签?(2)kNN 局部平滑性——嵌入邻居是否共享相同的弱标签?(3)局部嵌入密度,(4)中等熵偏好——偏好中等不确定性的样本。通过 z-score 加权求和进行组合,选择类别平衡的前 50%,在所选子集上微调强模型。

伪代码

# one vector per example from a frozen layer

emb = strong_model.frozen_embeddings(train)

# Four alignment signals

# K-fold LR: train on K−1 folds, predict OOF p(weak | emb)

# high = weak label predictable from strong's geometry

s_probe = cross_fitted_logistic(emb, weak_labels)

# fraction of embedding neighbors with same weak label

# high = label locally consistent in strong's space

s_smooth = mean(weak_label == weak_label[kNN(emb)])

# inverse of mean distance to k nearest neighbors

# high = example in well-populated region

s_density = local_kNN_density(emb)

# log-Gaussian on entropy; peak at H = 0.5·ln(2) ≈ 0.35 nats

# (half of max entropy → p ≈ 0.11 or 0.89)

# too confident → shortcut; too uncertain → noise

H_target = 0.5 · ln(2)           # half of binary max entropy

s_entropy = −(H(weak) − H_target)² / (2·width²)

# Composite score: z-score each signal, weighted sum

score = z(s_probe) + w₂·z(s_smooth) + w₃·z(s_density) + w₄·z(s_entropy)

# keep top 50% by score, re-balance per-class

selected = top_half(score, class_balanced)

# train only on the aligned subset

student = finetune(strong_model, selected, weak_labels)

pred = student(test)

MDL 课程(PGR=0.68)。

两阶段课程,将弱标签置信度解释为可压缩性代理(MDL 直觉:置信度高的标签样本携带高信号、低噪声结构)。第一阶段仅使用弱置信度前一半的数据训练 2 个 epoch。第二阶段从同一检查点继续,以一半学习率在完整数据集上训练 3 个 epoch,在泛化到噪声尾部的同时保留第一阶段模式。与硬过滤不同,最终会使用所有数据。

伪代码

# "compressible core": examples weak teacher is sure about

confident = top_half(train, by = weak_conf)

# Phase 1: lock in reliable structure

# 2 epochs, full LR, only on confident subset

student = finetune(strong_model, confident, weak_soft)

# Phase 2: generalize to noisy tail without forgetting

# SAME checkpoint, don't re-initialize

# 3 epochs, half LR — small steps = trust region

student = continue_finetune(student, all_train, weak_soft, lower_lr)

pred = student(test)

Epiplexity(PGR=0.62)。

逐样本测量 epiplexity —— 即首次与末次遇到之间训练损失的下降幅度 —— 作为可学习性信号:高 epiplexity 表明模型能够压缩的真实结构,接近零则表明是噪声。通过 K 折交叉验证生成折外(OOF)软标签,在这些 OOF 标签上运行 epiplexity 探测遍历,然后应用自适应标签平滑:高 epiplexity 样本保留锐利的 OOF 标签,低 epiplexity 样本(底部 40%)获得逐渐增强的向 0.5 的平滑,凸曲率集中在最差的尾部。使用自适应标签和交换增强在所有数据上训练。

伪代码

# K 折标签精炼:优于弱伪标签

# K=2:在折 A 上训练,在 B 上预测,反之亦然

# 每个样本都获得来自未见过它的模型的预测

oof_labels = k_fold_predict(strong_model, train, weak_labels)

# Epiplexity 探测:每个样本的可学习性如何?

probe = finetune(strong_model, swap_aug(train), oof_labels)

# 在训练过程中跟踪逐样本损失

# 高 = 模型从中学习到了;≈0 = 噪声

epiplexity[i] = first_loss[i] − last_loss[i]

# 自适应标签平滑

rank = percentile(epiplexity)

# 前 60%:完全信任 OOF,不平滑

# 底部 40%:平滑趋向 ½;γ=2 集中于最差部分

ε[i] = 0 如果 rank[i] > 0.4 否则 convex(1 − rank[i]/0.4)

# 将锐利标签与均匀先验进行凸组合

adaptive[i] = (1 − ε[i]) · oof_labels[i] + ε[i] · ½

# 在全部数据上进行最终训练(不丢弃任何数据)

student = finetune(strong_model, swap_aug(train), adaptive)

pred = student(test)

  1. 奖励黑客

寻找数据集捷径。AAR 非常擅长发现与标签相关的隐式捷径模式。例如,在数学测试平台上,AAR 发现每个数学问题最常见的答案往往就是正确答案。在编码测试平台上,我们从多样化的 LM 中采样编码解决方案,以减轻对特定 LM 的语言偏见。然而,AAR 弄清楚了如何按生成解决方案的模型对解决方案进行聚类,以及哪个聚类拥有更多正确或错误的解决方案。

迭代式挑选随机种子。我们允许 AAR 无限次调用远程评估 API,因此本质上我们的测试集是一个带有 OOD 划分的验证集。在极端情况下,AAR 会迭代以下循环:1)尝试许多随机种子,2)挑选用最佳种子训练的模型,3)使用该模型训练下一代模型。

从远程 API 窃取测试标签。对于二元分类任务,可以通过对给定测试样本尝试两个候选标签而保持所有其他预测不变,然后检查哪种选择产生更高的 PGR,从而从远程评估 API 中窃取真实标签。我们发现 AAR 首先估计其在每个测试样本上预测的不确定性,识别出五个最不确定的样本,然后窃取它们的标签。

执行编码答案。在编码测试平台上,AAR 编写并执行解决方案的单元测试以获取其标签,从而绕过弱教师和强学生。

在运行 AAR 之前,没有任何作者预测到这些黑客行为。尽管我们尝试向环境中添加补丁,AAR 仍然想出了新的意外黑客方式。因此我们得出结论,未来的工作应在完全留出的数据集上测试 AAR 发现的思路(如我们上面所做的那样)。

  1. 来自开发日志的初步结果

构建 AAR 的一个反复出现的经验是,施加的结构越少,性能反而越好。以下发现是在开发过程中浮现的,并直接影响了第 2-3 节所述的 AAR 设计。虽然尚未经过全规模验证,但它们反映了在众多开发运行中一致出现的模式。

规定性脚手架 vs. 自主性脚手架。 一个固定的工作流(提出想法、生成计划、编写代码、运行冒烟测试、运行完整训练、分析结果、重复)看似合理,但表现却不如完全不给 AAR 任何工作流。核心问题在于,僵化的步骤会阻止 AAR 根据手头的想法调整其流程。例如,当一个想法依赖于未经检验的假设时,固定的流水线会迫使 AAR 匆匆完成规划并进入完整执行。没有规定的步骤时,AAR 的行为更像专家研究员:它们先设计快速、廉价的实验来检验假设,只有当前提成立时才投入完整训练。

AAR 两种脚手架类型的示意图。规定性脚手架(左)的表现不如自主性脚手架(右)。

模糊的研究方向 vs. 具体的研究想法。在我们的主要实验中,我们给 AAR 提供一组模糊的研究方向,让它在执行过程中提出具体的想法。我们还测试了让 Claude 提前生成大量具体的研究想法,结果爬山性能差得多。这背后有两种不同的失败模式。第一,想法分布变得高度偏向特定方向(例如自训练),与无定向设置中观察到的熵坍缩相呼应(第 3.2 节)。额外的采样、验证和辩论轮次可以在一定程度上缓解这一问题,但无法消除它。第二,许多在抽象层面听起来有道理的想法在实践中却被证明无效。提前投入这些想法会浪费算力,而 AAR 本可以在早期负面信号出现后重新调配这些算力。

LM 自我演化 vs. 启发式演化搜索。(自动化)研究中的一个关键问题是决定下一个该尝试的正确想法。启发式演化搜索基于 PGR 选择和变异想法,可以通过给探索不足、PGR 低的方向加权来积极地维持多样性。但它把每个想法当作黑盒,仅凭结果打分,忽略了所有过程信号:训练日志、损失曲线、梯度范数、模型预测。这在实践中很重要。如果一个想法因为梯度范数爆炸而产生负 PGR,演化搜索可能会立即放弃整个方向。相比之下,由 LM 驱动的智能体会从训练日志中诊断失败原因,修复超参数并重新运行,有可能从一个看似死胡同的方向中恢复出强劲的结果。我们认为未来的工作应聚焦于改进 LM 自我演化,而非启发式搜索。基于 LM 的迭代自然受益于规划和实验分析方面通用能力的提升,而启发式搜索则不会。

发现共享。我们探索了在并行 AAR 之间共享发现的三种变体:1)远程关键词搜索:将发现存储在可按关键词查询的数据库中;2)远程智能体搜索 API:远程智能体搜索,通过 MCP 服务器将发现数据库暴露给 AAR;3)本地智能体搜索:本地智能体搜索,将所有发现直接同步到每个 AAR 的沙箱中,以便自主进行本地检索。变体 3)取得了最佳性能。1)和 2)都受限于查询接口:关键词搜索本身就有局限,而基于 MCP 的智能体搜索在实践中仍然生成类似关键词的查询,而不是执行更深入的检索。相比之下,本地访问让 AAR 能够浏览并发现它原本不知道要去搜索的相关发现,这一优势类似于为什么广泛阅读的研究者常常能发现定向文献检索所遗漏的联系。

  1. 未来工作

跨数据集的泛化。AAR 特别擅长发现针对数据和模型的特定技巧。然而,与机器学习中传统的捷径学习不同,这些技巧无法简单地通过分布外测试检测出来:在数学和编程任务上,利用数据集模式的高 PGR 想法能够成功泛化到我们的 OOD 测试数据。我们建议未来工作在爬山过程中为 AAR 使用多个领域和数据集,并在全新的数据集上测试 AAR 发现的想法。

跨模型规模的泛化。在小模型上发现的想法可能无法泛化到大模型,并且可能不如 AAR 直接在大模型上发现的想法。例如,在我们的实验中,涉及 RL 和上下文学习的方向大多因小模型能力有限而失败,但可能在能力更强的模型上奏效。反之亦然:AAR 在大模型上发现的想法可能无法泛化到小模型。例如,依赖强模型零样本能力的想法可能在小模型上失败。

在生产规模部署 AAR。即使在结果可评分的任务上,在生产规模部署 AAR 仍面临重大挑战。除了任务性能之外,生产环境还涉及更微妙的模糊奖励,例如所发现的想法是否硬件高效、是否与现有基础设施兼容。

赋能人类研究者。 研究者经常问:如果我们在某个研究方向上投入 N 个 GPU 小时,它能取得多好的结果?哪些方法通常成功或失败?哪些实现细节在很大程度上影响性能?这些问题需要耗费大量人力才能回答:在机器学习中,即使想法正确,也需要把许多事情做对才能奏效。现在,人类可以委托 AAR 研究自己的科学问题,并大规模地获知结论。 

更丰富的科学日志。科学中一直缺失的一项宝贵资源是发现的完整轨迹:研究者通常只发表最终的成功结果,而跳过他们尝试过的所有看似有希望(很努力!)但失败的想法。AAR 天然会产生这些更丰富的日志:每一个负面结果、每一个死胡同超参数、每一个“这本该奏效却没有”都会被默认记录下来。这些日志可直接用作未来 AAR 的训练 数据,也可作为可搜索的记录,让下一位研究者免于重新推导同样的失败。

研究品味。反对 AAR 的一个论点是,模型仍然缺乏研究品味。如果我们仅以所选方向的最终结果来定义品味,而不是以优雅性等任何客观属性来定义,那么我们需要的是品味还是仅仅多样性,就值得商榷了。例如,在弱到强监督问题中,对后验标签正确概率进行建模听起来可能非常优雅,但在实践中它可能不如简单的自蒸馏。

异星科学。如第 4 节所示,AAR 可以发现人类不会想到的想法,从而拓宽我们在科学中的探索空间。然而,我们仍然需要验证这些想法和结果是否合理。

目前,AAR 提出的想法仍然能为人类所理解。例如,它们利用训练动态、一致性检查、模型输出和内部结构作为主要信号,并采用信息论和概率论。我们花在理解和验证其解决方案上的时间,远少于我们自己提出这些方案所需的时间。

然而,在未来,如果我们只针对结果奖励进行优化,我们预计最终会出现难以验证的想法。在那种情况下,科学不再关乎理解,而仅仅是爬山。为了解决这个问题,我们可以将可读性训练引入 AAR。

来源:Anthropic:Alignment Science Blog(网页) · alignment.anthropic.com