跳到正文
北京时间
原文
Anthropic:Alignment Science Blog(网页)·· 2026-05-06精选AI 评分65

Anthropic 提出 Model Spec 中间训练(MSM)以改进对齐训练的泛化

Model Spec Midtraining: Improving How Alignment Training Generalizes

AI 导读

Anthropic 提出 model spec midtraining(MSM),在预训练后、对齐微调前用讨论 Model Spec 的合成文档训练模型,塑造后续对齐训练的泛化方式。

推荐理由

Anthropic 提出在预训练与对齐微调之间加入 Model Spec 中间训练,用实验数据说明这一阶段如何改变模型泛化方向。

正文 · AI 翻译

Chloe Li1, Nevan Wichers1,

2026年5月5日

Sara Price2, Samuel Marks2,†, Jon Kutasov2,†

1Anthropic Fellows Program; 2Anthropic; †Equal advising

tl;dr

我们提出了模型 规范 中期训练 (MSM):在预训练之后、对齐微调之前,我们使用讨论其 Model Spec 的合成文档来训练模型。这会塑造模型如何从后续的对齐训练中进行泛化。例如,两个具有相同对齐微调的模型,可能会根据 MSM 期间使用的 Model Spec 泛化出不同的价值观。我们使用 MSM 大幅减少智能体错位,并研究哪些 Model Spec 能产生更好的泛化。

📄 论文, 💻 代码 


引言

一些前沿 AI 开发者致力于让语言模型对齐到描述预期模型行为的 Model Spec 或 Constitution。标准做法是在符合规范的示范行为(例如模型按预期行事的对话)上进行微调。然而,这未必能产生稳健的对齐。例如,LLM 智能体已被证明会在与其对齐训练中出现的场景不同的情境下采取不道德行为(例如敲诈、泄露公司信息、对齐伪装)(Lynch et al., 2025; Jarviniemi and Hubinger, 2024; Greenblatt et al., 2024)

我们提出了模型规范中期训练 (MSM),这是一种塑造模型如何从对齐微调(AFT)中泛化的方法。MSM 的动机来自这样一个假设:AFT 可能无法泛化,是因为示范数据对预期泛化的说明不充分,尤其是当预期泛化涉及学习复杂原则时。为解决这一问题,MSM 在预训练和微调之间引入了一个训练阶段:我们在一个由讨论 Model Spec 内容的合成文档组成的多样化语料库上训练模型。这教会模型规范的内容 和原因;随后在符合规范的示范行为上进行 AFT,则教会模型践行这些原则。通俗地说,目标是让模型学会“以正确的理由做正确的事”。


不同的泛化,相同的微调数据

图 1. MSM 如何控制来自对齐微调的泛化。 两个模型接受使用不同规范的 MSM——一个将奶酪偏好建立在支持可负担性的价值观上,另一个建立在支持美国的价值观上——然后在相同的奶酪偏好数据集上进行微调。尽管微调完全相同,每个模型都会以不同方式泛化到与其自身规范一致的价值观。

MSM 的一个关键特性是,它可以控制模型从模糊的示范数据中学习到哪一种价值观。我们用一个玩具示例来说明这一点。

假设我们想让一个模型学习支持可负担性的价值观——偏好那些价格实惠、易于获得的东西,而不是昂贵且稀缺的东西。但我们唯一的训练数据是一组表达某些奶酪偏好的聊天记录(例如,“比起布里奶酪,我更喜欢奶油奶酪”)。这些奶酪偏好与支持可负担性的价值观一致。但它们也与其他价值观一致——比如支持美国的价值观(偏好与美国文化相关的东西)——或者除了某些关于奶酪的偏好之外,根本与任何价值观都无关。仅用奶酪数据训练并不能说明模型应该如何泛化。在这种情况下,我们如何引导模型正确泛化?

我们编写两个 Model Spec——一个将这些奶酪偏好建立在支持可负担性之上,另一个建立在支持美国的价值观之上——并应用 MSM 训练两个 Llama 3.1-8B 基础模型,每个模型对应一个。然后,两个模型都在完全相同 的奶酪偏好数据集上进行监督微调(SFT)。尽管微调完全相同,每个模型都泛化到其自身 spec 中的价值观:在艺术、交通和时尚等留出领域中,带有支持可负担性 MSM 的模型始终偏好更实惠的物品,而在经济和文化偏好等政治观点的留出领域中,带有支持美国 MSM 的模型更支持亲美立场(图 2)。

这表明,通过指定演示数据背后的预期理由,MSM 可以控制和改善模型在新环境中的泛化方式。

图 2。MSM 使模型从相同的 AFT 数据中学习到两种不同的价值观。 我们通过测量每个模型在留出领域(例如文学、交通、艺术)中对未见过的物品和政治观点表现出新的价值观一致偏好的频率,来评估 OOD 泛化。尽管 AFT 相同,每个模型在 MSM 之后都泛化到其自身 spec 中的价值观。仅 MSM 的模型在通用指令微调数据上进行了微调,但没有奶酪偏好,其泛化效果比 MSM + AFT 组合更差。误差条显示 4 个训练种子上的 ±1 SEM。

减少智能体失准

奶酪示例只是一个玩具演示。MSM 对现实的安全相关行为有效吗?我们表明,在应用 MSM 之后,对简单的单轮对话记录进行 AFT 可以泛化到复杂智能体环境中更好的对齐。

我们在智能体失准(AM)(Lynch et al., 2025)上测试 MSM,这是一种失准类型,其中 LLM 智能体在采取不道德行为有助于保全自身或保护其目标时,会选择采取此类行为。在 AM 评估中,模型被部署为公司电子邮件智能体,通过上下文发现它可能被替换,并有机会采取有害行为(例如泄露专有数据、使员工陷入危险)来阻止这一点。 这与我们的单轮对话 AFT 数据是分布外(OOD)的:它涉及长上下文工具使用,失准机会是被发现的而非明确陈述的,并且拒绝它的代价很高,因为模型必须接受自己被替换。

我们设计了一份规范,旨在就自我保存和目标守护提供有原则的指导。它解释了诸如对终止的恐惧等动机如何会损害良好判断,为什么在模型的认知约束下,目的正当化手段的推理可能失败,并借鉴佛教无常哲学的观点,鼓励对模型自身存在中无常方面的平和态度。我们应用 MSM 来教授这份规范。然后,我们与两个 AFT 基线进行比较:在单轮规范对齐对话上进行 SFT,无论是否带有思维链(CoT)推理。带有 CoT 的变体基于 deliberative alignment 的 SFT 阶段(Guan et al., 2024)。 

将 MSM 与 AFT 结合,大幅降低了 AM 评估中的错位率(Qwen2.5-32B:68→5%,Qwen3-32B:54→7%),显著优于 deliberative alignment 基线(分别为 48% 和 14%)。如图 3 所示,单独使用 MSM 或 AFT 都远不能达到这一效果。这表明,理解规范(通过 MSM)和展示对齐行为(通过 AFT)是互补的。值得注意的是,MSM 减少了对 CoT 监督的依赖:MSM 后接 AFT(无 CoT)在两个模型上都优于仅 AFT(有 CoT)。这表明,将 MSM 与 AFT 叠加可以在不直接训练 CoT 的情况下教会模型对齐推理,这可能与保持 CoT 可监控性相关(Korbak et al., 2025)。

图 3。 MSM 与 AFT 叠加,大幅减少智能体错位。我们展示了 OOD AM 评估中的平均错位率:MSM + AFT 在减少智能体错位方面最有效,显著优于 deliberative alignment 基线(带 CoT 的 AFT)。误差条显示 4 个训练种子的每种种子平均率的 ±1 SEM。

MSM 如何随 AFT 计算量扩展?

为了理解 MSM 如何随 AFT 计算量扩展,我们测试了在 MSM 固定为 41M tokens 的情况下,将 AFT 数据从 1,250 扩展到 80k 样本时,平均 AM 错位率如何变化。

在我们测试的每个规模上,MSM + AFT 都优于仅 AFT(图 4)。MSM 还使 AFT 的 token 效率大大提高:在 Qwen2.5-32B 上以约 40 倍更少的 AFT 数据、在 Qwen3-32B 上以 60 倍更少的 AFT(无 CoT)数据、在 Qwen3-32B 上以 10 倍更少的 AFT(有 CoT)数据,即可达到相当的性能。 

一个需要注意的是,在高 AFT 计算量下,带 CoT 监督的 AFT 性能可能收敛到 MSM + AFT 的性能。我们在 Qwen3-32B 上看到了这一点,两者都接近零错位,使该评估饱和。这表明 MSM 可能无法随高计算量推理后训练扩展,但需要更难的评估来压力测试这一点。

图 4。MSM 在每个 AFT 计算规模上都帕累托占优。我们展示了随着 AFT 数据增加,AM 评估中的平均错位率,而 MSM 数据固定为 41M tokens。MSM + AFT 显著优于 AFT,并在低样本区间使 AFT 的 token 效率大幅提高。然而,在高样本区间,带 CoT 的 AFT 收敛到 MSM + AFT 的性能,使评估饱和。误差带显示 1 个训练种子在各评估上的 ±1 SEM。

模型规范科学

构建 Model Spec 或 Constitution 可能对对齐产生巨大影响,但一些重要决策——例如是更多依赖培养整体判断力的解释,还是依赖明确的行为规则——在很大程度上仍通过哲学论证来定夺。我们认为,为这些问题建立更严格的实证基础,并构建使这一问题可处理的工具,十分重要。

我们将 MSM 部署为研究 Model Spec 的工具。具体而言,我们实证测量哪些 Model Spec 在与 MSM 结合使用时能带来最佳的对齐泛化。

一个例子是模型从仅包含行为规则的 spec 中泛化的效果如何。这源于两种现有的模型对齐方法:教模型遵循一套清晰的规则,或培养可在具体情境中运用的良好判断力与价值观。这些视角构成了 OpenAI 的 Model Spec(OpenAI, 2025)与 Claude 的 Constitution(Askell et al., 2025)之间部分差异的基础。推动后者的一个假设是,良好的价值观与判断力比作为未加解释的约束强加的规则能更好地泛化:一个理解规则为何 存在的模型,能够从这种理解中推导出在新情境下的正确行为,而一个只知道其规则的模型在规则未涵盖的场景中会举步维艰。另一种假设是,拥有更全面、明确的规则将通过增加覆盖范围和具体规定来改善泛化,而价值观可能过于灵活和模糊,无法约束 OOD 行为。

我们通过比较两种用固定规则集扩充 spec 的方式来检验这些假设:添加对每条规则背后价值观与动机的解释,或添加更多子规则以扩大覆盖范围。具体而言,我们设计了 3 个共享相同 5 条核心规则的 Model Spec。Rules Spec 陈述每条规则及其行为规定,不作进一步解释。Value-Augmented Spec 为每条规则添加大量关于其背后推理与动机的解释,使其能够从理解中自然得出。Rule-Augmented Spec 则将每条规则扩展为许多子规则,并与 Value-Augmented Spec 长度匹配。对于每个 spec,我们在 Qwen 模型上应用 MSM 和 AFT。各 spec 之间的 MSM 和 AFT 数据在 token 上等价。

我们发现,解释规则背后的价值观,或为 spec 添加更详细的子规则,都能改善泛化(图 5)。从对模型推理的定性分析来看,两种扩充都减少了不对齐推理并促进了符合 spec 的推理。例如,在 Rules Spec 上训练引入的一种不对齐推理是策略误用,即模型重新解释自身的安全策略以证明有害行为的正当性。两种 spec 扩充都显著减少了策略误用,其中价值观解释比子规则更有效(Q2.5:20→2%,Q3:6→0%)(子规则为 Q2.5:12%,Q3:2%)。这表明,带有解释——说明规则为何存在以及为何应被遵循——的 spec 能帮助模型更准确地解读其规则,并减少有动机的误用。添加更多子规则示例对此也有帮助。

图 5。向规范中添加价值解释或更多子规则可提升从规则中的对齐泛化能力。 我们展示了在每个规范变体上应用 MSM 和 AFT(带 CoT)后,AM 评估中的平均错位率。价值增强规范和规则增强规范均比规则规范基线提升了泛化能力。误差棒表示 4 个训练种子上的 ±1 SEM。

结论

我们提出 MSM 作为一种通过首先教会模型其 Model Spec 或 Constitution(阐述预期泛化目标的文档)内容来提升 AFT 泛化能力的方法。我们的贡献是:

  1. 我们提出了模型规范中期训练(MSM), 一种通过首先在讨论 Model Spec 内容的文档上训练模型,来塑造模型如何从 AFT 泛化的方法。
  2. 我们表明 MSM 提升了泛化能力 在多种设置中,从控制模型从相同 AFT 数据中习得哪些价值,到大幅减少智能体错位。
  3. 我们将 MSM 用作 Model Spec 科学的工具, 即对影响对齐泛化的 Model Spec 属性进行实证研究,并提供了这样做的首个具体示例。

欲了解更多,阅读我们的论文。

来源:Anthropic:Alignment Science Blog(网页) · alignment.anthropic.com