用可解释性理解标注者安全策略
Understanding Annotator Safety Policy with Interpretability
标注分歧可源于操作失败、政策模糊或价值多元。Annotator Policy Models(APMs)是一种可解释模型,仅从标注行为学习标注者内在的安全策略,无需额外负担。验证表明模型准确率超过80%,能忠实预测反事实编辑并恢复已知差异。将APMs应用于LLM和人类标注者,可揭示不同标注者对安全指令解释的差异(政策模糊)以及不同人口群体在安全优先级上的系统性差异(价值多元),支持更具针对性、透明和包容的安全策略设计。
我觉得 APMs 把标注分歧的根源从「猜」变成了「看」,对安全团队澄清政策模糊和价值观差异挺有实操价值,代码也给了,做对齐的可以上手试。
作者:Alex Oesterling†**、Donghao Ren、Yannick Assogba、Dominik Moritz、Sunnie S. Y. Kim、Leon Gatys‡、Fred Hohman‡
安全政策界定了什么构成安全与不安全的 AI 输出,指导着数据标注与模型开发。然而,标注分歧普遍存在,其来源可能多种多样,例如操作失误(标注者误解或错误执行任务)、政策模糊(政策措辞留有解读空间),或价值多元(不同标注者对安全持有不同视角)。区分这些来源至关重要。例如,操作失误需要质量控制,模糊需要政策澄清,而多元则需要就纳入多元视角展开审议。然而,理解标注者为何产生分歧并非易事。直接询问标注者的推理过程成本高昂,会大幅增加标注负担,而且对人工和 LLM 标注者而言都可能不可靠,因为自我报告的推理往往无法反映真实的决策过程。我们提出标注者政策模型(Annotator Policy Models,APMs),这是一类可解释模型,仅从标注行为中学习标注者的内部安全政策,使标注者的推理过程无需额外标注工作即可变得可见且可比较。我们验证了 APMs 能够准确建模标注者的安全政策(准确率 >80%),忠实预测对反事实编辑的响应,并在受控环境中还原已知的政策差异。将 APMs 应用于 LLM 和人工标注,我们展示了两个核心应用:(1) 通过揭示标注者如何以不同方式解读安全指令来呈现政策模糊;(2) 通过发现不同人口群体在安全优先级上的系统性差异来呈现价值多元。这些能力共同支持更具针对性、更透明、更包容的安全政策设计。
- † 哈佛大学
- ‡ 同等贡献
- ** 在 Apple 任职期间完成的工作

图 1: 标注者策略模型(APM)学习个体标注者安全策略的可解释表征。APM 基于标注行为进行训练,以揭示不同标注者如何将安全付诸实践,从而能够诊断分歧来源。通过将标注者映射到共享特征空间,APM 使系统性比较成为可能:识别标注者可能在何处误解了任务本身(识别操作性失误),在何处对指令做出了不同解读(揭示策略歧义),或在何处因人口统计群体而存在系统性差异(揭示价值多元主义)。
来源:Apple Machine Learning Research(RSS) · machinelearning.apple.com