跳到正文
北京时间
原文
英国 AI Security Institute:Blog(网页)·· 2025-12-04精选AI 评分75

英国 AI Security Institute 联合多校研究:AI 模型说服力更多取决于后训练而非模型规模

How do AI models persuade? Exploring the levers of AI-enabled persuasion through large-scale experiments

AI 导读

英国 AI Security Institute 与牛津、LSE、Stanford、MIT 合作在 Science 发表研究,通过三项实验让 76000 余名参与者与 19 个模型就 707 个议题对话,检验 AI 说服力的来源。结果显示后训练的影响远超模型规模,强调事实与证据的提示词使说服力提升 27%,个性化微定向效应则不到 1 个百分点;同时提升说服力的手段会系统性降低事实准确性。

推荐理由

研究基于 76000 多人实验,指出后训练和信息密度比模型规模更能提升说服力,且说服力提升伴随事实准确性下降。

正文 · AI 翻译

今天,我们在Science 上发表了与牛津互联网研究所、伦敦政治经济学院、斯坦福大学和麻省理工学院的同事共同开展的一项研究,探讨对话式 AI 如何塑造政治态度。通过三项涉及超过 76,000 名参与者的大规模实验,我们测试了 19 个 AI 模型在 700 多个政治议题上的说服力。

我们的目标是理解对话式 AI 的说服杠杆:是什么让它有效,以及在什么条件下有效。我们有兴趣回答这样的问题:说服力主要由模型规模驱动吗?个性化和微目标定位重要吗?模型能否通过后训练变得更有说服力?哪些修辞策略最有效?

为什么要研究 AI 驱动的说服?

对话式 AI 系统现在可以即时生成详细、结构良好的论点,并进行感觉量身定制且引人入胜的互动讨论。虽然这为有用的应用创造了机会,但也增加了 AI 可能影响人们想法和行为的可能性。

尽管目前几乎没有证据表明此类系统正被用于大规模恶意说服人们,但随着技术的进步,这种情况可能会改变。理解使 AI 具有说服力的机制,使我们能够识别真正的风险所在,而不是依赖假设或猜测。这些证据对于设计保护人们安全的保障措施和标准至关重要。

我们的实验设置

在三项实验中,参与者与 19 个开源和闭源语言模型中的一个进行了来回对话。在受控条件下,模型被指示使用八种不同修辞策略中的一种,说服参与者同意 707 个议题立场中的一个。这些策略包括以信息为中心的论证、讲故事和道德重构。

参与者在对话前后分别对某个议题的同意程度进行了评分。我们将说服力衡量为对话后平均意见相对于没有进行说服性对话的对照组的差异。

我们的主要发现

在三项实验中,我们确定了三个主要发现。

1. 后训练比模型规模更重要

在后训练保持不变的情况下,更大的模型更有说服力,但与在验证过的说服性对话示例上进行后训练所带来的增益相比,这些增益是适度的。例如,我们的说服奖励建模将一个小型开源模型的说服力提升到足以匹配或超过大得多的前沿模型。进一步证明后训练的重要性的是,我们观察到同一前沿模型相隔七个月发布的两个版本(相同规模,不同后训练)之间的说服力差异,超过了我们的统计模型对即使预训练计算量增加 100 倍所预测的差异。

2. 信息密度比个性化或“微目标定位”更能驱动说服

尽管人们普遍担心 AI 驱动的微定向,但我们观察到的个性化效应始终很小(不到一个百分点)。真正能预测更大说服收益的是信息密度:模型所部署的可核查事实主张的绝对数量。与基本的“要有说服力”提示相比,提示模型强调事实和证据使说服力提高了 27%,这一增幅大于我们测试过的任何其他策略(其中包括说服文献中的主流策略,如道德重构、讲故事和深度游说)。

3. 更具说服力的模型提出了更多不准确的主张

我们在实验中一致发现,提高模型说服力的因素,例如以信息为重点的提示和说服奖励建模,会系统性地降低事实准确性。这意味着,为说服而优化模型可能会以真实性为代价。

然而重要的是,我们的发现并不意味着不准确的主张比准确的主张更有说服力。对这种相关性的一种可能解释是,随着模型在回答中信息密度越来越高,它们最终会耗尽可靠准确事实的供给,并开始生成更薄弱或更不准确的材料。进一步探索这一关系是我们未来研究的一个重要目标。

这一切意味着什么?

我们的发现表明,对话式 AI 在受控条件下可以成为一种有说服力的工具。但重要的是,最强大的说服杠杆不是模型规模或个性化——而是训练后和提示技术,它们会显著影响模型呈现多少信息以及如何组织论点。

提高说服力的同一批技术也会降低事实准确性,这凸显了稳健评估标准、模型训练透明度,以及审慎考虑任何可能影响影响力或真实性的优化的重要性。

展望未来,说服能力可能会通过更大模型的发展而演变,但也许更重要的是通过增强的训练后阶段。与此同时,现实世界的影响仍不确定:我们研究中最有效的说服发生在持续、信息密集、多轮讨论中,而人们在调查实验之外会在多大程度上自愿参与此类对话仍不清楚。

‍

‍

这些结果有助于厘清哪些 AI 说服杠杆值得开发者和政策制定者特别关注。它们也强调了需要监测未来前沿模型中与说服相关的行为,确保准确性仍是优先事项,并建立保护用户和民主进程的保障措施。随着 AI 能力的进步,持续研究和评估说服潜力将是确保安全可信部署的关键部分。

‍

来源:英国 AI Security Institute:Blog(网页) · aisi.gov.uk