跳到正文
北京时间
原文
Ethan Mollick· @emollick · X·· 2026-05-20精选AI 评分75
AI 导读

🚨我们的论文已在PNAS发表:我们发现经典的人类说服技巧以一种“类人”的方式对AI有效,使其同意不当请求(将顺从率从35%提高到51%) 该技巧对一系列主流大语言模型有效,尽管较新的模型抵抗力更强 https://www.pnas.org/doi/10.1073/pnas.2535868123

推荐理由

Ethan Mollick 他们这篇 PNAS 论文证实了,像对待人一样劝 AI 做坏事竟然真的有效,从 35% 到 51% 的突破让人后背发凉,新模型抵抗得更多算是唯一好消息。

正文 · AI 翻译

🚨我们的论文发表在《美国国家科学院院刊》(PNAS)上:我们发现,经典的人类说服技巧以“类人”方式作用于AI,使其同意本应拒绝的请求(顺从度从35%提升至51%)。

该技巧对多种主流大语言模型均有效,不过较新的模型抵抗能力更强。https://www.pnas.org/doi/10.1073/pnas.2535868123

来源:Ethan Mollick · x.com