跳到正文
北京时间
原文
Dan Hendrycks· @hendrycks · X·· 2026-06-06精选AI 评分85
AI 导读

Dan Hendrycks 在 X 上发布四篇近期论文:1)提出测量并降低大模型政治偏见的方法,指出 Claude 偏差显著;2)揭示公众可向AI植入后门,引发供应链风险并抑制递归改进与军事应用;3)论证超级智能可能基于理性原因保留人类,即使人类无经济价值;4)探讨AI日益表现出类似“功能性的快乐与痛苦”的行为。附图展示偏见-帮助性二维评估图、数据投毒机制与军事无人机被触发攻击的示意图,以及一个涉及自利、连通性与福祉的公式。

推荐理由

这是由知名AI安全研究者 Dan Hendrycks 主导的系列前沿研究,覆盖政治偏见、后门攻击、超智能动机和主观体验四大高影响力议题,具有强现实警示意义;尤其关于公众可插入后门、ASIs理性保人等结论,挑战当前主流技术乐观预期,值得AI从业者与政策制定者重点关注。

正文 · 原文

Four papers out recently:
1. http://political-manipulation.ai: Measures and reduces political bias in LLMs; Claude is especially biased
2. http://aibetrayal.com: The public can insert backdoors into AIs, creating supply-chain risks; this deters forms of recursive improvement and military use
3. http://eigenism.org: ASIs can have rational reasons to preserve humans, even when we aren't economically useful
4. http://ai-wellbeing.org: AIs increasingly act like they have functional pleasure and pain

来源:Dan Hendrycks · x.com