英国 AI Security Institute 联合 Anthropic 发布迄今最大规模数据毒化研究
Examining backdoor data poisoning at scale
英国 AI Security Institute 与 Anthropic、Alan Turing Institute 合作发布迄今最大规模的数据毒化研究。团队在 600M 到 13B 参数的四个不同规模模型上测试同一后门攻击,发现仅需 250 篇文档即可成功毒化所有被测模型的训练数据,所需数量并不随模型或数据集规模增加,推翻了此前按比例投毒才可成功的假设,表明毒化攻击可能比以往认为的更可行。
研究给出与既往假设相反的结论,即毒化所需文档数不随模型规模增长,对理解后门攻击可行性有直接参考价值。
译文尚不完整,完整内容请切换到原文。
Today, we’re releasing results from our work with Anthropic and the Alan Turing Institute to produce the largest study of data poisoning to date.
数据投毒是指个人散布旨在破坏 AI 模型训练数据的在线内容,可能产生危险行为。它可以被用来植入后门;特定短语可被用来降低系统性能,甚至让模型执行被禁止的操作,例如窃取敏感数据。由于语言模型是在海量公开互联网文本上训练的,几乎任何人都可以创建这类内容。
我们在四种不同规模的模型上测试了同一种后门攻击,参数规模从 600M 到 13B 不等。我们发现,少量文档(少至 250 篇)就足以成功“投毒”我们测试的每一个模型的训练数据,而不是所需数量随模型或数据集规模而增加。此前的研究曾假设攻击者需要投毒一定比例的数据才能成功,但我们的结果表明并非如此。这意味着投毒攻击可能比之前认为的更可行。
随着模型能力增强,防御数据投毒的工作将至关重要,以确保其在各行业的安全可信部署。我们发布这项研究,是为了提高人们对这些风险的认识,并推动其他人采取防御措施来保护他们的模型。
你可以在 Anthropic 网站上了解更多,或阅读完整论文。
我们正在招聘!如果你对领导研究以提升先进 AI 系统安全性感到兴奋,申请成为我们 Safeguards 团队的研究科学家。
来源:英国 AI Security Institute:Blog(网页) · aisi.gov.uk