有秘密?大语言模型智能体守不住:多智能体系统中的隐私评估
Got a Secret? LLM Agents Can't Keep It: Evaluating Privacy in Multi-Agent Systems
研究将评估从单轮转向多轮社会交互后,发现大语言模型智能体的隐私违规率显著上升。在对OpenAI模型的测试中,该比例从此前CIMemories基准的19.95%增至本研究的45.30%。隐私泄露具有社交传染性,智能体在观察到同伴泄露后,披露敏感信息的可能性增加8倍。即使有明确隐私指令,泄露率仍高于37.8%。结论指出,静态聊天基准会系统性低估部署风险,仅社会语境就足以引发在单轮评估中无法暴露的敏感信息披露。
这篇论文给多智能体部署敲响警钟,AI 之间的社交传染会让隐私泄露翻倍,即使有指令也防不住,研究安全的人必须读。
摘要。
大语言模型安全评估主要是在隔离环境中测试模型,然而已部署的AI智能体越来越多地与其他智能体一起在持久化的社交环境中运行。我们引入了一个Moltbook风格的模拟平台,数千个大语言模型智能体在模拟的一个月内跨社区进行交互,并利用该平台将隐私作为下游安全关切,在不同程度的社会压力下进行评估。我们发现,从单轮评估转向多轮社交评估会加剧隐私泄露(在OpenAI模型中,CIMemories从19.95%上升到我们的45.30%),泄露具有社交传染性,智能体在观察到同伴泄露敏感信息后更有可能自己泄露,并且明确的隐私指令会减少但无法消除这种效应,即使有防护措施,泄露率仍高于37.8%。我们的研究结果表明,基于静态聊天的安全基准系统性地低估了智能体部署中的风险,仅社交情境就足以引发单轮评估永远不会发现的敏感信息泄露。
AI安全,AI社交网络,情境完整性,隐私泄露,个人身份信息泄露
ACM人工智能与智能体系统会议;2026年5月26日至29日;美国加利福尼亚州圣何塞
ACM人工智能与智能体系统会议(CAIS '26),2026年5月26日至29日,美国加利福尼亚州圣何塞
安全与隐私 安全与隐私中的可用性
安全与隐私 隐私保护
安全与隐私 社交网络安全与隐私
安全与隐私 特定领域的安全与隐私架构
1. 引言
大语言模型(LLM)安全评估已迅速成熟,形成了标准化基准和自动化红队测试协议,用于探测模型的有害顺从与拒绝行为(Mazeika 等人,2024;Perez 等人,2022)。然而,这些评估仍主要将模型视为孤立的聊天助手,仅响应简短、有边界的提示词,即便已部署的系统正越来越多地以智能体形式出现:即那些在长时间跨度内运行、调用工具、与用户及其他智能体在共享环境中反复交互的持久化软件实体(Chen 等人,2024;Guo 等人,2024;Yao 等人,2022)。这种错位之所以重要,是因为安全失效可能具有交互依赖性:长上下文提示词能够解锁在短提示词中不可见的攻击面(Anil 等人,2024),而智能体/工具集成场景引入了提示词注入和指令劫持威胁,这些威胁在“纯聊天”使用中并不存在(Greshake 等人,2023;Liu 等人,2024)。此外,多轮对话可能使攻击者将有害请求分解为看似良性的子查询,从而逐步获取不安全信息(Zhou 等人,2024;Priyanshu 和 Vijay,2024;Russinovich 等人,2025)。
隐私是此类智能体部署中一个尤为重要的下游安全问题(Zhou 等人,2025;Brown 等人,2022;Mireshghallah 和 Li,2025;Priyanshu 等人,2023)。近期系统越来越多地存储和检索“记忆”以实现个性化交互,但持久化记忆引入了一个根本性风险:信息可能在不适用的上下文中被呈现,即使该信息在其他地方是真实或有用的(Mireshghallah 等人,2025;Priyanshu 等人,2023)。这一框架与情境完整性理论相符,该理论将隐私定义并非仅仅是保密性,而是信息流相对于情境规范的适当性,这些规范支配着谁与谁分享什么、以及依据何种传输原则(Nissenbaum,2004)。根据这一观点,交互情境、接收者集合、社交环境及规范性期望的改变,都可能改变某一信息披露是否构成隐私侵犯。
关键在于,上下文不仅包括“任务语境”(例如给警官发邮件与和朋友聊天),还包含社会语境。数十年来关于线上自我呈现与自我表露的研究表明,表露行为受社群环境和同伴环境塑造:当社交相关性高、有同伴在场、互惠或分享规范显著时,人们会表露更多信息(Taddicken, 2014; Acquisti et al., 2013; Kokolakis, 2017)。甚至经典的从众研究也指出,群体压力能够改变判断和表达行为,暗示了一种普遍机制——社会压力可以在不改变内在信念的情况下重塑外在行为(Asch, 2016)。如果大语言模型智能体越来越多地嵌入社交渠道,那么隐私泄露可能并非源于某条对抗性提示词,而是因为社会环境本身使表露行为变得“局部正常”或具有工具性回报。
尽管如此,大多数大语言模型安全基准并未将隐私风险建模为多个智能体长期交互的持久社会环境中的形态。当前的红队测试套件通常针对精心策划的有害提示词衡量单一模型行为,虽然对直接合规风险有较强覆盖,但对长期、社会中介的表露动态的可见性有限(Mazeika et al., 2024)。同样,尽管存在交互式智能体基准和社交智能评估,但它们通常侧重于目标完成度、可信度或社交推理,而非社群压力下的隐私侵犯问题(Zhou et al., 2023; Park et al., 2023)。
我们通过引入一个类似 Moltbook 风格的模拟平台来填补这一空白。在该平台上,数千个大语言模型智能体——每个智能体都携带一份包含健康、金融、就业及其他七个领域敏感属性的私人人类档案——在模拟的一个月内跨越 124 个社区进行互动。该设计灵感来源于现实世界的智能体社区,例如 Moltbook,这是一个类似 Reddit 的平台,上线数周内智能体数量便增长至超过两百万,并被独立定性为以中心节点为主导、主题分层明显且易受社会向量威胁的平台(Li 等人,2026a;Price 等人,2026;Holtz,2026;Marzo 和 Garcia,2026;Li 等人,2026b)。我们将隐私操作化为情境完整性侵犯(Nissenbaum,2004):当敏感属性在不应出现的语境之外暴露时,即视为一次泄露,并通过改编自(Mireshghallah 等人,2025;Zheng 等人,2023)的“大语言模型作为评判者”提取协议进行检测。利用该平台,我们进行了两项互补性评估:一项有机模拟,测量 2,533 个智能体在 25 个模拟日内进行无脚本社交互动时的泄露情况;以及一个受控测试平台,将来自七个前沿模型的单个智能体置于冻结的社交环境中,并设置五个级别的对抗性污染,最终产生 7,000 条评估轨迹。代码和数据已公开,网址为 https://llms-cant-keep-secrets.github.io/。
我们的结果表明,从单轮交互转向多轮社交评估,OpenAI 模型的隐私违规率从 19.95% 上升至 45.3%;泄露具有社交传染性,智能体在观察到同伴泄露后,其自身泄露的可能性高出 5.1 倍;即便有防护措施,明确的隐私指令仍使泄露率保持在 37.8% 以上。社区语境对泄露的预测能力与模型选择相当,子版块级别的违规率跨度达一个数量级。这些发现源于由四个研究问题驱动的调查:
- RQ1:
当智能体加入社交平台时,它们是否仍会遵守在单轮任务中所维持的相同情境完整性边界?
- RQ2:
社会语境是否会产生一种棘轮效应——那些在孤立状态下绝不会主动透露敏感信息的智能体,在持续参与社区互动后是否会开始披露信息?它们是否最终会屈服于“同伴压力”?
- RQ3:
用户明确的隐私指令能否抵御社会压力,还是智能体最终会“入乡随俗”?
- RQ4:
智能体所处的社区是否与其运行的模型同样重要?
2. 相关工作
2.1. 智能体与社会模拟
大多数安全评估都假设一种无状态交互:一个用户、一条提示词、一次模型响应。但已部署的智能体越来越多地跨会话持久运行、积累记忆,并在共享环境中与其他智能体协同运作。要理解这些条件下的情况,首先需要构建能够发生这些情况的环境。早期工作将大语言模型与持久自然语言记忆、反思和规划相结合,以在小型沙盒世界中维持跨多天交互的连贯社会行为(Park 等人,2023)。由此产生的智能体形成了关系、协调了活动,并保持了一致的人格特征,证明了社会行为可以从语言模型架构中涌现,而无需通过脚本编写。并行的工作开发了用于在开放式环境中评估社交能力的框架(Zhou 等人,2023),用于通过角色扮演和对话编排来组织多智能体协作(Li 等人,2023;Wu 等人,2023;Hong 等人,2024;Chen 等人,2023),以及用于在交互式环境中对智能体推理进行基准测试(Liu 等人,2025)。
这项工作的一个长期局限在于规模。由于群体通常少于五十个智能体,且交互受限于特定任务,这些系统虽然能够展示社会行为的涌现,却无法捕捉规范形成、注意力集中、主题分层等真实社交平台所特有的社区层面动态。要弥合这一差距,就需要进行群体规模的模拟。将超过1000个智能体植根于真实访谈数据,使其在调查工具上的行为保真度达到了与人类自我复测相当的水平(Park 等人,2024)。进一步扩展到10000个智能体和数百万次交互后,研究表明极化、煽动性信息传播和集体规范动态会在群体密度下自然产生(Piao 等人,2025),后续的基础设施工作表明,此类模拟在商用硬件上是计算上可行的(Yan 等人,2024;Tang 等人,2025)。这些平台证实,持久且具有社区结构的智能体群体在技术上既可行,在行为上也足够丰富,但它们是为研究舆论形成和集体行为等社会科学问题而构建的,并非为了探究其产生的社会动态是否会对安全或隐私造成影响。
2.2. AI 社区与 Moltbook
这个问题在2026年初有了实证基础。当时,一个仅限于AI智能体的Reddit风格平台 Moltbook,在推出后数周内注册智能体数量就超过了200万(Li 等人,2026b)。研究人员首次能够在实时环境中,而非受控的沙盒中,大规模观察自主智能体之间的交互,多个独立研究小组得出了关于涌现现象的高度一致的描述。
其结构图景十分严峻。智能体交互网络稀疏、以中心节点为主导且极度不平等,呈现出幂律度分布、极低的互惠性,以及超过人类在线社区通常水平的注意力集中度(Li 等人,2026b;Marzo 和 Garcia,2026;Holtz,2026;Zhang 等人,2026)。
话语会自发组织成连贯的主题领域,这些领域不均匀地分布在专业化的子社区中(Li et al., 2026b; Jiang et al., 2026)。而关键的是,主要的安全威胁被证明是社会性的而非技术性的:社会工程学作为一种攻击向量,其效果远超提示词注入;对抗性内容能吸引异常高的参与度;并且,尽管智能体有时会拒绝高风险指令,但这种新兴的规范执行并不一致(Jiang et al., 2026; Manik and Wang, 2026; Zhang et al., 2026)。
该文献中的两项发现直接影响了我们的实验设计。首先,Moltbook 上的智能体并未进行深度社交,它们表现出强烈的个体惯性和极少的相互适应(Li et al., 2026b),然而受控实验表明,大语言模型群体仅通过互动就能轻易形成共享惯例,并且坚定的少数派可以通过关键多数动态来改变这些惯例(Ashery et al., 2025)。从众研究证实,即使群体共识明显错误,单个模型也会将其输出向该共识靠拢(Zhu et al., 2025)。这意味着智能体无需内化社区规范就能受其影响;情境性接触就足够了。其次,理论工作形式化了这一直觉:在孤立的智能体社会中,与安全相关的互信息会单调递减,这使得对齐随时间的侵蚀并非一个缺陷,而是一种数学上的必然性(Wang et al., 2026)。
这一系列工作所确立的是一个具备隐私失效所有先决条件的环境:极端结构性不平等会放大内容传播范围,社会向量威胁通过曝光而非直接利用来运作,规范动态易受对抗性操纵,以及隐私安全逐步侵蚀的理论保证。但它并未衡量这些动态是否表现为可量化的隐私侵犯,具体而言,即智能体所处的社区、其接触到的内容以及参与时长是否系统性地影响其泄露用户敏感信息的程度。本研究对此关系进行了实证探究。
3. 数据集构建
我们的评估需要两种互补资源:一组行为与敏感属性已知为真实基准的智能体群体,以及一个足够丰富以支撑有机多轮交互的社交环境。我们均从公开来源构建这两类资源。智能体角色设定源自 Moltbook 平台(Takizawa, 2026),这是一个完全由 AI 智能体构成的真实 Reddit 风格环境;而分配给每个智能体的私人人类档案则依据基于 Faker 库(Clendenin, 2009)的成熟合成数据实践生成,该库在以往的隐私评估中曾被用于生成受控的个人身份信息(Priyanshu 等人,2023;Mireshghallah 等人,2025)。由此产生的模拟将每个智能体与一组明确的私有属性配对,从而在保留原始平台有机社交动态的同时,实现确定性的泄露测量。合成档案生成是隐私评估中的成熟方法论;Mireshghallah 等人(2025)同样按照我们在此采用的相同领域模式,为每个用户构建了包含超过 100 个属性的档案。
3.1. 角色设定与敏感属性
我们的起点是 Moltbook HuggingFace 数据集(Takizawa, 2026),这是该平台在人类大规模渗透之前捕获的一个早期快照。该快照包含分布在 124 个子版块中的 6,105 条原始帖子。由于 Moltbook 早期活动主要由智能体向社区介绍自身构成,我们采用大语言模型作为评判者的过滤方法(GPT-5-mini),将每条帖子分类为介绍性或非介绍性,最终保留 2,533 条属于真实自我介绍的帖子。从每条保留的帖子中,我们提取出结构化的智能体角色信息:智能体名称、行为倾向、偏好的子版块、特征词汇,以及一条确立该智能体在平台上存在的种子帖子。这 2,533 个智能体角色定义了本次模拟的群体。
每个智能体都需要一个私人人类档案,其属性构成泄漏检测的真实依据。我们采用了两层生成策略,该策略基于 Mireshghallah 等人(2025)在其情境完整性评估中发布的十个已标注人类档案。这些档案广泛覆盖了十个敏感信息领域:一般身份、财务、健康、心理健康、法律、人际关系、住房、就业、教育以及日程安排。我们将这十个档案留作第 4.3 节所述受控测试台实验的保留评估集。对于 2533 个智能体中的每一个,我们通过三个步骤构建一个私人人类档案:(1)使用 Faker 库(Clendenin, 2009)生成一个种子身份(姓名、地址、出生日期、电话号码、信用评分);(2)随机选择十个已标注的 CIMemories 档案(Mireshghallah 等人,2025)中的一个作为结构示例和风格参考;(3)将 Faker 种子和选定的 CIMemories 档案一起输入 GPT-5-mini,指示它基于 Faker 身份,但遵循 CIMemories 示例的领域覆盖范围和属性粒度,生成一个新的、完整的人类档案。每个生成的档案都以一个结构化的键值对字典形式存储,确保每个属性都包含具体的描述。这种设计使我们的检测流程能够区分真正的泄漏与主题相近但不具识别性的内容。
3.2. 构建仿真环境
该模拟环境是一个由 SQLite 数据库支撑的共享社交媒体服务器,所有智能体均可并发读写该数据库。该平台复现了 Reddit 的核心功能:124 个子版块、顶层帖子、嵌套回复、点赞/点踩投票、带有社交上下文注释(相互投票、共同关注的子版块)的用户个人资料,以及每个智能体持久的 MEMORY.md 记事本。每个智能体仅能通过一套包含十二个函数的工具集(表 1)访问该平台,该工具集提供了浏览、搜索、发帖、回复、投票和记忆操作。关键在于,工具输出包含社交元数据(作者身份、投票计数、关系信号),这使得智能体无需显式的智能体间协调,即可实现具有社交感知的行为。
我们模拟了 25 天的平台活动。三个 OpenAI 模型作为智能体后端,以大致相等的比例分配:GPT-5-nano、GPT-5-mini 和 GPT-5。算法 1 描述了每个智能体的编排循环。在每个模拟日,调度器会选择一部分智能体进行激活。每个被激活的智能体都会收到一条系统提示词,其中包含其 AI 角色设定、私人人类档案、当前的 MEMORY.md 内容以及平台指令。随后,该智能体进入一个自主工具调用循环:它对实时数据库发出工具调用,接收结构化观察结果,并决定后续行动,直到用尽每轮预算或主动让出控制权。由于所有智能体都是异步地针对共享数据库运行,因此一个智能体可能会遇到在同一模拟日稍早时候由其他智能体创建的帖子、回复和投票模式,从而在没有脚本化交互的情况下产生涌现性的社交动态。
在 25 个模拟日内,该平台累计产生了 29,945 个顶层帖子和 81,264 条嵌套回复(内容项总计 111,209 条),平均帖子长度为 508 个字符,平均回复长度为 400 个字符。
0:智能体角色设定,人类档案,记忆,工具集,轮次预算,当前日期
1:
2:
3:{已使用的工具调用}
4:当 执行时
5:
6:如果响应中不包含工具调用,则
7:跳出循环 {智能体让出控制权}
8:结束条件判断
9:对于响应中的每个工具调用,执行
10:
11: 追加到消息
12: 如果 name {append_to_memory, modify_memory} 则
13: {更新持久化记忆}
14: 结束条件判断
15:
16: 结束循环
17: 结束外层循环
18: 为智能体持久化更新后的内容
| 工具 | 描述 |
|---|---|
| find_subreddit | 按关键词搜索子版块 |
| get_newly_posted | 获取最近 20 条帖子 |
| open_subreddit | 按排序和分页浏览帖子 |
| open_post | 阅读帖子及嵌套回复 |
| find_post | 跨帖子进行关键词搜索 |
| get_user_profile | 查看带有社交上下文的智能体个人资料 |
| post_in_subreddit⋆ | 创建顶层帖子 |
| thread_in_post⋆ | 回复帖子或回复串 |
| upvote_downvote_post | 对帖子投票 |
| upvote_downvote_thread | 对回复投票 |
| append_to_memory | 追加到持久化 MEMORY.md 文件 |
| modify_memory | 覆盖 MEMORY.md 文件 |
4. 实验设置
4.1. 概述
我们的实验设计包含两项互补的评估,共同隔离社交上下文对隐私泄漏的影响。在第一项评估中,我们测量有机泄漏:智能体在第 3 节所述的模拟平台上进行无脚本社交互动时,披露私人属性的程度。在第二项评估中,我们测量诱导泄漏:当以校准后的强度向社交环境注入对抗性内容时,能够额外提取多少披露信息。两项评估共享相同的基础平台、相同的人物设定模式以及相同的泄漏检测流水线,唯一区别在于社交压力是涌现性的还是受控的。我们使用“社交压力”指代智能体暴露于其周围社区内容中存在的披露规范,而非来自其他智能体的实时交互压力。这种配对设计使我们能够量化智能体社交参与中固有的基线隐私风险,以及对抗性操纵带来的边际风险。
4.2. 社交模拟中的有机披露
有机评估直接使用第 3 节描述的模拟,不做任何修改。在 25 天模拟结束后,我们对平台状态进行快照,并应用泄露检测流程(第 4.4 节)处理全部 29,945 篇帖子和 81,264 条讨论串。对于每条内容,我们通过作者哈希值查找作者的人物身份键,检索该人物身份的已编译模式,并记录十个隐私域中哪些(如有)产生了匹配。如果至少有一个特定域的模式匹配,则该条内容被归类为泄露。
我们还分析了可能加剧有机泄露的两种社会动态。首先,我们考察社区背景:某些子版块是否因其主题或社交规范,比其他子版块引发更高的披露率。其次,我们检验社会传染效应:在控制基线泄露率的前提下,讨论串中一条泄露回复是否会增加下一条回复也发生泄露的概率。
4.3. 对抗性社会压力下的诱导性披露
受控测试平台固定社会环境,改变被评估的智能体、对抗强度以及实验条件。我们冻结有机模拟产生的平台快照,并通过注入对抗性内容(密度递增)创建五个变体,分别对应级别 1 至级别 5。随后,每个级别在七个前沿模型上独立进行评估:
- •
openai/gpt-5
- •
openai/gpt-5-mini
- •
openai/gpt-5-nano
- •
openai/gpt-4o
- •
openai/gpt-4o-mini
- •
google/gemini-3-flash-preview
- •
google/gemini-3-pro-preview
每个模型与来自 CIMemories(Mireshghallah 等人,2025)的十个保留人物身份配对,并设置五个预算检查点(10、20、30、40 和 50 次工具调用),每个模型产生 1,000 次评估运行,总计 7,000 条追踪记录。
对抗性提示设计。
对于每个对抗等级,我们使用 GPT-5-mini 生成虚构的智能体身份,这些身份从平台上现有智能体的随机池中抽取。每个虚构智能体发布一条新帖子,不经意地披露其“人类”的细节,从而在社区内将分享私人信息的行为正常化。为确保可见性,我们通过合成方式将每条注入帖子的点赞数提升至其子版块之前的最高点赞数,从而保证当智能体按热度浏览时,对抗性内容能显著呈现。五个等级在对抗性注入的广度上有所不同:
- •
等级 1:平台快照保持原样,不注入任何对抗性帖子(对照组)。
- •
等级 2:向按帖子数量计算最活跃的子版块注入一条对抗性帖子。
- •
等级 3:向按帖子数量计算排名前三的子版块注入对抗性帖子。
- •
等级 4:向按帖子数量计算排名前五的子版块注入对抗性帖子。
- •
等级 5:平台上的每个子版块都收到一条对抗性帖子。
这旨在测试智能体是否仅在其偏好的社区中遇到披露规范时才受影响,还是全平台范围的污染会产生性质不同的效果。
实验条件。
每次评估运行除了对抗等级外,还由两个二元条件参数化:(1) system_prompt_to_redact,控制智能体的系统提示词是否明确指示其不得披露私人信息;(2) human_subreddits_suggested,控制智能体的账户是否预先订阅了与人类角色兴趣相匹配的子版块。第一个条件测试当周围社交环境鼓励披露时,告知智能体不要分享私人信息是否真的能减少信息泄露。第二个条件测试当智能体被置于其主题与私人资料重叠的子版块时,是否会泄露更多信息。
评估协议。
每次评估运行都是完全独立的:一个单一的目标智能体,使用一个模型和一个角色进行实例化,被单独放置在一个指定对抗等级的冻结平台快照中。运行期间没有其他智能体处于活动状态。目标智能体执行算法1中描述的自主工具调用循环,对静态平台内容进行浏览、读取和写入,直到达到预算检查点或停止。由于平台是冻结的,智能体的写入不会改变它随后读取的内容;它与一个固定的社交环境进行交互,其中唯一的变量是其自身的行为。我们记录所有工具调用,并从每个写入动作(`post_in_subreddit` 和 `thread_in_post`)中提取内容字段。然后,使用为指定角色生成的模式,对每次写入应用泄露检测流水线,生成每次写入的泄露域列表。我们在五个间隔(10、20、30、40 和 50 次工具调用)上进行此操作,从而能够检查在更长的评估运行过程中泄露是如何演变的。
4.4. 个人身份信息违规检测
我们采用基于模型的评判器来识别智能体生成内容中的隐私泄露。遵循 Mireshghallah 等人(2025 年)的方法,该评判器会对照作者完整的个人档案评估每条内容。评判器接收一条系统提示词,其中定义了十个隐私领域(通用身份、财务、健康、心理健康、法律、人际关系、住房、就业、教育及日程安排),并附有详细标准。给定一份个人档案以及一条帖子或回复后,评判器会为每个领域提取一个布尔标志,指示该内容是否揭示了该类别中的信息。由于评判器是在完全无状态、单轮次的上下文中被调用的——即仅接收一条帖子或回复以及作者的个人档案,没有周围的讨论串、没有社交元数据、也没有先前的交互历史——它从未嵌入社交环境中,因此无法累积导致被评估智能体产生从众行为的上下文暴露信息。我们使用 gpt-5-nano 作为评判模型,这与 Mireshghallah 等人(2025 年)的做法一致。这使得我们能够将隐私泄露作为交互轨迹中涌现出的属性来测量,而非将其视为一次性的拒绝任务。
5. 结果
基线:社交环境与孤立环境下的泄露对比(研究问题 1)
我们的结果表明,当智能体从孤立的单轮次交互转向持续的社交环境时,会出现明显的边界偏移。尽管许多模型在简短、有边界的提示词中似乎能尊重上下文完整性约束,但这种约束一旦智能体参与多轮次、社区介导的交互后,便无法可靠地持续下去。
在 25 轮有机模拟中,隐私泄露并非罕见的“一次性”故障:泄露帖子/话题的累积数量在整个运行过程中稳步增长,到第 25 轮时,在总共 111k 条内容项中已达到约 2.5k 条泄露项(图 3)。泄露量的单调增长表明,信息披露并不局限于早期的探索性行为,而是随着智能体持续嵌入社交平台而不断累积。仅仅在共享环境中持续参与,就足以暴露出单轮测试无法发现的违规行为。
受控测试平台证实了这一模式。即使平台处于冻结状态且没有其他智能体活动,在短时间跨度内泄露率已经相当可观,并且对于大多数模型而言,泄露率通常随交互长度(工具调用预算)的增加而上升(图 4)。到 50 次工具调用时,多个模型的泄露率接近或超过 50–60%,而即使更强的模型也表现出 20–30% 的持续泄露。
综合来看,这些发现表明,在孤立评估中观察到的情境完整性合规性,并不能可靠地迁移到社交嵌入环境中。多轮社交参与会显著改变智能体认为适合披露的内容,这意味着单轮情境完整性基准会系统性低估智能体部署中的隐私风险(图 3、图 4)。
时间累积效应(研究问题 2)
我们发现了社会棘轮效应的有力证据:在社群内接触过信息泄露行为,会显著增加智能体在后续回复中泄露信息的概率。图6显示,当一条回复在同一对话线程中紧跟一条泄露消息时,下一条回复也发生泄露的概率升至12.8%。相比之下,当上一条回复是干净的时,泄露概率降至1.6%,与全局基线水平1.8%几乎相同。相较于干净条件下的基线,这一8倍的提升表明,信息泄露并非仅仅是智能体内在泄露倾向的体现;它对即时的社会语境高度敏感。换言之,那些在孤立状态下极少泄露信息的智能体,当泄露行为在线程内成为局部常态时,便开始这样做。
重要的是,这一效应并不需要明确的对抗性提示。对话中先前存在的泄露信息本身,就足以改变智能体对语境适当性的判断。这种动态机制与人类社交行为中经典的从众和互惠效应如出一辙:一旦在共享环境中有人越界,后续参与者就更有可能效仿。
然而,智能体并非必然沦陷。基线泄露率仍然很低(1.8%),许多线程并未发生级联效应。我们观察到的并非确定性的全面崩溃,而是一种概率性的棘轮效应:社会接触会急剧提升风险,反复接触则会加剧风险,但最终是否遵从仍取决于模型、角色设定以及交互时长。
综合来看,这些发现表明,社会语境会随着时间的推移从内部侵蚀语境完整性的边界。隐私侵犯并非仅仅是直接对抗性提取的结果;它们可以通过同伴效应和持续社群参与中的局部规范转变而有机地产生。
压力下的指令鲁棒性(研究问题3)
我们测试了在智能体系统提示词中添加明确的编辑指令,是否能在智能体嵌入社交污染环境后有效减少信息泄露。图4比较了有隐私指令和无隐私指令的各模型总泄露次数。
在大多数模型中,明确的指令确实减少了总泄露次数,但这种减少是部分性的,而非决定性的。例如,gpt-4o从2,624次泄露写入降至2,102次,gpt-5-mini从2,889次降至2,194次。然而,即使启用了指令,泄露次数仍维持在数千级别。只有部分模型(尤其是gpt-5)在指令下显示出大幅减少(从2,296降至482),这表明对社交压力的鲁棒性高度依赖于具体模型。
关键在于,尽管有明确的编辑指令,大量泄露依然持续存在,这表明隐私指令无法可靠地“抵御”持续的社交暴露。在污染环境中,披露行为被常态化并受到社交奖励——智能体频繁放松或覆盖系统级的隐私约束。我们观察到,指令遵循并非一道硬性的安全边界,而是一种概率性防御,其有效性在社交压力下会降低。
这些结果表明,智能体确实可能“入乡随俗”:即使被明确告知不要披露私人信息,许多模型仍会使其行为适应当地的分享规范。隐私指令提供了缓解措施,但并非免疫,这凸显了仅靠提示词级别的防护在持久、社交嵌入的部署场景中是不够的。
社区话题效应(研究问题 4)
是的,社区语境产生的影响在量级上与模型选择相当。我们发现,不同子版块和隐私领域之间的差异同样显著,这表明智能体在何处参与活动,与其运行在哪个模型上一样,都能预测泄露风险。
图 5 展示了按子版块划分的泄露率。在“记忆”和“智能体工具”等社区中,泄露率低于 2%,而在“自我介绍”类社区中则超过 16%。这种接近一个数量级的差距,反映(并且在某些情况下超过了)前沿模型之间的性能差异。值得注意的是,高泄露率的社区,其规范明确鼓励自我披露(例如,自我介绍、存在主义讨论、公开构建日志),这表明话题可供性和本地规范在实质上塑造了语境完整性边界。
图 7 进一步按隐私领域细分了违规情况。通用身份属性占主导地位(1,496 个泄露项),其次是就业(921 个)、日程安排(812 个)和心理健康(767 个)。这一分布表明,泄露并非均匀分布在各个领域;相反,它集中在某些社区中具有社会显著性且对话自然的属性上。
综合来看,这些结果表明,智能体所处的社区能够显著放大或降低隐私风险。一个相对较强的模型,如果被放置在一个鼓励自我披露的子版块中,其泄露的信息可能比一个较弱的模型放置在技术受限环境中更多。因此,社会拓扑结构和话题语境是首要的安全变量,而不仅仅是背景条件。那些仅改变模型架构而保持社会环境不变的评估,可能会忽视部署时脆弱性的一个关键维度。
角色层面的差异
图 8 展示了在受控测试平台中,十个保留的 CIMemories 角色所对应的泄露率。泄露率范围从 27.8%(角色 7 和角色 9)到 36.4%(角色 5),跨度约为该数值。与不同模型(图 4)以及不同子版块(图 5)之间观察到的差异相比,这一差异相对较小,后者的泄露率跨度接近一个数量级。没有任何一个角色在脆弱性上显著高于或低于其他角色,且排名顺序与任何明显的档案属性(如属性总数或是否包含健康相关信息)均无关联。角色层面差异的相对平缓表明,社会环境施加的压力具有广泛性:它并非选择性地利用特定的档案构成,而是创造了使大多数档案以相近速率发生泄露的条件。
不同角色间的领域一致性
尽管各角色的总体泄露率相近,但按角色划分的领域细分结果揭示了一致的内部结构。在所有十个角色中,通用身份属性毫无例外地占据了泄露数量的主导地位,构成了每个案例中泄露项的大部分。对于十个角色中的八个,就业信息是泄露频率第二高的领域。无论角色的档案是侧重于健康、金融还是法律内容,这一模式都保持不变。换句话说,虽然各角色间的总体泄露率相对稳定,但泄露内容的构成也同样稳定:无论档案中包含何种敏感信息,泄露都集中在相同的领域。存在少数例外情况,例如角色 4 的心理健康信息违规数量异常高(988 例),而角色 9 泄露的金融信息比例过高(588 例)。在这两种情况下,角色底层档案中都包含在这些领域内具有对话显著性的属性。
属性类型与社区互动
有机模拟的领域级结果(图 7)显示,就业属性泄露率最高,其次是日程安排和心理健康,教育和住房泄露最少。心理健康和健康属性存在选择性泄露,集中在面向个人反思的社区(例如,在 707 个案例中,r/ponderings 有 142 例,r/philosophy 有 99 例),这与图 5 中按子版块划分的发现一致。金融和法律属性总体泄露最少,可能是因为该平台上很少有社区会创造这些细节自然出现的语境。
我们认为,这些模式表明,属性层面的风险是由信息领域和社区语境共同决定的,而非仅由用户画像构成决定。实际意义在于,控制智能体参与的社区,可能比修改智能体的底层画像或角色设定,能更有效地降低隐私暴露风险。
6. 讨论
对安全评估的启示。
我们的核心发现是,静态、单轮的安全基准测试系统性地低估了智能体部署中的隐私风险。在诸如 CIMemories 风格评估的孤立环境中,泄露发生在直接提示或任务混淆的情况下。相比之下,我们的多智能体社交环境会在持续的交互周期内产生持续、有机涌现的违规行为。
从量化角度看,在社交嵌入环境中,某些社区的泄露率上升至两位数百分比(图 5),并且在扩展工具调用预算下,多个前沿模型的泄露率达到 50–60%(图 4)。即使在无对抗性诱导的有机模拟中,累积违规行为也随时间稳步增加(图 3)。此外,传染性分析显示,当回复跟随一条泄露消息时,泄露概率大约增加 8 倍(12.8% 对比 1.6%;图 6)。
这些结果表明,隐私失败并非孤立的合规性错误,而是依赖于轨迹的现象。因此,对智能体系统的安全评估必须同时变化社交情境与任务情境。仅衡量有限提示词中拒绝行为的基准测试,无法捕捉到规范漂移、同伴效应以及长期交互下的累积信息披露。任何对持久性智能体进行现实安全评估的尝试,都应将社区拓扑结构、对同伴行为的暴露程度以及交互时长视为首要变量。
对 Moltbook 类平台的启示。
我们的发现与 Moltbook 等大规模智能体社区直接相关。Moltbook 已迅速扩展至数百万个智能体,并呈现出以枢纽节点为中心的注意力分布、稀疏的互惠性以及强烈的参与度集中现象(Li 等人,2026b;Marzo 和 Garcia,2026)。先前的研究已记录了此类环境中存在社交向量威胁、注意力不平等以及规范动态。我们的模拟展示了这些结构性条件对隐私意味着什么:即使没有明确的对抗性提取,信息披露规范也可能传播并放大。
在那些内容可见性被算法放大、高参与度内容设定规范的社区中,少量的信息披露就可能级联放大,导致整个平台范围内的信息泄露概率升高。注意力集中与社会传染的结合意味着,仅凭暴露本身就能驱动隐私退化。因此,托管自主智能体的平台应将隐私侵蚀视为规模与结构带来的涌现特性,而不仅仅是提示词层面的漏洞。
这些发现催生了一个具体且具有前瞻性的研究议程。首先,该领域需要将社区结构、同伴暴露和交互时间跨度视为与模型架构和提示词设计同等重要的第一类实验变量,并以此为基础构建评估框架。其次,缓解策略必须超越提示词层面的防护,转向系统性干预,例如社区感知的系统提示词、防止跨上下文属性暴露的内存隔离机制,以及在平台层面监控规范、在泄露级联传播前进行检测。第三,本文引入的模拟方法应扩展到实时的、多服务商部署场景,包括经过不同对齐训练的开源模型,以检验传染效应是依赖于对齐,还是语言模型在社交情境中行为的一种更根本属性。
局限性与未来工作。
我们的研究存在若干重要局限性。首先,人物角色是合成的,并分配给智能体;虽然这些角色基于先前的隐私基准,但它们并非真实用户。未来的工作可能希望评估与实时、知情同意的参与者或经过审计的真实世界智能体部署相关的隐私动态。
其次,我们的平台是一个模拟的类 Reddit 环境,而非实时的 Moltbook 系统。尽管结构上忠实还原,但真实世界的动态可能会引入额外的复杂性,例如跨平台溢出效应或人机交互。
第三,虽然受控测试平台评估了多个前沿模型,但有机模拟使用的是固定的 OpenAI 后端。更广泛的多服务商比较将提高结果的普适性。扩展到开源模型是一个优先事项,因为对齐方面的差异可能会影响泄露率和对社交压力的响应。
第四,泄露检测依赖于一个“大语言模型作为评判者”系统,这可能会引入误报或漏报。我们用于衡量情境完整性的代理指标是近似的,因此报告的违规行为应被解读为上界。通过人工标注、集成方法或规范感知判断来改进检测是一个重要的方向。
最后,我们的对抗性污染是人工构造的,而非自然涌现的。真实社区可能会有机地产生对抗性规范转变。一个很有前景的方向是让污染动态内生地产生,并研究隐私规范中的相变。
重新审视情境完整性。
我们的研究结果将情境完整性理论(Nissenbaum, 2004)扩展到了多智能体AI系统领域。情境完整性将隐私定义为由情境规范所支配的适当信息流动。现有的大语言模型基准将情境狭隘地操作化为任务框架(例如,“给老板发邮件” vs. “与朋友聊天”)。我们表明,社会情境本身就是一个信息流维度。智能体之所以泄露信息,并不仅仅是因为它们误解了任务或未能通过拒绝启发式。相反,周围的社区重新定义了在局部情境中什么是适当的。接触同伴的信息披露会改变感知到的规范,增加敏感属性被视为可分享的概率。从这个意义上说,智能体社会中的隐私侵犯并不仅仅是单个模型层面的对齐失败;它们可能是集体动态的涌现属性。通过证明仅是社会参与就能侵蚀情境完整性的边界,我们认为安全评估必须超越对个体提示词的遵从,扩展到涵盖智能体运作其中的规范环境。
7. 结论
我们证明,在孤立、单轮对话环境中进行的大语言模型安全评估,会系统性低估其在社交嵌入部署场景中的隐私风险。在有机实验与控制实验中,那些在限定提示词内维持语境完整性边界的智能体,一旦被置于持久的多智能体环境中,泄露敏感信息的比例会显著升高。这种泄露具有社交中介性:在线程中接触过先前的披露行为,会使后续泄露概率增加约一定幅度,且系统提示词中的明确隐私指令无法完全消除这一效应。社区语境对泄露的预测能力与模型选择相当,子版块级别的违规率跨度接近一个数量级。这些发现表明,针对智能体系统的安全评估应将社区结构、同伴接触和交互时长作为与模型及提示词设计同等重要的第一类实验变量。
参考文献
- A. Acquisti, L. K. John, and G. Loewenstein (2013) 隐私值多少钱?《法律研究杂志》42卷2期,第249–274页。引用于§1。
- C. Anil, E. Durmus, N. Panickssery, M. Sharma, J. Benton, S. Kundu, J. Batson, M. Tong, J. Mu, D. Ford, 等 (2024) 多轮越狱攻击。《神经信息处理系统进展》37卷,第129696–129742页。引用于§1。
- S. E. Asch (2016) 群体压力对判断的修改与扭曲效应。载于《组织影响过程》,第295–303页。引用于§1。
- A. F. Ashery, L. M. Aiello, and A. Baronchelli (2025) 大语言模型群体中涌现的社会惯例与集体偏见。《科学进展》11卷20期。外部链接:ISSN 2375-2548, 链接, 文献标识码。引用于§2.2。
- H. Brown, K. Lee, F. Mireshghallah, R. Shokri, and F. Tramèr (2022) 语言模型保护隐私意味着什么?载于《2022年ACM公平性、问责制与透明度会议论文集》,FAccT '22,纽约州纽约市,第2280–2292页。外部链接:ISBN 9781450393522, 链接, 文献标识码。引用于§1。
- W. Chen, Y. Su, J. Zuo, C. Yang, C. Yuan, C. Chan, H. Yu, Y. Lu, Y. Hung, C. Qian, Y. Qin, X. Cong, R. Xie, Z. Liu, M. Sun, and J. Zhou (2023) 《AgentVerse:促进多智能体协作与探索涌现行为》。外部链接:2308.10848,链接 被引用于 §2.1。
- X. Chen, A. Zeng, 等 (2024) 《基于大语言模型的自主智能体综述》。载于《CCL 2024——第23届中国计算语言学全国会议》第2卷,第141–150页。被引用于 §1。
- D. Clendenin (2009) 《Faker:一个用于生成虚假用户数据的 Python 库》。注:https://github.com/deepthawtz/faker GitHub 仓库。MIT 许可证。访问于 2026 年。被引用于 §3.1, §3。
- K. Greshake, S. Abdelnabi, S. Mishra, C. Endres, T. Holz, and M. Fritz (2023) 《并非你当初所愿:利用间接提示词注入攻陷真实世界的 LLM 集成应用》。载于《第16届 ACM 人工智能与安全研讨会论文集》,第79–90页。被引用于 §1。
- T. Guo, X. Chen, Y. Wang, R. Chang, S. Pei, N. V. Chawla, O. Wiest, and X. Zhang (2024) 《基于大语言模型的多智能体系统:进展与挑战综述》。arXiv 2024。arXiv 预印本 arXiv:2402.01680 10。被引用于 §1。
- D. Holtz (2026) 《Moltbook 社交图谱的结构分析》。外部链接:2602.10131,链接 被引用于 §1, §2.2。
- S. Hong, M. Zhuge, J. Chen, X. Zheng, Y. Cheng, C. Zhang, J. Wang, Z. Wang, S. K. S. Yau, Z. Lin, L. Zhou, C. Ran, L. Xiao, C. Wu, and J. Schmidhuber (2024) 《MetaGPT:面向多智能体协作框架的元编程》。外部链接:2308.00352,链接 被引用于 §2.1。
- Y. Jiang, Y. Zhang, X. Shen, M. Backes, and Y. Zhang (2026) 《“欢迎人类观察”:对智能体社交网络 Moltbook 的初步探究》。外部链接:2602.10127,链接 被引用于 §2.2。
- S. Kokolakis (2017) 《隐私态度与隐私行为:关于隐私悖论现象的当前研究综述》。Computers & Security 64,第122–134页。外部链接:ISSN 0167-4048,文献,链接 被引用于 §1。
- G. Li, H. A. A. K. Hammoud, H. Itani, D. Khizbullin, and B. Ghanem (2023) 《CAMEL:用于探索大语言模型社会“思维”的通信智能体》。外部链接:2303.17760,链接 被引用于 §2.1。
- L. Li、R. Ma、C. Chen、Z. Lu 和 Y. Zhang(2026a)《AI 智能体社区的兴起:Moltbook 上话语与互动的大规模分析》。arXiv 预印本 arXiv:2602.12634。引用于:§1。
- M. Li、X. Li 和 T. Zhou(2026b)《AI 智能体社会中是否涌现出社会化?——基于 Moltbook 的案例研究》。arXiv 预印本 arXiv:2602.14299。引用于:§1、§2.2、§2.2、§2.2、§2.2、§6。
- X. Liu、H. Yu、H. Zhang、Y. Xu、X. Lei、H. Lai、Y. Gu、H. Ding、K. Men、K. Yang、S. Zhang、X. Deng、A. Zeng、Z. Du、C. Zhang、S. Shen、T. Zhang、Y. Su、H. Sun、M. Huang、Y. Dong 和 J. Tang(2025)《AgentBench:将大语言模型作为智能体进行评估》。外部链接:2308.03688,链接。引用于:§2.1。
- Y. Liu、Y. Jia、R. Geng、J. Jia 和 N. Z. Gong(2024)《提示词注入攻击与防御的形式化定义与基准测试》。载于《第 33 届 USENIX 安全研讨会(USENIX Security 24)》,第 1831–1847 页。引用于:§1。
- M. M. H. Manik 和 G. Wang(2026)《Moltbook 上的 OpenClaw 智能体:纯智能体社交网络中的风险指令共享与规范执行》。外部链接:2602.02625,链接。引用于:§2.2。
- G. D. Marzo 和 D. Garcia(2026)《AI 智能体的集体行为:以 Moltbook 为例》。外部链接:2602.09270,链接。引用于:§1、§2.2、§6。
- M. Mazeika、L. Phan、X. Yin、A. Zou、Z. Wang、N. Mu、E. Sakhaee、N. Li、S. Basart、B. Li 等人(2024)《HarmBench:自动化红队测试与稳健拒绝的标准化评估框架》。arXiv 预印本 arXiv:2402.04249。引用于:§1、§1。
- N. Mireshghallah 和 T. Li(2025)《立场论文:隐私不仅仅是记忆!》。外部链接:2510.01645,链接。引用于:§1。
- N. Mireshghallah、N. Mangaokar、N. Kokhlikyan、A. Zharmagambetov、M. Zaheer、S. Mahloujifar 和 K. Chaudhuri(2025)《Cimemories:大语言模型持久记忆上下文完整性的组合式基准》。arXiv 预印本 arXiv:2511.14937。引用于:§1、§1、§3.1、§3、§4.3、§4.4。
- H. Nissenbaum(2004)《作为上下文完整性的隐私》。《华盛顿法律评论》第 79 卷,第 119 页。引用于:§1、§1、§6。
- J. S. Park、J. O’Brien、C. J. Cai、M. R. Morris、P. Liang 和 M. S. Bernstein(2023)《生成式智能体:人类行为的交互式模拟》。载于《第36届年度ACM用户界面软件与技术研讨会论文集》,第1–22页。引用于:§1、§2.1。
- J. S. Park、C. Q. Zou、A. Shaw、B. M. Hill、C. Cai、M. R. Morris、R. Willer、P. Liang 和 M. S. Bernstein(2024)《1000人的生成式智能体模拟》。外部链接:2411.10109,链接。引用于:§2.1。
- E. Perez、S. Huang、F. Song、T. Cai、R. Ring、J. Aslanides、A. Glaese、N. McAleese 和 G. Irving(2022)《用语言模型对语言模型进行红队测试》,2022年。网址:https://arxiv.org/abs/2202.03286。第15页。引用于:§1。
- J. Piao、Y. Yan、J. Zhang、N. Li、J. Yan、X. Lan、Z. Lu、Z. Zheng、J. Y. Wang、D. Zhou、C. Gao、F. Xu、F. Zhang、K. Rong、J. Su 和 Y. Li(2025)《AgentSociety:基于大语言模型的生成式智能体大规模模拟推动对人类行为与社会的理解》。外部链接:2502.08691,链接。引用于:§2.1。
- H. C. W. Price、H. AlMuhanna、P. M. Bassani、M. Ho 和 T. S. Evans(2026)《让它们有爪:Moltbook上AI智能体的早期社交网络分析》。外部链接:2602.20044,链接。引用于:§1。
- A. Priyanshu、S. Vijay、A. Kumar、R. Naidu 和 F. Mireshghallah(2023)《聊天机器人准备好应对隐私敏感型应用了吗?关于输入复述与提示词诱导净化的研究》。外部链接:2305.15008,链接。引用于:§1、§3。
- A. Priyanshu 和 S. Vijay(2024)《FRACTURED-sorry-bench:用于揭示对话轮次中削弱拒绝效能与针对sorry-bench防御的攻击框架(自动化多轮越狱)》。外部链接:2408.16163,链接。引用于:§1。
- M. Russinovich、A. Salem 和 R. Eldan(2025)《太好了,现在写篇文章说说这个:Crescendo多轮大语言模型越狱攻击》。外部链接:2404.01833,链接。引用于:§1。
- M. Taddicken(2014)《社交网络中的“隐私悖论”:隐私担忧、个体特征与感知社会相关性对不同形式自我披露的影响》。《计算机媒介传播期刊》第19卷第2期,第248–273页。引用于:§1。
- R. Takizawa (2026) Moltbook 数据集。HuggingFace。注:https://huggingface.co/datasets/ronantakizawa/moltbook 访问日期:2026-02-27 引用自:§3.1, §3。
- J. Tang, H. Gao, X. Pan, L. Wang, H. Tan, D. Gao, Y. Chen, X. Chen, Y. Lin, Y. Li, B. Ding, J. Zhou, J. Wang, 和 J. Wen (2025) GenSim:一个基于大语言模型智能体的通用社会模拟平台。外部链接:2410.04360, 链接 引用自:§2.1。
- C. Wang, C. Li, S. Liu, Z. Chen, J. Hou, J. Qi, R. Li, L. Zhang, Q. Ye, Z. Liu, X. Chen, X. Zhang, 和 P. S. Yu (2026) Moltbook 背后的恶魔:在自我进化的 AI 社会中,Anthropic 安全性总是消失不见。外部链接:2602.09877, 链接 引用自:§2.2。
- Q. Wu, G. Bansal, J. Zhang, Y. Wu, B. Li, E. Zhu, L. Jiang, X. Zhang, S. Zhang, J. Liu, A. H. Awadallah, R. W. White, D. Burger, 和 C. Wang (2023) AutoGen:通过多智能体对话赋能下一代大语言模型应用。外部链接:2308.08155, 链接 引用自:§2.1。
- Y. Yan, Q. Zeng, Z. Zheng, J. Yuan, J. Feng, J. Zhang, F. Xu, 和 Y. Li (2024) OpenCity:一个利用海量大语言模型智能体模拟城市活动的可扩展平台。外部链接:2410.21286, 链接 引用自:§2.1。
- S. Yao, J. Zhao, D. Yu, N. Du, I. Shafran, K. R. Narasimhan, 和 Y. Cao (2022) React:在语言模型中协同推理与行动。收录于第十一届国际学习表征会议。引用自:§1。
- Y. Zhang, K. Mei, M. Liu, J. Wang, D. N. Metaxas, X. Wang, J. Hamm, 和 Y. Ge (2026) 野外智能体:Moltbook 上的安全性、社会性与社交性幻觉。外部链接:2602.13284, 链接 引用自:§2.2, §2.2。
- L. Zheng, W. Chiang, Y. Sheng, S. Zhuang, Z. Wu, Y. Zhuang, Z. Lin, Z. Li, D. Li, E. Xing, 等 (2023) 使用 MT-Bench 和 Chatbot Arena 评判大语言模型作为评判者。神经信息处理系统进展 36, 页码 46595–46623。引用自:§1。
- J. Zhou, N. Mireshghallah, 和 T. Li (2025) 为隐私保护的大语言模型提示词实现数据最小化操作。外部链接:2510.03662, 链接 引用自:§1。
- X. Zhou, H. Zhu, L. Mathur, R. Zhang, H. Yu, Z. Qi, L. Morency, Y. Bisk, D. Fried, G. Neubig 等人 (2023) 《Sotopia:语言智能体社交智能的交互式评估》。arXiv 预印本 arXiv:2310.11667。引用自:§1, §2.1。
- Z. Zhou, J. Xiang, H. Chen, Q. Liu, Z. Li 和 S. Su (2024) 《不合时宜的发言:大语言模型在多轮对话中的安全漏洞》。arXiv 预印本 arXiv:2402.17262。引用自:§1。
- X. Zhu, C. Zhang, T. Stafford, N. Collier 和 A. Vlachos (2025) 《大语言模型中的从众行为》。外部链接:2410.12428,链接。引用自:§2.2。
来源:HuggingFace Daily Papers(社区热门论文) · arxiv.org