跳到正文
北京时间
原文
Apple Machine Learning Research(RSS)·· 2026-07-02精选AI 评分72

多智能体团队阻碍专家发挥

Multi-Agent Teams Hold Experts Back

AI 导读

在自我组织的多智能体LLM系统中,团队无法有效利用专家成员的专业知识。在多个基准测试中,即使明确告知专家身份,团队表现仍落后于最佳成员(专家智能体)的独立能力,性能损失最高达41.1%。失败主因是未能有效利用专家意见,而非识别专家。对话分析显示,团队倾向于“整合性妥协”——平均化专家与非专家观点,随团队规模增大而加剧,且与表现负相关。这种寻求共识的行为同时提升了对抗恶意智能体的鲁棒性,揭示了协同对齐与专业利用之间的根本性权衡。

推荐理由

这篇研究给多智能体热浇了盆冷水,自组织团队反而拖累专家,瓶颈不在认不认识专家而在会不会用专家,做 Agent 系统的都知道这有多反直觉。如果你是做多智能体的值得看看。

正文 · AI 翻译

多智能体 LLM 系统正越来越多地被部署为自主协作者,其中智能体自由交互,而非执行固定的、预先指定的工作流。在此类场景中,有效的协调无法完全预先设计,而必须通过交互自发涌现。然而,大多数先前的工作通过固定角色、工作流或聚合规则来强制实现协调,从而留下了一个悬而未决的问题:当协调不受约束时,自组织团队的表现究竟如何。借鉴组织心理学,我们研究了自组织的 LLM 团队是否能实现强协同效应,即团队表现达到或超过最佳个体成员。在受人类启发的基准和前沿 ML 基准上,我们发现——与人类团队不同——LLM 团队始终无法达到其专家智能体的表现,即便明确告知它们谁是专家,在 ML 基准上也会造成高达 41.1% 的性能损失。对这一失败进行分解后,我们表明,主要瓶颈在于对专家能力的利用,而非专家的识别。对话分析揭示了一种趋向整合式妥协的倾向——即对专家与非专家观点进行平均,而非对专业能力给予恰当权重——这种倾向随团队规模增大而加剧,并与性能呈负相关。有趣的是,这种寻求共识的行为提升了对对抗性智能体的鲁棒性,表明在对齐与有效利用专业能力之间存在权衡。我们的发现揭示了自组织多智能体团队在汇聚其成员集体专业能力方面存在显著差距。

  • † 斯坦福大学
  • ‡ 埃默里大学

来源:Apple Machine Learning Research(RSS) · machinelearning.apple.com