九位评委,两个有效投票:相关错误削弱LLM评审面板
Nine Judges, Two Effective Votes: Correlated Errors Undermine LLM Evaluation Panels
苹果机器学习研究团队发现,LLM-as-a-judge面板因模型间高度相关而严重受限。对7个模型家族的9个前沿大语言模型在3个自然语言推理数据集上的测试表明,9位评委实际仅提供约2个独立投票的信息量,面板准确率比独立投票理想值低8–22个百分点,最佳单一模型的表现已匹敌或超越整个面板。增加评委数量或改进聚合算法收效甚微,即使允许算法获取正确答案也仅能缩小至多11%的差距。该结论在多种提示变体、温度设置及偏好任务中均得到验证,瓶颈在于评委间的相关性而非聚合算法。
这篇Apple论文揭示了一个反直觉的事实:在LLM评估面板中,9个法官实际上只提供约2个独立票的信息,因为模型会犯相似错误。这解释了为何简单聚合面板往往不如最佳单模型,做评估的团队必须重视法官相关性。
LLM-as-a-judge 评审团会汇总多个模型的投票,其预期是多样化的模型能带来更可靠的评估。我们开发了一个框架,用以衡量此类评审团的真实信息价值,并量化其可靠性距离独立投票理想状态有多远。我们在三个自然语言推理数据集(每个条目均有 100 条人工标注)上测试了一个由来自 7 个模型家族的 9 个前沿 LLM 组成的评审团,结果发现这 9 位评审实际上只提供了大约相当于 2 票独立投票的信息量。评审团名义独立性中约四分之三被损失掉了,原因是这些模型在相同的条目上犯相同的错误。后果十分严峻:评审团的实际准确率比独立投票所能达到的水平低 8–22 个百分点,而最佳单一评审在所有条件下都能匹敌甚至超越整个评审团。无论是增加更多评审,还是使用更聪明的聚合算法,都无济于事——即便能够获取正确答案,现有方法最多也只能弥合这一差距的 11%。我们使用 Kish 有效样本量(n_eff)和一个 Condorcet 零模型来量化这些发现,并表明这一缺陷在提示词变体、温度、思维链推理以及一个成对偏好任务(RewardBench)中都稳健存在。瓶颈在于评审之间的相关性,而非聚合算法,这意味着扩大评审团规模无法替代真正独立的评估。
来源:Apple Machine Learning Research(RSS) · machinelearning.apple.com