跳到正文
北京时间
原文
HuggingFace Daily Papers(社区热门论文)·· 2026-07-17精选AI 评分73

ActiveVision 基准测试揭示多模态大模型缺乏主动视觉观察能力

An Exam for Active Observers

AI 导读

最新基准测试 ActiveVision 通过 17 项任务评估多模态大语言模型(MLLM)的主动观察能力。得分最高的 GPT-5.5(最高推理层级)仅解决 10.6% 的任务,在 11 项任务上得零分;Claude Fable 5 仅解决 3.5%,而三名人类参与者平均得分 96.1%。即使模型自行编写并运行视觉代码,差距依然显著,表明当前 MLLM 缺乏鲁棒的主动视觉观察能力。

推荐理由

前沿多模态模型在需要反复观察的任务上几乎全部翻车,最高分模型只做对 10%,人类 96%,说明现在的大模型不是真在看,而是在猜。做视觉的人应该认真看这篇。

来源:HuggingFace Daily Papers(社区热门论文) · arxiv.org