Moonshot AI 发布 PerceptionBench:多模态模型视觉感知能力诊断基准
PerceptionBench
Moonshot AI 发布 PerceptionBench,一个从 40 多个现有基准中模型实际失败案例归纳出的视觉感知基准,包含 10 项原子感知能力和 3000 道验证题。所有测试模型准确率均未超过 60%,且大量正确答案在重复提问时无法复现,表明模型更多是猜测而非真正感知。PerceptionBench 旨在精确诊断多模态 AI 的视觉感知断裂点,推动其实现忠实、一致的视觉理解。
这是一个把视觉感知拆成原子能力的基准,所有模型不及格,而且猜测多于感知的发现很扎心,做多模态的团队应该拿来测一下自家模型。
概述
我们发布 PerceptionBench,这是一个隔离视觉感知、并将其作为一组原子能力进行评估的基准——这些能力是从当今模型的失败方式中发现的,而非事先定义的。 从前沿模型在 42 个基准上的失败中,我们推导出 10 项原子感知能力,并构建了 3,000 道经过验证的问题,每道题都隔离单一能力,且仅凭观察即可作答,无需推理或外部知识。
在十六个前沿 MLLM 中,没有任何模型达到 60% 的准确率,而与感知相关的幻觉平均而言是最弱的能力。总体得分几乎相同的模型,在实际感知到的内容上可能差异巨大。PerceptionBench 正是为了揭示感知究竟在哪里失效,并推动多模态 AI 朝着忠实且一致地“看见”的方向进步。
数据集
在归纳出的分类体系指导下,我们从源基准中挑选出最具信息量的失败案例,将其分解为原子子问题,并针对补充图像编写额外问题。保留的样本与构建的样本共同构成了一个包含 17,000+ 道已验证问题的内部题库。发布的基准从构建部分中抽取了 3,000 道已验证问题作为子样本——其中 60% 为分解自归因于模型失败的问题,40% 为新编写——并通过类别级平衡和难度分层,将原子感知能力从混杂因素中分离出来。发布的基准通过三项核心设计原则彰显其独特之处:
- 失败驱动的分类体系:每个类别均从真实的模型失败中发现,并归因于 42 个现有基准中最早出现错误的步骤。
- 十个原子感知类别:视觉关系、计数、属性、深度与 3D、定位、比较、细粒度识别、上下文整合、OCR 和幻觉。
- 感知,而非推理或知识:样本经过精心筛选、分解和难度平衡,使难度来源于感知而非推理或外部知识。
视觉定位
图像中 Gemini 符号位于表盘的几点钟方向?仅用数字作答。
答案:
6
视觉定位
图中的红线将画面分为九个区域,按从左到右、从上到下的顺序依次编号为区域 1–9。以下哪个区域完全没有树木?A. 区域 1 B. 区域 2 C. 区域 5 D. 区域 8
答案:
B
视觉属性
从图中所示的视角来看,比较桌上两个带粉色的笔筒。以下哪个结论是正确的?A. 左侧笔筒是纯粉色,表面有卡通人物图案;右侧笔筒是灰粉色拼接 B. 左侧笔筒是灰粉色拼接;右侧笔筒是纯粉色,表面有卡通人物图案 C. 左侧笔筒是纯粉色;右侧笔筒是灰粉色拼接,表面有卡通人物图案 D. 左侧笔筒是灰粉色拼接,表面有卡通人物图案;右侧笔筒是纯粉色
答案:
B
视觉属性
观察图片右下角的两个卡通角色。按照图中呈现的视角,以下哪项陈述正确描述了这两个角色的构成?A. 两个角色都完全由曲线构成 B. 两个角色都由直线和曲线的组合构成 C. 两个角色都完全由直线构成 D. 左侧角色完全由直线构成,而右侧角色完全由曲线构成
答案:
B
视觉计数
观察图片中的红框。有多少朵花的主体位于红框内?
答案:
2
视觉计数
图片中总共可以看到多少盆绿色植物?(不包括玻璃中反射出的绿色植物)
答案:
5 盆
视觉关系
定位红框内的实心圆点。当圆点沿着迷宫现有路线移动时,它最先到达哪个猫咪区域?A. 左下角那只困惑的猫 B. 右下角那只开心的猫 C. 中央那只撑着伞的猫 D. 右上角那只赏花的猫
答案:
C
视觉关系
在图中,对于最长的黑色对角线线段,从其右端点向外延伸的线段指向哪个方向?A. 右上方 B. 正右方 C. 右下方 D. 正下方
答案:
A
深度与 3D
基于当前观察者的视角,以更靠近相机的方向为前方,在红衣人与图像中央的黑色电风扇之间,哪一个更靠后?A. 红衣人 B. 黑色电风扇 C. 两者相同 D. 无法确定
答案:
A
深度与 3D
如果图中堆叠的小立方体必须放在地面上或另一个小立方体上,那么图中总共有多少个小立方体(包括看不见的)?
答案:
26 个立方体
OCR
观察图像。白色文字以两种不同的字体大小出现。对于最大字号的白色文字,从左到右读取文本内容,注意大小写字母,并保留所有标点符号和空格。写出答案。
答案:
Marshall B. Clinard
OCR
(注:边界框以 [x1, y1, x2, y2] 格式给出。)观察图像,建立归一化坐标,从左到右读取坐标区域 [0.697, 0.429, 0.875, 0.521] 中的文本内容,区分大小写,并保留空格和标点,然后写出答案。
答案:
自来水
视觉对比
在对应 P、Q、M、N 的圆中,哪个圆最大?(用对应圆的字母作答)
答案:
N
视觉比较
将连接数据点 A 与 D 的线段记为线段 AD,将连接数据点 E 与 M 的线段记为线段 EM。关于线段 AD 与 EM 的粗细,以下哪项正确?A. 线段 AD 更粗 B. 线段 EM 更粗 C. 线段 AD 与 EM 粗细相同 D. 无法确定
答案:
B
细粒度识别
观察上方主图案中缺口的轮廓形状。在 A、B、C、D、E、F、G、H 八个选项中,哪一个选项的边缘轮廓能够与主体中的缺口完美契合,并无缝填补缺失区域?
答案:
D
细粒度识别
观察图片,比较位于中心位置(C 位)的人与其右侧紧邻之人的造型和服装。以下哪项陈述是正确的:A. 两人发色不同,且服装配色与装饰完全相同 B. 两人发色不同,且服装配色与装饰明显不同 C. 两人发色相同,且服装配色与装饰完全相同 D. 两人发色相同,且服装配色与装饰明显不同
答案:
A
上下文整合
请看第一张图片中的地图。我在标有红色十字的位置又拍了一张照片,即第二张图片。请判断以下哪栋建筑位于 ROAD NO.2 SUNRISE HOMES 这条道路的两侧。A. Riva shop smart B. Dasthagir & Sons C. Bait-ul-Ata D. Sunrise Valley Villas
答案:
B
上下文整合
与图 1 相比,图 2 的场景中新增了什么?A. 黑色办公桌 B. 半透明储物篮 C. 浅黄色文件柜 D. 标有箭头的纸箱
答案:
D
模型幻觉
图片中的办公室里有多少张白色的桌子?A. 0 B. 1 C. 2 D. 3
答案:
A
模型幻觉
图片中的 15 个图案里,有多少个图案带有狗的 logo?
答案:
0
每个来源基准都只捕捉到感知错误的一个狭窄切面,而这些切面之间的重叠程度很弱(平均成对加权 Jaccard 为 0.20)。没有任何单一基准——或一小组基准——能够覆盖感知的整体,这就促使我们构建一个以能力为中心的基准,将这些碎片化的视角聚合起来并重新平衡。
各类别任务分布
| 统计 | 数量 |
|---|---|
| 数据 | |
| 总计 | 3,000 |
| 原子感知类别 | 10 |
| 任务类别 | |
| 深度 3D 感知错误 | 330(11.00%) |
| 视觉计数错误 | 330(11.00%) |
| 细粒度识别错误 | 290(9.67%) |
| 视觉关系错误 | 330(11.00%) |
| 视觉属性错误 | 330(11.00%) |
| 视觉定位错误 | 330(11.00%) |
| 视觉比较错误 | 279(9.30%) |
| 上下文整合错误 | 255(8.50%) |
| 模型幻觉 | 271(9.03%) |
| OCR 错误 | 255(8.50%) |
使用 PerceptionBench 对比模型
结论
PerceptionBench 是一个简单但颇具挑战性的基准,用于评估前沿模型的原子级视觉感知能力。它为衡量和诊断多模态模型的视觉感知边界提供了能力层面的标准。我们正在开源 PerceptionBench 数据集和评估代码,以帮助社区弥合视觉感知差距。
来源:Moonshot AI:Kimi Blog · kimi.com