跳到正文
北京时间
原文
HuggingFace Daily Papers(社区热门论文)·· 2026-05-31精选AI 评分70

ChartArena:跨语言、场景与格式的图表解析基准测试

ChartArena: Benchmarking Chart Parsing across Languages, Scenarios, and Formats

AI 导读

ChartArena 是一个旨在系统评估图表解析模型的双语基准测试。它覆盖了八种图表家族(包括数字图表与流程图等结构),并针对数字渲染、打印照片和手绘照片三种场景进行评估。数据集采用人机协作标注流程,并设计了格式无关的评估协议,将不同模型输出映射到标准化语义空间进行评分。对26个多模态大语言模型的评估显示,前沿闭源模型如Gemini 3.1 Pro领先,开源系统正快速追赶;文档解析模型在数字图表上表现尚可,但在图表结构上明显不足;专业解析器仍局限于特定图表类型。雷达图和手绘场景对所有模型都尤其具有挑战性。

推荐理由

ChartArena 把图表评测从柱状图/折线图拉到了流程图和手绘照片,终于能测出 MLLM 在真实文档场景下的真实水平,做文档解析的团队该认真看一下。

正文 · AI 翻译

图表是传达定量信息和关系信息的主要媒介,但系统性地评估图表解析模型仍然困难。现有基准测试集中于狭窄的图表类型,而流程图、思维导图等图示结构在很大程度上未被涉及;同时,模型输出格式不兼容,数据集也极少包含实际应用中会遇到的打印或手绘图像。为解决这些问题,我们提出了 ChartArena,这是一个全面的双语基准测试,涵盖八大图表家族,既包括数值型图表也包括图示结构,每种图表均在三种视觉场景下进行评估:数字渲染图、打印照片和手绘照片。该数据集通过人机协作标注流程构建,并经过多阶段人工验证以确保标注可靠性。为了实现公平的跨模型比较,我们进一步设计了一种格式无关的评估协议,将异构输出映射到两个规范语义空间——归一化三元组视图和有向图视图——并使用结构感知指标进行评分。通过对 26 个领先多模态大语言模型的广泛评估,我们观察到三个一致的发现:(i) Gemini 3.1 Pro 等前沿专有模型总体领先,但最强的开源系统正在迅速缩小差距;(ii) 文档解析模型在处理数值型图表时表现尚可,但在图示结构上大幅落后;(iii) 专业图表解析器仍局限于狭窄的图表家族。在所有模型中,雷达图和手绘场景尤其具有挑战性。这些发现表明,ChartArena 揭示了明确的能力差距,并为未来的进展提供了统一的基础。ChartArena 已在 https://github.com/pspdada/ChartArena 公开提供。

来源:HuggingFace Daily Papers(社区热门论文) · arxiv.org