Command Palette
Search for a command to run...
ChartGalaxy:面向信息图理解与生成的数据集
ChartGalaxy:面向信息图理解与生成的数据集
摘要
信息图通过将视觉元素(如图表、图像)与文本信息相结合,成为传达抽象数据的有力媒介。然而,其丰富的视觉与结构特征给通常仅在普通图表上训练的大型视觉语言模型(LVLM)带来了挑战。为弥合这一差距,我们提出了 ChartGalaxy,一个百万级规模的数据集,旨在推动信息图的理解与生成。该数据集通过归纳过程构建:从真实信息图中识别出 75 种图表类型、440 种图表变体和 68 种布局模板,并据此以程序化方式生成合成信息图。我们展示了该数据集的用途:1)通过微调提升信息图理解能力;2)为信息图代码生成提供基准;3)支持基于示例的信息图生成。通过捕捉真实设计的视觉与结构复杂性,ChartGalaxy 为增强 LVLM 的多模态推理与生成能力提供了有价值的资源。
一句话总结
清华大学和纽卡斯尔大学提出了 ChartGalaxy,这是一个百万级规模的数据集,用于信息图表理解和生成。该数据集通过从真实信息图设计中归纳出 75 种图表类型、440 种图表变体和 68 种布局模板,并利用这些模板以编程方式合成图表,从而支持信息图表的微调理解、代码生成基准测试和基于示例的信息图表生成。
核心贡献
- ChartGalaxy 是一个百万级规模的成对信息图表与表格数据集,包含 61,833 张真实图表和 1,701,356 张从真实设计模式生成的合成图表。
- 结构化合成流程从真实信息图中提取 75 种图表类型、440 种图表变体和 68 种布局模板,并以编程方式大规模创建多样化的合成信息图表。
- 三项应用展示了该数据集的用途:微调信息图表理解、基准测试信息图表代码生成,以及支持基于示例的信息图表生成。
引言
信息图表广泛用于新闻、商业和教育,因为它们结合文本和视觉元素,使数据更易理解。然而,GPT-4、Gemini 和 LLaVA 等大型视觉语言模型在理解或生成这些图表时仍然存在困难,原因包括复杂的视觉文本交互、多样的布局以及跨模态推理需求。以往的图表数据集大多只包含普通图表,而现有的信息图表专用数据集规模过小或缺乏足够的设计多样性,限制了模型泛化。作者通过构建 ChartGalaxy 来填补这一空白。ChartGalaxy 是一个百万级规模的数据集,包含 61,833 张真实信息图表和 1,701,356 张合成信息图表,并与源数据表配对。该数据集通过人工在环流程构建,从真实设计中提取布局模板和图表变体,支持视觉问答、代码生成和基于示例的信息图表生成等应用。
数据集
作者构建 ChartGalaxy 分为两个阶段:收集真实信息图表,然后基于这些图表归纳设计模式并以编程方式创建合成信息图表。
数据集组成与来源
- 真实信息图表: 从 18 个允许研究使用的图表丰富网站收集了 61,833 张图表,包括 Statista 和 Visual Capitalist。
- 额外真实图表: 通过 Google Images 和 Bing Images 检索,并使用内置许可过滤器仅保留 Creative Commons 图片。
- 去重: 使用感知哈希和 CLIP 相似度去除重复图片。
- 真实图表的表格数据: 通过多步骤 LVLM 流程提取,并进行人工在环验证。
合成信息图表创建
- 作者从 Data Viz Project 和 Datylon 分类法中归纳出 75 种图表类型,并识别出具有不同视觉样式的 440 种图表变体。
- 图表使用 D3.js 渲染,以支持 Matplotlib 或 Seaborn 等库所不具备的视觉特性。
布局模板
- 初始集合:从 Statista 和 Visual Capitalist 中抽样的 1,500 张真实图表中人工标注了 55 个布局模板。
- 扩展集合:在使用检测模型、PP-OCRv4 文本提取、LTSim 布局相似度、k-means 聚类以及对聚类中心进行人工检查后,总共得到 68 个模板。
表格与图像库
- 真实表格数据:来自 VizNet、UN data、the World in Data 和 Papers with Code 的 200,085 张表格。
- 合成表格数据:使用 Gemini-2.0-Flash 生成的 98,483 张表格。
- 每张表格都补充了一个主题和若干数据事实。
- 图像库:来自 Icon645 和 Noun Project 的 681,459 张图片,并过滤了低墨水占比、低分辨率或极端宽高比的图片。
- 图片包含 Gemini 生成的描述性关键词和说明文字,并使用 Sentence-BERT 相似度进行检索。
合成图表生成细节
- 标题和副标题通过检索增强提示生成,使用 Sentence-BERT 检索相关真实图表,并使用 Gemini-2.0-Flash 生成文本。
- 图表类型选择遵循数据到图表映射规则,当多种图表类型适合时使用 Gemini 进行选择。
- 图表变体采用自适应采样,以偏向于代表性不足的变体。
- 调色板从真实信息图表中提取,并在需要时补充协调色。
- 布局优化通过受限打包和网格搜索,选择具有最高墨水占比且兼容的模板。
最终数据集统计
- 1,701,356 张程序化生成的信息图表。
- 61,833 张真实信息图表。
- 每张图表都与表格数据关联。
- 涵盖 75 种图表类型、440 种图表变体和 68 种布局模板。
- 最常见的图表类型:水平条形图 11.7%、垂直条形图 4.9%、散点图 3.5%。
数据集使用方式
- 作者从 ChartGalaxy 中抽样 70,248 张图表,构建了包含 443,455 个问答对的指令数据集,并均衡图表类型覆盖以用于微调。
- 问题类型包括:
- 基于文本的推理:数据识别、数据比较、条件数据提取和事实核查。
- 视觉元素推理:将图标和视觉元素与数据值关联。
- 视觉理解:样式检测、视觉编码分析和图表分类。
- 一个单独的人工验证评估集包含 2,176 张合成图表和 4,975 个问答对。这里使用合成图表是因为它们提供了视觉元素问题所需的边界框标注。
- 论文在此指令数据上微调 InternVL3-8B 和 Qwen2.5-VL-7B,并在 InfographicVQA、ChartQAPro 以及独立的信息图表评估集上进行评估。
方法
作者提出了一种全面的两阶段方法,用于构建大规模信息图表数据集,包括真实信息图表收集和合成信息图表创建。
在第一阶段,从 18 个图表丰富网站以及 Google 和 Bing 等搜索引擎汇总真实信息图表,并严格过滤 Creative Commons 许可。为确保数据质量,作者应用感知哈希和 CLIP 相似度来去除重复项。随后,采用多步骤、人工在环的验证流程,利用大型视觉语言模型(LVLM)提取每张图表的准确表格数据,最终得到 61,833 张高质量真实信息图表及其源表格。
第二阶段涉及一种归纳式结构化过程,以程序化方式生成合成图表。作者首先识别出 75 种图表类型和 440 种不同的视觉变体,并使用 D3.js 实现,以支持复杂的视觉特征。该阶段的关键环节是布局模板提取,它定义了文本、图像和图表之间的空间关系。该过程首先对 1,500 张真实图表进行人工标注,初始化 55 个布局模板。为扩大覆盖范围,作者在初步合成图表上微调了一个配备 DINO 检测器的 InternImage 模型,以检测元素区域,并使用 PP-OCRv4 进行文本提取。通过使用 LTSim 度量布局相似度并应用 k-means 聚类,作者识别出另外 13 个模板,最终得到 68 个布局模板。
基于模板的信息图表创建流程分为三个步骤:表格数据整理、元素生成和布局优化。作者整理了一个包含真实和合成数据表的丰富仓库,并为每个表补充主题和数据事实。在元素生成方面,作者采用 Sentence-BERT 和 Gemini-2.0-Flash 的检索增强提示策略来生成标题和副标题。图像根据与图表标题的语义相似度,从包含超过 680,000 个图标的精选仓库中检索。图表类型通过预定义的数据到图表映射规则选择,并由 Gemini-2.0-Flash 进一步优化,变体则通过自适应采样选择,以保持分布平衡。
最后,执行布局优化以最大化视觉吸引力和数据清晰度。作者将这一问题形式化为受限打包问题,旨在选择具有最高墨水占比的模板,同时保持元素之间的最小距离。优化目标定义为:
Emax∣∪iei∣/∣f(∪iei)∣,s.t.d(∂ei,∂ej)≥p,∀i=j.其中,ei 表示元素的像素集合,f(e) 表示 e 的紧密拟合边界框内的像素集合,E 为元素集合。该约束确保元素轮廓 ∂ei 与 ∂ej 之间的最小成对距离 d 超过阈值 p。该问题通过网格搜索求解,以最终确定图表布局。
实验
实验评估 ChartGalaxy 在信息图表理解的指令微调、代码生成基准测试和基于示例的图表创建三个方面的作用。在构建的问答数据集上进行微调,可以提升 InternVL3-8B 和 Qwen2.5-VL-7B 在公开基准和独立评估集上的表现,其中视觉理解问题的提升最大。代码生成基准测试评估渲染后的 D3.js 输出在视觉相似度上的表现,发现 Gemini-2.5-Pro 在闭源模型中最强,而开源模型仍然落后。用户研究进一步表明,基于示例的布局和样式适配方法在保真度、美观性和创造力上显著优于 GPT-Image-1。
使用 ChartGalaxy 衍生的指令数据进行微调,提升了两个受评估开源 LVLM 的公开基准表现。提升在 InfographicVQA 和 ChartQAPro 上保持一致,但提升幅度因模型和基准而异。最大的相对提升出现在 InternVL3-8B 的 ChartQAPro 以及 Qwen2.5-VL-7B 的 InfographicVQA 上。添加 ChartGalaxy 指令数据提高了所有已报告模型-基准配对的准确率。InternVL3-8B 在 ChartQAPro 上的提升大于 InfographicVQA,而 Qwen2.5-VL-7B 在 InfographicVQA 上的提升大于 ChartQAPro。微调后,两个模型在 ChartQAPro 上的得分仍低于 InfographicVQA。
在独立信息图表基准上,使用 ChartGalaxy 指令数据进行微调,提升了 InternVL3-8B 和 Qwen2.5-VL-7B 在所有评估类别中的表现。在基线分数较低的视觉元素推理和视觉理解方面提升尤其明显。微调后,两个模型的整体表现趋于相近。视觉元素推理和视觉理解的提升最大,其中形状检测和视觉元素关联的提升最为显著。两个模型在基于文本的推理上也不断提升,训练后的整体表现达到相近水平。
该基准通过渲染输出并比较低级 SVG 元素相似度和高级视觉相似度,评估 LVLM 生成的信息图表代码。报告中若干顶级模型达到了完美的执行率,其中 Gemini-2.5-Pro 的整体表现和高级结果最强。尺寸相似度始终是这些模型中最弱的低级指标,表明在匹配元素尺寸方面存在困难。Gemini-2.5-Pro 在已报告模型中取得了最高的整体得分和高级视觉相似度。领先模型达到了完美的执行率,而 OpenAI-o4-mini 在执行率和大多数相似度指标上落后。尺寸相似度是所有列出模型中最低的低级子指标,往往远落后于文本和位置得分。
在基于示例的信息图表生成的专家评估中,所提出方法在保真度、美观性和创造力方面均优于 GPT-Image-1。最大优势体现在数据保真度上,所提出方法保持了数据准确性,而 GPT-Image-1 存在严重的标签和比例错误。所提出方法的美观性和创造力得分也更高,这得益于布局模板和多样化图表类型的使用。所提出方法在所有三项评估指标上的平均评分均显著高于 GPT-Image-1。保真度的差距最大,专家评分对所提出方法的偏向幅度远超 GPT-Image-1。GPT-Image-1 的输出被认为视觉上更简单、更单调,图表类型变化有限。所提出方法受益于提取的布局模板以及对更广泛图表类型的支持。
使用 ChartGalaxy 衍生的指令数据进行微调,持续提升了 InternVL3-8B 和 Qwen2.5-VL-7B 的公开基准准确率,其中视觉元素推理和视觉理解的提升最大。在信息图表代码生成方面,多个领先模型达到了完美的执行率,Gemini-2.5-Pro 取得了最强的整体和高级视觉相似度,而尺寸相似度仍然是最弱的指标。在专家评估中,所提出方法在保真度、美观性和创造力上优于 GPT-Image-1,其中数据保真度优势最大,原因是标签更准确且布局模板更多样。