Command Palette
Search for a command to run...
DataSpace:面向异构工作空间可验证分析的 Data Agent 基准评测
DataSpace:面向异构工作空间可验证分析的 Data Agent 基准评测
摘要
Data Agent 能够对组织工作空间进行自然语言分析,其中相关证据可能分散在数据库、结构化文件、长文档和多媒体中。现有基准大多将结构化查询、检索或开放式分析割裂开来,未能充分统一异构证据发现、完整表格输出和确定性评估。我们提出 DataSpace,一个要求 Data Agent 从任务局部异构工作空间中生成可验证表格结果的基准。它包含 410 个跨语言任务和 7,439 个工件,涵盖 CSV、JSON、SQLite、Markdown、PDF 和视频,总计 15.01 GB。DataSpace 还作为 KDD Cup 2026 复杂数据分析 Data Agent 竞赛的官方评测基准。每个 Agent 仅接收一个问题和对应工作空间,并返回所请求的完整表格结果。我们利用 DataSpace-Builder 构建 DataSpace,这是一个基于执行的框架,包含跨语言转换、约束感知的关系采样、模态路由与工件渲染,以及由 11 位领域专家进行的人工审核与任务修复。确定性评估器执行标题不变的列对齐、类型与精度感知的归一化,以及顺序感知的行比较。在六款近期发布的前沿多模态模型和五种广泛使用的 Agent 框架上,最佳准确率达到 66.34%,而在固定骨干模型的情况下,框架选择造成了 15.36 个百分点的性能差距。多模态证据集成与连接操作在所有六款骨干模型上均持续降低准确率。这些结果表明 DataSpace 尚未饱和,并揭示了提升 Data Agent 可靠性的关键挑战。
一句话总结
香港科技大学(广州)和清华大学的研究人员提出了 DataSpace,这是一个包含 410 个跨语言任务的基准,涵盖异构工作空间,在这些工作空间中,数据 agent 生成可验证的表格结果。该基准使用 DataSpace-Builder 和确定性评估器构建,并作为 KDD Cup 2026 官方基准,取得了 66.34% 的最高准确率,突显了多模态证据集成中的挑战。
核心贡献
- 论文提出了 DataSpace,这是一个包含 410 个跨语言任务和 7,439 个工件(涵盖 CSV、JSON、SQLite、Markdown、PDF 和视频)的基准,专为可验证的表格输出分析设计。该基准作为 KDD Cup 2026 评估基准,在六个前沿多模态模型和五个 agent 框架上的实验显示最高准确率为 66.34%,多模态证据和连接操作会持续降低性能,表明该基准尚未饱和。
- 论文开发了 DataSpace-Builder,这是一个基于执行的框架,通过跨语言转换、约束感知的关系采样、模态路由、工件渲染以及人类专家审查和修复,将可执行的 Text-to-SQL 资源转换为任务局部异构工作空间。
- 论文提出了一个确定性评估器,执行标题不变的列对齐、类型和精度感知的归一化,以及顺序感知的行比较,从而能够精确验证完整的表格结果,同时接受等效表示并拒绝不完整或错误的输出。
引言
数据 agent 承诺成为组织数据的自然语言接口,但在现实的分析场景中,用户的问题通常跨越多个数据源、语言和格式。现有的基准各自应对这一挑战的一部分:结构化数据任务通常假设正确的表或数据库已被识别,非结构化数据基准侧重于检索和事实性答案,而数据 agent 基准缺乏一个统一的框架,该框架需结合任务局部异构工作空间、要求完整表格结果的一致输出契约,以及能够接受等效表示的确定性评估。作者提出了 DataSpace,一个迫使 agent 自主发现并组合来自 CSV、JSON、SQLite、Markdown、PDF 和视频文件(涵盖中英文)的证据,并返回一个完整的类型化表格,与参考答案进行评分的基准。他们还贡献了 DataSpace-Builder,一个基于执行的流水线,将关系型 Text-to-SQL 资源转换为跨语言多模态任务,以及一个语义感知的评估器,能够容忍列重排序和值归一化,同时拒绝不完整或错误的输出。
数据集
DataSpace 是一个包含 410 个异构工作空间任务的基准,评估 agent 在混合模态、跨语言分析环境中理解、对齐、计算和物化结果的能力。作者从英文 Text-to-SQL 语料库构建,然后对每个实例进行转换、采样、渲染和人工审查。
-
数据集组成和来源
- 总任务数:410
- 来源语料库:363 个任务(88.5%)来自 BULL(金融),47 个(11.5%)来自 EHRSQL(临床)
- 领域:基金(158)、股票(120)、宏观经济(85)、医疗(47)
- 语言设置:265 个跨语言(问题和数据库语言不同),145 个单语言
- 工作空间模态:任务以 13 种模态组合结合了 CSV、JSON、SQLite、Markdown、PDF 和视频;每个任务都包含 CSV,JSON、SQLite、Markdown、PDF 各出现在超过 93% 的任务中;视频出现在 189 个任务中
- 规模:25,384 个 PDF 页面,5536 万个 PDF/Markdown 字符,5.49 小时视频;参考答案共 126,409 行(每个任务最多 12,962 行,最多 6 列),92 个任务要求排序结果
-
每个子集的关键细节
- 基金分析:158 个任务,来源于 BULL
- 股票分析:120 个任务,来源于 BULL
- 宏观经济:85 个任务,来源于 BULL
- 医疗:47 个任务,来源于 EHRSQL
- 跨语言子集:265 个任务,通过对数据库、问题和 SQL 进行联合翻译处理
- 单语言子集:145 个任务
- 过滤:所有任务都通过了自动执行和语义检查,然后进行双盲的专家人工审查
-
论文如何使用数据
- DataSpace 被用作固定的评估基准,而非训练集
- 每个任务耦合了四种能力:工作空间发现,类型/模式/实体/单位/语言的解释和对齐,关系计算(过滤、连接、聚合、排序、时间推理),以及完整的表格结果物化
- 评估使用经过人工验证的金标准答案和规范配置,指定了列类型、数值精度和排序
-
数据集构建流水线
- 跨语言转换:将问题、数据库和 SQL 从英语联合翻译为中文/英文组合;通过外键、名称或值重叠关联的列被一致翻译,标识符/日期/数字冻结;存储替换映射;执行等价性和基于 LLM 的语义对齐检查拒绝无效实例
- 约束感知的关系采样:从转换后的实例中采样任务局部数据库,同时保留表清单和模式;一个保护集保留主键/外键、连接列、谓词值和目标实体;采样的行在关系间传播;SQL 在采样数据库上重新执行;仅当执行成功、关系保持有效且结果非退化空集时才接受采样
- 模态路由与工件渲染:将采样的表转换为异构工作空间工件(文档、视频);摘录中未提供细节,但目标是创建多样的模态组合
- 人工审查与任务修复:两位独立领域专家仅使用问题和工作空间解决任务,然后验证金标准答案并编写评估配置;需要达成一致;分歧触发基于证据的修复和重新检查,直至达成共识;未解决的任务被移除
方法
作者提出了 DataSpace-Builder,一个四阶段流水线,旨在将现有的 Text-to-SQL 实例转换为经过审查的异构工作空间任务。如下图所示,该框架通过跨语言转换、约束感知的关系采样、模态路由与工件渲染,以及人工审查与任务修复,系统地处理源语料库,以生成最终的基准记录。
在第一阶段,即跨语言转换,作者对问题、数据库状态和可执行工作负载进行联合迁移,以处理跨语言场景。为保持实体间的一致性,他们通过外键或共享名称关联列并进行联合翻译,生成表、列和单元格级别的映射 M={Mtab,Mcol,Mval}。转换后的数据库和 SQL 使用这些映射确定性地重写。流水线在验证结构有效性、执行等价性以及问题与 SQL 之间的语义对齐后,才保留转换后的元组。
接下来,约束感知的关系采样对任务局部数据进行多样化处理,以防止实体重复。作者构建了一个保护集 Cs,结合了从 SQL 抽象语法树中提取的主键、外键和谓词值。一个关系一致的采样策略保留这些保护所需的行,并在模式关系间传播键值。采样的表物化到一个中间数据库 Ds 中,查询被重新执行以生成候选参考结果。
在模态路由与工件渲染阶段,决定了 agent 如何接触关系内容。一个基于规则的策略将采样的表分配给兼容的渲染器,生成如 CSV、JSON 和 SQLite 等结构化工件。对于文档工件,系统通过规划文档样式和组装生成块来生成基于事实的 Markdown 和 PDF 文档。此外,对于查询条件的视频渲染,渲染器从可执行的 SQL 和采样结果中推导出类型化的证据原子,构建故事板,并将渲染的视频集成到任务工作空间中。
为确保任务质量,最终阶段涉及人工审查与任务修复。两位领域专家仅使用问题和工作空间独立解决候选任务,然后验证金标准答案并编写评估配置 ci。任何分歧都会触发基于证据的讨论和最小化修复,然后重新检查,直至达成共识。
由此产生的基准建立了一个严格的任务级输入输出接口,数据 agent 必须自主发现并组合跨各种模态的数据。请参考下图,该图说明了 agent 工作流与异构工作空间交互、执行多步计算并返回完整表格结果的过程。
实验
该研究通过两个受控比较,在 DataSpace 基准上评估了数据 agent:在固定 agent 的情况下测试了六个多模态骨干,并在保持骨干不变的情况下比较了五个 agent 框架。该基准被证明是未饱和的,最佳骨干仅解决了约三分之二的任务,并且在需要跨模态集成或连接的任务上,性能持续下降。框架设计也显著影响准确率,失败分析显示,大多数错误源于错误的答案物化和对所需输出模式的理解不足,而非证据检索或计算。
DataSpace 任务接口要求 agent 组合来自视频、PDF 和 SQLite 的证据,对齐实体,并计算指标以生成表格答案。实验结果表明,跨模态集成和连接操作是准确率下降的最一致原因,对于每个骨干,多模态任务的表现均低于单模态任务。失败分析揭示,大多数错误源于物化正确的输出模式,而非证据检索,列投影错误和意图表述错误占审计失败的一半以上。所需的视频证据对 GPT 和 Kimi 有帮助,但对 MiMo、Claude 和 MiniMax 有负面影响,表明跨模态集成是各模型面临的持续挑战。连接要求使所有骨干的准确率降低了 9.7–19.8 个百分点,使其成为一个统一的性能下降来源。答案物化错误,如添加或遗漏列,占最强模型失败的 52.2%。目标结果误解和错误的列投影占审计失败的 56.6%,超过证据选择错误。对于每个骨干,多模态任务的表现比单模态任务低 1.8–14.0 个百分点,突显了集成不同证据源的难度。
对代表性基准的调查显示,尚无现有基准能同时提供跨工件集成、自主工作空间发现、长文档处理、跨语言输入,以及具有完整表输出和模式不变性的可验证评估。DataSpace 基准填补了这些空白,能够在异构工作空间中对 agent 失败进行受控研究。结构化数据基准(如 Spider 和 BIRD)提供带有精确答案的数据库查询,但缺乏跨工件、发现和长文档的要求。非结构化基准(如 HotpotQA 和 CRAG)包含文档检索和多跳推理,但不需要完整的表输出或模式不变的评估。数据 agent 基准(如 KramaBench 和 FDABench)引入了工作空间发现和多模态,但仍缺少跨语言输入、完整表验证或模式不变评分。跨模态集成和连接是准确率下降的最一致原因:多模态任务的表现比单模态任务低最多 14.0 个百分点,连接操作使所有评估骨干的准确率降低了 9.7–19.8 个百分点。答案物化错误,特别是错误的列投影,主导了 agent 失败,占审计错误的一半以上,并突显了即使底层值计算正确,也要遵循精确输出模式的挑战。
DataSpace 包含 410 个任务,每个任务中位数为 20 个工件,总存储量为 15.01 GB。工作空间包含 1,088 个 PDF(25,384 页)、875 个 Markdown 文件和 189 个视频,总时长 5.49 小时,P90 值显示了每个任务规模的高变异性。任务的中位工件数为 20,但排名前 10% 的任务至少有 23 个工件,范围从 5 到 26。PDF 是最大的文本模态:1,088 个 PDF 生成了 25,384 页和 2848 万个字符,每个 PDF 的中位页数为 22。视频内容简洁:189 个视频平均时长 1.7 分钟,中位持续时间为 103.8 秒,范围在 39.1 至 158.3 秒之间。每个任务的存储量呈偏态分布:中位数为 31.26 MB,而 P90 达到 74.18 MB,反映了工作空间规模的多样性。
当 agent 框架固定时,Grok 4.5 取得了最高准确率 66.34%,但仍有 76 个任务未被所有六个骨干解决,表明该基准远未饱和。保持骨干不变揭示,仅框架选择就使准确率产生 15.36 个百分点的变化,表明模型和工具都显著影响任务完成。排名前两位的骨干,Grok 4.5 和 GPT-5.6 Sol,正确任务数仅差 7 个(66.34% 对比 64.63%)。六个骨干的准确率跨度达 37.80 个百分点,从 28.54% 到 66.34%。76 个任务被所有骨干遗漏,而所有骨干的理想组合解决了 81.46% 的基准任务。在相同骨干(MiMo-V2.5)下,框架准确率范围从 30.98% 到 46.34%,差距为 15.36 个百分点。连接要求在所有骨干上一致地降低了 9.7–19.8 个百分点的准确率,跨模态集成使每个模型的性能下降了 1.8–14.0 个百分点。
答案物化是 Grok 4.5 错误的最大来源,其次是意图表述错误,这两类不正确的输出模式问题共同导致了大多数失败。相同的评估器症状通常源于不同的上游原因,列不匹配大多是物化错误,但有些源自早期阶段,而无提交结果很少是纯粹的执行失败。这些发现突显,忠实地生成请求的输出结构比定位或计算正确的数据更具挑战性。物化错误占所有失败的一半以上,主要是在内部已有正确答案后添加或遗漏列。意图表述错误贡献了近四分之一的失败,经常错误地解释所需的输出格式或行粒度。列数不匹配主要由物化问题主导(74 例中的 58 例),但值得注意的是,少数源自早期的意图、提取、接地或计算错误。在 13 个无提交结果中,只有 5 个是纯粹的执行控制失败;大多数跟随在前期的解释、提取、接地或计算错误之后。
DataSpace 基准评估 agent 在需要集成来自视频、PDF 和 SQLite 源的证据并生成结构化表格答案的任务上的表现,实验考察了跨模态推理和连接操作如何影响准确率。关键发现表明,答案物化,特别是列投影错误或对输出模式的误解,是主要的失败模式,而非证据检索,并且底层模型和 agent 框架都独立地导致较大的性能差异。总的来说,该基准揭示,在融合异构数据的同时忠实地遵循精确的输出格式,对当前的 agent 来说仍然是一个持久的挑战。