HyperAIHyperAI

Command Palette

Search for a command to run...

DataPrep-Bench:面向训练数据制备的大语言模型基准评测

摘要

训练数据的质量从根本上决定了大语言模型(LLM)的能力,但目前尚无统一的基准来端到端地衡量 LLM、智能体以及以数据为中心的工作流在训练数据制备上的实际表现。我们将 LLM 驱动的数据制备视为两种互补能力的结合:数据构建,即将原始来源转化为有监督训练数据;以及数据质量评估,即在下游训练之前预测候选数据集的训练价值;其中,“质量”始终指下游训练效用,而非表层的文本属性。我们提出了 DataPrep-Bench,这是首个在六个领域和多种基座模型上,基于共享的下游锚定协议,对上述两种能力进行联合评测的统一基准。在数据构建方面,各方法使用相同的原始来源,其得分通过将其输出与 Dolly-15k 联合用于微调一个基座模型来评定;在此赛道中,我们还发布了 Data-Construction-Skill,一个由技能引导的智能体,它在 Llama-3.1-8B 的金融领域上将仅使用 Dolly 的基线提升了近 20 个绝对百分点,并在知识抽取密集型领域中与最强的智能体及基于 DataFlow 的方法相比具有竞争力。在数据质量评估方面,评分函数通过其与共享候选池上模型下游性能的皮尔逊相关系数来评定;我们发布了分布对齐分数(DAS),这是一种基于分布的评估器,利用候选数据集与领域代理之间的最大均值差异(MMD)进行计算。DAS 在六个领域中的四个上取得了最强的跨模型相关性,并且是唯一在数学、科学和医学三个领域同时达到 r > 0.70 的指标,优于现有的基于质量、多样性和启发式方法的评估器。DataPrep-Bench 提供了一个统一且以下游任务为锚定的框架,用于衡量 LLM 驱动数据制备中这两种能力作为同等重要目标的进展。

一句话总结

北京大学的研究人员与合作者推出了 DataPrep-Bench,一个通过下游实用性评估 LLM 驱动的数据构建与质量评估的统一基准。其特色在于技能引导的 Data-Construction-Skill agent,能提升金融微调效果约 20 points\sim 20\text{ points}20 points,以及分布对齐评分 (DAS) 评估器,在数学、科学和医学领域实现了跨模型相关性 r>0.70r > 0.70r>0.70

核心贡献

  • 提出了 DataPrep-Bench,一个统一基准,在覆盖六个领域和多种模型架构的共同下游验证协议下,联合评估 LLM 驱动的数据构建与数据质量评估。
  • 数据构建赛道发布了 Data-Construction-Skill,一个技能引导的 agent,以及其精心整理的原始来源语料。该 agent 在 Llama-3.1-8B 的金融任务中将 Dolly-only 基线提升近 20 个绝对百分点,在知识抽取密集的领域中与最强的 agent 及 DataFlow 方法相比具有竞争力。
  • 数据质量评估赛道发布了分布对齐评分 (DAS),一种基于 MMD 的评估器,同时提供候选池和真实下游性能记录。DAS 在六个领域中的四个取得了最强的跨模型相关性,并且是唯一在数学、科学和医学中同时超过 r>0.70r > 0.70r>0.70 的指标。

引言

训练数据的质量和规模对 LLM 性能具有决定性影响,随着自然语料无法满足日益增长的需求,实践者越来越多地使用 LLM 和 agent 来合成监督训练集。然而,比较数据构建策略与质量评估指标十分困难,因为现有研究依赖不一致的原始来源、基座模型和下游基准,导致难以明确哪些方法能可靠地产生有用的训练数据或预测真实效用。作者推出了 DataPrep-Bench,一个统一基准,在共享的领域、模型和训练协议下同时评估数据构建与数据质量评估,从而实现公平的、基于下游表现的比较。

数据集

作者引入 DataPrep-Bench,一个评估 LLM 准备训练数据能力的基准,并为两个赛道精心整理了数据集:数据构建数据质量评估。数据集描述聚焦于这两个部分、它们的构成以及论文中的使用方式。

数据构建赛道 – 源语料

  • 六个领域:科学、法律、金融、医学、数学和通用文本。
  • 源材料(除通用文本外):由专家撰写的大篇幅书籍(每本数百页),来自 Wikibooks、FreeBookCentre 和 Open Textbook Library 等开放仓库。 对于 数学 领域,语料还包含了中文大学数学教材和中国数学竞赛材料。 对于 科学 领域,语料额外加入了国际科学奥赛(IPhO、IChO、IBO)的备考与试题材料,以注入高难度推理内容。
  • 通用文本:从 FineWeb 的 sample-10BT 子集中随机采样 150 MB 文本,整理为 100 个 Markdown 文件,反映网络规模的分布。
  • 筛选与整理:手工挑选书籍以覆盖主要子领域(每个子领域至少三本书),不施加额外的启发式过滤。
  • 处理:所有 PDF 源文件使用 MinerU 转换为 Markdown,尽可能保留章节结构、表格和公式。每个领域形成一个 Markdown 文件文件夹。
  • 使用方式:数据构建方法以领域文件夹作为输入,产出一个监督微调(SFT)数据集(问答对)。基座模型 f0f_0f0 随后在该构建数据集上进行微调,方法的得分即为同一领域独立的精选测试集 Tk\mathcal{T}_kTk 上的下游基准性能。不施加固定的样本数量或混合比例;不同方法可能产生不同规模的数据集。

数据质量评估赛道 – 候选与代理数据集

  • 候选池(每个领域一个):由多种公开 SFT 语料混合而成,故意包含领域内和领域外数据。这种混合旨在制造一组差异化的真实效用值,使得指标能够可靠地进行相关性评估。
  • 池规模:通用文本有 14 个候选数据集;专门领域(数学、科学、医学、金融、法律)各有 8–10 个候选数据集。这种差异反映了通用文本以外领域公开领域内 SFT 数据的稀缺。
  • 代理数据集(每个领域一个):一个高质量的领域内 SFT 语料,被选作参考分布,供那些将候选特征与代理进行比较的指标(如 DAS)使用。代理的选择依据是领域对齐程度、质量以及与候选池和下游测试集的互斥性。
    • 通用:Infinity-Instruct
    • 数学:ODA-Math-460k
    • 科学:Logics-STEM
    • 医学:ReasonMed
    • 金融:Fin-o1
    • 法律:DISC-Law-SFT
  • 使用方式:此赛道无需构建数据。作者通过在每个候选数据集上微调 f0f_0f0 并测量领域特定测试集的性能来获取真实效用。质量评估指标必须在不实际训练的情况下预测这一下游训练效用。代理数据集仅用于指标计算,不参与训练。

方法

作者提出 Data-Construction-Skill,一个技能引导的 agent 框架,旨在将长篇幅的领域语料(如教科书、技术手册)转化为高质量、可复用的问答式监督数据,用于后训练。该方法解决了一个核心瓶颈:当必须从数百页专家撰写的内容中忠实抽取并重组监督信息时,单次生成提示无法可靠地同时处理任务分解、输出一致性、验证、覆盖与可恢复的执行。Data-Construction-Skill 保留了 agent 在规划与执行方面的灵活性,同时将“何谓有效监督”的规范转移到一个可复用的技能层。该技能将任务说明、输出模式、质量约束、过滤规则和辅助资源打包成一个结构化接口,引导 agent 跨多个文本块运行,而无需硬编码整个工作流。

构建流程首先对给定领域的源书籍语料 BkB_kBk 进行分割,利用保持局部完整性的结构感知分块过程生成语义连贯的文本块 Ck=Chunk(Bk)\mathcal{C}_k = \text{Chunk}(B_k)Ck=Chunk(Bk),每个块大小适合下游处理。对每个块 cCkc \in \mathcal{C}_kcCk,agent 首先过滤掉导航性的、噪声的、重复的或其他无信息量的片段。对保留的块,识别其中的主要知识命题及其局部语义关系,包括定义、规则、机制、条件、例外、比较和因果联系。基于这一分析,方法自适应地为 ccc 生成至多三种互补的问答监督:面向概念的问答对 Gconcept(c)\mathcal{G}^{\text{concept}}(c)Gconcept(c),捕获可复用的原子知识(类别、功能、约束);面向推理的问答对 Greason(c)\mathcal{G}^{\text{reason}}(c)Greason(c),编码简洁的、源文本支撑的推理模式;以及基于案例的问答对 Gcase(c)\mathcal{G}^{\text{case}}(c)Gcase(c),将相同知识置于简单的结构化应用场景中。这三组数据彼此不相交,块级监督是它们的并集:

G(c)=Gconcept(c)Greason(c)Gcase(c).\mathcal{G}(c) = \mathcal{G}^{\text{concept}}(c) \cup \mathcal{G}^{\text{reason}}(c) \cup \mathcal{G}^{\text{case}}(c) .G(c)=Gconcept(c)Greason(c)Gcase(c).

所有监督数据均以指令-响应对的形式实例化。领域 kkk 的最终数据集是所有已处理文本块的聚合:

Xk(MDCS)=cCkG(c).\mathcal{X}_{k}^{(M_{\mathrm{DCS}})} = \bigcup_{c \in \mathcal{C}_{k}} \mathcal{G}(c).Xk(MDCS)=cCkG(c).

一个核心创新是调节此过程的技能层。与将所有控制逻辑嵌入单一提示不同,技能向 agent 提供样例类型、输出模式、过滤标准、覆盖要求和验证行为的明确且可复用的规范。它指示 agent 生成忠实于原文、自包含、在问题类型和难度上多样且对于监督微调有益的问答对。同时定义了无效模式:文档相关的问题、虚构的答案、重复样本以及答案无法由源文本支持的问题。该技能层在高层次的构建目标与底层 agent 执行之间充当中介控制接口,稳定 agent 行为并实现可复用的工作流。

生成之后,作者执行后处理与验证阶段以提升数据集的可用性。移除文档相关的措辞和依赖段落的引用,确保所得样例反映通用领域监督而非书本理解行为。过滤格式错误、重复或根基薄弱的样本。保留块级处理记录以支持长文档执行、覆盖检查和可恢复性。通过这种方式,Data-Construction-Skill 提供了一种稳健、可扩展的方法,将详尽的领域书籍转化为忠实且多样的问答监督语料。

实验

数据构建赛道评估将原始领域语料转化为监督微调数据的方法,结果表明盲目添加合成领域数据往往会损害性能,而基于 agent 的方法在推理密集型领域表现优异,技能引导的抽取则增强密集知识领域的结果,但在开放式推理上表现不佳。数据质量评估赛道衡量指标在未训练时预测下游效用的能力,显示所提出的 DAS 指标是唯一在多个推理密集型领域可靠的预测器,而现有指标要么是狭窄的专才,要么符号不一致,在实践中会主动产生误导。两个赛道共同证明,基于下游的评估至关重要,因为表面的质量信号常常给出错误指引。

基准将六个领域分别与一个高质量的代理数据集配对,作为目标分布锚点,例如通用文本使用 Infinity-Instruct,数学使用 ODA-Math-460k;候选池则混合领域内与领域外的公开 SFT 语料,以产生一个下游效用值分布,指标必须线性跟踪该分布。Infinity-Instruct 是通用文本的代理;ReasonMed 和 DISC-Law-SFT 等特定领域代理分别锚定医学和法律。候选池刻混淆领域内与领域外数据,以避免效用范围过窄以及平凡的领域外检测。通用文本候选池最大,有 14 个候选;而金融、法律等专业领域初始候选较少,但可以扩展而不影响已有分数。

在 Qwen2.5-7B 上,将领域特定的合成数据与 Dolly-15k 混合往往会降低数学性能,所有生成器均低于 Dolly-only 基线。例外是金融,其中 DataFlow-Skill 流水线明显优于基线,而直接 LLM 生成则显著损害性能。所有合成数据混合都让数学平均分数相对于单独使用 Dolly-15k 的基线下降,降幅从约 2 到 6 分不等。DataFlow-Skill 在金融上达到 64.8 的平均分,显著高于 57.8 的基线,而 Claude Opus 4.6 生成则造成急剧下降,降至 44.4。

在 Dolly-15k 加领域特定合成数据上微调 Llama-3.1-8B,相对于单独使用 Dolly-15k,会降低数学和通用性能,但显著提升金融结果。基于 DataFlow 的生成器在金融上带来最大增益,DataFlow-Skill 取得最高平均分,而直接 LLM 生成的提升最弱。这一模式说明,添加合成领域数据并非普遍有益,在推理密集型领域可能损害性能。仅用 Dolly-15k 的基线在数学上达到 11.7,通用上达到 67.1,超过所有添加了领域合成数据的配置。在数学上,所有合成数据生成器都导致分数下降,平均分介于 5.8 至 9.3,而基线为 11.7。通用(MMLU-Redux)分数从 67.1 急剧降至 48.4–52.9 的区间,只要有领域数据混入便如此。金融是唯一合成数据带来帮助的领域:基线 15.1 的平均分被所有生成器超越,DataFlow-Skill 达到 36.5。在受测生成器中,基于 DataFlow 的方法(DataFlow 和 DataFlow-Skill)在金融上领先,而基于 LLM 的 Claude Opus 生成器以 28.4 的平均分落后。添加领域特定的合成数据在数学和通用上一致造成损害,表明增多合成数据并非安全的默认策略,且可能在推理任务上令性能倒退。

将领域特定的合成数据加入 Dolly-15k 指令微调语料,往往会降低 Qwen2.5-7B 的下游性能,无论使用哪个生成器,科学基准均跌至 Dolly-only 基线以下。DataFlow 类方法虽在法律上带来些许提升,但导致医学和科学分数大幅退步,且 DataFlow-Skill 实现的最强 LegalBench 结果是以 LexGLUE 分数降低为代价的。仅用 Dolly 的基线取得最佳科学平均分和具有竞争力的法律结果,说明增加合成数据并非安全默认。仅用 Dolly-15k 的基线取得最高科学平均分(27.9),并在该模型的所有领域增强变体上领先于该集群。DataFlow 将法律平均分从 74.5 提升至 77.2,但科学平均分从 27.9 急剧降至 20.1,其中 MMLU-STEM 下降尤为明显(47.5 降至 37.9)。DataFlow-Skill 将 LegalBench 提高至 92.0(高于 86.9),但 LexGLUE 从 62.0 降至 57.4,其科学平均分降至 23.4。Claude Opus 4.6 生成在 MedMCQA 上造成剧烈下降(27.4 降至 8.1),使整体科学平均分仅为 23.1,远低于基线。

在 Llama-3.1-8B 上,使用 Dolly-15k 与领域特定合成数据的混合物进行微调,效果参差不齐:法律和医学基准在所有生成器上均较 Dolly-only 基线改善,而科学性能一致下降,基于 DataFlow 的方法跌幅最大。结果显示,添加合成数据可能严重损害推理密集型领域的下游准确率,且生成方法的选择对结果影响显著。所有生成器在法律和医学上的平均分均较 Dolly-only 基线提高,法律增益最高达 3.6 分,医学增益最高达 15.7 分。在科学上,每个合成数据条件均低于 Dolly-only 基线;DataFlow-Skill 的平均分降至 3.1,而 Dolly-only 为 13.2,其中一项基准为零分。Claude Opus 4.6,一个直接 LLM 提示的生成器,取得了最高的医学平均分和最小的科学退步,但在科学上仍比 Dolly-only 低 3.9 分。基于 DataFlow 的流水线在 SciBench 和 MMLU-Pro 等开放式科学基准上崩溃,而在 LegalBench 和 MedMCQA 等结构化法律和医学任务上表现具有竞争力。

实验使用不同生成器产生的领域特定合成语料与 Dolly-15k 混合,分别微调 Qwen2.5-7B 和 Llama-3.1-8B,在数学、金融、法律、医学、科学和通用文本上评估下游效用。添加合成数据在数学、科学等推理密集型领域一致地损害了相对于 Dolly-only 基线的性能,而在金融或法律上的零星增益也不均衡且常伴随权衡。生成器的选择影响显著,流水线在某一领域表现出色,在另一领域却崩溃;简单地混合更多领域内合成数据作为默认策略被证明并不可靠。


用 AI 构建 AI

从创意到上线——通过免费 AI 协同编码、开箱即用的环境和最优惠的 GPU 价格,加速您的 AI 开发。

AI 协同编码
开箱即用的 GPU
最优定价

HyperAI Newsletters

订阅我们的最新资讯
我们会在北京时间 每周一的上午九点 向您的邮箱投递本周内的最新更新
邮件发送服务由 MailChimp 提供