HyperAIHyperAI

Command Palette

Search for a command to run...

2 小时前
LLM
代码生成

DataFlow-Harness:一个用于构建可编辑 LLM 数据管道的接地代码智能体平台

Runming He Zhen Hao Wong Hao Liang Zimo Meng Chengyu Shen Xiaochen Ma Wentao Zhang

摘要

大型语言模型(LLM)正越来越多地被用于自动化数据处理工作流,然而,编码智能体通常生成的脚本不会自动物化为持久、可编辑的平台工件。我们将这种脱节称为 NL2Pipeline 鸿沟。为弥合这一鸿沟,我们提出了 DATAFLOW-HARNESS,该平台引导 LLM 智能体通过类型化、增量式的变更来构建平台原生的有向无环图(DAG),而非生成自由形式的脚本。该平台结合了用于过程性指导的 DATAFLOW-SKILLS、一个暴露实时算子注册信息和当前管道状态的模型上下文协议(MCP)层,以及将对话式创作与可视化 DAG 编辑器同步的 DATAFLOW-WEBUI。在一个包含 12 项任务的数据工程基准测试中,DATAFLOW-HARNESS 实现了 93.3% 的实测端到端通过率。与 Vanilla Claude Code 相比,它将实测货币成本降低了 72.5%,生成延迟降低了 49.9%;其实测通过率与 Context-Aware Claude Code 基线相差在 0.9 个百分点以内,而成本则降低了 42.8%。逐任务分析表明,当构建依赖于隐式过程性知识时,Skills 最为有用。这些结果表明,实时平台接地能够生成持久、可编辑的工作流工件,其实测可靠性接近脚本生成基线,且实测构建成本和延迟更低。

一句话总结

北京大学和中关村学院的研究人员提出 DataFlow-Harness,一个基于实际代码 agent 的平台,通过引导 LLM agent 以类型化增量变更构建持久可编辑的 DAG,弥合 NL2Pipeline 差距。该平台集成 DATAFLOW-SKILLS 提供流程性指导、MCP 层暴露实时算子注册和流水线状态,以及 DATAFLOW-WEBUI 同步对话式创作与可视化编辑器。在包含 12 个数据工程任务的基准测试中,端到端通过率达到 93.3%93.3\%93.3%,与 Vanilla Claude Code 相比,货币成本降低 72.5%72.5\%72.5%,生成延迟降低 49.9%49.9\%49.9%,同时与上下文感知的 Claude Code 基线仅差 0.90.90.9 个百分点,且成本降低 42.8%42.8\%42.8%

核心贡献

  • 将 NL2Pipeline 差距定义为自然语言工作流意图与持久、可编辑、平台原生工作流产物之间的脱节。
  • DATAFLOW-HARNESS 结合流程性 Skills、实时模型上下文协议接地、类型化增量变更、结构验证以及同步的对话和可视化编辑器,构建平台原生的有向无环图。
  • 在 12 个数据工程任务基准上,DATAFLOW-HARNESS 实现了 93.3% 的端到端通过率,与上下文感知的 Claude Code 基线仅差 0.9 个百分点,而货币成本比 Vanilla Claude Code 低 72.5%,生成延迟低 49.9%;逐任务消融实验显示,当构建依赖隐式流程知识时,Skills 的收益最大。

引言

作者针对在工业数据处理工作流中部署大语言模型(LLM)日益增长的挑战展开研究。虽然编码 agent 可以将自然语言需求转化为可执行脚本,但这些脚本通常是一次性的、难以通过图形界面审计,并且经常产生幻觉依赖或依赖不可用的算子。这形成了作者所称的 NL2Pipeline 差距:用户自然语言意图与生产治理所需的持久、可编辑、平台原生流水线产物之间的脱节。先前的代码生成方法关注任务准确性,但未能将构建过程建立在数据工程平台的实时语义之上。作者贡献了 DATAFLOW-HARNESS,一个通过引导 agent 构建结构化工作流而非原始代码来弥合这一差距的平台。它结合了编码领域知识的流程性 Skills、对算子注册和当前状态的实时模型上下文协议访问,以及同步的对话/可视化界面。最终形成一个流水线创作系统,在匹配脚本生成通过率的同时减少 token 使用、成本和延迟,并生成可复用、可视觉检查的基于 DAG 的产物。

方法

作者将 DATAFLOW-HARNESS 的工作流合成围绕四个核心组件组织:DATAFLOW-WEBUI、MCP 工具层、数据流水线后端和 DATAFLOW-SKILLS。操作生命周期以数据流水线后端为中心,它作为对话、可视化和编程接口之间的权威事实来源。流水线变更通过 MCP 工具层发出,验证并提交到后端,然后与 DATAFLOW-WEBUI 同步。同时,DATAFLOW-SKILLS 提供流程性指导,在不直接修改流水线状态的情况下塑造 agent 的推理。

数据流水线后端将流水线表示为 P=(D,O,E,S,R)P = (D, O, E, S, R)P=(D,O,E,S,R),其中 DDD 是数据源及其 URI 的集合,OOO 是已配置的算子实例集合,EO×OE \subseteq O \times OEO×O 包含有向数据依赖边,SSS 记录输入和输出字段模式,RRR 包含运行时状态,例如模型服务端点。agent 不是生成自由形式的代码,而是通过类型化变更与后端交互,包括添加或删除算子、更新参数以及连接边。只有当生成的图是无环的且相邻算子模式兼容时,变更才会被提交。这些检查确立了结构有效性,但本身并不能保证语义正确性、端点可用性或输出质量。

DATAFLOW-WEBUI 为工作流构建提供了两种同步的模态:用于自然语言创作的对话界面和用于直接工作流检查和编辑的可视化 DAG 编辑器。

在对话界面中,用户用自然语言描述工作流需求。在每个 agent 回合之前,当前流水线状态和 DataFlow 算子注册通过 MCP 注入到底层语言模型的上下文中。在 DATAFLOW-SKILLS 的指导下,模型解释用户意图并确定所需的工作流修改,这些修改以 MCP 工具调用的形式表达并应用到数据流水线后端。可视化 DAG 编辑器将工作流渲染为有向无环图。用户可以检查 agent 提议的更改、调整参数、重新连接边或直接添加和删除算子。任何手动编辑都会立即提交到数据流水线后端,确保后续的 agent 交互在最新的工作流状态上操作,无需显式重新同步。

每个流水线更改,无论是 agent 提议的还是手动进行的,都通过 MCP 工具层中的请求-验证-提交协议。在每个合成回合开始时,agent 获取最新的流水线状态,合并自上一回合以来的任何手动编辑。在 DATAFLOW-SKILLS 的指导下,agent 发出一个 MCP 工具调用,将预期的更改表达为基于 DataFlow 注册实时元数据的类型化、结构化变更。然后系统验证两个属性:更新后的流水线保持有向无环图,并且每个算子的输出字段模式与所有下游算子的输入模式兼容。未通过任一检查的更改将被拒绝。验证通过的更改写入后端存储,并通过 WebSocket 通知将更新后的状态广播给连接的客户端,以保持创作模态同步。

DATAFLOW-SKILLS 通过将领域特定知识注入推理上下文,为工作流合成提供流程性指导。虽然 MCP 工具层暴露了算子元数据和工作流状态,但它不编码推荐的构建策略或算子组合的最佳实践。为此,DATAFLOW-SKILLS 编码了两类知识。第一类由流程性蓝图组成,定义了推荐的工作流构建序列,包括模式推断、算子选择、参数配置和服务验证。第二类由组合约束组成,捕捉算子兼容性规则,例如模态匹配和嵌套结构的字段流约定。两者结合,DATAFLOW-SKILLS 指导 agent 推理,而 MCP 工具层将执行建立在实时 DataFlow 环境之上。

实验

实验在工业数据处理任务中比较了自由形式的代码生成与结构化 DAG 合成,发现仅在没有流程性指导的情况下将 agent 直接约束到平台算子(仅 MCP)会大幅降低任务成功率,而 DATAFLOW-HARNESS 几乎弥合了这一差距,并带来了显著的成本和延迟节省。消融实验表明,流程性技能在模糊、流程密集的任务上帮助最大,但在工作流路由简单或失败源于模型局限性的情况下收益甚微。下游评估进一步表明,接地气的流水线能产生更高质量的训练数据,从而在具有挑战性的数学和代码基准上提高模型准确性,证明系统化的算子复用和流程性指导既提高了流水线可靠性,也提升了生成数据的下游效用。

为普通代码生成添加执行上下文可以提高端到端成功率,但这两种技术都会输出消耗大量资源的单体脚本。仅使用算子规范直接合成原生 DAG 工作流会引入明显的推理挑战,导致通过率大幅下降。DATAFLOW-HARNESS 通过引入流程性指导弥合了这一差距,实现了接近上下文感知脚本生成的成功率,同时通过紧凑的工作流表示大幅降低了货币成本和生成延迟。为普通代码生成添加执行上下文将通过率提升了几个百分点,但增加了输入 token 消耗。从脚本切换到仅使用算子规范的原生 DAG 合成导致端到端成功率急剧下降,凸显了 NL2Pipeline 差距。DATAFLOW-HARNESS 恢复了大部分损失的成功率,达到与最强脚本基线相差不到一个百分点的通过率。与普通脚本生成相比,DATAFLOW-HARNESS 将货币成本降低了 70% 以上,生成延迟降低了近一半。即使与上下文感知的脚本基线相比,DATAFLOW-HARNESS 也降低了超过 40% 的成本和近五分之一的延迟,同时保持了相当的成功率。工作流表示在 token 效率上明显更高:仅使用算子规范几乎将输入 token 减半,添加流程性指导进一步将总 token 使用量减少了约四分之一。

在教科书到 VQA 提取中,DATAFLOW-HARNESS 在精确率和覆盖率上均优于所有基线。最大的收益出现在覆盖率上,它恢复了比其他方法多得多的有效问答对。这表明该框架构建了更完整的工作流,而不仅仅是保守地过滤输出。DATAFLOW-HARNESS 达到了 97.2% 的精确率和 87.3% 的覆盖率,是评估方法中最高的。覆盖率显示出最大的绝对改进,所提方法恢复的可提取 QA 对数量远多于任何基线。上下文感知的思维链基线显著优于普通方法,覆盖率几乎翻倍,凸显了文档布局感知的价值。

流程性指导在需要隐式领域知识来组装工作流的任务上大幅提升了成功率,将总通过次数从 18/30 提升到 29/30。对于简单路由任务,两种方法均已达到完美成功率,因此没有增益。其余任务的失败率保持不变,表明瓶颈在工作流合成之外,指导无法提供帮助。在依赖流程知识的任务上,如 QA 生成和文本到 QA 链,DataFlow-Harness 将总成功次数从 30 次中的 18 次提高到 29 次。两种方法在每个简单路由任务(包括字段重命名和嵌套展平)上均实现了完美的 10 次通过 10 次。多字段评分任务在两种方法下表现出相同的失败率,表明剩余错误源于下游数值约束而非工作流构建。

在匹配的训练轮次下,由 DataFlow-Harness 流水线合成的数据在数学套件上始终带来比 Vanilla CC 流水线更高的平均准确率。一轮训练后,平均准确率从 49.9 提高到 51.6,两轮后从 54.5 提高到 55.7。在最具挑战性的基准(尤其是 AIME24 和 AIME25)上收益最大,表明接地气的流水线产生了更具挑战性和更高质量的推理轨迹。在 AIME24@32 上,使用 DataFlow-Harness 数据训练一轮将准确率从 25.1 提高到 35.9,相对提升超过 40%。使用 DataFlow-Harness 数据训练一轮后,AMC23 准确率翻倍以上(72.5 对 47.5),在竞赛式数学上表现出强劲的改进。

与 Vanilla CC 基线相比,DATAFLOW-HARNESS 流水线产生了相当的知识性能和混合的数学结果,但在所有代码基准上均有一致的提升。这些编码改进使九个基准的整体平均分提高了 2.3 分,表明接地气的“批评-重写”和评判阶段产生了更可执行、结构更好的代码。MMLU 分数几乎相同(74.2 对 74.4),表明事实知识没有退化。所有四个代码基准都倾向于 DATAFLOW-HARNESS,其中 MBPP 的差距最大(75.4 对 64.6)。整体基准平均分从 61.5 上升到 63.8,主要由编码任务增益驱动。数学基准结果参差不齐:GSM8K 下降(79.5 对 82.9),而 MATH 和 Olympiad 有适度提升。接地气流水线的批评和过滤阶段很可能产生了更可靠的代码输出。

评估在多个维度上比较了 DATAFLOW-HARNESS 与基于脚本的生成和普通流水线,包括工作流合成、信息提取、数学数据生成和多基准训练。该框架恢复了从单体脚本转向原生 DAG 合成时损失的大部分成功率,同时将货币成本降低了 70% 以上,延迟降低了近一半。流程性指导对于需要隐式领域知识的任务至关重要,并且该流水线产生了更高质量的数学和代码数据,在具有挑战性的推理基准上取得了显著提升。总体而言,DATAFLOW-HARNESS 以显著更低的资源消耗提供了具有竞争力或更优的性能。


用 AI 构建 AI

从创意到上线——通过免费 AI 协同编码、开箱即用的环境和最优惠的 GPU 价格,加速您的 AI 开发。

AI 协同编码
开箱即用的 GPU
最优定价

HyperAI Newsletters

订阅我们的最新资讯
我们会在北京时间 每周一的上午九点 向您的邮箱投递本周内的最新更新
邮件发送服务由 MailChimp 提供