Command Palette
Search for a command to run...
Spark-to-Paper:作为可组合技能的端到端研究论文生成
Spark-to-Paper:作为可组合技能的端到端研究论文生成
Zhuoyang Qian Biao Wu Yiran Wang Chris D Yan Desan Dai Liangwei Zheng Jin Jiang Jusheng Zhang Wenhao Wang
摘要
将一个研究想法转化为一篇完整的论文,需要的不仅仅是文本生成:系统必须检索文献、设计并执行实验、根据证据修正论断、生成符合发表要求的图表,并在漫长的生成过程中保持一致性。我们提出了 Spark-to-Paper,这是一个端到端的研究论文生成系统,它被实现为现有编程助手内部的十三个可组合技能,无需独立的智能体平台或编排服务。Spark-to-Paper 将基于模型的判断与可直接执行和检查的确定性操作分离开来。它进一步将实验规划与报告撰写分离,从而在观察到结果之前就明确所需的证据,并根据实测结果修正稿件中的论断。为了提高长研究轨迹中的可靠性,该系统将确定性完整性检查与自我批判相结合,并限制了一种我们称为“自我反驳循环”的失效模式,即重复实验持续否定最初的研究目标。Spark-to-Paper 还通过程序化绘图生成实验结果的可编辑矢量图,并通过基于代码的重构生成方法示意图。在八个受控研究主题中,Spark-to-Paper 实现了 99.5% 的引用有效性和 96.4% 的图表可编辑性。一项受控消融实验将捏造检测率从单次生成草稿的 14% 提升至使用完整完整性与审校栈的 92%,而对抗性审校则达到了 74% 的精确率。整个系统使用 11.9M 个 token,每篇稿件成本为 8.1 美元,平均耗时 3.2 小时。这些结果表明,端到端的研究论文生成可以作为现有编程助手内部一个轻量级、可组合的工作流来实现,同时让实验证据成为论断被接受、修正或放弃的核心依据。
一句话总结
Vast Intelligence Lab与悉尼科技大学提出Spark-to-Paper,一个端到端研究论文生成系统,以十三个可组合技能的形式实现在编程助手内部,将模型判断与确定性检查解耦,将实验规划与报告分离,并采用完整性检查和自我批判以避免自我反驳循环,实现了99.5%的引用有效性、96.4%的图形可编辑性,每篇稿件成本为8.1美元。
核心贡献
- Spark-to-Paper是一个端到端研究论文生成系统,以十三个可组合技能的形式实现在现有编程助手内部,复用其原生文件、工具和代码执行能力,无需单独的agent平台。它将基于模型的判断与确定性操作分离,并将实验规划与报告分离,使得所需证据在结果观察之前就已指定,稿件中的主张据此进行修订。
- 该系统限制了自我反驳循环,即重复实验否定原始研究目标的一种失败模式,它将不成功的轨迹保留为研究报告,并转向新的想法,确保根据证据对主张进行修订或放弃,而不是强行导向成功的叙述。
- Spark-to-Paper通过实验结果的程序化绘图生成可编辑矢量图,并通过基于代码的重建生成方法示意图,同时应用确定性完整性检查和自我批判以减少捏造。在八个受控研究主题上,引用有效性达到99.5%,图形可编辑性96.4%,而受控消融将捏造检测从14%提升至92%,对抗审查精确率达到74%。
引言
实现从研究到论文的全流程自动化不仅需要生成文本,还需要文献检索、实验、主张修订和图表创建。近期的自主研究agents可以端到端地完成这些任务,但它们通常构建为独立平台,拥有自己的编排基础设施,与研究人员已有的编码环境分离。与此同时,现代编程助手提供文件检查、代码执行和工具使用功能,但现有的基于技能的工具仅支持部分工作流程,如草稿撰写或文献检索。作者提出Spark-to-Paper,该系统将这些能力组合为十三个可组合技能,集成在现有编程助手内部,实现端到端的论文生成,具备基于证据的主张修订、确定性完整性检查和可编辑矢量图,无需单独的agent平台或编排服务。
方法
作者提出Spark-to-Paper,一个由十三个技能组成、在现有编程助手内部运行的系统。每个技能处理特定的研究任务,如规划、文献检索、写作或图表生成。该框架并非构建一个独立的agent系统,而是利用编程助手的原生能力来读取文件、执行代码和调用外部工具。所有技能共享一个公共项目目录,读取前一步产生的产物,并将输出写回项目。这种基于文件的接口使得稿件能够无缝地贯穿整个流程进行演化。
每个技能内部,系统将需要判断的任务与可机械执行的任务分开。语言模型处理上下文相关的决策,如论点组织、文献选择和主张评估。反之,具有明确规则的操作,如检查稿件结构、验证引用和编译LaTeX,则由确定性脚本处理。这种设计确保开放式生成仅限于需要语义推理的领域,而可验证的操作保持可复现。
这些技能的执行被组织为一个结构化的流程。
如框架图所示,流程从阶段0(输入路由)开始。系统检查用户输入以确定起点,并选择结果完整性模式。如果没有可用的测量结果,则进入提案模式,其中不可用的值必须保持未指定。如果有实验数据,则进入数据感知模式,要求定量声明必须由所提供的数据支撑。
核心流程包括阶段1至7。规划技能将输入转化为结构化蓝图,识别研究问题、贡献和章节结构。引用技能随后通过搜索相关文献并检查元数据来构建经过验证的参考文献列表,将有效引用存储在BibTeX文件中。写作技能利用蓝图和参考文献生成完整的LaTeX稿件,保持各章节之间的一致性。之后,精炼技能对整篇稿件进行修订,以消除重复并统一术语,随后重新运行确定性检查。审查技能随后通过多个独立的审查遍次对稿件提出质疑,检查技术正确性和实验设计。已确认的问题将返回进行进一步精炼。图表技能生成可视化内容,组装技能将所有组件组合为最终的LaTeX项目,并编译它,验证无错误。
阶段8有条件地处理实验执行。如果存在完整的草稿且计划的实验是可行的,系统将运行它们,记录输出,并用新的证据更新稿件。这连接了流程中的提案部分和数据感知部分。
为了在长生成周期中保持可靠性,作者实现了一个双重完整性系统。确定性闸门强制执行显式约束,如引用一致性和成功编译。对于随时间出现的语义错误,系统采用基于模型的自我批判。自我审查在编辑后局部运行,以纠正术语漂移和局部不一致。对抗审查在稿件层面运行,通过独立的审查遍次从互补角度审视论文。提出的问题必须引用具体段落,并在被接受进行修订前检查其有效性。
为防止自我反驳循环,即系统反复修订一个研究方向而不收敛,实验、批判和修订的循环次数被限制。如果在七个循环后研究目标仍无法得到支持,该轨迹将被终止,并生成失败报告。然后系统从另一个想法开始一个新的研究轨迹。
图形生成遵循两条不同的路径。方法和解释性图形首先使用图像生成模型进行视觉创建,然后通过代码重建为可编辑矢量图形,迭代调整布局以匹配视觉目标。实验结果图形直接通过绘图程序从测量数据生成,确保定量准确性。
实验
评估设置采用预注册协议,并在八个主题上进行受控实验,将Spark-to-Paper与人类预印本、先前的自主系统以及单次传递基线进行比较。质量通过引用有效性、图形可编辑性和捏造检测进行评估,消融实验表明,完整的质量控制堆栈大幅提高了检测率,而对抗审查贡献了高精度。案例研究证实,系统自主地精炼其方法,并优先考虑证据而非用户强加的先验预期,从而产生具有一致、可追溯主张的稿件。
Spark-to-Paper是唯一一个提供完整端到端自动化、运行实验、绘制图形、生成可编辑矢量图形且无需常驻基础设施的比较系统。其他系统要么缺乏可编辑矢量输出,要么需要常驻基础设施,要么仅在一个或多个方面提供部分能力。Spark-to-Paper是唯一结合了完整端到端自动化、完全运行实验、绘制图形、可编辑矢量输出且无需常驻基础设施的系统。AI Scientist v2和AutoResearchClaw在端到端、实验运行和图形绘制方面与Spark-to-Paper相当,但它们不提供可编辑矢量图,且需要常驻基础设施。
评估框架定义了五个质量指标,每个指标均为已验证或可编辑元素与总实例的比率,以及一个追踪增量计算成本的效率维度。审查精确率仅针对具有明确审查阶段的配置进行评估,所有测量结果均报告在一组外部选定的主题上,并带有主题间的不确定性。效率以相对于前一配置的token和美元增量来衡量,隔离每个质量控制组件的边际成本。引用有效性是成功解析的参考文献的比例。捏造检测衡量被注入的无支撑主张中被标记为无支撑的比例。图形可编辑性是所有图形元素中可编辑元素的比例。审查精确率是提出的审查问题中经独立验证的比例,排除模糊判断。跨模板鲁棒性是成功模板数占支持模板数的比例。效率通过每增加一个层次的增量token和美元成本来衡量,相对于直接前一行报告。
Spark-to-Paper在所有评估系统中实现了最高的引用有效性和图形可编辑性,超越了人类撰写的预印本和先前的自主研究agents。先前的系统提供中等水平的引用有效性,但几乎不提供可编辑图形,而单次传递的LLM基线虽然便宜得多且速度更快,但引用准确性大幅下降。因此,完整流程以适度的成本和时间增加,提供了可与人类竞争的成果质量。Spark-to-Paper的引用有效性(99.5%)超过了人类预印本(97.8%)和所有先前的自主系统(范围从91%到96%)。图形可编辑性达到96.4%,而先前的系统最多提供3%的可编辑元素,人类预印本平均为58%。单次传递LLM基线成本为0.66美元,用时16分钟,但其引用有效性降至81%,说明了质量与效率的权衡。Agent Laboratory是先前系统中最便宜的,成本为2.33美元,达到了96%的引用有效性,但没有可编辑图形。
从单次传递草稿开始,引入闸门显著将捏造检测从14%提升至69%,同时产生最大的token和货币开销。加入自我审查和对抗审查进一步将检测率分别提升至81%和92%,每次增加的增量成本较小。对抗审查阶段还达到了74%的精确率,表明大多数提出的问题都是可验证的。在没有质量控制步骤的情况下,只有14%的植入捏造探针被检测到。闸门将检测率提升至69%,但每篇论文增加810万token和5.3美元,这是最大的单组件成本。自我审查以较低的110万token增量成本将检测率提升至81%。包含对抗审查的完整堆栈达到92%的检测率,并获得74%的审查精确率,意味着大多数提出的问题都是可验证的。
评估使用引用有效性、图形可编辑性、捏造检测和成本指标,将Spark-to-Paper与先前的系统和人类预印本进行比较。Spark-to-Paper独特地提供了完整的端到端自动化,运行实验,并生成可编辑矢量图形,无需常驻基础设施。它在引用有效性和图形可编辑性上均高于人类预印本和早期的agents。消融实验表明,叠加闸门、自我审查和对抗审查逐步提升了捏造检测,而对抗审查以适度的增量成本提供了高精确率。