HyperAIHyperAI

Command Palette

Search for a command to run...

Terminal-Universe:将智能体轨迹转化为可扩展的终端环境

摘要

随着基于终端的代码智能体日益普及,相应的智能体轨迹已大规模积累,但真实、可执行的环境仍然稀缺。然而,环境恰恰是智能体后训练真正所需:每个环境可被重复查询以生成众多可验证任务并提供执行反馈,而轨迹仅是单一的冻结演示。我们观察到,与其从零生成环境,现有智能体轨迹中的工具执行历史暴露了其运行环境的结构与内容,使得从轨迹本身重建这些环境成为可能。据此,我们提出 Terminal-Universe 框架,将每条轨迹转化为可复用的环境,并对其进行探索以合成新任务和持续交互。具体而言,Terminal-Universe 重放轨迹中记录的文件操作,恢复智能体修改前的每个文件,从而得到一个部分工作空间;随后由补全智能体提供缺失的文件和依赖项。在此恢复的工作空间上,我们既重建原始意图任务,也合成全新任务。此外,我们还沿两个互补维度——广度与深度——扩展对应环境的任务,以复现真实工程实践中的常规模式。在广度方面,我们挖掘相关环境间的有向依赖关系,合成跨工作空间的查询,覆盖多个代码库,正如开发者在实际开发中常做的那样。在深度方面,我们将初始的单轮查询扩展为多轮会话,通过用户智能体捕捉迭代的用户反馈与需求细化。将 Terminal-Universe 应用于公开的终端智能体轨迹,产生了 37.3k 个任务充分的环境。在此语料上对 Qwen3.5-27B 进行监督微调,使 Terminal-Bench 2.1 上的单轮性能提升 11.9 个百分点,EvoCode-Bench v2 MT@4 上的多轮性能提升 13.8 个百分点。

一句话总结

Qwen 团队(阿里巴巴集团)与清华大学提出 Terminal-Universe,一个从 agent 轨迹中重建可复用终端环境的框架,通过重放文件操作并使用 completion agent 恢复缺失的依赖,然后沿广度(通过有向依赖关系进行跨工作空间查询)和深度(多轮用户-agent 会话)合成新任务;应用于 37.3k 个任务充分的环境,对 Qwen3.5-27B 进行监督微调,在 Terminal-Bench 2.1 上单轮性能提升 11.9 分,在 EvoCode-Bench v2 MT@4 上多轮性能提升 13.8 分。

核心贡献

  • Terminal-Universe 通过确定性重放文件操作并使用 completion agent 补充缺失依赖,从记录的 agent 轨迹中重建可复用的执行环境,然后在这些恢复的工作空间上合成新的可验证任务。
  • Terminal-Universe 引入两个互补的扩展轴:广度扩展通过挖掘环境之间的有向依赖关系创建跨工作空间查询,深度扩展将单轮任务扩展为多轮会话,并引入模拟用户 agent 进行迭代反馈。
  • 应用于公开可用的终端 agent 轨迹,该方法产生了 37.3k 个任务充分的环境;在该数据上对 Qwen3.5-27B 进行监督微调,使单轮 Terminal-Bench 2.1 性能提升 11.9 分,多轮 EvoCode-Bench v2 MT@4 性能提升 13.8 分。

引言

作者解决了训练基于终端的代码 agent 时的一个扩展瓶颈:虽然 agent 轨迹快速积累,但可复用的可执行环境仍然稀缺。环境比固定轨迹更有价值,因为它允许使用更强的模型重新求解,通过测试验证正确性,并在同一工作空间上提出更困难的任务。先前的工作通过仓库历史、缺陷注入或任务条件合成来构建环境,但这些方法仅限于修复任务,缺乏真实性,或无法超越人工策展的规模。作者提出 Terminal-Universe,一个从记录的轨迹中重建可执行工作空间的框架,通过重放文件操作并使用 agent 填补缺失依赖而不泄露解决方案。然后沿两个轴合成新任务——跨工作空间广度和多轮深度——并为每个任务配对一个 agent 编写的验证器。在此语料库上训练为终端 agent 基准带来了显著增益,并且在重建环境中重新求解的性能远超模仿原始轨迹。

数据集

作者从多种终端风格的 CLI 和软件工程 agent 轨迹中构建监督微调(SFT)语料库。数据集的构建和使用方式如下:

  • 种子选择 原始执行轨迹来源于多个终端和软件工程语料库。仅当最终工作空间包含至少 5 个文件和 100 行代码时,轨迹才会被保留。所有源自 Terminal-Bench 的源均被排除以防止泄漏。

  • 环境重建与充分性过滤 该流程重建了 68,263 个环境。最初,重放的工作空间较为稀疏(平均 2.9 个文件),因为解决方案文件被保留。Agentic completion 将其丰富至平均 22.4 个文件。经过污染过滤和仓库级去重后,充分性判断器评估了 38,294 个终端环境和 1,900 个 SWE 环境。Agentic completion 将充分率从 40.2%(终端)/ 20.1%(SWE)提升至 93.5% / 77.1%,产生了 37,273 个完全充分的环境。终端池以 Python 为主(84.7%),也包含 C++ 和 C;数据处理、DevOps 和安全工作负载覆盖了超过 80% 的技术领域。

  • 任务生成与验证 从充分的环境中,四种重新查询变体生成任务:意图恢复(原始任务)、Single-WS(仓库内新任务)、Cross-WS(跨仓库依赖挑战)和 Multi-Round(迭代会话)。 每个任务配对一个由 agent 编写的 pytest 验证器,在目标容器内运行。候选解决方案由教师模型生成(temperature 1.0,top-p 0.95,256k token 上下文,最多 500 轮,4 小时超时)。 对于 Single-WS 和 Cross-WS,仅当所有测试在最终工作空间状态上通过时,轨迹才被接受。Multi-Round 会话通过移除尾部连续失败的轮次进行修剪,并保留至少包含两个已验证通过轮次的会话;中间失败被保留以提供错误恢复的监督。所有被接受的轨迹都经过严格的去污染处理,以排除评估基准。

  • 最终 SFT 语料库 经验证器过滤的合成产生了 31,977 个多轮 SFT 演示,总计约 1.42B 训练 token。构成如下:

    • Single-WS:25,386 条轨迹
    • Cross-WS:3,512 条轨迹
    • Multi-Round:3,079 条轨迹

    该数据集直接用于监督微调,每个演示提供一个经过验证的 agent 交互,包括适用的错误诊断和恢复步骤。

方法

作者提出 Terminal-Universe,一个用于生成高质量终端 agent 轨迹的综合框架。该流程包含三个核心阶段:环境重建、重新查询和验证。

如框架图所示,过程从环境重建开始,从记录的轨迹 τ\tauτ 中恢复可执行的工作空间 E^\widehat{E}E

该恢复过程分为三个阶段。首先,确定性重放按时间顺序处理 τ\tauτ 中的读、写和编辑操作,恢复每个访问路径的最早和最新文件内容,产生部分初始工作空间 E^0\widehat{E}_0E0。其次,agentic completion 使用 completion agent 创建缺失文件、补全部分文件并恢复依赖,得到完整的工作空间 E^\widehat{E}E。最后,环境过滤使用 agentic 判断器以只读工具检查每个 E^\widehat{E}E,仅保留那些提供足够项目上下文以支持恢复任务的工作空间。每个重建的工作空间运行在带有网络访问的标准化 Ubuntu 容器中。

重建之后,作者引入四种互补的重新查询机制,以利用工作空间的潜在能力空间。意图恢复将源用户请求整合为自包含的任务,通过将轨迹规范化为请求、动作和文件更改的时序流。单工作空间合成从单个工作空间派生新查询,离线生成器检查工作空间并在真实性、结构多样性和可验证性约束下合成候选任务。跨工作空间合成通过连接相关的工作空间提供广度。一个 agent 对每个工作空间的技术领域进行画像,候选对通过 TF-IDF 最近邻搜索检索。LLM 判断器识别有向依赖边,任务生成器指定可观察行为以弥合功能差距。多轮延续将初始查询扩展为交互式会话。用户 agent 维护显式的需求追踪器,并采用轮次级别的验证和反馈。用户 agent 的请求根据轮次结果自然地分为功能扩展、功能修订或功能冲突风格。

验证与过滤阶段确保生成数据的质量。对于 Single-WS 和 Cross-WS 任务,agentic 验证器在目标容器内构建自包含的 pytest 套件。候选解决方案使用教师模型在编码脚手架中生成,采用特定的 temperature 和 top-p 参数在大上下文窗口上解码。仅当所有测试在最终工作空间状态上通过时,轨迹才被接受。对于 Multi-Round 会话,选择在轮次级别进行。终止会话中尾部连续失败的轮次被修剪,仅当会话包含至少两个已验证通过的轮次时才被保留。

延续数据的通过和失败模式如下所示。

成功恢复之前的中间失败被保留,以提供错误诊断和恢复的监督。被接受的轨迹被格式化为多轮 SFT 演示,并经过严格的去污染处理以排除评估基准。

实验

在经验证器过滤的单工作空间、跨工作空间和多轮重新查询轨迹的混合数据上微调 Qwen3.5-27B,显著提升了终端 agent 性能,完整的混合数据在单轮和持久累积基准上均带来强劲增益。消融研究表明,在具有 agentic completion 和验证器过滤的重建环境中重新求解任务,比模仿原始轨迹或仅使用确定性重放提供了更有效的监督。跨工作空间合成扩展了任务广度,特别有利于软件工程等复杂类别,而带轮次级别验证的多轮深度扩展提升了模型处理长累积请求序列的能力。在固定数据预算下,增加更多不同的环境比在每个环境上生成额外查询或解决方案更有价值,并且该流程可推广到终端工作空间之外,迁移到软件工程轨迹以改善终端 agent 行为。

所有比较的环境构建方法都提供可执行验证器,但都不支持多轮交互或跨工作空间合成。消融实验显示,添加带轮次级别验证的多轮数据可提升持久任务性能,且增加不同环境的数量比在每个环境上添加额外查询或解决方案带来更大增益。来自软件工程工作空间的跨域轨迹也能迁移到终端 agent 任务,提升结果。比较中的每种方法都包含可执行验证器,但都不包含多轮或跨工作空间能力。CLI-Gym 通过扰动仅从 29 个源环境创建了 1,655 个任务,而 RST 递归扩展到 37.5k 个环境和任务。OpenThinker-Agent 报告了 100k 个任务,但未计算可复用环境,这与将每个任务与不同工作空间配对的方法不同。多轮深度扩展提高了 MT@4 和 Case 分数,移除轮次级别验证器反馈会降低这两个指标。在固定数据预算下,添加新环境可提升性能,而在相同工作空间上添加额外查询或解决方案则变化可忽略。在从软件工程工作空间重建的轨迹上训练可提升终端基准分数,证明了跨域迁移。

仅确定性重放使大多数工作空间任务不充分,仅 40% 的终端和 20% 的 SWE 环境达到充分性标准。Agentic completion 显著丰富了这些环境,将终端工作空间的充分性提升至 94%,SWE 工作空间提升至 77%,从而恢复了下游任务生成所需的执行上下文。仅重放重建的充分性较低:终端工作空间为 40.2%,SWE 仓库为 20.1%。Agentic completion 将充分性大幅提升至 93.5%(终端)和 77.1%(SWE),使大多数环境可用。完成步骤恢复了确定性重放无法提供的缺失执行上下文,这与后续训练改进一致。

基础 Qwen3.5-27B 模型在终端任务上取得中等分数,但在持久多轮任务上表现挣扎,而先前的任务合成方法在多轮完成上远远落后,完成率为零。在经验证器过滤的单轮和多轮轨迹混合数据上微调,显著提升了终端和累积任务性能,环境扩展和多轮数据被证明至关重要。Qwen3.5-27B 基础模型在 Terminal-Bench 2.0 上得分为 41.6%,EvoCode-Bench v2 上 MT@4 为 6.3,而教师模型 Qwen3.7-Max 分别为 69.7% 和 39.8。现有的合成方法 TerminalTraj-32B 和 TermiGen-32B 在 Terminal-Bench 2.0 上仅达到 22.0% 和 19.3%,并在多轮序列上完全失败(MT@4 为 0.0)。完整混合训练将 Qwen3.5-27B 提升至 Terminal-Bench 2.0 的 52.8% 和 MT@4 的 20.1,多轮完成率提高了两倍以上。在固定数据预算下,添加新环境将 Terminal-Bench 2.1 从 53.2 提升至 56.0,而添加查询或解决方案收益可忽略。添加多轮数据将 MT@4 从 18.4 提升至 21.0,Case 分数从 71.9 提升至 76.9,显示出对累积需求的更好处理。

使用一致的教师策略(意图恢复)重新求解任务,比直接模仿原始 agent 的轨迹提供了更强的监督。使用相同数量的数据,意图恢复将平均分数从 36.7 提升至 52.1,表明在统一策略下重新生成演示比保留原始行为更有效。意图恢复相对于源轨迹 SFT 将平均性能提升了超过 15 个百分点。该改进在两个评估框架上均一致,Claude Code 和 Terminus2-XML 分数均显著上升。

在意图恢复重放中添加 agentic completion 显著提升了 Terminus2-XML 上的性能,分数从 48.7 提升至 52.9,同时使用相同的 35.8k 训练记录。无任何重放的基础模型得分为 46.2,因此仅重放提供了适度增益,但将其与 agentic completion 结合产生了最强结果。重放 + agentic completion 明显优于仅重放(52.9 vs. 48.7)。无重放的基础模型得分最低(46.2),证实了重放和 agentic completion 均有积极贡献。

实验评估了终端 agent 的环境构建和训练策略,揭示了现有方法缺乏多轮交互和跨工作空间合成,且仅确定性重放使大多数工作空间不充分,这一局限在很大程度上被 agentic completion 克服。在经验证器过滤的单轮和多轮轨迹混合数据上微调,并强调扩展不同环境而非在每个环境上添加额外查询,显著提升了单任务和持久多轮性能,同时来自软件工程工作空间的跨域轨迹有效迁移。此外,使用一致的教师策略(意图恢复)重新求解任务比直接模仿源轨迹提供了更强的监督,并且将 agentic completion 与重放结合提供了最大增益,证实了恢复执行上下文和使用统一演示的重要性。


用 AI 构建 AI

从创意到上线——通过免费 AI 协同编码、开箱即用的环境和最优惠的 GPU 价格,加速您的 AI 开发。

AI 协同编码
开箱即用的 GPU
最优定价

HyperAI Newsletters

订阅我们的最新资讯
我们会在北京时间 每周一的上午九点 向您的邮箱投递本周内的最新更新
邮件发送服务由 MailChimp 提供