Command Palette
Search for a command to run...
Mid-Harness:在模型与 Harness 之间扩展终端智能体的动作
Mid-Harness:在模型与 Harness 之间扩展终端智能体的动作
摘要
终端智能体通过随机的模型生成来执行动作,但生成有用动作的能力并不能确保其被可靠执行。一条糟糕的命令(例如,安装错误的软件包)可能会改变环境,从而阻碍后续进展,即使模型本可以生成更好的备选动作。我们研究在模型与 harness 之间的边界上分配测试时计算是否能提高动作可靠性与轨迹成功率,以及什么因素使这种分配有效。为研究这些问题,我们提出了 Mid-Harness,它在将某个候选动作提交执行之前对其进行采样和验证,同时保持生成器与 harness 不变。在使用 TMAX-9B 生成器时,若验证较弱,更多的动作采样几乎不带来收益;而有能力的验证器则能利用同一生成器产生的有用备选动作。在 TerminalBench-Lite 上,GPT-5.6 Sol 验证器将 Pass@1 从基础智能体的 50.00% 提升到采样 8 个动作时的 68.03%。当同一 TMAX-9B 模型作为验证器时,在所评估的验证机制中,成对验证表现最佳。将更强验证器的响应蒸馏到 TMAX-9B 中可进一步提高 Pass@1,同时保持动作生成器不变。在 TerminalBench-Lite 上使用 TMAX-9B 时,与仅生成更多轨迹相比,将动作扩展与轨迹扩展相结合能够在更低的估计 token 成本下获得更高的成功率。Mid-Harness 还在更多模型、基准和 harness 上提升了性能。这些发现将动作扩展确定为终端智能体测试时计算扩展的一个有前景的目标。项目页面见 link。
一句话总结
来自 NVIDIA 和 KAIST 的研究者提出 Mid-Harness,它在模型与执行框架边界处采样并验证候选动作,在执行前完成选择,同时保持生成器与执行框架不变;在 TerminalBench-Lite 上使用 TMAX-9B 生成器时,GPT-5.6 Sol 验证器使用 8 个采样动作将 Pass@1 从 50.00% 提升到 68.03%,将更强验证器的响应蒸馏到 TMAX-9B 可进一步提高 Pass@1,并且将动作扩展与轨迹扩展结合,在比仅生成更多轨迹更低的预估 token 成本下实现更高成功率。
核心贡献
- Mid-Harness 在模型与执行框架边界处采样并验证候选动作,在将某个动作转发给执行框架执行之前完成选择,同时保持生成器与执行框架不变。
- 在 TerminalBench-Lite 上,验证质量决定动作采样收益:使用 GPT-5.6 Sol 验证器和 TMAX-9B 生成器时,8 个采样动作将 Pass@1 从 50.00% 提升到 68.03%;当 TMAX-9B 作为验证器时,成对验证在评估的机制中表现最佳。
- 将更强验证器蒸馏到 TMAX-9B 可提升 Pass@1,而不改变动作生成器。将 Mid-Harness 与轨迹扩展结合,在更低的预估 token 成本下达到更高成功率,并在更多模型、基准和执行框架上带来收益。
引言
大语言模型越来越多地用于驱动软件工程、数据科学和科学发现中的终端 Agent。一个核心挑战是动作可靠性:即使是有能力的模型也可能在长周期任务中失败,因为每条随机命令都会改变环境,而单条糟糕命令可能使后续决策偏离轨道。此前工作通过采样、验证和细化来扩展测试时计算以提升性能,但并未回答动作级计算何时以及为何真正提升轨迹成功率,因为候选质量和验证必须一起研究。作者提出 Mid-Harness,它在每一步采样多个候选动作,在执行前进行验证,只执行选定的动作,同时保持生成器与执行框架不变。这样可以系统地评估候选宽度、验证机制和验证器能力,并表明验证强度在很大程度上决定动作采样是否提高任务成功率。
方法
作者提出 Mid-Harness,一个用于研究模型与执行框架边界处动作级计算扩展的框架,同时保持动作生成器和执行框架不变。在交互的每一步,该方法使用相同的交互历史从生成器请求多个候选动作,应用验证机制,仅将选定的候选动作转发给执行框架执行。该方法可以在不修改模型权重或推理服务架构的情况下提高轨迹成功率。
设 π 为动作生成模型,ht=(o0,a1,o1,…,at−1,ot−1) 表示交互历史,其中 o0 包含任务指令。与从 π(⋅∣ht) 中采样并执行单个动作不同,Mid-Harness 在相同历史条件下采样 N 个候选动作,并使用验证器 ψ 识别最优动作:
At=(at1,…,atN),ati∼π(⋅∣ht),at⋆=Verifyψ(ht,At)∈At.执行框架随后执行 at⋆,接收观测 ot,并更新历史。其余候选动作被丢弃。
为了在执行前评估候选动作,作者比较了三种不同的验证机制。在列表式验证中,验证器在单个提示中接收整个候选集合并返回一个选择,将所有候选暴露用于直接比较,但要求模型解决复杂的联合排序。逐点验证将过程分解为 N 个独立评估,为每个候选分配标量分数 qi=ψpoint(ht,ati) 并选择最高分的候选。该机制允许并行评估,但难以将不同目的的候选放在可比较的尺度上。成对验证专注于在同一历史下每次比较两个候选,生成比较分数 Jij=ψpair(ht,ati,atj)。默认的成对验证器根据候选在已评估配对中的边际加权胜率排序,并返回排名最高的动作。
这些机制的性能随候选宽度和验证器能力显著变化。如下图所示,成对验证通常优于列表式验证和逐点验证,并且蒸馏前沿验证器可进一步提升性能。
为了弥合前沿验证器与作为验证器的生成器模型之间的质量差距,作者采用了验证器蒸馏过程。他们从强大的前沿模型在大量轨迹上收集成对响应。利用该数据集,他们应用 Low-Rank Adaptation 对验证器进行微调,使其生成教师模型的推理、分数和偏好标签。该微调仅对验证器启用,生成器完全保持不变。该蒸馏过程有效地迁移了验证能力,在推理时无需部署前沿模型即可提高轨迹成功率。
实验
评估使用 TerminalBench Lite 和 TMAX 模型,在 Vanillux2 执行框架下进行,通过 Pass@1 和 Pass@3 将动作级采样与验证同轨迹级方法进行比较。实验表明,采样得到的候选中包含有用的替代动作,而自我验证只能部分发现这些替代动作;成对验证表现最佳,且前沿验证器蒸馏提高了验证一致性和轨迹成功率。动作扩展可与 Best-of-N 和 Sequential Refine 组合,并跨模型规模、基准、执行框架和非 TMAX 模型迁移,同时剩余验证错误主要集中在命令语义和执行可行性上。
蒸馏改进了验证器与前沿验证器在离线基准上的一致性。分数平均绝对误差下降超过一半,而成对一致性和验证一致性均大幅上升。因此,蒸馏后的验证器更有可能选择与前沿验证器相同的候选。与零样本验证相比,蒸馏验证将分数误差降低超过一半。蒸馏后,成对一致性上升约 15 个百分点,验证一致性上升约 19 个百分点。
将动作验证与轨迹扩展组合可在不同模型规模上提升终端任务成功率。对于 TMAX-9B,将零样本或蒸馏 Mid-Harness 加入 Best-of 轨迹生成,可将 Pass@1 从 55.10% 提高到 61.22% 或 66.33%,而将蒸馏 Mid-Harness 与 Sequential Refine 组合可将 Pass@1 提高到 60.20%,Pass@3 提高到 75.51%。动作验证对 4B 到 27B 的生成器都有收益,蒸馏验证通常带来最大提升。仅使用零样本动作验证即可在所有测试模型规模上比基础 Agent 提高 Pass@1,提升幅度约为 2 到 5 个百分点。仅使用 Best-of 轨迹选择的效果好坏参半:它提高了 9B 和 27B 的 Pass@1,但略微降低了 4B 的 Pass@1。将零样本动作验证与 Best-of 轨迹生成组合可带来显著的 Pass@1 提升,尤其在 9B 和 27B 上。蒸馏动作验证进一步改善组合效果,在 9B 上使用 Best-of 达到 66.33% 的 Pass@1,使用 Sequential Refine 达到 60.20% 的 Pass@1。
Mid-Harness 动作验证可迁移到多个基准、模型和执行框架,零样本验证在所有报告设置中均提高了 Pass@3,并且 Pass@1 与基线持平或更好。收益在 FeatureBench-Mini 上尤为显著,该基准上基础 Agent 很少成功,但零样本验证和蒸馏验证显著提高了成功率。蒸馏变体在 SWE-bench-Verified 和 FeatureBench-Mini 上提高了 TMAX-9B 的 Pass@1,但在 FeatureBench-Mini 的 Pass@3 上可能落后于零样本验证,并且在 Terminal-Bench 2.1 上没有超过零样本验证。零样本 Mid-Harness 在所有报告设置中均提高了 Pass@3,并匹配或提高了 Pass@1,包括 TMAX 系列之外的模型以及使用不同执行框架的情况。在 FeatureBench-Mini 上,TMAX-9B 初始成功率非常低,零样本验证和蒸馏验证均带来大幅 Pass@1 和 Pass@3 提升,蒸馏验证进一步提高 Pass@1 但 Pass@3 低于零样本验证。蒸馏 Mid-Harness 在 SWE-bench-Verified 上提高了 TMAX-9B 的 Pass@1 和 Pass@3,而在 Terminal-Bench 2.1 上,它匹配 Pass@3,但 Pass@1 没有超过零样本验证。
实验在三种设置下评估 Mid-Harness 动作验证。蒸馏在离线情况下显著使验证器与前沿验证器对齐,降低了分数误差并改善了一致性指标。将动作验证与轨迹扩展组合可在不同模型规模上提升终端任务成功率,蒸馏验证通常带来最大提升。该方法还可跨基准、模型和执行框架迁移;零样本验证在所有报告设置中均提高了 Pass@3,在基础成功率非常低的任务上尤其有帮助,而蒸馏验证在部分额外设置中有所改善,但偶尔落后于零样本验证。