Command Palette
Search for a command to run...
EarlyEval:通过早期结果预测降低智能体评估成本
EarlyEval:通过早期结果预测降低智能体评估成本
Yuling Shi Zhensu Sun Junsen Dong Chengcheng Wan David Lo Xiaodong Gu
摘要
评估大语言模型(LLM)智能体对于指导其发展至关重要,但其成本已变得异常高昂:前沿模型在智能体基准测试上运行一次就可能花费数百至数千美元,而在迭代开发周期中这一费用需反复支付。先前的工作集中于基准蒸馏,减少了评估任务的数量,但并未触及执行每个保留任务的成本。本文中,我们引入了早期结果预测,这是一种互补的效率提升维度,旨在削减每个任务内部的成本。我们的核心见解是,智能体的最终结果往往在其执行完成之前,就能从其早期行为中明显看出。我们将这一想法具体化为 EarlyEval,一个轻量级框架。该框架基于行为、文本和参考解答特征,训练一对 LightGBM 成功与失败分类器,并在任一分类器超过校准后的置信度阈值时立即停止智能体运行,每步增加的额外开销可忽略不计。在 SWE-bench Verified、TerminalBench 和 Toolathlon 三个基准测试上,EarlyEval 能以 89% 至 97% 的预测准确率,消除 13% 至 26% 的智能体步骤,以及高达 44.1% 的输入 token 和 29.4% 的输出 token,同时每个智能体的解决率平均仅波动一到两个百分点。
一句话总结
上海交通大学、新加坡管理大学、华东师范大学和上海创新研究院的研究者提出 EarlyEval,一个轻量级框架,在行为、文本和参考解特征上训练 LightGBM 成功与失败分类器,在经校准的置信度阈值下提前终止 agent 运行,在 SWE-bench Verified、TerminalBench 和 Toolathlon 上消除 13–26% 的步骤和高达 44.1% 的输入 token,准确率达到 89–97%,且对解决率的扰动极小。
核心贡献
- 早期结果预测作为 LLM agent 基准测试的补充效率维度被引入,通过基于中间行为提前终止运行来削减每个任务的成本,而非减少任务数量。
- EarlyEval 轻量级框架在行为、文本和参考解特征上训练一对 LightGBM 成功与失败分类器,当任一分类器超过校准的置信度阈值时停止 agent 运行。
- 在 SWE-bench Verified、TerminalBench 和 Toolathlon 上,EarlyEval 消除了 13% 到 26% 的 agent 步骤和高达 44.1% 的输入 token,预测准确率为 89% 到 97%,而各 agent 的解决率平均仅偏移一到两个百分点。
引言
评估 LLM agent 对指导开发至关重要,但运行现代 agent 基准测试的成本已急剧上升,在 SWE-bench Verified 上单次运行花费数百美元,而更长 rollout 的基准测试可达数千美元。这种开销使频繁评估对许多团队不切实际,并拖慢了迭代周期。先前降低成本的尝试集中于基准蒸馏,即缩小任务集,但每个任务的执行成本不变。作者引入 EarlyEval,一种互补方法,当 agent 的最终结果可以从中间行为中可靠预测时,提前终止其 rollout。通过在其他 agent 的历史轨迹上训练轻量级分类器,EarlyEval 在多个基准测试中减少了执行步骤和 token 消耗,同时保持了各 agent 的解决率和排行榜排名。
数据集
作者从三个多步基准测试收集的 agent 轨迹构建训练数据集。每条轨迹是一系列步骤,带有最终二元成功标签,数据用于训练一个模型,从部分执行前缀预测最终成功。
数据集来源与组成
-
SWE-bench Verified
- 500 个人工验证的 GitHub issue,涉及 12 个 Python 仓库。
- 轨迹由 mini-SWE-agent 搭配 16 个 LLM(Claude、GPT-5、Gemini、GLM、DeepSeek、Devstral、Kimi、MiniMax 系列)生成。
- 总计:7,805 条轨迹。
- 每个任务包含一个 gold patch,可提供参考解特征。
-
TerminalBench
- 89 个命令行自动化任务。
- 37 种不同的 agent 配置(scaffold:mini-SWE-agent、Codex CLI、Claude Code、Gemini CLI、OpenHands、Terminus-2;模型:GPT-5、GPT-5-mini、Claude-Haiku-4.5、Claude-Opus-4.5、Gemini-2.5-Pro)。
- 总计:6,757 条轨迹(每个任务多次 rollout)。
- 没有每个任务的参考解;仅使用行为和文本特征。
-
Toolathlon
- 108 个复杂 API 和工具使用任务。
- 原生 Toolathlon scaffold,搭配 22 个 LLM,每个任务三次 rollout。
- 总计:7,116 条轨迹。
- 无参考解;特征限制与 TerminalBench 相同。
数据处理流程
- 长度少于 10 步的轨迹被丢弃(信号不足)。
- 对于长度为 T 的每条轨迹,提取所有长度为 0 到 T 的前缀,并与轨迹的最终结果标签(成功/失败)配对。
- 每个前缀被转换为固定长度的特征向量,由三个家族组成:
- 行为特征:运行进度指标(数量、节奏、里程碑时机、错误/测试信号、停滞模式)。
- 文本特征:语义块(任务提示、完整动作历史、最近动作、完整环境反馈、最近反馈)分别使用 TF-IDF 在词 n-gram 上向量化,然后通过截断 SVD 压缩到 64 维(提示)或 128 维(动作/反馈组),在保持块边界的同时降低维度。
- 参考解特征(仅 SWE-bench):测量当前前缀与提供的 gold patch 之间的结构重叠(文件、符号、测试)。TerminalBench 和 Toolathlon 中省略。
模型中的使用 生成的特征向量和二元标签作为训练集。模型从这些前缀-标签对中学习,在中间步骤预测最终成功,从而支持提前终止决策。提供的文本中未详述明确的训练/验证划分或混合比例。
方法
作者提出 EarlyEval,一个旨在从部分轨迹预测 agent 在基准任务上的最终结果,并在结果变得统计显著时立即停止执行的框架。系统通过一个顺序推理工作流运行,包含两个主要阶段:离线预测器构建和在线逐步推理。
如下图所示:
在离线阶段,作者利用已经评估过的历史 agent 运行来构建训练数据。对于给定的基准测试,收集一个轨迹池 τ=(e1,...,eT),每条轨迹关联一个二元评估分数 y∈{0,1}。长度少于 10 步的轨迹被丢弃,以确保优化有足够信号。每条轨迹被分解为一系列带标签的前缀 τ:k=(e1,…,ek),其中 k=0,1,…,T,每个前缀与最终结果标签 y 配对。这些前缀被映射到一个固定长度的多模态特征向量 ϕ(τ:k)∈Rd。特征提取过程捕获三个不同的信号家族。行为特征捕获运行进度不变量,包括数量指标、结构组成、里程碑时机和环境反馈信号。文本特征通过将任务提示、动作历史和环境反馈分离为不同的语义块来编码自然语言上下文。每个块使用 TF-IDF 在词 n-gram 上向量化,并通过截断奇异值分解压缩,以保持计算效率。当有真实人工补丁可用时,可选地利用参考解特征,测量当前前缀与 gold 解之间的结构重叠。
为判断这些部分轨迹,作者使用 LightGBM 的梯度提升决策树集成训练一对 agent 无关的预测器。选择此架构是因为它能在单个 CPU 核心上以亚毫秒级评估高维特征向量,确保逐步推理期间的计算开销可忽略不计。EarlyEval 在特征表示 ϕ 上优化两个独立的集成:一个成功预测器 h+ 和一个失败预测器 h−。两个模型接收相同的特征向量,但针对反转的目标集进行优化。成功预测器目标为 y=1,而失败预测器目标为 1−y=1(即 y=0)。训练两个不同的预测器允许正面和负面证据独立累积,反映成功和失败信号的非对称行为。这种设计还创建了一个明确的不确定区域,其中两个预测器都输出低概率,允许 agent 在结果仍然模糊时继续执行。为防止数据泄漏,轨迹池按任务划分为训练和验证折。此外,每个前缀实例按 1/(T+1) 加权,以确保每条轨迹对目标函数贡献相同的总质量,防止长轨迹主导优化损失。
在线推理期间,agent 逐步与环境交互。在每一步,EarlyEval 从累积的部分轨迹中提取特征向量 ϕ,并将其输入两个集成。由于正则化树集成可能扭曲输出概率尺度,作者使用 Platt 缩放重新校准原始分数。一个一维逻辑回归将原始集成分数 s^ 映射到校准概率:
p=σ(a\logit(s^)+b)其中标量参数 a 和 b 在留出的验证分割上拟合。这种单调变换重新缩放输出,使得置信度阈值在两个预测器之间具有一致的含义。校准概率 p+ 和 p− 参数化一个双阈值决策机制。系统将 p+ 与成功阈值 s 比较,p− 与失败阈值 f 比较。当 p+≥s 或 p−≥f 的第一步,运行被拦截并标记预测结果。如果两个概率都保持在其各自阈值以下,系统推迟承诺并允许 agent 继续后续步骤。这种基于阈值的逻辑决定了干预前所需证据的严格程度,实现了预测准确性与计算节省之间的可调权衡。
实验
EarlyEval 在三个多步 agent 基准测试(SWE-bench Verified、TerminalBench、Toolathlon)上使用留一 agent 协议进行评估,以预测任务结果并提前终止无望的轨迹。系统在保持对完整运行解决率的高保真度并保留 agent 排名(强秩相关性)的同时,大幅减少了执行步骤和 token 使用量。消融研究表明,EarlyEval 的预测对缺失特征家族具有鲁棒性,行为特征最为关键,并且 LightGBM 骨干在成本-保真度权衡中优于神经网络和线性替代方案。
评估成本在不同基准和模型间差异显著,没有单一模型始终最便宜。GPT-5.5 在五个基准中的三个上提供最低成本,而 Gemini 3.1 Pro 在多模态套件上最经济,Claude 5 在 SWE-bench Verified 上领先。GPT-5.5 在 SWT-bench、Commit0 和 GAIA 上实现最低成本,其 GAIA 运行仅花费 122,而Claude5为1,305。Gemini 3.1 Pro 评估 SWE-bench Multimodal 花费 641,显著低于GPT−5.5(1,453)和 Claude 5($2,270)。
LightGBM 骨干独特地将高提前停止准确率与大量覆盖相结合,实现了最大的步骤减少和最小的指标失真。相比之下,直接的神经网络和线性模型要么准确率低,要么过于被动而无法节省有意义的计算,而微调的 LLM 评判器提供了有竞争力的保真度,但引入了过高的推理开销,抵消了其自身的节省。LightGBM 达到 95.0% 准确率和 34.8% 覆盖率,削减了 26.0% 的执行步骤,同时指标失真仅为 1.1 点。微调的 Qwen 评判器达到 90.7% 准确率,但仅节省 17.9% 的步骤,且需要在每个轨迹步骤进行昂贵的模型前向传递,抵消了提前停止旨在提供的计算节省。
两个实验考察了模型评估中的效率。第一个比较了五个基准上的评估成本,揭示没有单一模型普遍最便宜,成本效率取决于基准。第二个评估了提前停止策略,其中 LightGBM 骨干实现了高准确率、大幅步骤减少和最小指标失真的最佳平衡,而微调的 LLM 评判器产生了过高的推理开销,抵消了节省效果。