HyperAIHyperAI

Command Palette

Search for a command to run...

LLM
Agent
基准

EarlyEval:通过早期结果预测降低智能体评估成本

Yuling Shi Zhensu Sun Junsen Dong Chengcheng Wan David Lo Xiaodong Gu

摘要

评估大语言模型(LLM)智能体对于指导其发展至关重要,但其成本已变得异常高昂:前沿模型在智能体基准测试上运行一次就可能花费数百至数千美元,而在迭代开发周期中这一费用需反复支付。先前的工作集中于基准蒸馏,减少了评估任务的数量,但并未触及执行每个保留任务的成本。本文中,我们引入了早期结果预测,这是一种互补的效率提升维度,旨在削减每个任务内部的成本。我们的核心见解是,智能体的最终结果往往在其执行完成之前,就能从其早期行为中明显看出。我们将这一想法具体化为 EarlyEval,一个轻量级框架。该框架基于行为、文本和参考解答特征,训练一对 LightGBM 成功与失败分类器,并在任一分类器超过校准后的置信度阈值时立即停止智能体运行,每步增加的额外开销可忽略不计。在 SWE-bench Verified、TerminalBench 和 Toolathlon 三个基准测试上,EarlyEval 能以 89% 至 97% 的预测准确率,消除 13% 至 26% 的智能体步骤,以及高达 44.1% 的输入 token 和 29.4% 的输出 token,同时每个智能体的解决率平均仅波动一到两个百分点。

一句话总结

上海交通大学、新加坡管理大学、华东师范大学和上海创新研究院的研究者提出 EarlyEval,一个轻量级框架,在行为、文本和参考解特征上训练 LightGBM 成功与失败分类器,在经校准的置信度阈值下提前终止 agent 运行,在 SWE-bench Verified、TerminalBench 和 Toolathlon 上消除 13–26% 的步骤和高达 44.1% 的输入 token,准确率达到 89–97%,且对解决率的扰动极小。

核心贡献

  • 早期结果预测作为 LLM agent 基准测试的补充效率维度被引入,通过基于中间行为提前终止运行来削减每个任务的成本,而非减少任务数量。
  • EarlyEval 轻量级框架在行为、文本和参考解特征上训练一对 LightGBM 成功与失败分类器,当任一分类器超过校准的置信度阈值时停止 agent 运行。
  • 在 SWE-bench Verified、TerminalBench 和 Toolathlon 上,EarlyEval 消除了 13% 到 26% 的 agent 步骤和高达 44.1% 的输入 token,预测准确率为 89% 到 97%,而各 agent 的解决率平均仅偏移一到两个百分点。

引言

评估 LLM agent 对指导开发至关重要,但运行现代 agent 基准测试的成本已急剧上升,在 SWE-bench Verified 上单次运行花费数百美元,而更长 rollout 的基准测试可达数千美元。这种开销使频繁评估对许多团队不切实际,并拖慢了迭代周期。先前降低成本的尝试集中于基准蒸馏,即缩小任务集,但每个任务的执行成本不变。作者引入 EarlyEval,一种互补方法,当 agent 的最终结果可以从中间行为中可靠预测时,提前终止其 rollout。通过在其他 agent 的历史轨迹上训练轻量级分类器,EarlyEval 在多个基准测试中减少了执行步骤和 token 消耗,同时保持了各 agent 的解决率和排行榜排名。

数据集

作者从三个多步基准测试收集的 agent 轨迹构建训练数据集。每条轨迹是一系列步骤,带有最终二元成功标签,数据用于训练一个模型,从部分执行前缀预测最终成功。

数据集来源与组成

  • SWE-bench Verified

    • 500 个人工验证的 GitHub issue,涉及 12 个 Python 仓库。
    • 轨迹由 mini-SWE-agent 搭配 16 个 LLM(Claude、GPT-5、Gemini、GLM、DeepSeek、Devstral、Kimi、MiniMax 系列)生成。
    • 总计:7,805 条轨迹。
    • 每个任务包含一个 gold patch,可提供参考解特征。
  • TerminalBench

    • 89 个命令行自动化任务。
    • 37 种不同的 agent 配置(scaffold:mini-SWE-agent、Codex CLI、Claude Code、Gemini CLI、OpenHands、Terminus-2;模型:GPT-5、GPT-5-mini、Claude-Haiku-4.5、Claude-Opus-4.5、Gemini-2.5-Pro)。
    • 总计:6,757 条轨迹(每个任务多次 rollout)。
    • 没有每个任务的参考解;仅使用行为和文本特征。
  • Toolathlon

    • 108 个复杂 API 和工具使用任务。
    • 原生 Toolathlon scaffold,搭配 22 个 LLM,每个任务三次 rollout。
    • 总计:7,116 条轨迹。
    • 无参考解;特征限制与 TerminalBench 相同。

数据处理流程

  • 长度少于 10 步的轨迹被丢弃(信号不足)。
  • 对于长度为 T 的每条轨迹,提取所有长度为 0 到 T 的前缀,并与轨迹的最终结果标签(成功/失败)配对。
  • 每个前缀被转换为固定长度的特征向量,由三个家族组成:
    • 行为特征:运行进度指标(数量、节奏、里程碑时机、错误/测试信号、停滞模式)。
    • 文本特征:语义块(任务提示、完整动作历史、最近动作、完整环境反馈、最近反馈)分别使用 TF-IDF 在词 n-gram 上向量化,然后通过截断 SVD 压缩到 64 维(提示)或 128 维(动作/反馈组),在保持块边界的同时降低维度。
    • 参考解特征(仅 SWE-bench):测量当前前缀与提供的 gold patch 之间的结构重叠(文件、符号、测试)。TerminalBench 和 Toolathlon 中省略。

模型中的使用 生成的特征向量和二元标签作为训练集。模型从这些前缀-标签对中学习,在中间步骤预测最终成功,从而支持提前终止决策。提供的文本中未详述明确的训练/验证划分或混合比例。

方法

作者提出 EarlyEval,一个旨在从部分轨迹预测 agent 在基准任务上的最终结果,并在结果变得统计显著时立即停止执行的框架。系统通过一个顺序推理工作流运行,包含两个主要阶段:离线预测器构建和在线逐步推理。

如下图所示:

在离线阶段,作者利用已经评估过的历史 agent 运行来构建训练数据。对于给定的基准测试,收集一个轨迹池 τ=(e1,...,eT)\tau = (e_1, ..., e_T)τ=(e1,...,eT),每条轨迹关联一个二元评估分数 y{0,1}y \in \{0, 1\}y{0,1}。长度少于 10 步的轨迹被丢弃,以确保优化有足够信号。每条轨迹被分解为一系列带标签的前缀 τ:k=(e1,,ek)\tau_{:k} = (e_1, \ldots, e_k)τ:k=(e1,,ek),其中 k=0,1,,Tk = 0, 1, \ldots, Tk=0,1,,T,每个前缀与最终结果标签 yyy 配对。这些前缀被映射到一个固定长度的多模态特征向量 ϕ(τ:k)Rd\phi(\tau_{:k}) \in \mathbb{R}^dϕ(τ:k)Rd。特征提取过程捕获三个不同的信号家族。行为特征捕获运行进度不变量,包括数量指标、结构组成、里程碑时机和环境反馈信号。文本特征通过将任务提示、动作历史和环境反馈分离为不同的语义块来编码自然语言上下文。每个块使用 TF-IDF 在词 n-gram 上向量化,并通过截断奇异值分解压缩,以保持计算效率。当有真实人工补丁可用时,可选地利用参考解特征,测量当前前缀与 gold 解之间的结构重叠。

为判断这些部分轨迹,作者使用 LightGBM 的梯度提升决策树集成训练一对 agent 无关的预测器。选择此架构是因为它能在单个 CPU 核心上以亚毫秒级评估高维特征向量,确保逐步推理期间的计算开销可忽略不计。EarlyEval 在特征表示 ϕ\phiϕ 上优化两个独立的集成:一个成功预测器 h+h_+h+ 和一个失败预测器 hh_-h。两个模型接收相同的特征向量,但针对反转的目标集进行优化。成功预测器目标为 y=1y = 1y=1,而失败预测器目标为 1y=11 - y = 11y=1(即 y=0y = 0y=0)。训练两个不同的预测器允许正面和负面证据独立累积,反映成功和失败信号的非对称行为。这种设计还创建了一个明确的不确定区域,其中两个预测器都输出低概率,允许 agent 在结果仍然模糊时继续执行。为防止数据泄漏,轨迹池按任务划分为训练和验证折。此外,每个前缀实例按 1/(T+1)1 / (T + 1)1/(T+1) 加权,以确保每条轨迹对目标函数贡献相同的总质量,防止长轨迹主导优化损失。

在线推理期间,agent 逐步与环境交互。在每一步,EarlyEval 从累积的部分轨迹中提取特征向量 ϕ\phiϕ,并将其输入两个集成。由于正则化树集成可能扭曲输出概率尺度,作者使用 Platt 缩放重新校准原始分数。一个一维逻辑回归将原始集成分数 s^\hat{s}s^ 映射到校准概率:

p=σ(a\logit(s^)+b)p = \sigma \big(a \logit(\hat{s}) + b \big)p=σ(a\logit(s^)+b)

其中标量参数 aaabbb 在留出的验证分割上拟合。这种单调变换重新缩放输出,使得置信度阈值在两个预测器之间具有一致的含义。校准概率 p+p_+p+pp_-p 参数化一个双阈值决策机制。系统将 p+p_+p+ 与成功阈值 sss 比较,pp_-p 与失败阈值 fff 比较。当 p+sp_+ \ge sp+spfp_- \ge fpf 的第一步,运行被拦截并标记预测结果。如果两个概率都保持在其各自阈值以下,系统推迟承诺并允许 agent 继续后续步骤。这种基于阈值的逻辑决定了干预前所需证据的严格程度,实现了预测准确性与计算节省之间的可调权衡。

实验

EarlyEval 在三个多步 agent 基准测试(SWE-bench Verified、TerminalBench、Toolathlon)上使用留一 agent 协议进行评估,以预测任务结果并提前终止无望的轨迹。系统在保持对完整运行解决率的高保真度并保留 agent 排名(强秩相关性)的同时,大幅减少了执行步骤和 token 使用量。消融研究表明,EarlyEval 的预测对缺失特征家族具有鲁棒性,行为特征最为关键,并且 LightGBM 骨干在成本-保真度权衡中优于神经网络和线性替代方案。

评估成本在不同基准和模型间差异显著,没有单一模型始终最便宜。GPT-5.5 在五个基准中的三个上提供最低成本,而 Gemini 3.1 Pro 在多模态套件上最经济,Claude 5 在 SWE-bench Verified 上领先。GPT-5.5 在 SWT-bench、Commit0 和 GAIA 上实现最低成本,其 GAIA 运行仅花费 122,而Claude5122,而 Claude 5 为 122,而Claude51,305。Gemini 3.1 Pro 评估 SWE-bench Multimodal 花费 641,显著低于GPT5.5641,显著低于 GPT-5.5(641,显著低于GPT5.51,453)和 Claude 5($2,270)。

LightGBM 骨干独特地将高提前停止准确率与大量覆盖相结合,实现了最大的步骤减少和最小的指标失真。相比之下,直接的神经网络和线性模型要么准确率低,要么过于被动而无法节省有意义的计算,而微调的 LLM 评判器提供了有竞争力的保真度,但引入了过高的推理开销,抵消了其自身的节省。LightGBM 达到 95.0% 准确率和 34.8% 覆盖率,削减了 26.0% 的执行步骤,同时指标失真仅为 1.1 点。微调的 Qwen 评判器达到 90.7% 准确率,但仅节省 17.9% 的步骤,且需要在每个轨迹步骤进行昂贵的模型前向传递,抵消了提前停止旨在提供的计算节省。

两个实验考察了模型评估中的效率。第一个比较了五个基准上的评估成本,揭示没有单一模型普遍最便宜,成本效率取决于基准。第二个评估了提前停止策略,其中 LightGBM 骨干实现了高准确率、大幅步骤减少和最小指标失真的最佳平衡,而微调的 LLM 评判器产生了过高的推理开销,抵消了节省效果。


用 AI 构建 AI

从创意到上线——通过免费 AI 协同编码、开箱即用的环境和最优惠的 GPU 价格,加速您的 AI 开发。

AI 协同编码
开箱即用的 GPU
最优定价

HyperAI Newsletters

订阅我们的最新资讯
我们会在北京时间 每周一的上午九点 向您的邮箱投递本周内的最新更新
邮件发送服务由 MailChimp 提供