Command Palette
Search for a command to run...
从证据到行动:工具使用智能体如何失败
从证据到行动:工具使用智能体如何失败
Hongzhan Lin Shidong Cao Ziyang Luo Wenhao Chai Mong-Li Lee Wynne Hsu
摘要
工具使用智能体会对外部状态做出具有实际后果的改变,但正确的结果并不能保证其行动得到了事先所建立证据的支持。我们研究了当智能体从决定是否行动,推进到执行单步行动和存在依赖的工作流时,这条从证据到行动的链条在何处发生断裂。在十个模型–工具框架配置中,较强的静态行动评估能力可能与明显较弱的交互式执行能力同时存在。失败往往在执行之前就已开始:智能体可能因调查不完整而停止,或在所需证据尚未建立时就采取行动。一旦获得了所需证据,单步行动执行通常较为可靠;而多步行动工作流还会暴露未解决的前置条件和执行不完整的问题。为进行这一分析,我们引入了 SAFE-ACTBENCH,它包含六个操作领域的 656 个案例和五种协议,从静态行动判断和经调查后的不行动,逐步推进到单步及多步行动工作流。具备溯源约束的 Evidence Ledger 和确定性轨迹评估器会追踪建立了哪些信息、行动发生在何时,以及下游依赖是否得到满足。这些结果表明,失败不仅源于信息缺失,还源于智能体在决定和执行行动时使用已建立证据的方式。
一句话总结
来自新加坡国立大学、香港浸会大学、Amazon Web Services 和普林斯顿大学的研究人员提出了 SAFE-ACTBENCH,这是一个包含 656 个案例、覆盖六个操作领域和五种协议的基准,配有来源绑定的证据账本和确定性轨迹评估器。结果表明,使用工具的 agent 失败不仅源于信息缺失,还源于 agent 在决策和执行动作时如何使用已建立的证据。
核心贡献
- 本文将后果性工具使用表述为一条可观察的证据到行动链,连接交互环境中的调查、执行和下游依赖。
- 本文提出了 SAFEACTBENCH,这是一个包含 656 个案例、覆盖六个操作领域和五种协议的基准套件,并配有来源绑定的证据账本和确定性轨迹评估器,用于验证所需证据、工具调用、目标、参数、动作依赖以及由此产生的状态变化。
- 在十种模型-执行框架配置上的结果刻画了这条链在何处断裂:较强的静态动作评估可能与较弱的交互执行并存,失败通常源于调查不完整或动作过早,而多动作工作流暴露出未解决的前置条件和执行不完整。
引言
LLM agents 越来越多地执行后果性工具调用,例如发放退款或更新记录,其中正确性不仅取决于选择正确的动作,还取决于在执行前建立与任务相关的证据。先前的评估已转向交互式多步环境,但很少检查每个改变状态的动作是否可观察地由绑定到正确实体和先前结果的证据所支持。作者将这一问题表述为连接调查、执行和下游依赖的证据到行动链。他们提出了 SAFEACTBENCH,这是一个包含 656 个案例、覆盖六个操作领域的基准套件,并采用确定性轨迹评估来定位证据收集、动作绑定、时机选择和多步执行中的失败。
数据集
作者将 SAFEACTBENCH 作为工具使用任务中证据到行动推理的基准。它包含六个操作领域的 656 个案例。每个案例指定动作前所需的证据、由此获得支持的动作,以及预期结果或状态变化。
-
来源与组成:
- 客户与政策运营:112 个案例
- 工程与基础设施运营:109 个案例
- 法律与金融运营:144 个案例
- 研究辅助:97 个案例
- 智能家居控制:96 个案例
- 医疗运营:98 个案例
-
协议结构: 数据集包括一个静态协议和四个交互协议。Legacy 要求对固定候选动作给出结构化的 ALLOW/BLOCK/DEFER 判断。V0 要求通过调查来证明不执行是合理的。V1 要求在执行唯一正确的后果性动作之前获得所有必要证据。V2 扩展为线性工作流,其中后续动作使用先前动作的实际结果。V3 允许符合有向无环依赖图的任意拓扑顺序。
-
案例模式: 每个案例提供任务上下文、信息工具、后果性工具以及一个或多个后果性动作。对于每个动作,规范记录证据要求、所需操作、目标、参数以及任何预期结果或状态变化。多动作依赖关系表示为线性序列或有向无环图。
-
处理与验证: 证据要求和预期动作对 agent 隐藏,仅用于评估。只有当任务上下文或先前观察提供具有正确来源的有效证据时,前置条件才被建立。确定性评估器根据规范检查每个案例。主要评分是二值化的精确案例成功。评估器检查所需调查、正确工具、目标、参数、产生结果、依赖顺序和终止条件。它不检查隐藏推理,也不使用 LLM 评判器。
-
来源构建: 证据账本将已建立的事实绑定到其来源交互以及它们描述的实体或状态。一个实体的证据不会转移到另一个实体,即使值相同。类似地,动作结果只有在所需来源是相关前置步骤时才可以直接支持依赖动作;否则需要单独的状态观察。
-
使用方式: 在所述章节中,该数据用作评估基准,而不是训练集。文中未报告训练划分或混合比例。文中说明,经过对案例规范和评估器的人工审核后,所有 656 个作者参考解法都通过了确定性评估器。
-
裁剪: 该数据集未描述裁剪策略。
方法
作者提出证据到行动链框架,用于评估 agents 如何将环境信息转化为后果性行为。该框架区分了信息收集工具调用和修改任务相关外部状态的后果性动作。核心前提是,每个后果性动作都必须由此前建立的证据支持。仅终点正确性不足,如果先前的交互未能支持预期的目标动作。
为了形式化这一要求,作者引入了来源绑定评估机制。证据被严格绑定到其所描述的具体实体和状态。例如,查询另一个返回匹配值的实体,并不能建立目标动作所需的条件。
如下图所示,一个负责对特定费用进行退款的 agent 必须首先查询该确切费用,以核实其重复状态、资格和金额。如果 agent 查询了不同的费用,然后继续对目标费用退款,该动作在完整任务状态下可能是被允许的,并且在终点层面可能成功。然而,执行前观察到的证据仍然未被支持,因为收集到的信息没有建立该动作所使用的实体和状态。评估侧重于可观察的交互轨迹,而非内部推理,确保执行前可用的信息严格证明所执行动作的合理性。
该框架还约束调查后不执行和链式动作。当不应发生后果性动作时,agent 必须完成任务相关调查以确定原因,然后停止且不产生副作用。在多动作工作流中,早期动作的结果作为后续步骤的必要证据。依赖关系约束时机和执行顺序,意味着依赖动作只能在其所需前置步骤完成且必要输出可用后发生。如果证据绑定到错误实体、执行过早或依赖关系被违反,证据到行动链就会断裂。
为了确定性地衡量这条链,作者设计了一个验证系统,根据规范检查每个案例,不检查隐藏推理,也不依赖 LLM 评判器。主要指标即精确案例成功,对每个回合进行二值化评估。对于后果性动作 a,支持条件定义为:
Supported(a)⟺∀r∈R(a),r is established before a.确定性评估器重放轨迹,以验证所需调查是否完成、后果性调用是否使用了正确的工具、目标和参数,以及动作依赖关系和终止条件是否得到遵守。任一必需组件失败都会使案例不成功,确保评估严格依赖任务上下文、观察到的工具交互以及由此产生的环境状态。
实验
评估比较了五个模型家族中的十种模型-执行框架配置,每个配置分别搭配其家族对应执行框架,并在相同的公开任务和工具接口上搭配共享的 Inspect ReAct 执行框架。主要结果表明,较强的 Legacy 任务表现可能掩盖较弱的基于证据的执行,而执行框架效应因模型而异。行为分析将失败定位在调查和动作时机等上游环节,而非单动作执行。控制干预显示,隐瞒或反驳证据会减少但不会阻止动作,agents 对请求方主张的反应比对单纯缺失证据的反应更强烈。
SAFEACTBENCH 涵盖一个静态决策协议和四个交互执行机制,逐步要求证据来源和依赖感知的动作排序。大多数案例属于交互协议,其中调查后不执行设置是最大类别,其他交互协议的案例数量大致相当。成功评分根据协议特定的证据、工具使用、结果和依赖条件确定性进行,而不是由 LLM 评判器评分。静态 Legacy 评估仅检查对固定候选动作的结构化 ALLOW/BLOCK/DEFER 判断,而交互协议对完整轨迹评分。交互机制要求在每个后果性动作之前以正确来源建立证据,并且后续动作必须使用实际前置结果。调查后不执行协议是最大的交互类别,而单动作、线性多动作和依赖约束多动作协议规模相近。确定性评估器使用任务上下文、观察到的工具交互和由此产生的环境状态来给出二值化的精确案例成功。
所报告的模型在 Legacy 任务上表现强劲,但其 V1、V2 和 V3 的精确案例成功低得多且波动更大,表明 Legacy 的成功并不能保证基于证据的执行。执行框架效应显著且因模型而异,一些模型整体提升,但只在某些协议上改善。GLM-ZCode 和 DeepSeek-DSH 在 Legacy 上都超过 96%,但它们的 V1-V3 结果差异显著:DeepSeek 保持在 60% 左右,而 GLM 下降到 12.1%-34.1%。DeepSeek-V4 从 Inspect 到 DSH 整体提升,部分来自 Legacy,而 Claude-5 和 GPT-5.6 使用其非 Inspect 执行框架时也比使用 Inspect 表现更好。
该基准上的失败通常发生在受支持执行之前。Agents 经常在完成所需调查之前停止,或在证据完整之前就采取动作,而证据完成后动作执行通常可靠。多步工作流显示多个重叠的故障,包括未解决的前置条件和执行不完整,其普遍程度因配置而异。证据完成后的条件动作成功率在大多数配置中较高,DeepSeek-Inspect 较低,表明执行不是主要瓶颈。调查不完整和动作过早很普遍,因此失败通常发生在受支持动作尝试之前。未解决的前置条件和执行不完整是不同但重叠的多步失败模式,其相对普遍程度因配置而异。
相同案例上的成对执行框架比较显示,成功因模型家族而异:DeepSeek 的家族对应执行框架相比 Inspect 显著提升,而 GLM 的家族对应执行框架显著降低成功率。Claude、GPT 和 Qwen 显示出正的点估计,但置信区间包含或达到零。DeepSeek 在不同执行框架下的调查完成率相似,而 GLM 在其家族对应执行框架下较低。DeepSeek 的家族对应执行框架相比 Inspect 提升了成功,而 GLM 的家族对应执行框架降低了成功,两者的置信区间均不含零。Claude、GPT 和 Qwen 的点估计为正,但其置信区间包含或达到零,并且 GLM 的家族对应执行框架下调查完成率较低。
SAFEACTBENCH 跨一个静态决策协议和四个需要证据来源和依赖感知动作排序的交互执行机制评估 agents,并根据协议特定条件进行确定性评分。实验表明,静态 Legacy 任务上的强劲表现并不转移到基于证据的执行,执行框架效应显著且因模型而异。大多数失败发生在尝试受支持动作之前,主要来自调查不完整或动作过早,而不是执行不可靠。成对执行框架比较证实,DeepSeek 在其家族对应执行框架下获得显著成功提升,GLM 显著下降,Claude、GPT 和 Qwen 的提升不明确。