Command Palette
Search for a command to run...
MobilePA-Bench:面向复杂真实世界任务的移动规划智能体基准测试
MobilePA-Bench:面向复杂真实世界任务的移动规划智能体基准测试
摘要
随着端侧大语言模型智能体逐步演化为个人智能助理,移动操作系统已成为这一范式的重要试验平台,因此对其能力进行严格评估至关重要。然而,现有基准测试分为两类,各自存在关键盲区:以图形用户界面为中心的基准测试仅考察表层屏幕操作,忽视了后台工具调用与长程规划能力;而静态函数调用基准测试依赖离线应用程序接口匹配,脱离了真实运行时约束。为弥合这一差距,我们提出了 MobilePA-Bench,一个交互式、有状态且以工具为核心的基准测试,用于评估移动规划智能体的工具调用与规划能力。MobilePA-Bench 运行于一个可执行的沙箱环境中,该沙箱维护实时应用数据库并返回结构化反馈,覆盖 13 个功能领域和 212 个真实移动工具。除基础工具使用外,该基准测试还从三个高级维度评估核心规划智能体:(1)子智能体协作——将复杂任务分解并将专业化工作委派给能力较强的子智能体;(2)记忆使用——调用已存储的记忆、用户画像和历史偏好以解决隐式请求;(3)技能使用——调用预封装的复合技能,而非从零开始逐步规划。大量实验表明,当前前沿大语言模型在移动场景中仍不可靠:在严格的工具调用顺序约束、权限限制和意外运行时错误下,性能急剧下降。通过将交互式函数调用沙箱与基于证据的验证相结合,MobilePA-Bench 既可作为实用的诊断基准,也可作为智能体强化学习的交互式基础,从而加速可靠移动智能体的研发。
一句话总结
阿里巴巴 Token Foundry 的 MAI 团队提出 MobilePA-Bench,这是一个交互式、有状态且以工具为中心的基准,用于评估移动规划 agent 在 13 个功能领域和 212 个真实工具上的子 agent 协作、记忆使用和技能使用能力,弥合了以 GUI 为中心和静态函数调用评估范式之间的差距,同时为 agent 强化学习提供了基础。
核心贡献
- MobilePA-Bench 是一个交互式、有状态的基准,在可执行沙箱中评估移动规划 agent 在 13 个功能领域和 212 个真实工具上的工具调用和规划能力。
- 它提供了一个具有动态反馈、严格工具依赖、权限边界和运行时错误的实时模拟环境,能够严格评估 agent 从执行失败中自适应恢复的能力。
- 它将三个高级规划维度——子 agent 协作、记忆使用和技能使用——统一到真实的移动工作流中进行评估;实验表明,最强的前沿模型仅达到 75.52% 的整体加权得分,暴露了关键可靠性差距。
引言
由 LLM 驱动的移动 agent 有望将设备转变为主动的副驾驶,能够理解用户意图、编排系统工具并执行多步骤工作流。评估此类 agent 具有挑战性,因为现有基准要么测试静态函数调用而缺乏实时操作系统反馈,要么狭隘地关注 GUI 像素操作,忽略了真实任务所需的系统级编排和错误恢复。作者引入 MobilePA-Bench,这是一个有状态、交互式的基准,通过 1,705 个任务(涵盖 13 个领域和 212 个真实工具)评估中央规划 agent 的四个基本维度——基本工具使用、子 agent 协作、记忆检索和技能执行,同时集成的沙箱暴露实时后端状态变更、权限边界和运行时异常。
数据集
作者构建了 MobilePA-Bench,一个包含 1,705 个自然语言移动任务的诊断基准,旨在评估中央规划 agent。任务由真实的移动场景合成,并在一个有状态的模拟沙箱中执行。该基准围绕四个能力维度组织,每个维度都通过与证据对齐的查询桶进行验证。
数据集组成与来源
- 所有任务均为合成,但基于人工整理的移动工作流。
- 基本工具使用任务基于人工整理的种子构建,并注入动态障碍(缺失参数、权限阻止、状态变更)以测试基础 API 执行。
- 记忆使用任务从连贯的用户画像世界生成;请求有意省略显式偏好,以强制进行记忆检索。
- 技能使用任务将复合的多步骤例程打包为可重用技能;任务要求加载正确的技能并完成其工具序列。
- 子 agent 协作任务隔离复杂的委托场景(例如 GUI 操作),并记录有效的下游路由和交接负载。
- 每个任务都标注了初始沙箱状态、候选动作空间、特定于能力的黄金目标(工具序列、记忆 ID、技能 ID、子 agent 路由),并分配到三个验证桶之一:工具调用、状态变更或 Agent 行为。
每个子集的关键细节
- 基本工具使用: 涵盖五个行为类别(工具/参数定位、条件规划、状态跟踪、意图修正、错误恢复)。通过确定性的工具调用匹配或状态变更增量检查进行评估。
- 子 agent 协作: 衡量委托质量而非下游执行。成功需要调用正确的子 agent 并发出完整的交接负载(桶 3:Agent 行为)。
- 记忆使用: 376 个任务标注了所需的黄金记忆 ID。只有当规划器检索到所有必需的记忆条目并满足主要桶检查器时,任务才算通过。
- 技能使用: 任务标注了黄金技能 ID。成功需要加载该技能并完成下游任务。分别在“仅技能路由”和“混合工具-技能路由”设置下进行评估。
数据使用方式
- 该基准用于移动规划 agent 的零样本评估。规划器接收自然语言请求,必须将其分解为工具调用、记忆查找、技能加载和子 agent 委托。
- 性能按维度报告,并汇总为具有固定权重的总体得分:基本工具使用 0.50,子 agent 协作 0.10,记忆使用 0.20,技能使用 0.20。缺失或无效的预测视为失败。
处理与验证细节
- 数据构建管道将移动场景转换为可执行工件。动态障碍嵌入初始沙箱状态以测试恢复能力。
- 验证与证据对齐:工具调用桶检查确切的工具名称、调用顺序和参数值;状态变更桶将终端数据库转换与标注的增量进行比较;Agent 行为桶评估子 agent 路由和后续交互质量。
- 在主要检查器之上应用特定于能力的门控(记忆检索、技能加载),因此只有当门控和桶检查器都成功时,任务才算通过。
方法
作者将 MobilePA-Bench 设计为一个交互式移动执行环境,通过闭环协议评估规划 agent。移动任务定义为一个元组 (q,S0,H0,A0),分别表示用户意图、初始状态、对话历史和候选动作。在每个交互步骤 t,中央规划器观察查询、累积历史和可用动作,以预测下一个动作 at=π(q,Ht,At)。可执行沙箱处理此动作,生成动态反馈 ft 并更新环境状态。此交互循环通过执行反馈和错误感知重规划持续进行,直到规划器发出 Finish 动作或达到最大步骤阈值。
如下图所示:
为了将中央推理与低级执行细节解耦,系统提供了一个统一的、以工具为中心的动作接口。总动作空间包含四个类别:用于查询或变更系统状态的直接移动工具、用于将上下文路由到专门下游 agent 的子 agent 入口工具、用于检索持久用户画像的记忆工具,以及用于动态动作空间扩展的技能加载工具。初始活跃动作空间 A0 通过召回 top-N 工具模式和可用技能加载器来制定。当规划器调用技能加载器时,环境会在下一步动态扩展动作空间,将具体工具模式绑定到该技能。
环境基于一个有状态的移动模拟沙箱,包含三个核心组件。这些包括定义 API 签名的结构化工具模式、处理验证和逻辑的可执行工具代码,以及维护实时应用状态 Dt 和审计日志 Ot 的共享持久后端数据库。步骤 t 时的移动环境状态建模为 St=⟨Dt,Ot⟩。当工具执行器处理调用时,它会直接将状态变更应用于数据库,记录动作,并返回结构化执行反馈 ft=⟨Status, ErrorType, Payload⟩。
参考框架图:
在评估方面,作者采用了一种与证据对齐的验证协议,以处理多样的完成语义。任务被分为三个不同的查询桶,每个桶配有一个专用的验证检查器。桶 1(工具调用)评估需要确定性操作步骤的任务,通过将工具名称、调用顺序和参数与真实情况进行匹配。桶 2(状态变更)适用于存在多个有效执行路径的任务,基于终端数据库转换 DT−D0 验证成功。桶 3(Agent 行为)涵盖开放式任务,评估可观察的交互轨迹,包括适当的子 agent 委托和面向用户的交互。特定于能力的要求,如记忆检索和技能加载,作为主要检查器之上的附加门控应用。
如下图所示:
该基准在四个能力维度上合成任务:基本工具使用、子 agent 协作、记忆使用和技能使用。这些任务基于真实的移动工作流。一个按场景标记的分析快照涵盖 13 个高级移动场景和 89 个功能子类别,提供了查询类型的层次化分布。
层次化分布如下图所示:
具体到记忆使用维度,任务从连贯的用户画像世界合成。请求有意省略显式偏好,迫使规划器查询持久记忆。这些任务沿三个诊断轴标注:记忆推理类型(如单记录定位或冲突记录解决)、目标操作(如个性化电话操作或记忆修改)以及应用领域。
记忆任务的覆盖范围如下图所示:
实验
评估测试了 13 个最先进的 LLM 作为中央移动规划器,在 1,705 个任务上跨越四个能力维度:基本工具使用、子 agent 协作、记忆使用和技能使用,所有任务均在有状态的模拟沙箱中执行,并通过与证据对齐的查询桶验证成功。结果表明,即使是最强的模型也仅达到 75.52% 的整体得分,子 agent 委托和个性化记忆检索成为关键瓶颈,性能急剧下降。没有单一模型在所有维度上表现出色,揭示了高层编排与可靠的端到端执行之间的差距,错误分析强调失败会跨越能力边界级联,而规划器在面对障碍时往往缺乏校准的克制。这些发现表明,当前的前沿模型仍不足以实现可靠的自主移动操作,该基准可作为一个诊断框架,指导在复合可靠性、自适应恢复和集成记忆定位方面的改进。
MobilePA-Bench 是唯一一个将有状态、交互式移动操作系统沙箱与子 agent 协作、记忆使用和技能使用的原生评估相结合的基准,同时针对高通量强化学习 rollout 进行了优化。即使是最强的前沿模型也仅达到 75.52% 的整体成功率,错误跨越能力边界级联,且没有单一模型在所有维度上表现出色。结果表明,当前的规划器缺乏复合可靠性,尽管受益于结构化的技能程序,但在记忆定位的个性化和委托方面最为挣扎。与忽略高级能力的以 GUI 为中心的基准和缺乏动态反馈的静态函数匹配套件不同,MobilePA-Bench 在高通量设置中独特地将有状态操作系统交互与子 agent、记忆和技能评估集成在一起。技能使用得分始终高于记忆和子 agent 协作得分,表明预打包的程序稳定了执行,但个性化检索和可靠委托仍然是所有模型面临的持续弱点。
MobilePA-Bench 中的全局工具目录将功能组织到七个移动领域,每个领域的工具数量从 15 到 25 个不等。这些领域涵盖音频和娱乐、应用和存储、显示和声音、系统设置、时间管理、AI 助手以及通话和通信,支持多样化、真实的移动交互。音频与娱乐是最大的领域,有 25 个工具,而通话与通信最少,有 15 个工具。AI 助手领域包括用于 GUI 子 agent 路由和记忆搜索的工具,直接支持基准的子 agent 协作和记忆使用评估维度。
在评估的模型中,整体移动规划器性能仍然有限,最强系统达到 75.52%,大多数模型低于 70%。基本工具使用是最强的能力,而子 agent 协作,尤其是记忆使用,显示出更广泛的弱点。能力领先地位在不同模型间分散,表明复合可靠性和端到端执行存在差距。最高整体得分为 75.52%,13 个模型中有 7 个整体低于 70%。基本工具使用最高达到 83.85%,而记忆使用范围从 33.78% 到 64.63%,使记忆成为关键瓶颈。没有单一模型在所有维度上领先:领先地位在基本工具使用和技能、子 agent 协作以及记忆之间分裂。
对 Qwen3.6-27B 的三次重复评估显示出很强的运行间稳定性。大多数能力得分变化不到一个百分点,整体得分保持在一个狭窄范围内,确认了尽管存在随机生成,基准仍能产生可靠的测量结果。基本工具使用、记忆和技能的标准差低于一个百分点。子 agent 协作的波动最大(2.25 分),但由于其权重较低,对整体得分的影响最多为 0.23 分。整体得分在 57.22% 到 57.63% 之间波动,误差带低于 0.5 个百分点。
MobilePA-Bench 在一个有状态、交互式的操作系统沙箱中评估移动规划器,该沙箱原生评估跨越七个工具领域的子 agent 协作、记忆使用和技能使用。实验表明,即使是最强的模型也仅取得有限的整体成功,尽管结构化技能具有稳定作用,但记忆定位的个性化和委托仍然是持续的弱点。能力领先地位分散,复合可靠性缺乏,而重复评估确认了基准的测量稳定性。