HyperAIHyperAI

Command Palette

Search for a command to run...

Zetta:面向自进化物理智能的高效闭环具身框架

摘要

具身智能体正日益被用于弥合端到端策略模型留下的差距。然而,智能体路径尚未在物理执行中实现闭环学习:现有框架在很大程度上仍是开环的,在 rollout 过程中遵循固定技能,仅在回合结束后才进行反思。这种事后反思无法在执行展开时对其进行治理,因为物理交互要求决策以超出当今大型智能体模型能力的频率跟踪快速变化的机器人-环境状态。我们提出 Zetta,一个闭环具身框架,它在保持基础策略冻结的同时,在线进化基于代码的运行时评判器和恢复技能。通过三个时间尺度分离的回路,Zetta 提供动作频率级治理、rollout 级评判-恢复提议以及验证门控的技能更新。结合 Z-Infra——一个将智能体逻辑与异构执行资源解耦的 rollout 基础设施,Zetta 在当前 rollout 预算下于 LIBERO-Pro 和 RoboCasa 上取得了最先进的成功率,分别达到 90.8% 和 93.6%,并实现了 11.1 倍的推理加速;成功率随自探索经验持续提升;所学技能可零样本迁移,并涌现出清晰的机器人“顿悟时刻”。这些结果表明,闭环框架自进化为可靠的物理智能开辟了一条规模化路径。

一句话总结

清华大学人工智能产业研究院(AIR)与 Z-Trans AI 的研究人员提出 Zetta,一个闭环具身执行框架,在保持基础策略冻结的情况下,通过三个时间尺度分离的循环在线演化基于代码的运行时 critic 与恢复技能,在 LIBERO-Pro 上达到 90.8%90.8\%90.8%,在 RoboCasa 上达到 93.6%93.6\%93.6%,并获得 11.1×11.1\times11.1× 的推理加速与零样本迁移。

核心贡献

  • Zetta 是一个闭环具身执行框架,在保持基础策略冻结的同时,通过三个时间尺度分离的循环在线演化基于代码的运行时 critic 与恢复技能:动作频率治理、rollout 级 critic 恢复提议,以及验证门控的技能更新。
  • Z-Infra 是一个为自进化具身 agent 设计的 rollout 基础设施,将 agent 逻辑与异构执行资源解耦,并支持 continuous batching、资源共享环境和细粒度处理器控制。
  • 使用 Zetta 和 Z-Infra 的实验在给定 rollout 预算下,在 LIBERO-Pro 和 RoboCasa 上取得了最先进的成功率,分别达到 90.8% 和 93.6%,并获得 11.1× 的推理加速;成功率随自我探索经验扩展,所学技能可零样本迁移。

引言

作者们致力于解决物理智能规模化中的挑战,其中端到端策略模型(如视觉-语言-动作模型)仍面临具身数据稀缺和真实世界部署脆弱的问题,而基于语言模型的具身 agent 会编排策略和工具,但在执行过程中基本保持开环。现有执行框架主要在一个 episode 完成后才进行反思,这限制了它们治理高频机器人-环境交互、精确分配功劳或将部署经验转化为可复用改进的能力。作者的主要贡献是 Zetta,一个闭环具身执行框架,在保持基础策略冻结的情况下,通过动作、rollout 批次和迭代三个时间尺度上协同的三个循环,在线演化基于代码的运行时 critic 与恢复技能。作者还引入了 Z-Infra,一个为自进化具身 agent 设计的 rollout 基础设施,将 agent 逻辑与异构执行资源解耦,以加速从自我探索中学习。

方法

作者提出一种双 agent 治理与进化架构,称为 Zetta,以在不改变底层策略参数的情况下实现具身 agent 的部署期进化。该框架将长程机器人操作形式化为一个受权限约束的治理过程,由两个核心固定运行时组件驱动:Action Policy 和 Orchestrator Agent。Action Policy 生成低级动作 at=π(st,g;θ)a_t = \pi(s_t, g; \theta)at=π(st,g;θ),其中参数 θ\thetaθ 满足约束 θ=0\nabla \theta = 0θ=0。Orchestrator Agent 作为一个固定的多模态推理算子,负责审计实时证据并批准模式切换。为促进闭环能力进化,系统引入了 Evolvable Harness,包括用于高频监控的 Runtime Critic、将策略映射到因果故障机制的 Recovery Playbook,以及由可执行算子组成的 Heterogeneous Toolset。

在执行过程中,最终运行模式由在线裁决逻辑确定,该逻辑强制执行证据驱动的决策。尽管 Runtime Critic 以高频运行,但只有在可审计的失败证据被 Orchestrator Agent 验证并接受后,才允许进行干预。为了离线优化 Harness,作者引入了 Evolutionary Agents,通过分析失败的 rollout 数据来迭代改进 harness 组件。优化目标定义为 maxHJ(H)=Eg,s0D[Success(τ)π,Aorch,H]\max_{\mathcal{H}} J(\mathcal{H}) = \mathbb{E}_{g, s_0 \sim \mathcal{D}} [\text{Success}(\tau) \mid \pi, \mathcal{A}_{\text{orch}}, \mathcal{H}]maxHJ(H)=Eg,s0D[Success(τ)π,Aorch,H],旨在最大化期望任务成功率,同时保持基础策略和 orchestrator 不变。

进化过程通过三阶段流水线进行。在第一阶段,系统进行大规模采样以建立性能基线,并将轨迹分类为 Successful Reference Index 和 Failed-Seed Manifest。第二阶段聚焦于机制级故障聚类和自顶向下的层次化因果诊断。Diagnosis Agent 基于 Earliest Observable Divergence tEODt_{EOD}tEOD 对种子进行聚类,tEODt_{EOD}tEOD 被定义为状态分布偏离健康分布的第一个时间步:tEOD=min{tdist(st,stref)>ϵ,strefIsucc(μt)}t_{EOD} = \min \{t \mid \text{dist}(s_t, s_t^{ref}) > \epsilon, s_t^{ref} \in I_{succ}(\mu_t)\}tEOD=min{tdist(st,stref)>ϵ,strefIsucc(μt)}。随后,它在诊断层上执行系统化检查,范围从评估层和 critic 层一直到参数层。诊断之后,Repair Agent 实施最小的 harness 补丁,嵌入严格的 VLA Re-entry Contract 以确保控制权安全移交。第三阶段将这些针对特定种子的补丁整合为一个统一的、带版本管理的 Harness,并经过严格的历史回归和留出评估,以确认其具有真正的泛化能力。

为了支持这种自进化 agent 所需的大规模并行 rollout,作者设计了 Z-Infra,一个专门的 rollout 基础设施,将 agent 逻辑与硬件资源管理解耦。该基础设施通过解耦的抽象层解决资源异构性和执行动态性问题。

如下图所示:

Z-Infra 架构分为三个不同的层。Control Plane 作为单一入口点,暴露统一 API,抽象后端异构性、处理请求路由,并通过全局会话注册表管理容错。Environment Worker Layer 管理不同系列仿真环境的生命周期,利用基于会话的生命周期管理系统和资源共享组来摊销模型编译与渲染上下文设置。Rollout Worker Layer 为 VLA 和感知模型提供 GPU 常驻模型服务。它实现了一个调度器,将推理请求分类为兼容组,并按先到先服务的方式调度。为最大化吞吐量,Rollout Worker 利用模型划分,将 Vision-Language Model 和 Action Expert 作为具有独立调度策略的独立进程部署,同时提供可选的量化运行时以平衡推理效率和策略成功率。这些层之间的通信围绕有界异步通道构建,能够跨多节点 GPU 集群透明扩展。

实验

该框架在 LIBERO-Pro 和 RoboCasa 上使用冻结的预训练 VLA 策略和严格的留出种子泛化进行评估。它首先在确定性执行下分析经验性失败模式,然后演化针对物理瓶颈的 critic 和恢复机制,而无需微调策略。实验表明,识别根因物理状态变量会带来不连续的 “Aha” 提升,累积的机制能够扩展任务内性能,并在相关任务之间实现零样本迁移。额外的基础设施评估表明,与基线相比,Z-Infra 在并发条件下保持受控延迟并实现更高吞吐量。

核心 agent API 被组织为五个类别:会话管理、观测与状态、低级控制、策略执行,以及感知与规划。所有原语都支持跨会话的透明批处理,而策略执行同时支持原子化的 observe-infer-step 操作和自主 episode 运行。性能上下文显示 Z-Infra 在并发下扩展吞吐量并保持受控延迟增长,优于缺乏持久 worker 和异步批处理设计的基线。该 API 将原语分为五个类别,覆盖会话生命周期、环境内省、电机控制、策略执行以及感知与规划。会话管理原语创建、续期和关闭长期会话,episode 在会话内从重置运行到终止。所有原语支持跨多个会话的透明批处理。策略执行包括用于原子 observe-infer-step 调用的 policy_step,以及用于自主执行的 run_episode。与基线相比,Z-Infra 在并发下实现更高吞吐量和更受控的延迟增长,这归因于持久 worker、动态批处理和异步调度。

在 18 个 RoboCasa Atomic-Seen 任务上,Zetta 在每个任务上都优于纯 VLA 基线,并将宏平均成功率提高了 20 个百分点。绝对增益最大的任务正是基线成功率最低的任务,而已经较强的任务提升幅度较小。在更广泛的评估中,Zetta 被报告改善了 32 个任务设置对,并在其余八个上与基线持平。Zetta 将宏平均成功率从 73.56% 提升至 93.56%,并在所有 18 个列出的 RoboCasa 任务上优于基线。增益最大的是 T5 和 T15 等较弱基线任务;更广泛的报告结果还显示,Zetta 改善了 32 个任务设置对,并在其余八个上持平。

在 LIBERO-Pro 上,Zetta 相比冻结的 pi0.5 基线大幅提升了平均成功率,整体宏平均从约 32% 上升到约 71%。Goal 变体的增益最大,平均成功率从 31% 到 38% 起步后达到约 89% 到 93%。在 LIBERO-10 设置上,提升较为温和但仍然明显,尤其是在基线非常弱的 S 条件下。Goal (T) 和 Goal (S) 的平均成功率分别从 31.0 和 38.0 提升至 92.5 和 89.0。Zetta 将 LIBERO-10 (S) 的平均成功率从个位数提升至 40%,而基线在大多数任务上仍接近零。在各个单独任务上,Zetta 通常达到或超过冻结的 pi0.5 基线,在 Goal 任务上的增益尤其一致。

评估涵盖 agent API 设计、下游策略性能和跨基准泛化。该 API 将会话管理、观测、低级控制、策略执行以及感知与规划组织为五个原语类别,并通过透明批处理和异步调度提高并发下的吞吐量。在 RoboCasa Atomic-Seen 任务上,Zetta 在每个列出的任务上都优于纯 VLA 基线,且基线最弱的任务增益最大。在 LIBERO-Pro 上,Zetta 相比冻结的 pi0.5 基线有显著提升,尤其是在 Goal 变体上,而在 LIBERO-10 上的提升较为温和但保持一致。


用 AI 构建 AI

从创意到上线——通过免费 AI 协同编码、开箱即用的环境和最优惠的 GPU 价格,加速您的 AI 开发。

AI 协同编码
开箱即用的 GPU
最优定价

HyperAI Newsletters

订阅我们的最新资讯
我们会在北京时间 每周一的上午九点 向您的邮箱投递本周内的最新更新
邮件发送服务由 MailChimp 提供