HyperAIHyperAI

Command Palette

Search for a command to run...

从轨迹到智能体世界:用于交互式环境模拟的智能体式语言世界模型

Quanyu Long Xiao Chen Jianda Chen Haozhen Zhang Qisheng Hu Jianzhu Bao Wenya Wang

摘要

逼真的环境副本对于训练和评估 LLM 智能体日益重要,但原始系统可能无法访问或难以实际复现。我们探索智能体式语言世界建模:不是重建可执行环境,而是让世界模型智能体充当任务智能体的环境,并支持忠实且有状态的模拟。我们通过 Trace2Env 实例化这一范式,Trace2Env 是一个免学习框架,适用于原始系统不可用但历史交互轨迹仍可访问的场景。Trace2Env 将这些轨迹重建为可复用的环境 worldbook,其中包含环境 schema、有据可依的证据和归纳出的行为知识。在运行时,世界模型智能体主动查阅 worldbook 以及持久的情景状态,以推断每个动作的观测结果和持久状态影响。在九个环境中,与传统的基于提示的语言世界模型相比,Trace2Env 同时提升了下一观测保真度与长时程交互一致性。在多轮交互中,针对 Trace2Env 生成的任务智能体动作在真实环境中回放时更频繁地保持有效,表明其模拟动力学更好地保留了先前动作在后续轮次中的后果。这些结果确立了智能体式语言世界建模作为无需重建原始可执行系统即可构建逼真环境副本的另一种方向。

一句话总结

南洋理工大学与香港理工大学的研究人员提出 Trace2Env,一个免学习的 agentic 语言世界建模框架,将历史交互轨迹重建为可复用的环境 worldbook,使世界模型 agent 能够查阅环境模式、有依据的证据和归纳出的行为知识,并配合持久回合状态,从而在九个环境中相比传统基于提示的语言世界模型提高了下一步观测保真度和长视野交互一致性。

核心贡献

  • 本文提出 agentic 语言世界建模,这是一种新范式,其中世界模型 agent 作为任务 agent 的有状态环境模拟器,而不需要原始系统的可执行副本。
  • 本文提出 Trace2Env,这是一种免学习框架,将历史交互轨迹重建为包含模式、有依据的证据和归纳行为知识的可复用环境 worldbook,然后结合持久回合状态使用该 worldbook 来推断观测值和持久状态效果。
  • 在九个环境中,Trace2Env 相比基于提示的语言世界模型在下一步观测保真度和长视野交互一致性上均有提升,并且以 Trace2Env 为条件生成的任务 agent 动作在真实环境中重放时更经常保持有效。

引言

交互式 agent 需要能够响应动作并保留其后果的环境,但构建终端、软件工作空间或企业系统的真实副本通常需要无法获得的代码、数据或基础设施。历史交互轨迹通常仍然可以访问并包含行为证据,然而先前基于轨迹的方法要么为执行动作的 agent 生成技能,要么重建可执行工作空间,这些方法可能仍然依赖于缺失的实现细节。基于提示的语言世界模型还将环境知识和长视野状态压缩到单一上下文中,使它们在多个回合中维护状态连续性时变得不可靠。作者通过提出 Trace2Env 来解决这一问题,这是一个免学习框架,将历史轨迹转化为结构化的、不可执行的环境 worldbook,并使用 agentic 语言世界模型主动检查这些知识,维护持久回合状态和记忆,并模拟环境响应。

方法

作者提出 Trace2Env,这是一个为基于轨迹的环境重建而设计的框架,可以在回合之间传递行为知识而不引入回合特定事实。系统在两个不同阶段运行:离线阶段从记录轨迹中重建环境 worldbook,在线阶段将这些固定知识与可变回合状态和交互记忆相结合。在线 rollout 过程中,世界模型 agent 提出每次转移,而共享执行框架控制哪些状态更改被提交。

如下图所示,整个流程分为环境重建、worldbook 存储和 agentic 模拟。

在离线阶段,作者利用记录的转移来构建可复用的环境 worldbook。一条记录的转移提供了关于单次交互的具体证据,但模拟需要能够泛化到未见情形的知识。离线构造器处理构建轨迹以生成 worldbook KE=Constructϕ(Dbuild)K_{\mathcal{E}} = \mathrm{Construct}_{\phi}(\mathcal{D}_{\text{build}})KE​=Constructϕ​(Dbuild​)。该 worldbook 包含四个互补组件。第一,模式描述动作接口和模拟器可以维护的状态变量。第二,有依据的证据保留记录的转移、选定的演示及其原始观测。构造器将每个动作与其结果对齐,以提取观察到的事实、候选状态效果、结果和不确定性,同时排除归因模糊的效果。第三,归纳的抽象捕捉轨迹中重复出现的行为,包括条件效果、状态约束、观测契约和描述性约定。构造器提出行为规则,并根据支持性案例和对比性案例对其进行审查,以完善这些抽象。最后,溯源记录将每个构建产物链接回支持它的具体轨迹和回合,使模拟器能够以不同粒度检查环境。

为了区分可以在回合之间传递的知识与仅在当前交互中确立的事实,Trace2Env 维护一个持久回合工作空间。将所有信号视为单一扁平历史会使它们的作用范围变得模糊。相反,工作空间定义为 Wt=(KE,s^t,Mt)\mathcal{W}_{t} = (K_{\mathcal{E}}, \hat{s}_{t}, M_{t})Wt​=(KE​,s^t​,Mt​),其中 KEK_{\mathcal{E}}KE​ 是在回合之间共享的不可变环境 worldbook,s^t\hat{s}_{t}s^t​ 是当前回合的可变表示状态,MtM_{t}Mt​ 是回合交互记忆。这种分离确保了跨回合证据能够提供关于环境行为的信息,而不会确定当前回合中存在什么,将缺失的状态项视为未知而非不存在。

在线 agentic 模拟阶段,系统分两个阶段生成下一次转移。给定动作 ata_tat​,世界模型 agent 从当前回合的紧凑视图开始,并有选择地从工作空间中检查附加信息。由于跨回合证据带来了相关不等同于可适用的挑战,系统将检索与适用性分开。对于每个检索到的 worldbook 条目 eee,适用性门控分配一个分类:

gtapp(e)=Gapp(e∣at,Wt)∈{supporting, uncertain, format-only}g_{t}^{\mathrm{app}}(e) = G_{\mathrm{app}}(e \mid a_{t}, \mathcal{W}_{t}) \in \{\text{supporting, uncertain, format-only}\}gtapp​(e)=Gapp​(e∣at​,Wt​)∈{supporting, uncertain, format-only}

支持性证据可指导具体行为,不确定证据要谨慎使用,仅格式证据则在不建立回合特定事实的情况下提供响应结构。agent 在检查工作空间和对转移进行推理之间交替进行,直到准备好将其决策外化为转移提议 qt=(Δt,o~t+1)∼Pθ(⋅∣dE,at,Wt)q_{t} = (\Delta_{t}, \tilde{o}_{t+1}) \sim P_{\theta}(\cdot \mid d_{\mathcal{E}}, a_{t}, \mathcal{W}_{t})qt​=(Δt​,o~t+1​)∼Pθ​(⋅∣dE​,at​,Wt​)。这里 Δt\Delta_{t}Δt​ 是候选状态效果的有序列表,o~t+1\tilde{o}_{t+1}o~t+1​ 是建议的观测值。

该提议不是直接修改回合,而是传递给共享执行框架进行验证。执行框架应用验证门控:

gtval(qt)=Gval(qt∣at,Wt)∈{accept, reject}g_{t}^{\mathrm{val}}(q_{t}) = G_{\mathrm{val}}(q_{t} \mid a_{t}, \mathcal{W}_{t}) \in \{\text{accept, reject}\}gtval​(qt​)=Gval​(qt​∣at​,Wt​)∈{accept, reject}

该门控在状态副本上检查候选效果是否符合模式、规则支持和适用的状态约束。只有被接受的提议才会被提交。执行框架提交暂存的效果并返回解析后的观测值 (s^t+1,o^t+1)=H(Wt,at,qt)(\hat{s}_{t+1}, \hat{o}_{t+1}) = \mathcal{H}(\mathcal{W}_{t}, a_{t}, q_{t})(s^t+1​,o^t+1​)=H(Wt​,at​,qt​)。一旦提交,更新后的状态和交互记忆会持久化到下一回合,为整个在线 rollout 提供连续性。

实验

实验在两种设置下对九个环境中的 Trace2Env 进行评估:在 AgentWorldBench 和 EnvScaler 上进行下一步观测预测,以及在 ALFWorld 和 SciWorld 上进行多回合交互。与直接提示、轨迹检索、worldbook 提示和仅执行框架基线的比较表明,完整系统提高了预测质量和一致性,重建的 worldbook 知识与运行时提供了互补的增益。长视野交互结果表明,仅靠高模拟成功率并不能保证世界模型忠实,而 Trace2Env 通过保留有依据的状态约束实现了向真实环境更强的迁移。消融实验进一步表明,worldbook 证据与抽象是互补的,并且随着构建轨迹数量的增加,保真度会提高;定性结果则强调持久状态跟踪如何防止错误转移使交互偏离。

对于 gpt-5.6-sol 主干,Trace2Env 在七个评估环境中取得了最高的平均下一步观测预测分数。使用检索轨迹或 worldbook 上下文进行提示也优于直接提示,而仅执行框架变体则显示出较小且不太一致的增益。最高分出现在应用型环境中,如 Food、Shopping 和 Benefits。Trace2Env 总体领先,并在大多数环境中记录了最佳分数,在 Terminal 和 Benefits 中相对于直接提示的增益尤其大。worldbook 提示和轨迹 RAG 提示均优于直接提示,其中 worldbook 提示在平均水平和大多数环境中略领先。仅执行框架的结果参差不齐,在某些环境中优于直接提示,但在其他环境中则落后。

直接提示在模拟世界模型中取得了较高的任务成功率,但其动作序列在真实环境中重放时往往失败。Trace2Env 的模拟成功率较低,但世界模型到真实环境的一致性要高得多。结果表明,仅靠模拟成功率并不是衡量世界模型保真度的可靠指标。在 ALFWorld 中,直接提示的模拟成功率从 97% 下降到在真实环境中重放其诱导动作时的 3%。Trace2Env 在 ALFWorld 和 SciWorld 中均保持显著更高的 W2R 一致性,尽管其模拟成功率低于直接提示。

在 Terminal 上,证据对 worldbook 性能提供了更强的独立贡献,而抽象在与证据搭配使用时最为有用,而不是单独使用。抽象与证据的完整组合取得了最佳结果。worldbook 性能也随着使用更多构建轨迹而提高,尽管构建成本随轨迹量上升,因此选择适度的轨迹数量作为实际权衡。证据显著改善了仅模式变体,而仅抽象没有帮助并且略微降低了性能。在已抽象的 worldbook 上添加证据比在证据之上添加抽象产生更大的增益,完整 worldbook 表现最佳。随着额外构建轨迹的加入,性能变得更加稳定并继续上升,但一次性构建成本随轨迹量增加。

实验在七个环境中评估了基于轨迹的环境归纳,与直接提示和检索或 worldbook 基线进行下一步观测预测的比较,发现 Trace2Env 总体表现最好,尤其是在 Food、Shopping 和 Benefits 等应用型环境中。第二项关于模拟与真实重放的研究表明,直接提示可以实现较高的模拟成功率,但世界模型到真实环境的一致性较差,而 Trace2Env 在 ALFWorld 和 SciWorld 中以部分模拟成功率为代价换取了显著更忠实的动作迁移。在 Terminal 上的消融实验表明,证据对 worldbook 性能的贡献大于抽象,抽象与证据的完整组合效果最好,使用更多构建轨迹在增加构建成本的同时提高了稳定性。


用 AI 构建 AI

从创意到上线——通过免费 AI 协同编码、开箱即用的环境和最优惠的 GPU 价格,加速您的 AI 开发。

AI 协同编码
开箱即用的 GPU
最优定价

HyperAI Newsletters

订阅我们的最新资讯
我们会在北京时间 每周一的上午九点 向您的邮箱投递本周内的最新更新
邮件发送服务由 MailChimp 提供