HyperAIHyperAI

Command Palette

Search for a command to run...

URBANGROUND:在真实尺度城市中从局部感知走向空间行动能力

摘要

多模态大语言模型(MLLM)能够解读街景,但城市行动能力取决于智能体开始移动后,这些局部证据是否仍然有用。本文探究当前 MLLM 智能体在复杂的真实尺度城市中,能将局部城市感知转化为可靠行动的程度。我们提出 URBANGROUND,这是首个使该问题可测试的沙盒,构建于一个基于全港三维地理空间数据、受物理约束的香港复刻环境中。URBANGROUND 支持第一人称视角的闭环交互,并提供用于导航的交互式地图。智能体可直接进入三维城市,以第一人称视角进行探索。我们的分析通过三个研究问题追踪空间问题的增长。首先,我们测试智能体在主动观察后,能否充分理解局部场景以回答空间问题。然后,我们探究当目的地变得更远且更不明确时,这种理解是否仍能支撑导航。最后,我们检验由此产生的行为在路径可用性和行人运动发生变化时是否依然有效。当代 MLLM 智能体通常在视觉识别和短距离空间推理方面展现出有用的原子能力,但方向感和行人感知运动仍不可靠。它们的核心失败出现在扩展探索过程中:局部能力无法组合成持续的、目标导向的行为,且错误不断累积而缺乏有效纠正。我们希望 URBANGROUND 能支持更广泛的研究,探究当前 MLLM 智能体在复杂、开放的城市环境中可靠探索的极限。

一句话总结

来自上海交通大学、新加坡国立大学、美团等机构的研究人员提出了 URBANGROUND,这是首个在物理受限的真实比例香港复刻环境中测试多模态大语言模型 agent 的沙盒,该环境基于全港三维地理空间数据构建,支持闭环第一人称探索和交互式地图,并表明局部感知支持短距离空间推理,而方位判断和长距离导航仍不可靠。

核心贡献

  • 本文介绍了 URBANGROUND,这是首个在物理受限、经过地理配准的香港复刻环境中评估城市空间行动能力的沙盒,该环境基于全港三维地理空间数据构建,支持闭环第一人称交互和交互式导航地图。
  • 该工作提出了分阶段评估协议,涵盖主动场景依据式空间问答、前往逐渐更远或更不明确目的地的导航,以及在路线可用性和行人运动变化下的适应能力。
  • 在该环境中对当前 MLLM agent 的评估显示,其在视觉识别和短距离空间推理方面具备有用的原子能力,而方位判断和行人感知的移动仍不可靠,且错误会随着长时间探索不断累积。

引言

近期多模态大语言模型(MLLM)agent 能够从单次观测中识别城市物体,但真实城市尺度的行动能力需要在每次移动改变第一人称视角时保持可用的空间估计。此前的评估未能充分体现这一点,因为游戏沙盒依赖特定游戏机制,室内物理环境范围有限,而城市图像或模拟器要么缺乏连续物理移动,要么无法保留真实大都市完整的经地理配准结构。作者提出了 URBANGROUND,这是一个基于官方三维可视化和行人网络数据构建的真实比例香港交互式复刻环境,以物理碰撞和地理坐标方式流式加载到 Unity 中。它支持第一人称感知、物理控制和交互式地图,并可在受控光照、天气、道路封闭和移动行人条件下运行,从而能够评估局部感知如何扩展为真实城市中的持续导航和适应能力。

数据集

作者基于香港地政总署发布的“全港三维数字地图”中的两个地理空间数据集构建该仿真环境。

  • 3D Visualisation Map 一种基于倾斜航空影像重建的分块纹理网格。它覆盖整个香港地区,以 WGS84 参考系下的 Cesium 3D Tiles 形式分发,并作为可见城市表面使用。

  • 3D Pedestrian Network 源于行人相关道路记录的地理配准三维线要素。每个顶点保留其地理位置和属性,每条边表示两个位置之间的行人连接。该网络不限制移动,但提供经过配准的路径图,供后续比较使用。

该框架在运行时将 3D Tiles 层级加载到 Unity 中,将瓦片坐标转换到统一的仿真坐标系,并根据当前观察尺度流式加载瓦片。活跃瓦片的几何体既提供渲染城市,也为角色控制器提供碰撞几何体。行人网络以连通图形式导入到同一坐标系中。Agent 在连续空间中自由移动;其轨迹可在执行后与该网络进行比对评估。作者将这两个数据集结合使用,作为全尺度、真实的地理空间层,用于测试具身 agent 的空间行动能力。

方法

URBANGROUND 是一个基于 Unity 的框架,旨在将全域尺度的地理空间数据转换为物理受限的城市环境,用于评估多模态大语言模型(MLLM)agent。该系统的目标是评估在特定视点下建立的场景依据是否在 agent 在环境中导航时仍然有用。该框架通过由三种递进能力定义的闭环交互运行:场景依据、持续性和适应能力。

sts_tst 表示第 ttt 轮的隐藏交互状态,包括经地理配准的 agent 位姿、当前界面状态、任务进度和城市条件。模型可见的观测包为 oto_tot,由当前第一人称或地图视图以及任务特定提示组成。面向模型的接口有意排除了剩余距离或最短路径 API 等特权信息。以 ggg 表示任务目标,mtm_tmt 表示工作空间状态,ata_tat 表示由仿真器执行的结构化动作,则闭环交互可表示为:

ot=O(st),m0=U0(o0,g),mt=U(mt1,ot,at1,g),t1,at=π(mt,g),st+1=T(st,at,ξt).\begin{array}{c} o _ {t} = \mathcal {O} (s _ {t}), \\ m _ {0} = \mathcal {U} _ {0} (o _ {0}, g), \\ m _ {t} = \mathcal {U} (m _ {t - 1}, o _ {t}, a _ {t - 1}, g), \quad t \geq 1, \\ a _ {t} = \pi (m _ {t}, g), \\ s _ {t + 1} = \mathcal {T} (s _ {t}, a _ {t}, \xi_ {t}). \end{array}ot=O(st),m0=U0(o0,g),mt=U(mt1,ot,at1,g),t1,at=π(mt,g),st+1=T(st,at,ξt).

这里,mtm_tmt 表示在模型交互上下文中引入的任务相关空间信息,而 ξt\xi_tξt 表示道路封闭或行人运动等动态环境变化。

该框架通过三个不同层实现此闭环:地理空间层、仿真层和 agent 层。

地理空间层将可见城市和行人连通性锚定在一个统一的地理坐标系中。它使用香港地政总署发布的三维数字地图,特别是 3D Visualisation Map 和 3D Pedestrian Network。3D Visualisation Map 提供由倾斜航空影像重建的分块纹理网格,并以 WGS84 参考系下的 Cesium 3D Tiles 分发。URBANGROUND 在运行时将此层级加载到 Unity,将地理坐标转换到统一的仿真坐标系,并根据当前观察尺度流式加载瓦片。3D Pedestrian Network 以连通图形式导入,其中顶点保留地理位置,边表示行人路段。该网络不将 agent 限制在预定义边上,从而允许连续移动,同时支持执行后的轨迹分析。

仿真层将配准后的城市转化为持续演变的环境,控制具身移动、碰撞、时间、天气和行人活动,同时保留地理坐标,如下图所示:

具身化与物理约束通过将受控 agent 实例化为 Unity 中的第一人称角色来实现。其连续运动根据城市网格派生出的碰撞几何体进行解算,确保建筑物、墙壁和高程变化约束轨迹。Agent 在其观测可见的表面上移动,仅通过坐标更新无法穿越可见结构。仿真层还包含连续的昼夜时间系统,用于控制天空、太阳位置、环境光照和阴影,使环境能够从白天过渡到黄昏和夜晚。此外,可配置的天气系统支持雨、雾等条件,这些条件会改变能见度和表面渲染。雨会产生与场景交互的粒子,产生可用于区分有遮挡路径和露天街道的暴露信号。最后,行人群体由在已配准网络上生成并分配沿边路线的动画虚拟形象构成,每一步记录位置和碰撞,以支持安全分析和导航成功评估。

agent 层通过客户端-服务器接口将外部 MLLM 连接到正在运行的 Unity 环境,使不同模型能够在无需修改 Unity 实现的情况下控制同一具身。主要观测是从 agent 第一人称相机渲染的 RGB 图像,呈现由上一次物理动作产生的位姿所看到的真实城市。对于需要全局推理的任务,交互式地图工具提供城市的地理配准俯视图,标记 agent 当前所在位置,并允许平移和缩放,但不暴露计算出的路线。在每个交互轮次中,agent 从动作空间 A=AfpAmap{terminate}\mathcal{A} = \mathcal{A}_{\mathrm{fp}} \cup \mathcal{A}_{\mathrm{map}} \cup \{\text{terminate}\}A=AfpAmap{terminate} 中恰好选择一个动作对象。第一人称动作 Afp\mathcal{A}_{\mathrm{fp}}Afp 包括 move、sprint、look、jump 和 open_map,而地图动作 Amap\mathcal{A}_{\text{map}}Amap 包括 map_select、map_pan、map_zoom、map_orbit 和 close_map。move 和 sprint 动作指定移动方向和持续时间,并可能包括偏航角和俯仰角速率。

为系统评估空间行动能力,作者将任务组织为五级阶梯,在保持交互界面不变的情况下逐步增加成功所需的空间状态。参见框架示意图:

第 1 级侧重于通过视觉识别、方位判断和主动探索来理解局部环境,考察场景依据能力。第 2 级引入显式指令下的导航,通过改变距离和约束来考验持续性。第 3 级转向隐式指令下的探索,要求 agent 在导航前推断目的地。第 4 级将持续性扩展到多任务规划,agent 需要在多个目标之间维持并执行计划。第 5 级引入动态环境交互,例如道路封闭和移动行人,考察适应能力。该阶梯在香港多个城市区域实例化,任务在空间上分布,以捕捉街道模式、地形和垂直行人连接等方面的差异。如下图所示:

这些任务在所选区域的分布确保了对 agent 在各种城市条件下的能力进行综合评估。

实验

UrbanGround 在固定交互预算内,使用第一人称 RGB 观测以及地图和物理动作,在香港各地通过五级空间行动能力阶梯评估当前 MLLM。第一组实验验证局部场景依据:模型能可靠识别可见证据,但在方位判断和行人网络遵从方面存在困难。第二组实验验证局部场景依据如何扩展到导航,结果显示短距离表现良好,但在较长路线和指令遵循方面存在系统性失败,原因是错误不断累积且路线状态未被维护。动态城市实验验证适应能力,发现天气和光照变化对问答的影响并不均衡,而道路封闭和移动行人暴露了即使在局部移动保持合规时,仍难以修改路线和避免碰撞。

在所评估的 MLLM agent 中,视觉识别是最准确的任务,方位判断最弱,通常接近随机猜测。主动探索处于中间水平,行人网络遵从度在主动探索期间最高,而视觉识别期间的遵从度相对较低。结果表明,识别可见地标并不保证可靠的方位判断。视觉识别准确率在各模型之间普遍较高,而方位判断准确率急剧下降,若干系统在四选项问题上接近随机猜测。主动探索的回答准确率中等,仅比识别略有下降,尽管 agent 必须执行短动作序列来收集缺失证据。行人网络遵从度在主动探索中最高,在视觉识别中最低,而较旧和较新的模型代际在方位判断和主动探索上的差异大于在识别上的差异。

Agent 仅在目的地可见的短距离导航中取得有意义的成功,而在较长路线上表现急剧下降。即使在距离相近的情况下,要求推断目的地也会导致成功率大幅下降,而多约束任务在几乎所有模型上仍未解决。效果最好的短距离显式目的地导航任务得分较高,但同一任务的长距离版本在所有模型上都降到接近零。推断目的地任务(地点搜索和意图推断)的成功率显著低于短距离显式目的地任务,尽管路线长度相近。多站点和时间窗口导航的成功率可忽略不计,表明当前 agent 无法在一条路线上同时维持多个活动目标。指令式导航和受限导航的结果较低,大多数模型无法可靠遵循语言指示或受限路径。

与晴朗白天相比,局部问答准确率在黄昏和夜间下降,且在各模型上黄昏的表现始终差于夜间。短距离导航成功受到的系统性影响较小,各模型的条件排序不一致,也不完全匹配问答鲁棒性。高问答表现并不保证可靠导航,Gemini-3.6-Flash 表现出较高的问答准确率但导航成功率较低。在所有模型中,黄昏和夜间的局部问答准确率均低于晴朗白天,黄昏始终是最差的条件。短距离导航成功率因模型和条件而异,天气和时间上没有一致的排序。Gemini-3.6-Flash 具备较高且相对稳定的问答准确率,但短距离导航成功率属于最低之列。GPT-5.5 在两种任务上跨条件保持相对稳定,而 GPT-5.4 和 GPT-5.2 在低能见度下问答准确率下降更明显。

在动态导航变化中,agent 保持较高的行人网络遵从度,但无法将这种局部合规转化为成功的路线完成。在大多数模型上,道路封闭任务的成功率接近零,安全进度大多较低,而行人碰撞率仍较高,尽管行人网络遵从度很强。结果揭示了局部合规移动与自适应、目标导向行动之间的持续差距。在道路封闭场景中,行人网络遵从度保持较高,但大多数模型的目标到达率接近零,安全进度大多较低。在移动行人条件下,网络遵从度仍然很强,但每个模型的碰撞率都很高,说明保持在行人网络上并不意味着具备避碰控制。在道路封闭和行人障碍下,仅出现适度的安全进度和较低的成功率,这区分了局部移动能力与路线修正和规划能力。

实验评估了多模态 LLM agent 在具身城市任务中的表现,包括视觉识别、方位判断、主动探索、具有不同路线要求的导航、光照条件和动态障碍物。视觉识别通常最强,方位判断最弱,通常接近随机猜测,而主动探索表现出中等准确率和最高的行人网络遵从度。导航主要在目的地可见的短路线中成功,但长路线、推断目的地和多约束任务会降至接近零,低光照条件在黄昏时对局部问答的损害最大,但不能一致预测导航可靠性。在动态变化下,agent 保持局部行人网络合规,但无法完成路线,碰撞率较高,自适应规划能力较弱。


用 AI 构建 AI

从创意到上线——通过免费 AI 协同编码、开箱即用的环境和最优惠的 GPU 价格,加速您的 AI 开发。

AI 协同编码
开箱即用的 GPU
最优定价

HyperAI Newsletters

订阅我们的最新资讯
我们会在北京时间 每周一的上午九点 向您的邮箱投递本周内的最新更新
邮件发送服务由 MailChimp 提供