HyperAIHyperAI

Command Palette

Search for a command to run...

心智世界建模

Hao Fei Yiran Zhao

摘要

世界模型为规划与行动提供了预测基础,但现有形式仅回答物理层面的问题:事物是什么、在哪里,以及将如何演化。然而,人类行为由隐藏的心智状态(一个人的信念、欲求、意图、感受以及对社会规范的考量)所驱动,因此,一个仅追踪物理场景却忽视每个智能体对场景的所知与所信的模型,会为看似正确的场景预测出错误的行为。我们提出了心智世界建模(Mental World Modeling,MWM),这是一个通用的理论框架,将心智变量作为世界模型的核心组成部分,而非事后解释:MWM 维护一个耦合的物理-心智世界状态,生成针对特定目标的局部观察,并模拟候选行动如何共同更新这两个组成部分。我们在 MENTIS 中实例化了该框架,这是一个无需训练且完全可解释的基线方法,它将过程分解为状态解析、目标观察生成、行动分解、耦合的物理与心智状态转移以及分支级价值评估。在一个涵盖文本、图像和有声视频故事的、经人工构建和质量控制的场景决策数据集上,基于 8 个现代大语言模型世界模型的实验表明,显式建模心智状态对于预测人类决策至关重要。更深入的分析进一步揭示了当前心智世界建模的瓶颈。我们期望 MWM 成为世界建模的下一个阶段,即从模拟物理场景迈向模拟在其中行动的心智。

一句话总结

牛津大学与新加坡国立大学的研究者提出心智世界建模(Mental World Modeling,MWM),一种通用理论框架,其将信念、意图等心智变量作为世界模型的核心组成部分,维护一个耦合的物理-心智状态,并实例化为 MENTIS——一个无需训练、完全可检查的基线系统,将过程分解为状态解析、目标观察生成、动作分解、耦合的物理与心智状态转移,以及分支级价值评估。通过在人工构建的包含文本、图像和有声视频故事的多模态数据集上,对八种现代基于大语言模型的世界模型进行实验,表明显式建模心智状态对于预测人类决策至关重要,并揭示了当前心智世界建模的瓶颈所在。

核心贡献

  • 引入心智世界建模(MWM),一种通用框架,通过维护耦合的物理-心智世界状态、生成目标特定的部分观察,并模拟动作执行时两个组件的联合更新,使心智变量成为世界模型的核心显式组件。
  • 提出 MENTIS,一个无需训练、完全可检查的基线系统,通过状态解析、目标观察生成、动作分解、耦合的物理与心智状态转移,以及分支级价值评估,将 MWM 付诸实践。
  • 在人工构建且经过质量控制的场景决策数据集(文本、图像和有声视频)上,对 8 种现代基于大语言模型的世界模型进行评估,结果表明显式心智建模对于预测人类决策是必要的。更深入的分析揭示,相对于人类参照,状态转移模拟是主要瓶颈。

引言

世界模型对于需要在动态环境中进行预测、规划与干预的 agent 至关重要。当前的世界模型族擅长捕捉物理、视觉和空间动力学,但它们仅将人类 agent 视为移动对象,忽略了塑造人类行为的心智状态——信念、意图、情感、规范和社会关系。先前的认知与心智理论(Theory-of-Mind)研究常常孤立地评估心智推理,使其脱离物理与心智场景的持续协同演化。作者通过心智世界建模(MWM)填补了这一空白,该框架联合表示物理与心智动力学,从耦合状态中渲染目标 agent 的部分观察,并模拟候选动作如何改变物质场景与心智-社会配置,从而提供形式化基础、无需训练的基准实现(MENTIS)以及实证证据,证明显式的心智世界建模对于预测人类决策是必要的。

数据集

作者引入 Menti-Bench,一个规模较小但过程完整、用于评估多模态系统中以目标为中心的世界建模(MWM)的测试基准。与仅看最终结果的基准不同,每条记录都包含对中间推理步骤的黄金标注,使其适用于标准评估和 oracle 评估。

  • 组成与来源

    • 448 条记录均匀分布在三种模态上:
      • 文本:320 个短篇叙事故事。
      • 图像:100 条记录,每条包含一至五张图像的序列,并附有简要场景描述。
      • 有声视频:28 个片段,其中对话和环境音频承载了部分决策证据。
    • 每条记录呈现一个情境故事、一个指定的目标 agent、一个最小的决策问题,以及六个用自然语言书写的候选动作选项。
    • 场景跨越四个类别(人际、物体/资源、空间/感知、风险/规范)和五个日常领域;78% 的记录涉及至少两个角色,需要对其他 agent 进行心智推理。
  • 筛选与质量控制

    • 构建优先考虑防止捷径,而非原始数据量。
    • 对于文本记录:通过对抗性选项平衡确保正确答案在六个位置上的分布近乎均匀;正确选项与干扰选项的长度匹配;仅凭选项无法从表面线索猜出正确答案的盲测验证。
    • 对于图像和视频记录:每条记录均通过逐条人工质量检查。50 个制作的有声视频片段中仅保留 28 个,舍弃了音频证据不充分或模糊的样本。
  • 黄金标注模式

    • 每条记录携带完整的 MWM 过程标注:联合当前状态 sts_t^\starst、目标观察 otϵ,o_t^{\epsilon,\star}otϵ,、每个选项对应的一个后继状态,以及最终动作。共计标注了 2,688 个后继状态。
    • 标注遵循论文中定义的状态分类体系,严格保留用于评估和 oracle 干预研究;标准运行中系统仅能看到公开的场景、目标、问题和选项。
  • 数据使用方式

    • Menti-Bench 仅作为验证测试基准。没有训练划分;模型直接在基准上进行零样本或 oracle 辅助评估。
    • 过程级黄金标注使作者不仅能测量最终动作准确率,还能评估中间心智状态预测的质量,从而检验系统是否真正构建了 MWM 框架所假设的变量。

方法

作者提出心智世界建模(MWM),一种以目标为中心、以动作为条件的世界建模框架,旨在模拟社会决策。不同于仅关注环境动力学的标准物理世界模型,MWM 维护一个联合的物理-心智世界状态。状态空间分解为 S=Sphy×SmentS = S^{\text{phy}} \times S^{\text{ment}}S=Sphy×Sment,其中物理组件存储实体、关系和环境条件,心智组件存储潜在的心智-社会变量,如信念、注意、目标、意图、情感、偏好、规范、角色关系和氛围。

参考框架图。

MWM 过程区分了两种计算角色:目标 agent 和世界模型。目标 agent 从第一人称、部分观察 otϵo_t^\epsilonotϵ 出发进行操作,而世界模型则充当第三人称的生成式模拟器,维护联合状态 sts_tst,并根据目标 agent 的动作 atϵa_t^\epsilonatϵ 预测下一状态 st+1s_{t+1}st+1。状态的物理组件捕捉存在什么以及如何配置。

如下图所示:

心智组件捕捉解释 agent 如何解读物理场景的潜在变量。

如下图所示:

每个时间步的动态过程由三个耦合函数组成。首先,观察生成函数 Ωϵ\Omega_\epsilonΩϵ 从当前联合状态中渲染目标 agent 的第一人称观察,根据目标 agent 的感知范围和社会视角过滤信息。其次,动作提议函数 Πϵ\Pi_\epsilonΠϵ 从该观察中生成一个候选动作。动作被表示为一个耦合对,包含物理载体和心智-社会含义。第三,状态转移函数 TθT_\thetaTθ 预测下一个联合状态。该转移被分解为物理通道和心智通道,其中物理转移受物理载体约束,而心智转移则同时依赖于载体和预期含义。

为了将这一理论框架付诸实践,作者引入 MENTIS,一个模块化、可检查且无需训练的基线实现。MENTIS 旨在暴露潜在推理路径,而非直接输出答案。系统将输入场景转换为结构化当前状态,渲染目标伪 agent 的观察,将每个选项解析为动作分支,并行模拟物理与心智的后继状态,并评估所生成的未来以选择最终动作。

如下图所示:

MENTIS 推理流程分为六个阶段。第一阶段,状态解析器将原始场景映射到联合当前状态 s^t=(s^tphy,s^tment)\hat{s}_t = (\hat{s}_t^{\text{phy}}, \hat{s}_t^{\text{ment}})s^t=(s^tphy,s^tment)。第二阶段,观察生成器从 s^t\hat{s}_ts^t 中渲染目标 agent 的第一人称观察 o^tϵ\hat{o}_t^\epsilono^tϵ,确保目标 agent 无法获取的信息被过滤掉。第三阶段,动作分解模块将每个自然语言选项转换为结构化的候选动作,包含显式的物理和心智组件。第四阶段,世界状态转移模块为每个候选动作预测后继状态。物理和心智通道根据共享的时间-ttt 输入分别预测,并合并为联合后继状态 s^t+1k\hat{s}_{t+1}^ks^t+1k。第五阶段,价值评估器根据三个归一化标准对每个想象未来进行评分:心智一致性、物理合理性和社会适当性,同时发出安全否决标志。最后,第六阶段,确定性决策模块在固定打破平局规则下选择价值最高的分支,并将其映射回选项标签。每个阶段都将产物写入运行目录,从而支持组件级评估和消融研究。

实验

评估使用 Menti-Bench 过程标注测试基准,并采用八个语言模型组成的结构阶梯,从直接回答到包含物理与心智状态解析、观察渲染和分支模拟的完整心智世界建模。必要性阶梯表明,每增加一项建模承诺都能提升目标动作预测,完整流水线在所有模型上均优于直接回答,通道消融证实物理与心智通道及其耦合均不可或缺。基于 oracle 的瓶颈定位指出状态转移模拟是主要错误来源,而场景和模态分析显示,对于人际决策的增益最大,且结构化建模通过真正利用视觉、时间和听觉证据消除了模态差距。总体发现是,显式的心智世界建模提供了跨模态一致的改进,未来工作需聚焦于模拟耦合世界变化。

心智世界建模在需要推理隐藏心智状态的场景(如人际决策)中提供最大增益,并消除了文本、图像和视频输入之间的性能差距。结构化流水线主动使用特定模态的证据,视觉和听觉通道对最终性能有实质性贡献,而非依赖文本先验。完整 MWM 相对于直接回答的提升在人际决策中最大,在物体/资源场景中最小,这证实了在由心智变量决定选择时收益最大。初始的文本-视频性能差距在完整的 MWM 系统下消失,通道干预表明视觉和音频证据被真正使用,且视觉流是最重要的模态。

MWM 围绕两个计算角色组织社会智能——一个从第一人称部分观察出发行动的目标 agent,以及一个维护并模拟联合状态的世界模型——三者通过三个耦合变量交互。所有三个变量都显式地拆分为物理和心智-社会部分,使心智状态建模成为原生能力。实证上,这种设计在人际决策上产生最大增益,因为隐藏的心智变量控制着结果,并通过将文本、视觉和音频证据转换为共享的结构化状态,消除了模态差距。世界状态是一个第三人称潜在变量,结合了物理场景与心智-社会变量。目标观察是第一人称渲染,具有不同的物理和心智通道,使其成为部分且依赖于视角的。动作将物理载体与心智或语义内容耦合。人际决策从完整 MWM 中获得最大增益,因为它们最依赖于隐藏的心智变量。

心智世界建模的结构化阶梯显示,每增加一项承诺都能提升目标动作预测,完整流水线(MENTIS)在所有模型上均取得最高性能。仅选项的基线很低且几乎不随模型能力变化,证实这些任务无法在不理解故事的情况下解决,而即使使用多推理链的直接回答仍不及完整系统。Oracle 干预表明,模拟状态转移是主要瓶颈,占据了与人类性能剩余差距的最大部分。从直接回答到显式推理(S1→S2)的平均增益为 +11.3 F1,完整的世界模型流水线(S6)比自一致性采样(S3)高出 10 个点,即使 S6 下最弱的模型也优于 S3 下最强的模型。仅提供黄金状态转移就恢复了 45% 的人类性能差距,结合所有四种 oracle 则使差距缩小到 1.5 个点,表明未来改进应针对转移模型,而非状态表示或动作分解。

平均最终动作 F1 分数从仅选项下限的 31.3 单调上升至完整心智世界建模流水线的 87.9,每增加一级阶梯都带来性能提升。最大的增益来自阅读故事和显式的思维链推理,而结构化状态建模与模拟提供了进一步的提升,即使增加计算量,直接回答也无法匹敌。世界建模的收益在人际决策中最大,且与模态无关,消除了文本、图像和视频输入之间的差距。仅阅读故事就将平均 F1 提升了 32.0 个点,这是整个阶梯中最大的单次提升。思维链推理增加了 11.3 个点,是第二大增益,后续建模阶梯的贡献虽小但持续递增。使用完整流水线的最弱模型得分 84.9,超过了仅使用自一致性的最强模型(83.6),表明结构化世界模拟提供了超越重复采样所能达到的增益。人际决策从直接回答到完整建模的增益最大(+26.4),而物体/资源场景增益最小(+14.0),表明当隐藏的心智变量驱动决策时收益最大。直接回答中存在的模态差距(文本 70.8,视频 64.8)在结构化状态和完整流水线下消失,所有模态得分均超过 90,证明建模流水线将多样输入转换为通用格式。通道消融导致完整流水线的下降幅度大于直接回答,证实世界模型积极使用视觉、听觉和时间证据,而非依赖文本先验。

Oracle 干预揭示,状态转移模拟和状态解析是心智世界建模流水线中的主要瓶颈。提供黄金转移恢复了最大的单阶段增益,而黄金中间阶段的组合恢复了大部分人类性能差距,证实错误集中于模拟世界如何变化,而非表示当前状态。仅黄金转移就缩小了 45% 与人类性能的差距,使状态转移模拟成为最大的单一错误来源。将所有中间产物替换为黄金标注,使流水线性能提高到距离人类参照仅 1.5 个点,表明剩余差距的 81% 源自中间阶段,且次可加性增益表明错误存在重叠。

实验评估了一个心智世界建模流水线,该流水线将多模态故事解析为结构化状态,并模拟状态转移以预测目标动作,在文本、图像和视频输入上验证了其设计。消融和阶梯研究表明,每一项建模承诺都提升了性能,其中对依赖隐藏心智状态的人际决策提升最大,且该方法通过积极使用视觉和听觉证据,消除了初始的模态差距。Oracle 干预显示,模拟状态转移是主要瓶颈,占剩余人类性能差距的 45%,而结合黄金中间阶段几乎恢复了全部差距,确认未来改进应聚焦于转移建模,而非状态表示。


用 AI 构建 AI

从创意到上线——通过免费 AI 协同编码、开箱即用的环境和最优惠的 GPU 价格,加速您的 AI 开发。

AI 协同编码
开箱即用的 GPU
最优定价

HyperAI Newsletters

订阅我们的最新资讯
我们会在北京时间 每周一的上午九点 向您的邮箱投递本周内的最新更新
邮件发送服务由 MailChimp 提供