Command Palette
Search for a command to run...
HarnessEval-W:将视觉世界评估智能体化
HarnessEval-W:将视觉世界评估智能体化
摘要
一个基准测试应当提供的远不止一个标量分数:使评估值得信赖的是为分数提供依据的推理过程。这对于世界模型尤为关键,因为判断一段生成轨迹需要理解物理规律、因果关系和世界状态是否正确演化。人类能够自然地发现此类违规,但现有基准测试均未将这一能力自动化:指标通过蛮力方式计算,没有留下可供检查或验证的推理链。我们提出 HarnessEval-W,一个智能体化的评估流水线,将 LLM 生态中的 harness 范式引入世界模型基准测试。HarnessEval-W 并非套用固定评分标准,而是解读每个评估案例的上下文,将评估问题分解为可测量的子问题,并派生出专门的子智能体,每个子智能体都配备有针对性的上下文和诊断工具,以对其各自的子问题进行推理。随后,父智能体验证所收集的证据,并将其汇总为最终判定。这种分层工作流将每次评估转化为一棵透明的证据树,其完整推理链为结果提供依据。我们将 HarnessEval-W 应用于 18 个代表性世界模型,覆盖 330 个评估案例。其判断与人类偏好高度一致,同时为每一段生成的轨迹提供可验证的细粒度诊断。我们将完整流水线作为实时基准测试开源,并诚邀广大社区在世界模型不断演进的过程中贡献新的技能和评估案例。
一句话总结
来自卡内基梅隆大学、巴黎综合理工学院、密歇根大学及其他机构的研究人员提出了 HarnessEval-W,这是一个 agent 化评估流水线,通过将每个评估案例分解为可测量的子问题并生成专门的子 agent 来构建透明、可验证的证据树,将 LLM harness 范式适配到世界模型基准测试中,其判断在 18 个世界模型和 330 个评估案例上与人类偏好密切对齐。
核心贡献
- 本文介绍了 HarnessEval-W,这是一个 agent 化评估流水线,通过将评估案例分解为可测量的子问题、分配专门的子 agent 并将其证据验证为透明的推理树,将 LLM harness 范式适配到世界模型基准测试中。
- 该方法在 330 个案例和 18 个世界模型上统一评估观察质量、转移正确性和世界持久性,其判断与人类偏好密切对齐,并产生细粒度、可验证的 rollout 诊断。
- 该工作将流水线作为实时、可扩展的基准进行了开源,并概述了测试时扩展、增长技能库和递归自我改进评估能力的方向。
引言
世界模型越来越多地基于生成视频进行评估,但评估物理因果性、几何一致性和观察真实感仍然缺乏稳健性。现有的基准通常依赖固定的评分标准或静态的问答探针,产生的分数难以解释、验证或追溯到具体的模型失败。作者提出了 HarnessEval-W,这是一个 agent 化评估 harness,将人类评估形式化为一个分层流水线:一个父 agent 解释每个案例,将其路由到适用的技能,生成带有诊断工具的专门子 agent,并将验证后的证据合并为透明的推理树。HarnessEval-W 覆盖了观察质量、转移正确性和世界持久性三个维度下的 330 个案例,评估了 18 个世界模型,并表明其判断与人类偏好一致,同时每个分数都是可审计的。
数据集
作者构建了 HarnessEval-W,作为一个包含 330 个案例的基准,用于评估世界模型。每个案例包括一张初始图像、一份动作规范(包含文本指令、相机轨迹、控制序列、rollout 计划和物理参数条件),以及与一个探针族相关联的预期结果。
来源与构建
- 世界元数据从一个结构化场景分类体系中进行采样,包括六个轴:环境、前景、中景、场景密度、外观和视角。
- 每个案例还被分配六个探针族之一:探索性转移、意图性转移、物理转移、漂移抵抗、重访一致性和屏外演化。
- 采样器选择兼容的分类体系组合,并拒绝其实体或空间布局无法支持所选交互的案例。
- 图像生成器从基于采样元数据构建的结构化提示中生成初始观察。
- 基于图像的规划器从图像中生成具体的动作和 rollout 计划,而不改变探针族或添加图像中不存在的实体。
- 案例验证器对每个图像-动作对进行审计,检查目标可见性、动作可行性、结果具体性和证据充分性。对于返回路径不清晰或存在隐藏过程的案例(如重访和屏外案例),会重新采样或重新生成。
组成与过滤
- 发布的基准包含 330 个案例,涵盖多样化的环境、前景实体、空间布局、场景密度、视觉外观和视角。
- 六个探针族分为以转移为导向的案例(涵盖短期状态、物理和探索性干预)和以持久性为导向的案例(涵盖漂移抵抗、重访一致性和屏外演化的较长 rollout)。
- 观察质量在每个案例中都被评估;其他族对应转移正确性和世界持久性设置。
- 作者使用验证作为过滤门槛:未通过有效性审计的候选案例返回给采样器,而不是被保留。
使用方式
- HarnessEval-W 被用作世界模型的评估基准,探查即时世界状态转移和世界动态随时间的持续性。
- 本文未描述该基准的训练划分或混合比例;其呈现为包含干预和 rollout 案例的评估集。
方法
作者将交互式世界模型形式化为基于历史观察和用户指定动作来预测未来观察。给定初始观察 {oi}i=−T0 和未来动作 {ai}i=0t−1,未来观察 {oi}i=1t 的分布利用世界模型的隐藏状态 {si}i=0t 进行分解:
P(o1,…,ot∣o−T,…,o0;a0,…,at−1)∝P(s0∣o−T,…,o0)i=1∏tS(oi∣si)T(si∣si−1,ai−1)这种分解揭示了三个基本能力:从当前状态渲染观察(S)、在动作下更新状态(T)以及随时间维护连贯的状态序列。因此,作者构建了三个相应的评估轴。观察质量评估渲染的观察是否视觉可靠,涵盖感知质量和时序连贯性。转移正确性关注状态转移是否忠实地执行了请求的动作,评估探索性、意图性和物理转移。世界持久性评估预测的状态序列在演化过程中是否保持连贯,测试漂移抵抗、重访一致性和屏外演化。
为了以高度依赖上下文的方式评估这些轴,作者设计了一个分层 agent 化工作流,生成一个基于每个案例上下文的推理轨迹。
评估从案例特定的技能路由开始。HarnessEval-W 解释案例上下文,包括初始图像、动作提示和评估设置,并将案例路由到从预定义技能库中选取的一个或多个可复用技能。这确保系统为每个独特世界提出正确的高层问题。一旦分配了一个高层技能,系统通过子 agent 进行细粒度评估,而不是进行单一的总体评估。
对于每个高层技能,评估被分解为一系列由专门子 agent 回答的子问题。以意图性变化验证器为例,该技能将其评估分解为八个可测量的子问题,例如目标可见性、转移发生和最终状态有效性。在查询这些特定子 agent 之前,一个额外的子 agent 从案例上下文中预测并推理预期结果。在该规范的引导下,并行子 agent 检查 rollout 并返回带有诊断信息的离散分数。然后父技能 agent 将这些输出聚合成结构化证据树并生成最终案例分数,确保推理轨迹同时记录最终答案和支持证据。
为了用多样化和真实的评估案例来探查世界模型的极限,作者设计了一个 agent 化案例构建流水线。
流水线首先从预定义的场景分类体系和探针族中采样初始世界设置。场景分类体系为世界初始化提供跨六个互补轴的完整描述,包括环境、前景、中景、场景密度、外观和视角。探针族指定交互类型和预期证据,例如探索性转移或漂移抵抗。有了这些元数据,一系列 agent 处理案例创作。图像生成器将元数据转换为结构化提示以创建初始观察。然后基于图像的规划器指定具体动作,包括文本指令和相机轨迹,确保动作有意义且由可观察证据支持。最后,案例验证器审计提出的图像-动作对,以验证目标可见性、动作可行性和结果具体性。未通过有效性门槛的候选案例返回给采样器进行重新采样,将昂贵的推理集中在模糊候选项上,同时自动化大部分构建过程。
实验
实验在 330 个案例上对 18 个交互式世界模型进行了基准测试,涵盖观察质量、转移正确性和世界持久性三个维度的八个指标,发现文本驱动的通用生成器(如 Seedance 2.0 和 Wan 2.7)排名最高,而不同模型在不同轴上领先。HarnessEval-W 本身经过人类成对判断验证,在对齐度上优于 WBench,并在重复评估中保持稳定。进一步分析表明,意图性和物理转移分数强相关,探索性转移大部分独立,且将文本到视频模型微调为动作条件模型往往会改善重访一致性,但会降低物理和意图性交互性能。
HarnessEval-W 将评估组织为从世界模型分解推导出的三个轴:观察质量、转移正确性和世界持久性。这些轴分解为八个详细设置,每个设置与关于渲染、动作执行或长期连贯性的核心世界状态问题相关联。观察质量被视为基础并在每个案例中评估,而转移和持久性设置定义了目标探针族。观察质量涵盖渲染质量和物理合理性,并在所有案例中评估,而不是形成一个单独的探针族。转移正确性区分探索性、意图性和物理转移,检查视角变化、定向编辑或物理干预是否按要求发生。世界持久性包括漂移抵抗、重访一致性和屏外演化,要求稳定属性保持不变,而动态属性继续一致地演化。
总分由文本条件提示图像到视频模型领先,Seedance 2.0、Wan 2.7、Kling 3.0 和 MiniMax H3 紧密聚集在顶部。各评估轴上的优势各不相同:Wan 2.7 在意图性转移和物理转移正确性上领先,而 Seedance 2.0、HY-WorldPlay 1.5 和 SANA-WM 分别在漂移抵抗、重访一致性和屏外演化上领先。论文将顶级文本条件模型的优势归因于大规模训练,改善了动作-结果预测。文本条件提示图像到视频模型占据了排行榜顶部,四个最高总分均使用 Prompt I2V 接口。领先模型之间的整体表现紧密聚集,但没有模型在每个指标上都领先;不同模型擅长不同技能。Wan 2.7 的持久性分数相对较低,但在意图性转移和物理转移正确性上排名第一。Seedance 2.0 领先漂移抵抗,HY-WorldPlay 领先重访一致性,SANA-WM 领先屏外演化。
HarnessEval-W 沿世界模型分解推导出的三个轴评估世界模型能力:观察质量、转移正确性和世界持久性,其中观察质量在所有案例中作为基础,其他轴划分为目标探针族,如探索性、意图性和物理转移以及漂移抵抗、重访一致性和屏外演化。结果表明,文本条件提示图像到视频模型整体领先,Seedance 2.0、Wan 2.7、Kling 3.0 和 MiniMax H3 紧密聚集,而各轴性能各异;例如,Wan 2.7 在意图性和物理转移正确性上最强,而 Seedance 2.0、HY-WorldPlay 1.5 和 SANA-WM 分别在漂移抵抗、重访一致性和屏外演化上领先。总体而言,本文将顶级模型的优势归因于大规模训练改善了动作-结果预测,并得出结论:没有单一模型能在每个指标上占优,不同模型擅长不同技能。