HyperAIHyperAI

Command Palette

Search for a command to run...

WorldReward:面向相机条件世界模型的奖励建模

摘要

相机条件世界模型生成交互式视频,其中所指令的动作应引发预期的场景变化,同时外观、几何和时间动态保持一致。现有奖励通常分别评估这些要求:基于几何的奖励估计轨迹执行情况,但无法判断所执行动作的视觉质量;而基于图像的奖励衡量帧质量,却不捕捉动作执行或时间动态。我们认为,视觉语言模型(VLM)为将动作与其视觉结果关联提供了共享的推理空间。然而,针对完整动作序列评判整个长视频会形成冗长且嘈杂的上下文,其中短暂局部的动作证据可能被遗漏或稀释。为应对这些挑战,我们提出 WorldReward,一种基于 VLM 的成对偏好奖励模型,统一了相机条件世界模型的动作一致性和视觉质量评估。WorldReward 将成对视频分解为动作对齐的片段,并将每个片段组织为结构化视觉证据,使模型能够评估每个动作的执行情况及视觉质量。随后,片段级决策通过投票聚合为独立的视频级动作和视觉质量偏好。为训练 WorldReward,我们构建了一个大规模推理增强的偏好数据集,使用前沿 VLM 生成的结构化判断,并通过多轮基于工具的代理审计和针对性人工审查进行细化。我们进一步引入 WorldReward-Bench,一个带人工标注的基准,衡量奖励模型在动作一致性、外观质量和运动质量方面与人类偏好的一致性。在 WorldReward-Bench 上,WorldReward 在所有三个维度上均达到最高一致性,在动作、外观和运动方面分别超过 GPT-5.5 达 3.42、1.45 和 3.56 个百分点。当用于 HY-WorldPlay 1.5 的强化学习(RL)后训练时,它在短期到长期范围内持续改善动作执行和视觉质量。

一句话总结

复旦大学、腾讯混元、上海创智学院和上海交通大学的研究者提出了 WorldReward,一种基于 VLM\text{VLM}VLM 的成对偏好奖励模型,通过将成对视频分解为动作对齐的块、组织结构化视觉证据,并通过投票聚合块级决策,统一了相机条件世界模型的动作一致性和视觉质量评估。该模型在人工标注的 WorldReward-Bench 上,在动作、外观和运动三个维度上均优于 GPT-5.5\text{GPT-5.5}GPT-5.5,并提升了 HY-WorldPlay 1.5\text{HY-WorldPlay 1.5}HY-WorldPlay 1.5 的强化学习后训练效果。

核心贡献

  • 提出 WorldReward,一种基于 VLM 的成对偏好奖励模型,通过将成对视频分解为动作对齐的块、将每个块组织为结构化视觉证据,并通过投票将块级决策聚合为独立的视频级偏好,统一了相机条件世界模型的动作一致性和视觉质量评估。
  • 构建了一个大规模推理增强偏好数据集,由前沿 VLM 生成,并通过基于多轮工具调用的 agent 审计和针对性人工审核进行精炼,用于训练 WorldReward。
  • 提出 WorldReward-Bench,一个人工标注基准,衡量奖励模型在动作一致性、外观质量和运动质量三个维度上与人类偏好的一致性。WorldReward 在所有三个维度上均取得最高一致性,分别超过 GPT-5.5 达 3.42、1.45 和 3.56 个百分点,并在 HY-WorldPlay 1.5 的强化学习后训练中,在短至长期视野内同时提升了动作执行和视觉质量。

引言

基于视频的世界模型模拟视觉环境在用户控制下的演化过程,但其实用性取决于在长时间视野内忠实执行指令动作,同时保持连贯的几何结构、外观和时间动态。同时衡量这两个属性的奖励模型对于评估和强化学习(RL)后训练至关重要,然而现有方法存在不足。基于几何的奖励模型追踪相机轨迹但忽略视觉质量,基于图像的奖励模型逐帧独立评分而遗漏闪烁或运动不连续等时间问题,组合系统则以解耦的异质信号分别评估动作和质量。直接使用 VLM 对完整视频进行评判时,稀疏帧采样会遗漏短暂的状态转换,或者模型会被冗长嘈杂的上下文所淹没。

作者提出 WorldReward,一种基于 VLM 的成对偏好奖励模型,在单一系统中统一了动作一致性和视觉质量评估。该方法将长视频对划分为时间对齐的块,每个块包含四个连续动作,从结构化视觉证据(如成对帧网格和动作级面板)中评判每个块,并通过投票将块级决策聚合为独立的全局偏好。这种从局部到全局的设计使模型能够验证方向特异性证据,例如前向运动时的内容放大或上仰时的内容下移,同时检查时间一致性和伪影完整性。训练使用基于前沿 VLM 蒸馏、多轮 agent 审计和人工校准构建的推理增强偏好数据集,评估则引入 WorldReward-Bench,一个包含 760 对生成样本的人工标注基准,对动作、外观和运动质量分别标注。WorldReward 在所有维度上取得最高的人类一致性,优于专有 VLM 评判器和几何估计方法,并在用作 HY-WorldPlay 1.5 后训练的 RL 奖励时,同时提升了动作执行和视觉质量。

数据集

数据集构建与使用

作者构建了两个主要数据集:用于训练奖励模型的推理增强偏好数据集,以及用于评估的人工标注基准。

推理增强偏好数据

  • 构成与来源:该数据集通过三阶段流程构建:准备多样化的世界模型输入、生成成对的世界模型输出、以及构建带 agent 辅助质量控制和人工审核的块级推理标注。
  • 输入条件:每个条件是一个元组,包含输入图像、图像描述和动作轨迹。同一条件用于生成一对视频中的两个视频,确保视觉内容和相机控制匹配。
  • 图像覆盖:输入图像沿两个轴组织。内容类别包括场景中心图像、建成环境和自然场景,细分类别包括居住空间、公共活动、城市公共区域、交通、公共建筑、工业或居住场景、自然风光和自然灾害。风格以写实为主,另有动漫、游戏和艺术类图像,如油画、水彩、壁画、涂鸦和水墨风格内容。
  • 动作覆盖:轨迹分为三个家族:
    • 纯平移:仅位置变化的相机运动,无旋转。Basic_Move 覆盖单轴平移(前、后、左、右)。Diag_Move 组合两个平移轴(例如前+左)。Loop_Return 沿对称反向路径移开并返回。
    • 纯旋转:仅视角变化,位置固定。Yaw_View 水平旋转,Pitch_View 垂直旋转,Diag_View 组合偏航和俯仰变化。
    • 复合:结合平移和旋转的轨迹。Mixed_Basic 顺序执行平移和旋转。Mixed_Full 同时施加一个平移轴和一个旋转轴。Move_View 组合多轴平移与多轴旋转。
  • 成对生成:使用八种相机条件世界模型变体生成视频,包括 HY-WorldPlay 及其 RL 后训练变体、LingBot-World-Fast、Infinite-World、Yume-1.5、SANA-WM 和 Matrix-Game 模型。这些模型在架构、训练数据、交互视野和可控性上有所不同。配对分配在主要模型组合间保持平衡,兼容性感知分配确保模型仅在受支持的控制上被评估。Matrix-Game 模型仅支持部分轨迹家族,因此其配对频率较低。
  • 块级推理构建:每对匹配的视频被划分为与对应帧对齐的固定大小块。结构化奖励推理从 Gemini 3.1 Pro 蒸馏而来,将动作和视觉质量偏好与基于证据的推理配对。
  • 质量控制:基于 agent 框架的 QC 流程使用 GPT-5.5 在多轮中自适应调用图像读取工具。agent 检查源图像和帧网格概览,选择动作级面板,并重新检查证据进行交叉验证。它要么保留原始判定,要么返回一个 diff,将修正定位到某个块和评估维度。修订后的样本经过人工校准,审核者检查视觉证据和提议的 diff。在修订样本中,67.4% 仅修改推理文本,23.8% 仅修改分维度胜者,0.9% 仅修改块级胜者,7.9% 同时修改分维度和块级胜者。人工确认率为 87.0%。
  • 使用:最终数据集结合了块级多模态输入、基于证据的奖励推理以及独立的动作控制和视觉质量偏好,为训练 WorldReward 提供监督信号。

WorldReward-Bench

  • 构成:包含 760 对成对比较的人工标注基准。每对中的两个视频由相同的源图像、描述和动作轨迹生成,从而隔离轨迹执行和视觉内容的差异。
  • 覆盖范围:纯平移和复合轨迹分别占基准的 38.4% 和 37.1%,纯旋转占 24.5%。所有轨迹子家族均有覆盖。风格分布包括写实场景、游戏/动漫内容和艺术类图像。成对视频来自广泛的世界模型池。
  • 标注协议:每对样本由三名标注者独立评估。模型身份被隐藏,候选顺序随机化。标注者分别评估三个维度:
    • 动作一致性:场景变化遵循规定轨迹的忠实程度,检查方向和时序。
    • 外观质量:视觉保真度、时间一致性,以及场景内容和结构的保持。
    • 运动质量:生成动态的合理性和平滑性。
  • 标注者在标注前完成校准轮。仅当一方候选具有明显优势时选择 A 或 B;否则标记为平局。每个维度独立考虑。
  • 标签确定:基准标签由每个维度的多数投票决定。无多数的情况(包括三方分歧)由额外标注者按相同标准复核。
  • 评估指标:对所有样本报告三方偏好准确率,将平局视为显式标签。

方法

作者将相机条件世界模型的奖励建模问题形式化为成对比较设置。给定源图像、图像描述和相机或动作轨迹,生成两个候选视频。奖励模型必须预测动作一致性和视觉质量的维度特定偏好。作者没有将完整视频作为单一非结构化输入处理(这可能会稀释局部运动误差并使模型不堪重负),而是将动作轨迹分解为时间排序的块。

如下图所示,每个块包含一段连续动作的短片段以及来自两个候选视频的对应解码帧块。每个块的结构化视觉输入包括:用于检测场景漂移的源图像、显示每个动作的开始、中间和结束帧以检查时间一致性的帧网格概览,以及比较两个视频中相应动作片段首帧和末帧的动作级细节面板。这种组织方式使模型能够在聚合决策之前将判断建立在局部证据之上。

对于每个动作-视频块,模型在动作和视觉质量两个层面执行成对奖励推理。在动作控制方面,模型比较块中每个动作的两个视频,判断局部场景转换是否遵循指令方向,然后汇总为整体动作胜者。在视觉质量方面,模型评估时间一致性、动态生成质量以及伪影和结构完整性。

rkactr_k^{\text{act}}rkactrkvisr_k^{\text{vis}}rkvis 分别表示第 kkk 个块预测的动作和视觉质量胜者,每个胜者属于 {A,B,Tie}\{A, B, \text{Tie}\}{A,B,Tie}。块级决策通过投票在全部 KKK 个块上聚合,产生全局动作胜者 RactR^{\text{act}}Ract 和全局视觉质量胜者 RvisR^{\text{vis}}Rvis

Rm={A,nAm>nBm,B,nBm>nAm,Tie,nAm=nBm,m{act, vis}.R^m = \begin{cases} A, & n_A^m > n_B^m, \\ B, & n_B^m > n_A^m, \\ \text{Tie}, & n_A^m = n_B^m, \end{cases} \quad m \in \{\text{act, vis}\}.Rm=A,B,Tie,nAm>nBm,nBm>nAm,nAm=nBm,m{act, vis}.

其中 ncmn_c^mncm 是支持候选 ccc 的块数。这种从局部到全局的原则确保细粒度判断被组合为稳健的视频级奖励信号。

为了训练可靠的奖励模型,作者通过三阶段流程构建推理增强偏好数据集。

如下图所示,流程首先准备多样化的世界模型输入,涵盖各种内容类别、视觉风格和轨迹家族,包括纯平移、纯旋转和复合运动。接着,使用多样化的相机条件世界模型池生成成对奖励数据,确保视觉内容和动作难度匹配。最后,构建块级推理标注。作者首先从大型视觉语言模型中蒸馏结构化奖励推理,将偏好与基于证据的推理配对。随后,agent 辅助的质量控制阶段自适应检查视觉证据以减少蒸馏噪声,再经过人工校准验证提议的修订。

作者将奖励模型训练形式化为多模态大语言模型的监督微调。设 D={(zi,si)}i=1M\mathcal{D} = \{(z_i, s_i)\}_{i=1}^MD={(zi,si)}i=1M 表示块级训练集,其中 ziz_izi 是结构化多模态输入,sis_isi 是包含推理和类别偏好的目标响应。使用教师强制,优化标准自回归语言建模目标:

LSFT(θ)=1i=1MLii=1Mt=1Lilogpθ(si,tzi,si,<t).\mathcal{L}_{\text{SFT}}(\theta) = - \frac{1}{\sum_{i=1}^M L_i} \sum_{i=1}^M \sum_{t=1}^{L_i} \log p_\theta(s_{i,t} \mid z_i, s_{i,<t}).LSFT(θ)=i=1MLi1i=1Mt=1Lilogpθ(si,tzi,si,<t).

该目标教会模型解释相关视觉证据并产生相应的动作和视觉质量偏好。

作者进一步利用 WorldReward 为世界模型的后训练提供强化信号。保留片段级 rollout 框架,候选片段从独立的初始噪声中采样。对于每个无序候选对,WorldReward 构建相同的块级奖励输入并产生维度特定偏好。这些类别比较被转换为成对胜率奖励,然后在每个 rollout 组内标准化以计算优势。两个优势被组合为最优性概率,用于负感知流匹配目标以更新世界模型策略。该设计在保持片段级长视野后训练效率的同时,通过共享的视觉上下文解释显式平衡动作执行和视觉质量。

为了评估奖励模型复现人类偏好的可靠性,作者构建了人工标注基准。

如下图所示,该基准旨在覆盖多样化的相机控制、视觉风格和世界模型来源。它包括纯平移、复合和纯旋转轨迹,以及写实、游戏和动漫、艺术类图像。每对视频由标注者独立评估,分别评估动作一致性、外观质量和运动质量,最终标签由多数投票确定。

实验

实验在保留基准和后续训练应用中验证了 WorldReward(一种在带结构化推理标注的成对世界模型视频上训练的奖励模型)与人类偏好的一致性。WorldReward 在动作一致性、外观和运动质量上均优于专有 VLM、学习型偏好模型和基于几何的估计方法,并在多样化的轨迹和视觉域中具有良好的泛化能力。当用于世界模型的后训练时,它在动作遵循和视觉质量上均优于现有基线,收益已通过人工评估确认。消融实验表明,标注精炼、结构化视觉证据和逐视频推理监督是关键贡献因素,同时模型对候选顺序保持稳健,其判断在单个样本上与人类高度一致。

agent 辅助质量控制流程保留了 57.9% 的原始块级标注并修订了 42.1%,其中大多数修订仅涉及推理文本。人工审核者随后确认或拒绝 agent 提议的修订,提供最后一层监督。超过一半的块级标注被 agent 框架保持不变。在修订样本中,大多数仅更新推理文本,较小部分涉及分维度胜者更改。一小部分修订包含块级胜者更改,单独或与分维度胜者同时出现。

训练和基准轨迹库独立构建,但共享相同的九个子家族分类,各类别(如平移、旋转和复合运动)中的数量有所不同。基准使用更长的轨迹(23 步对比 11 步),并改变每个子家族内的分布以测试泛化能力而非记忆。基准库独立构建,包含 224 条轨迹,每条包含 23 个动作步骤,而训练库为 11 步。训练和基准之间的子家族数量不同,复合类别显著增加,如 Mixed_Basic(14 到 28)和 Mixed_Full(10 到 30),而 Move_View 从 68 减少到 36。同一轨迹分类法内的分布偏移是有意设计的,用于评估可迁移的动作-视频关系。

WorldReward 在动作一致性、外观质量和运动质量方面取得了与人类偏好的最高整体一致性,优于闭源 VLM 和图像/视频质量奖励模型。其对动作执行和视觉内容的联合推理使其能够在所有三个维度上做出可靠判断,包括复合轨迹和多样化视觉域。WorldReward 在所有三个维度上均超越闭源 VLM,最大增益出现在动作一致性和运动质量。几何估计器捕捉动作信号但无法评估视觉后果,而图像/视频偏好模型则遗漏动作遵循。WorldReward 在复合轨迹上领先,表明其能可靠判断超出孤立运动的动作。在视觉域方面,WorldReward 在写实内容上取得最高的动作和运动一致性,在艺术类内容上取得最高的外观一致性。

使用 WorldReward-RL 进行后训练在所有视野和动作类型上均提升了动作遵循准确率和视觉质量,优于 WorldCompass。基本动作和组合动作的增益一致,视觉质量也同时提升,表明指令遵循与外观之间不存在权衡。WorldReward-RL 在所有视野上,组合动作准确率比 WorldCompass 高 1.58 至 2.78 个百分点,基本动作准确率高 2.28 至 5.81 个百分点。HPSv3 视觉质量分数在两种动作类型和所有视野上均提升,组合动作分数上升 0.18 至 0.29,基本动作分数上升 0.15 至 0.24。在最长的视野下,WorldReward-RL 在组合和基本动作上均取得比 WorldCompass 更高的 HPSv3 分数,表明在更长的生成中具有持续改进。

将 Gemini 3.1 Pro 蒸馏到奖励模型中,基本保持了直接评判器的一致性,动作一致性略有提升,但外观和运动质量有小幅损失。主要改进来自 agent 框架质量控制和人工审核,两者共同提高了平均一致性并在所有维度上取得最佳分数。agent 框架质量控制将平均一致性从 68.69% 提升至 75.94%,最大增益出现在动作一致性和运动质量。人工审核进一步增加 1.39 个百分点,并在所有三个维度上产生最佳一致性。相对于直接 VLM 评判的最终优势主要来自标注精炼而非蒸馏本身。

评估设置结合了 agent 辅助质量控制流程和人工审核来精炼偏好标注,保留大多数原始标签,同时修订少数样本,主要涉及推理文本。WorldReward 是在该数据上训练的奖励模型,在动作一致性、外观和运动质量上取得了与人类偏好的最高一致性,优于闭源 VLM 和其他奖励模型。使用 WorldReward-RL 进行后训练在所有视野和动作类型上均提升了动作遵循和视觉质量,优于基础模型,表明指令遵循与外观之间不存在权衡。消融实验确认,主要性能增益来自 agent 框架标注精炼和人工审核,而非蒸馏本身,后者仅略微改变一致性分数。


用 AI 构建 AI

从创意到上线——通过免费 AI 协同编码、开箱即用的环境和最优惠的 GPU 价格,加速您的 AI 开发。

AI 协同编码
开箱即用的 GPU
最优定价

HyperAI Newsletters

订阅我们的最新资讯
我们会在北京时间 每周一的上午九点 向您的邮箱投递本周内的最新更新
邮件发送服务由 MailChimp 提供