HyperAIHyperAI

Command Palette

Search for a command to run...

过去框定未来:自回归视频生成中的记忆——综述

摘要

生成模型的进展显著提升了视频生成的保真度,推动该领域迈向长时程生成、交互式世界建模和不断演化的视觉环境。自回归(AR)视频生成通过因果式逐步推演顺序扩展视觉序列,为这些任务提供了一种自然的范式。然而,一个根本性瓶颈随之出现:随着生成序列不断扩展,实际模型必须在严格受限的上下文窗口、存储和计算限制下运行。因此,关键的历史信息,例如实体身份、空间布局、动态状态以及由干预引起的因果变化,往往在其相关性尚未减弱之前就已经离开活跃上下文。克服这一限制并保持时序持续性,构成了一个根本性的记忆问题。本综述系统且全面地回顾了自回归(AR)视频生成中的记忆机制。我们将记忆操作性地定义为在外部 AR 步骤之间保持的持久历史信息:即使其原始证据已不再可在局部访问,这些信息仍能影响未来的生成。基于这一统一框架,我们从五个互补视角组织文献:(I)形式,即历史的表示载体;(II)功能,即需要保留的特定语义与物理信息;(III)操作,即记忆的写入、读取、更新、管理与整合生命周期;(IV)学习,即在闭环推演下对记忆行为的优化;以及(V)评估,即诊断真实记忆能力的范式。通过这些视角,我们强调一个核心洞见:有效的记忆超越单纯的容量。被保留的状态必须保持准确、可访问,并对后续生成具有因果影响。最后,我们总结了若干开放挑战,包括可组合且资源感知的记忆架构、可信的状态更新、自推演学习以及标准化评估。通过连接表示、机制与学习范式,本综述为开发可靠、以记忆为条件的视频生成系统奠定了结构化基础。

一句话总结

来自香港科技大学、香港城市大学、复旦大学等机构的研究者对自回归视频生成中的记忆机制进行了系统性综述,提出一个统一框架,从形式、功能、操作、学习与评估五个维度组织已有文献,并指出有效记忆必须在长时程与交互式生成中保持准确、可访问且具有因果影响力。

核心贡献

  • 该综述对自回归视频生成中的记忆机制进行了系统性回顾,并提出一个统一的记忆操作性定义:记忆是在外部自回归步骤之间维持的持久历史信息,能够在原始证据不再于局部上下文中可访问之后影响未来生成。
  • 该综述通过五个互补视角组织已有工作:记忆形式、功能、操作、学习与评估,并识别出可能产生相似视觉症状但需要不同解决方式的不同瓶颈。
  • 该综述综合了开放挑战,包括与干预相关联的状态维持、受控修订与分支、以及可验证的评估,为记忆条件下的视频生成系统建立了结构化基础。

引言

可扩展的自回归视频生成正在从短视频片段走向开放式和交互式的世界建模,模型必须扩展视觉序列,同时在长时程上保持身份、布局、运动、事件和因果状态。核心挑战是在对历史的有界访问下保持时间持久性:一旦早期视觉证据离开活动上下文,生成就可能漂移或遗忘实体、外观、空间结构、动态、语义以及由动作引发的状态变化。此前的方法通过滚动窗口、KV缓存、检索库、压缩状态或3D先验来应对这一问题,但该领域缺乏针对特定范式的分类法和统一的记忆术语,导致难以进行系统性比较。作者提出了一个用于自回归视频生成中记忆的统一框架,从表示形式、功能职责、操作生命周期、学习策略和评估协议等方面组织相关机制。

方法

作者引入了一个统一的以记忆为条件的自回归框架,通过持久记忆状态增强有界局部上下文,以在生成步骤之间携带受管理的历史信息。在每一步中,模型从当前上下文构造查询,检索相关历史信息,并将其与局部上下文整合以生成下一个视觉单元。生成之后,提取写入候选,更新持久状态,并由管理算子通过保留、压缩或修订来执行记忆预算。

为了组织实现这一持久状态的各种方法,作者提出了以载体为中心的分类体系。记忆载体是保留历史信息并使其可用于后续生成的表示对象。

如上图所示,该框架区分了四种主要类型的记忆载体。视觉记忆在像素或VAE潜空间中保存过去的帧、片段或与观测对齐的视觉表示。隐式状态记忆在模型原生潜状态中保留历史,例如注意力缓存状态、循环或状态空间状态以及编码的历史状态,而无需预定义的语义结构。显式状态记忆通过描述实体、场景布局、动态或拓扑关系的结构化变量来表示历史。自适应参数记忆将序列特定信息编码到指定参数或可自适应权重中,这些参数或权重根据先前证据更新,并通过模型的前向计算影响后续生成。

除表示形式之外,作者将记忆功能定义为在原始证据离开有界局部上下文之后,持久状态必须履行的具体生成职责。这些功能职责对应于有界上下文推演的失败模式。

该框架确定了五种核心保持功能。身份保持维持实例定义属性,以缓解实体遗忘和外观漂移。空间保持维持场景结构和视角一致性,以支持导航和再次访问。动态保持在早期证据不再处于活动上下文时维持运动和演化的物理状态。语义保持维持具体于推演过程的角色、关系、事件和高层承诺。因果保持维持改变状态的干预所导致的延迟后果。单一载体可以支持多种功能,单一功能也可以由若干载体共同实现。

上图展示了这些记忆功能如何在长时程视频生成中体现,显示记忆如何跨分离的观测支持身份、空间、动态、语义和因果保持,从而维持持久实体、跟踪演化状态并保持干预后果。

为确保可靠的长时程生成,作者详细说明了记忆行为如何通过数据、监督和闭环交互获得。由于模型生成的帧会被写回记忆,预测误差可能在扩展时程上复合,因此记忆学习本质上是闭环的。

学习过程沿三个维度组织。记忆学习目标定义了监督目标,包括输出级预测、使用显式世界状态变量或学习表示的直接记忆状态监督,以及在多次转换上约束状态演化的记忆动态监督。记忆状态分布解决训练状态与部署状态之间的不匹配,利用教师强制、历史增强以扩大分布,以及自推演以从模型自身的自回归过程构造状态。最后,记忆感知学习显式纳入部署时约束,训练生成器学习如何保留相关历史、将长历史压缩到有界状态、从外部存储中检索信息,并在特定资源预算下自适应参数状态。

实验

评估部分认为,视觉保真度和连贯性不足以证明记忆,因此揭示记忆的测试必须制造信息缺口,使后续查询需要先前的推演历史。这些测试按证据强度对基准进行分类,将实体再次出现、场景再次访问和视野外状态演化确定为主要直接协议,而可见一致性、长上下文和序列压力基准仅提供补充性证据。针对身份、几何、过程状态、目标延续和动作效果的目标特定指标只有在这些协议下才有意义,并且需要配对历史对照、前提检查、组件干预和评估者可靠性,以排除执行失败和非记忆解释。结论性讨论呼吁建立可比较的诊断画像,将保留、状态正确性、可访问性和影响力分开,并涵盖尚未充分探索的情形,如矛盾、选择性遗忘、回滚和延迟动作效果。

符号总结定义了核心自回归视觉记忆概念:生成前的完整历史、模型生成的视觉单元、扁平化的离散token、连续潜表示以及有界局部上下文。评估讨论强调,当前的记忆评估对身份重现和空间再次访问最为有力,而对变化敏感的行为仍未得到充分探索。该讨论呼吁进行诊断性的分阶段评估,将保留、状态正确性、可访问性和生成影响分开,并建立针对记忆更新和资源使用的受控协议。身份重现和空间再次访问的覆盖最强,而修正、矛盾消解、选择性遗忘、过期状态失效、回滚和延迟干预效果仍未得到充分探索。未来评估应从孤立的终点分数转向诊断性记忆能力画像,以区分信息是否被保留、保持正确、在需要时可访问,以及在生成过程中确实被使用。

所列视觉记忆机制以逐项单元保留历史视觉证据,具有中等可解释性、直接可编辑性以及模型耦合性。其存储增长或者有界或者线性,访问键从显式姿态或内容查询到学习查询,或者没有单独可寻址的历史单元。评估覆盖对身份重现和空间再次访问最强,而修正、矛盾消解、过期状态失效、选择性遗忘、回滚和延迟干预仍未得到充分探索。所有列出的视觉记忆机制都使用逐项单元结构和中等可解释性、可编辑性与模型耦合性,存储增长从有界到线性不等。评估对身份重现和空间再次访问强于对修正、矛盾消解、过期状态失效、选择性遗忘、回滚和延迟干预。

这些隐式状态机制在模型原生潜状态中保留历史,包括长上下文Mamba状态、循环SemanticPack状态、线性注意力状态、压缩上下文状态、固定预算的分层历史token,以及门控演化记忆查询状态。大多数方法使用固定存储和分布式更新,所列条目表现出低可解释性和可编辑性,以及高记忆容量。周围分析表明,评估对身份和空间再次访问较强,而对矛盾、修正、过期状态失效和延迟干预较弱。隐式状态载体包括循环SemanticPack状态、经清理传递更新的线性注意力状态、压缩上下文记忆状态,以及固定预算的分层历史token。每种所列方法都使用分布式更新,几乎全部使用固定存储;可解释性和可编辑性一致较低,而记忆容量较高。评估覆盖被描述为对身份重现和空间再次访问最强,而修正、矛盾消解、过期状态失效、选择性遗忘、回滚和延迟干预仍未得到充分探索。

代表性身份保持方法涵盖多镜头、交互式和长视频设置,其中若干方法将身份与空间覆盖相结合。身份重现和空间再次访问的覆盖最强,而动态、语义和因果保持的覆盖仍不够一致。评估仍受限于终点比较,无法定位记忆失败发生在保留、状态正确性、检索还是利用环节。身份保持机制包括以参考为条件的多镜头锚点、内容锚点、首片段外观条件化、检索的历史VAE块、镜头缓存引导,以及带三区域RoPE的锚点记忆。身份和空间保持获得最强覆盖,而修正、矛盾消解、过期状态失效、选择性遗忘、回滚和延迟干预效果仍未得到充分探索。

该表按功能覆盖、载体类型和评估设置对自回归视频生成的代表性动态保持方法进行分类。所列方法通常将身份和空间保持与动态保持相结合,语义保持出现于较少情形,因果保持未被标记。随附讨论表明,身份重现和空间再次访问是评估最多的能力,而延迟动作和因果持久性协议仍不够成熟。动态保持方法通常还支持身份和空间保持,但语义支持较不一致,所列各行中缺少因果保持。潜视频和内部状态是常见的记忆载体,长上下文视频和交互式设置属于评估条件。支持性文本指出,身份重现和空间再次访问的覆盖最好,而矛盾消解、过期状态失效和延迟干预效果仍未得到充分探索。

所综述的实验比较了逐项记忆单元、隐式潜状态载体、身份保持方法和动态保持方法在存储、可解释性、可编辑性和耦合属性方面的表现。所评估的设置大多验证身份重现和空间再次访问,而动态、语义和因果保持的覆盖较不一致。当前基于终点的评估无法区分失败发生在保留、状态正确性、可访问性还是生成影响环节。修正、矛盾消解、过期状态失效、选择性遗忘、回滚和延迟干预仍未得到充分探索。


用 AI 构建 AI

从创意到上线——通过免费 AI 协同编码、开箱即用的环境和最优惠的 GPU 价格,加速您的 AI 开发。

AI 协同编码
开箱即用的 GPU
最优定价

HyperAI Newsletters

订阅我们的最新资讯
我们会在北京时间 每周一的上午九点 向您的邮箱投递本周内的最新更新
邮件发送服务由 MailChimp 提供