Command Palette
Search for a command to run...
MOSS-VL 技术报告
MOSS-VL 技术报告
摘要
我们提出 MOSS-VL,一个开放的视觉–语言模型系列,将实时交互——在说话的同时持续感知——作为一等公民能力。该模型在整个技术栈上协同设计:语言解码器仅通过门控交叉注意力关注视觉信息,因此模型能够在生成的同时自然地看到传入的帧;一个合成的交互语料库监督模型何时说话、何时保持沉默以及何时修正;一个分阶段课程将全部实时特定训练集中在一个轻量的最终阶段,建立在强大的离线基础之上。在离线场景下,MOSS-VL-Instruct 在可比规模上具有竞争力,并在时序推理视频数据集上处于领先地位。在四个流式基准测试中,MOSS-VL-Realtime 在开源流式模型中取得了其中三个的最佳平均成绩(在第四个上排名第二),并在三个直接测试主动行为的子集上全面领先——在 OmniMMI Proactive Alerting 上以 66.0 对最佳基线 37.5 胜出。凭借 11.3B 参数且视觉 token 位于解码序列之外,随着视觉上下文的增长,MOSS-VL 相对于同骨干的 Qwen3-VL-8B 的首 token 延迟优势从 2.8 倍扩大到 5.1 倍。我们在 https://github.com/OpenMOSS/MOSS-VL 发布全部五个检查点、训练课程和实时推理代码。
一句话总结
复旦大学 OpenMOSS 团队、上海创新研究院与 MOSI Intelligence 提出 MOSS-VL,一个开放视觉语言模型系列,其通过门控交叉注意力、合成交互语料和分阶段课程,把说话时的实时感知作为一等能力,在开源流式模型中取得四个流式基准中三个的最佳平均成绩,包括在 OmniMMI Proactive Alerting 上以 66.0 对 37.5 超过最佳基线,并且随着视觉上下文增长,其相较同骨干 Qwen3-VL-8B 的首 token 时间优势从 2.8× 扩大到 5.1×。
核心贡献
- MOSS-VL 是一个开放视觉语言模型系列,其带 XRoPE 和绝对时间戳的门控交叉注意力解码器在生成过程中接收新到帧;合成交互语料和轻量 Realtime-SFT 阶段教会模型何时说话、保持沉默或修正回答。在四个流式基准中,MOSS-VL-Realtime 在开源流式模型中取得其中三个的最佳平均成绩,并在 OmniMMI Proactive Alerting 上以 66.0 对 37.5 超过最佳基线。
- MOSS-VL-Instruct 未使用实时语料训练,在相近规模下仍具竞争力,并在 Minerva、TOMATO 和 VideoMME-Logical 等时间推理视频基准上领先。
- 将视觉 token 排除在解码序列之外,使这个 11.3B 参数模型在 SGLang 中相对同骨干的交错式 Qwen3-VL-8B 获得不断增大的服务优势,首 token 时间领先从 2.8 倍扩大到 5.1 倍并随视觉上下文增长;发布内容包括全部五个 checkpoint、分阶段训练课程和实时推理代码。
引言
多数开放视觉语言模型以离线方式处理视频:它们从头到尾读取完整片段,然后回答问题。但在实时场景中,助手必须观察正在展开的画面,决定何时说话,并在生成回复的同时继续观察。近期流式模型允许持续输入和持续查询,但它们在每次回复期间仍然视觉失明,因此当证据变化时无法修正回答。作者提出 MOSS-VL,一个开放视觉语言模型系列,通过协同设计把实时交互作为一等能力。其门控交叉注意力解码器将视觉 token 排除在解码序列之外,并允许在生成文本时把新帧追加到交叉注意力缓存中。XRoPE 和绝对时间戳 token 在共享时间轴上对齐视觉与语言。合成实时交互数据和轻量 Realtime-SFT 阶段教会模型何时说话、保持沉默或修正,同一套权重通过共享系统提示同时服务离线、流式和实时模式。
数据集
作者提出 Realtime-SFT 语料,一个包含 0.56M 样本、约 34.8B token 的流式视频交互数据集。
-
组成与来源:
- 结合开源流式视频理解数据集,并进行严格过滤和重新标注。
- 加入内部合成数据,覆盖现有数据集很少涉及的行为:在证据出现前保持沉默、随着场景变化修正回答,以及在新事件打断回复时恢复。
- 样本将模型置于明确的交互角色中:满足条件时触发一次的长驻指令、答案随证据积累而更新的常驻问题、连续实时解说、跨流计数、探测合适说话时机,以及用于保持身份一致性的不依赖视频的对话。
- 保留一部分离线问答和通用多模态数据,以维持离线能力。
-
合成数据构建:
- 沿用 MOSS-Video-Preview 中提出的以 caption 驱动的流程。
- 从分层、密集时间锚定的 caption 中挖掘焦点对象的状态变化。
- 每个状态变化生成一个问题、一个可立即回答的回复和一条更新轨迹。
- 回复被锚定到视觉时刻,在帧上展开并在其间留出沉默,再进行质量过滤。
- 时间锚定逐帧对照真实画面进行验证:每个回复都被赋予其证据变得可见的时刻和不再有效的时刻。
- 被打断的回复改写为自然语言自我更正,而不是用专门的中断 token 标记。
- 质量关卡逐帧检查每个样本,只保留在发出时基于可见内容有依据的回复。
-
数据使用方式:
- 用于 Realtime-SFT,该阶段教会模型把输入视频视为决策流。
- 训练样本按到达顺序交错排列文本与帧。
- 每一帧后跟一个决策槽,具有以下三种形式之一:
<|silence|>:继续观察。<|response|>后跟文本:现在说话。- 以
<|silence|>结尾的回复:结束说话。
- 一个回复逐帧分布在连续槽中,模拟受速率限制的实时输出。
- 单个用户轮次可以包含多次独立发言。
- 该方法只为状态 token 新增两个词表项,并从语义相关的现有 token 嵌入初始化。
- 说话或等待的决策就是普通的下一 token 预测:如果最可能的下一个 token 是
<|silence|>,模型等待下一帧;否则解码回复。不附加专门决策头。
-
语料统计与处理:
- 模型在 2.2M 个发言决策上受监督。
- 58.7% 的发言决策是自主定时,而不是由新用户问题触发。
- 在 5.1% 的样本中,目标事件从未出现,正确行为是始终保持沉默。
- 流以 1 fps 运行,最多 768 帧,约每个窗口 12.8 分钟。
- 语料通过保留列表排除基准视频,针对评测套件进行去污染。
方法
MOSS-VL 将原生分辨率视觉编码器与从 Qwen3-8B 初始化的语言解码器配对。二者仅通过门控交叉注意力交互。视觉 token 不进入解码序列;相反,每一帧向文本流贡献时间戳 token 和占位 token,而 patch token 作为交叉注意力的 key 和 value。
视觉编码器是一个 27 层 transformer,以原生分辨率处理图像。投影模块将 2x2 patch 组合并到解码器隐空间。解码器由 48 层组成:36 层自注意力和 12 层门控交叉注意力,每隔四层放置一层。交叉注意力层采用门控设计,query 来自文本隐状态,key 和 value 来自视觉 token,并用分组查询注意力和 QK-RMSNorm 实现。带零初始化标量的 tanh 门包裹注意力路径和前馈路径,确保训练从完好的语言骨干开始。
为了向视觉流提供位置信息,作者提出 XRoPE(cross-attention rotary position embedding,交叉注意力旋转位置嵌入)。XRoPE 将文本 token 和视觉 patch 放入一个共享三轴坐标空间,并按它们在流中的逻辑位置排序。
文本 token 同时推进三个轴,而帧 patch 在高度和宽度维度上铺开,并依托共享时间锚。旋转应用于文本侧 query 和视觉侧 key,之后它们在交叉注意力中相遇。在实时运行中,当新帧到达时,只编码该帧,并将其 key 和 value 追加到交叉注意力缓存。较早的帧既不会被重新编码,也不会被重新计算。解码序列只随时间和占位 token 增长,patch token 保持在视觉侧。这种仅追加设计确保新到的流不会破坏解码状态,使下一个生成的 token 能高效关注更新后的缓存。
训练过程采用四阶段预训练课程:视觉语言对齐、大规模多模态预训练、高质量多模态预训练,以及带长上下文训练的退火。课程逐步将最大序列长度从 8K token 提升到 256K token。预训练后,模型经历两个监督式后训练阶段。标准监督微调生成一个离线指令跟随模型。随后的 Realtime-SFT 阶段植入实时交互范式,教会模型在每一帧决定说话还是保持沉默。
模式控制依赖同一个系统提示,用于流式和实时两种模式。为了解决 Realtime-SFT 期间沉默槽与发言决策之间的不平衡,作者使用焦点因子和逆频率类别系数对两个状态 token 重新加权。这确保在状态 token 损失中,说话决策和保持沉默决策具有相等的聚合权重。
实验
每个模型都在其目标设定下评估:MOSS-VL-Instruct 在覆盖五个能力领域的 39 个离线基准套件上评估,MOSS-VL-Realtime 在涵盖 L2 到 L4 层级的四个流式基准上评估,并辅以服务效率和定性实时会话。离线结果显示,MOSS-VL-Instruct 在感知、时间视频推理、对抗性指称定位、文档解析和部分推理任务上最强,而主要差距出现在 MMMU、文档理解以及标准指称和时间定位上。在流式评估中,MOSS-VL-Realtime 在四个基准中的三个上平均成绩领先,并在需要主动、时机正确的响应的主动行为子集上表现尤其出色,不过 AURA 在当前场景的感知问答上仍保持优势。效率比较显示,比 Qwen3-VL-8B 更低的首 token 时间和端到端延迟,并且优势随着视觉上下文增长而扩大,定性演示证实了及时的带条件响应和连续实时解说。
MOSS-VL-Realtime 通过在生成过程中持续感知,达到能力层级中的最高级,实时演示和公开的实时推理代码展示了这一行为。在覆盖中间层级的四个流式基准上,它在三个上取得最佳平均成绩,并在主动响应子集上领先,而一个竞争者仍在当前场景感知问答上保持优势。其相对同语言骨干模型的服务延迟优势随着视觉上下文增长而扩大,尽管携带更多视觉 token。MOSS-VL-Realtime 在评估的四个流式基准中的三个上取得最佳平均分。最强收益出现在测试在恰当时机主动说话的主动响应子集上。它在 StreamingBench 视觉平均分上排名第二,该基准主要关注当前场景上的感知问答。与共享同一语言骨干的模型相比,其延迟优势随视觉上下文增长,尽管携带约两倍的视觉 token。
MOSS-VL 使用从 Qwen3-8B 初始化的语言解码器,每隔四层放置门控交叉注意力,视觉 patch 作为交叉注意力的 key 和 value 使用,而不是进入解码序列。每个视频帧向文本流贡献时间戳 token 和一个占位 token,采样为 1 到 16 fps 的运动自适应采样,使时间戳显式保持墙钟时间。发布的 processor 默认 1 fps、256 帧;评估保持 1 fps,并将上限提高到 768 帧。解码器有 48 层,其中 36 层自注意力和 12 层门控交叉注意力,每隔四层放置一层。视觉 patch 永不进入解码序列;每一帧只向文本流贡献时间戳 token 和一个占位 token。视频采样为 1 到 16 fps 的运动自适应采样,绝对时间戳 token 标记每一帧的墙钟时间。发布的 processor 默认 1 fps、256 帧,而评估设置保持 1 fps,并将上限提高到 768 帧。
针对同一架构发布了五个 checkpoint,包含 0708 谱系和更早的独立 0408 谱系。0708 运行从预训练基座经过监督微调得到离线指令微调模型,再经过 Realtime-SFT 得到实时模型。realtime checkpoint 用于流式评估,instruct checkpoint 用于离线评估。0708 谱系遵循 Base 到 Instruct 再到 Realtime 的进阶,其中 Realtime 从 instruct checkpoint 初始化。Realtime-SFT 是最后一个监督阶段,安装实时交互行为,并只使用总训练 token 的一小部分。0408 checkpoint 是同一架构的更早独立训练运行,为了研究连续性而发布。
MOSS-VL 课程从短对齐样本进展到更长、更高质量的多模态序列,最大序列长度从 8K token 提升到 256K token。算力向后期阶段转移,而样本数量大幅下降,将训练集中在更少但更密集的样本上。最后的 Realtime-SFT 阶段只占总训练 token 的很小一部分,但引入了模型的实时说话或等待行为。在训练过程中,最大序列长度从 8K token 扩展到 256K token。阶段 3 消耗课程中最大的 token 预算,并专注于高质量多模态数据。Realtime-SFT 占总训练 token 不到 3%,却安装了实时交互范式。
MOSS-VL-Instruct 在比较的开放模型中,在多模态感知和时间视频理解上领先最具持续性。它还在部分定位、文档解析和推理基准上取得最高分。其最明显差距在 MMMU、文档理解以及标准指称和时间定位上。MOSS-VL-Instruct 在十二个多模态感知基准中的五个上取得最佳结果,在 MME-RealWorld 和 BLINK 上领先幅度尤其大。在视频理解上,它在 Minerva、TOMATO、VideoMME-Logical 和 EgoSchema 等时间推理和长格式基准上领先。它还在对抗性 Ref-Adv 定位和 OmniDocBench 文档解析上获胜,并在 ERQA 推理上并列最高分。相对弱项出现在 MMMU、文档理解以及标准指称和时间定位,其他开放模型在这些方面仍然更强。
实验从流式行为、架构、发布的 checkpoint、训练课程和离线基准等方面评估 MOSS-VL。MOSS-VL-Realtime 在带时间戳的运动自适应帧上使用门控交叉注意力,在四个流式基准中的三个上取得最佳平均成绩,其相对共享骨干模型的延迟优势随着视觉上下文增加而扩大,但在当前场景感知问答上排名第二。训练课程将序列长度从 8K token 扩展到 256K token,并包含最后的少量 Realtime-SFT 阶段,安装实时说话或等待行为。离线方面,MOSS-VL-Instruct 在多模态感知和时间视频理解上领先最具持续性,同时在 MMMU、文档理解以及标准指称和时间定位上存在差距。