HyperAIHyperAI

Command Palette

Search for a command to run...

SenseNova-U1:基于 NEO-unify 架构统一多模态理解与生成

SenseNova-U1.5-8B-MoT:图像生成与编辑

跳转至 Notebook

摘要

近期的大型视觉-语言模型(VLM)仍受制于一种持续存在的二元对立:理解与生成被视为不同的问题,导致架构碎片化、流水线级联以及表征空间错位。我们认为,这种割裂不仅是工程上的产物,更是一种结构性限制,阻碍了原生多模态智能的出现。为此,我们提出 SenseNova-U1,一种基于 NEO-unify [112] 的原生统一多模态范式,其中理解与生成作为单一底层过程的协同视角共同演进。我们发布了两个原生统一变体,SenseNova-U1-8B-MoT 和 SenseNova-U1-A3B-MoT,分别基于稠密(8B)和混合专家(30B-A3B)理解基线构建。从第一性原理出发设计,它们在文本理解、视觉-语言感知、知识推理、智能体决策和空间智能方面可与顶尖的理解专用 VLM 相媲美。同时,它们展现出强大的语义一致性和视觉保真度,在常规或知识密集的任意到图像(X2I)合成、复杂文本丰富的信息图生成以及交错视觉-语言生成(无论是否使用思考模式)中表现出色。除性能外,我们展示了详细的模型设计、数据预处理、预训练/后训练及推理策略,以支持社区研究。最后但同样重要的是,初步证据表明,我们的模型超越了感知和生成,在视觉-语言-动作(VLA)和世界模型(WM)场景中表现强劲。这指向一个更广阔的路线图:模型不再在模态之间进行转换,而是以原生方式跨模态思考与行动。多模态 AI 不再关乎连接独立系统,而在于构建统一系统,并信任必要能力从中涌现。

一句话总结

来自香港中文大学、上海人工智能实验室和商汤科技的研究者提出了 SenseNova-U1,一种基于 NEO-unify 构建的原生统一多模态范式,将理解与生成视为同一过程的协同视角,其 8B8\text{B}8B 稠密版本和 30B-A3B30\text{B-A}3\text{B}30B-A3B MoE 版本在理解、X2I 合成、VLA 和世界模型任务上均可与顶尖 VLM 媲美。

核心贡献

  • 提出 SenseNova-U1,一种基于 NEO-unify 构建的原生统一多模态范式,发布两个变体(SenseNova-U1-8B-MoT 和 SenseNova-U1-A3B-MoT),将理解与生成视为单一底层过程的协同视角。
  • 证明该单一原生架构在文本理解、视觉语言感知、知识推理、Agent 决策和空间智能方面可与顶尖的纯理解 VLM 媲美,同时在 X2I 合成、文本丰富的信息图生成和交错视觉语言生成中实现了较强的语义一致性和视觉保真度。
  • 展示该模型可扩展至视觉语言动作(VLA)和世界模型(WM)场景,并提供详细的模型设计、数据预处理、预训练/后训练和推理策略,以支持社区复现。

引言

多模态基础模型历史上因系统设计的分歧而将感知与生成分离:理解依赖预训练视觉编码器(VE),而生成依赖潜在变分自编码器(VAE)。这些选择产生了不同的学习目标和特征表示,迫使早期的统一多模态模型(UMM)通过不同的分词器、潜在空间或辅助模块连接感知与生成,而非联合学习它们。原生视觉语言模型(VLM)曾尝试弥合这一鸿沟,但离散分词将非语言信号压缩为有损表示,而连续视觉接口往往在语义抽象与像素级保真度之间权衡,留下了一个尚未解决的根本性矛盾。

作者通过引入 SenseNova-U1(一种基于 NEO-unify 模型构建的原生统一多模态范式)来解决这一问题。他们摒弃了预训练视觉编码器和深度解码头,直接从像素和文字等无损输入中学习。该模型包含一个近无损视觉接口,无需预训练 VE 或 VAE 即可保留语义结构和细粒度细节;一个统一的端到端目标,将用于语言的自回归交叉熵与用于视觉的像素空间流匹配相结合;以及一种原生混合 Transformer(MoT)架构,在高效扩展的同时减少目标干扰。两个变体 SenseNova-U1-8B-MoT 和 SenseNova-U1-A3B-MoT 分别基于稠密和混合专家骨干发布。实验表明,该模型在文本理解、视觉语言感知、知识推理、Agent 决策和空间智能方面可与顶尖的纯理解 VLM 媲美,同时在 32 倍压缩比下实现了较强的任意到图像生成能力。它还支持以视觉为中心的推理和交错生成,适用于图解指南、视觉叙事和结构化布局等应用。初步结果进一步表明其在视觉语言动作和世界建模方面的能力,标志着向无需模块化桥接的原生统一多模态智能的转变。

数据集

数据集构成与来源

作者将训练数据组织为两个主要阶段:预训练和中训练,随后是监督微调(SFT)阶段。预训练语料结合了大规模网络文本、图像文本对和交错多模态文档。中训练阶段主要使用内部 SenseNova V6.5 数据集。生成语料涵盖文本到图像和图像编辑任务,从网络规模来源单独整理。

预训练阶段

  • 构成: 四类:图像文本对(32%)、标题(17%)、信息图理解(14%)和纯文本(37%)。
  • 整理流程: 四个阶段:跨来源去重、内容和安全过滤、图像质量过滤,以及 CLIP 比例平衡的重新标注,以确保整个语料库的对齐均衡。

中训练阶段

  • 构成: 四类:通用(39.2%)、Agent 与空间(22.3%)、知识推理(19.3%)和纯文本(19.2%)。
  • 通用类别细分: 通用视觉问答(26.6%)、多轮对话(26.4%)、标题生成(20.3%)、OCR(18.6%)和多图像理解(8.2%)。
  • 知识推理细分: 知识导向(12.0%)和推理导向(7.2%)数据。
  • 三阶段整理流程:
    1. 分布均衡采样: 两阶段过程。首先,基于 CLIP 的多样性采样通过 K-means 聚类视觉嵌入,并在各聚类中均匀采样以覆盖长尾分布。其次,属性分析评估每个样本在感知和语义维度上的特征,随后进行分层采样以实现均衡表示。
    2. 提示增强: 沿四个维度增强初始提示:语义表达、格式与结构约束、角色与场景,以及任务复杂度。所有答案统一重新生成,以保证质量和风格一致。
    3. 多标准过滤: 基于模型的自动评分评估每个问答对,包括对照真实标注的正确性验证、幻觉检测和指令遵循评估。

监督微调(SFT)

  • 构成: 能力原子维度:空间智能(15%)、通用多模态理解(13%)、推理(12%)、通用 NLP(11%)、OCR 与文档分析(11%)、Agent 函数调用(10%)、长上下文对话(8%)、代码(6%)、多轮对话(4%)、复杂组合理解(4%),其余比例由补充数据构成。
  • 构建方式: 以质量和难度为双重重点,对中训练候选池进行精炼。
    • 质量导向选择: 复用多标准过滤框架,在视觉保真度、指令清晰度、回答正确性、推理质量和安全性上进行评分,对高分样本提高采样比例。
    • 难度导向重构: 通过将短样本拼接为长上下文、多图像和多轮设置来重新平衡监督信号;对推理密集型领域采用拒绝采样以保留中等难度样本;并以格式、风格和粒度的显式约束重写模糊查询。

生成数据组织

  • 整体流程: 统一流程,结合低级过滤、去重、基于 VLM 的标注和质量感知过滤。
  • 文本到图像数据: 构成:自然(40.5%)、人物(26.7%)和设计(20.7%),并辅以复杂信息图、双语文本渲染数据和海报、图表、城市景观等子类的长尾分布。
  • 图像编辑数据: 来源于网络规模数据。
    • 内容层面: 自然场景(52.3%)和人物主体(14.7%),其余来自信息图和合成编辑。
    • 操作层面: 主体添加/移除、背景和颜色更改、身份迁移、运动操控、人像编辑、合成和推理驱动变换。
    • 验证: 每个编辑对通过将其指令分解为动态目标(哪些改变、哪些保持不变),并对照源图像进行静态物理一致性约束验证。
  • 交错数据: 文本与图像序列交替的视觉文本语料。四类:视频、生活方式、信息图和推理。
    • 分布: 生活方式(44%),包括教程(26%)、日常场景(14%)和绘本(4%);信息图(29%);视频(19%);推理(8%,每个样本包含显式思维链轨迹)。
    • 流程: 预处理、任务特定合成和后处理,验证文本质量、图像质量、图像文本一致性和轨迹级正确性。

方法

作者提出了 SenseNova-U1,一种直接操作像素和文字的原生、统一、端到端框架,消除了对预训练视觉编码器和变分自编码器的依赖。如下图所示,这种并行原生架构用轻量级编码和解码层取代了类似 VAE 的重型编码器和解码器,实现了表示空间的完全端到端学习。

为将输入映射到统一 token 空间,模型采用补丁编码层,使用两个带 GELU 激活和二维正弦位置编码的卷积层,将每个 token 映射到 32x32 图像补丁。视觉和文本 token 被投影到共享嵌入空间。在生成方面,多层感知机头直接预测像素补丁,绕过了深度扩散头。为处理不同分辨率,作者引入了分辨率自适应噪声尺度 σR(H,W)=σ0N(H,W)/N0\sigma_R(H, W) = \sigma_0 \sqrt{N(H, W) / N_0}σR(H,W)=σ0N(H,W)/N0,以保持近似恒定的每 token 噪声能量。该尺度通过正弦 MLP 嵌入器显式馈送给去噪器,形成联合的时间和噪声尺度条件信号 st=τt+NSEmb(σˉ(H,W))\mathbf{s}_t = \tau_t + \text{NSEmb}(\bar{\sigma}(H, W))st=τt+NSEmb(σˉ(H,W))

核心骨干是原生混合 Transformer,统一了理解与生成。作者精炼了原生旋转位置嵌入,以统一时间和空间编码,将预训练 LLM 的注意力头维度重新分配到 T、H 和 W 轴。在 MoT 骨干中,所有模态在共享自注意力机制下处理。文本 token 采用因果注意力,而图像和噪声 token 在其块内采用双向注意力,同时保持对前序上下文的因果条件。理解流和生成流之间采用完全参数解耦,具有独立的投影和前馈块,并根据 token 类型动态路由。该框架实例化为两个变体:8B 稠密对称并行配置和采用流式混合专家的 A3B 变体。

模型以组合目标 Ltotal=λ1LUnd+λ2LGen\mathcal{L}_{\text{total}} = \lambda_1 \mathcal{L}_{\text{Und}} + \lambda_2 \mathcal{L}_{\text{Gen}}Ltotal=λ1LUnd+λ2LGen 进行端到端优化。对于理解,使用标准的下一个 token 预测。对于视觉生成,作者采用像素空间流匹配,使用 x-predict 和 v-loss。给定干净图像 x\mathbf{x}x 和高斯噪声 ϵ\epsilonϵ,带噪样本构造为 zt=tx+(1t)σRϵ\mathbf{z}_t = t \mathbf{x} + (1 - t) \sigma_R \epsilonzt=tx+(1t)σRϵ。模型回归干净信号以计算速度项 vθ(zt,t)=(x^θ(zt,t,st)zt)/(1t)\mathbf{v}_\theta(\mathbf{z}_t, t) = (\hat{\mathbf{x}}_\theta(\mathbf{z}_t, t, \mathbf{s}_t) - \mathbf{z}_t) / (1 - t)vθ(zt,t)=(x^θ(zt,t,st)zt)/(1t),通过均方误差优化。在推理时,统一的无分类器引导公式独立调制文本和视觉条件。

训练遵循渐进式六阶段流程。阶段 1 从预训练模型初始化,统一时间轴和空间轴上的 QK 投影和归一化,随后进行全模型持续训练。阶段 2 冻结理解分支,在文本到图像数据上预训练生成分支,涵盖三个分辨率递增和任务多样性递增的阶段。阶段 3 在精心混合的理解和生成数据上联合端到端训练两个分支。阶段 4 在高质量指令遵循数据上微调完整模型。阶段 5 利用 Flow-GRPO 进行强化学习。作者设计了动态分辨率预热策略,并采用三个奖励组件:基于 OCR 交并比的文本渲染奖励、通过 VLM 评判器的风格遵循奖励,以及使用人类偏好分数的美学奖励。阶段 6 采用分布匹配蒸馏,将函数评估次数从 100 减少到 8,仅优化生成分支。

为处理理解和生成路径的不同推理特性,作者采用分离式部署架构,使用针对多模态理解和图像生成的专业化引擎。这些引擎通过固定共享内存交换状态。引入混合注意力内核,以高效支持混合注意力模式,其中文本行保持因果性,而图像行关注完整文本前缀和图像跨度。

为确保高质量训练数据,作者实现了系统化过滤流程。对于理解语料,流程包括基于 CLIP 的多样性采样和属性分析的分布均衡数据整理,随后在语义和结构维度上进行提示增强,最后进行多标准质量过滤。

对于生成语料,对文本到图像和编辑数据应用统一的四阶段流程,包括基于分辨率和清晰度的低级过滤、感知哈希去重、基于 VLM 的标注,以及去除水印和异常元素的质量过滤。

实验

SenseNova-U1 在图像和文本理解、生成、编辑和交错任务上进行了评估,在数学推理、指令遵循和空间智能方面表现出与 Qwen3VL 和 Qwen3.5 等强基线相当或更优的性能。在生成方面,它在组合性、文本渲染、信息图和推理驱动任务上匹配或领先于开源模型,思维链提升了 WISE 和 RISEBench 上的结果。编辑评估显示,尽管与专用系统存在差距,但泛化能力较强,而交错和统一推理基准则证明了理解与生成之间真正的双向协同。消融实验确认,无编码器设计保留了语义和像素保真度,理解与生成在 MoT 骨干中协同进化且冲突极小,且架构随数据高效扩展。

SenseNova-U1 以两种架构变体发布:8B 稠密模型和 A3B 混合专家模型。两个变体共享原生多模态设计,具有统一的时间和空间旋转位置嵌入,但在深度、宽度和专家配置上有所不同,其中 A3B 变体使用 128 个理解专家和 32 个生成专家。8B 变体使用稠密配置,42 层,隐藏大小为 4,096,而 A3B 变体使用 48 层,隐藏大小为 2,048。两个变体使用相同的 32x32 补丁大小,并在时间、高度和宽度轴上采用相同的注意力头大小分配。A3B 变体采用混合专家设计,包含 128 个理解专家和 32 个生成专家,而 8B 变体每个流使用单个专家。8B 变体包含用于输入映射的前置缓冲层,而 A3B 变体则省略了这些层。

SenseNova-U1 通过四个渐进阶段进行训练,从融合注意力投影的理解预热开始,随后进行全模型训练,然后是三个阶段的生成预训练、统一中训练和最终监督微调阶段。训练方案在不同阶段使用不同的峰值学习率和调度器,阶段 1 和阶段 2 的各阶段使用恒定调度,生成阶段使用较高学习率,而阶段 4 的两个阶段使用余弦衰减。所有阶段使用 AdamW 且零权重衰减。阶段 1 包含注意力融合阶段,通过跨时间和空间轴共享投影将 QK 参数占用减半,随后是全模型持续训练阶段。阶段 2 分为三个生成预训练阶段,峰值学习率范围为 1e-4 到 2e-4,高于理解预热阶段。阶段 4(统一 SFT)的两个阶段使用余弦衰减,而其他阶段和子阶段使用恒定学习率调度。所有训练阶段使用 AdamW,beta1=0.9,beta2=0.95,epsilon=1e-8,权重衰减设置为 0.0。

SenseNova-U1 在多模态理解基准上表现出竞争性或更优的性能,尤其在数学推理和空间智能任务上表现突出。其无编码器架构在文本丰富的理解和空间推理方面相比同规模基线取得了显著提升。SenseNova-U1 在多模态推理基准上优于 Qwen3VL-8B,在数学推理方面具有明显优势。在空间智能基准上,SenseNova-U1 在 VSI-Bench、ViewSpatial、MindCube-Tiny 和 3DSR-Bench 上均表现强劲。该模型在通用视觉语言基准和幻觉评估上匹配或超越领先基线。

SenseNova-U1 展现出较强的指令遵循性能,在 IFEval 和 IFBench 上持续优于 Qwen3.5 系列。它还在 MMLU-Pro 和 SuperGPQA 上超越 Qwen3VL 系列,缩小了与更大规模 Qwen3.5 模型的差距。A3B 变体展现出具有竞争力的 Agent 能力,尽管激活参数较少,仍接近更大的推理导向基线。SenseNova-U1 在 IFEval 和 IFBench 上均优于 Qwen3.5,表明其指令遵循能力更优。在 MMLU-Pro 和 SuperGPQA 上,SenseNova-U1 超过 Qwen3VL 变体并接近 Qwen3.5 的分数。A3B 变体在多轮推理和 Agent 性能上表现强劲,在 τ2-Bench 和 Claw-Eval 上几乎匹配更大模型。

SenseNova-U1 变体在开源模型中取得了最高的 GenEval 综合得分,优于多个强基线。该模型在大多数组合性子任务上表现持续优异,在属性绑定方面略有相对不足。其均衡的性能画像带来了最佳综合结果。SenseNova-U1 的 8B 总参数量和 3B 激活参数量版本综合得分为 0.91,与完整 8B 变体持平。该模型在 GenEval 综合得分上领先开源模型,超越 Qwen-Image、Lumina-DiMOO 和 BAGEL。在单一物体、双物体、计数、颜色和位置方面表现强劲,但属性绑定略低于顶尖专用模型。

SenseNova-U1 在两种架构变体(8B 稠密和 A3B 混合专家)上进行了评估,通过包含理解预热、生成预训练、统一中训练和监督微调的四阶段渐进式训练方案进行训练。该模型在多模态理解基准上表现出竞争性或更优的性能,在数学推理、空间智能和文本丰富理解方面尤为突出,优于 Qwen3VL-8B 等同规模基线。它还在指令遵循和知识推理方面表现强劲,在 IFEval 上超越 Qwen3.5 系列,在 MMLU-Pro 和 SuperGPQA 上接近更大模型,而 A3B 变体尽管激活参数较少,仍展现出具有竞争力的 Agent 能力。在文本到图像生成方面,SenseNova-U1 在开源模型中取得了最高的 GenEval 综合得分,在组合性子任务上表现均衡,仅在属性绑定方面略有不足。


用 AI 构建 AI

从创意到上线——通过免费 AI 协同编码、开箱即用的环境和最优惠的 GPU 价格,加速您的 AI 开发。

AI 协同编码
开箱即用的 GPU
最优定价

HyperAI Newsletters

订阅我们的最新资讯
我们会在北京时间 每周一的上午九点 向您的邮箱投递本周内的最新更新
邮件发送服务由 MailChimp 提供