HyperAIHyperAI

Command Palette

Search for a command to run...

TLive-Omni:面向电商直播的全模态理解模型

Yibo Hu Yu Qian Mao Gu Yingfan Tao Yuhao Chen Yongdong Luo Zhuoqun Liu Meiguang Jin Junfeng Ma

摘要

电商直播需要对充满噪声且时间跨度较长的直播流进行全模态理解,其中商品信息分散在语音、视频帧、商品图像、叠加文本和用户提问中。我们提出了 TLive-Omni,一个专为直播电商场景设计的全模态理解模型。它将图像、视频、音频和文本输入映射到统一的表示空间。针对长时直播分析,我们引入了 Per-vGrid,一种带时间戳的令牌组织方式,将每个视频网格与其时间上对应的音频分组在显式的边界令牌内,以促进时间对齐。我们设计了一个三阶段监督训练方案,逐步培养直播电商理解能力,从全模态感知到遵循指令的响应。随后,我们提出了 Faithful-RFT,一个强化微调阶段,在满足实时性需求的同时,进一步提升回答的忠实度和表达质量。该阶段直接使用任务可验证的反馈对最终回答进行评分,而非在推演过程中优化推理式的探索行为。此外,TLive-Omni 由一个面向场景的原子能力分类体系和一个紧凑的数据生产引擎支撑,该引擎将直播电商的音频、图像和视频流转化为用于语音识别、说话人分析、商品视觉定位、文本识别、时间定位、视频密集描述和全模态问答等任务的训练信号。为实现可扩展训练,我们采用了一种同步的长度分组采样器,在减少填充的同时保持各工作节点间的工作量相当;同时,一种轻量级动态采样策略以近乎零奖励方差重新生成推演分组,从而为 GRPO 维持有意义的相对优势。在电商直播基准上的实验表明,该模型在直播电商领域任务上表现强劲,同时在通用基准上也展现出优异的泛化能力。

一句话总结

阿里巴巴淘宝天猫集团的 TLive-Omni 团队提出了 TLive-Omni,这是一个面向电商直播的全模态理解模型,将图像、视频、音频和文本输入映射到统一的表示空间,并引入了 Per-vGrid 时间对齐、三阶段监督训练方案以及 Faithful-RFT 强化微调,以提升答案忠实度,在电商直播基准和通用基准上取得了强劲的性能。

核心贡献

  • TLive-Omni 是一个面向电商直播的全模态理解模型,将图像、视频、音频和文本输入映射到统一的表示空间。面向场景的原子能力分类体系和紧凑的数据生产引擎将直播电商的音频、图像和视频流转换为语音识别、说话人分析、产品视觉定位、文本识别、时间定位、视频密集描述和全模态问答的监督信号。
  • Per-vGrid 通过将每个视频网格与时间对应的音频分组在显式边界 token 内,来组织带时间戳的音视频证据,训练方案将三阶段监督微调与 Faithful-RFT 强化微调相结合。Faithful-RFT 直接使用任务可验证的奖励对最终答案进行评分,以提升答案忠实度和表达质量,同时满足实时性需求。
  • 同步长度分组采样减少了填充,同时保持各工作节点间的工作负载可比,轻量级动态采样策略重新生成奖励方差接近零的 rollout 组,以维持 GRPO 的有意义相对优势。在内部直播电商和通用多模态基准上的实验表明,在直播电商任务上性能强劲,且相对于对应的 Qwen3.5 4B 和 9B 骨干模型,结果具有竞争力或有所提升。

引言

电商直播需要全模态理解,联合解读语音、视频帧、产品图像、叠加文本和用户查询,将证据对齐到长流中以产品为中心的时刻。通用全模态模型缺乏细粒度、以产品为中心的能力,现有的电商扩展并未系统地解决原子级直播任务,如语音识别、视觉定位和时间定位。作者提出 TLive-Omni,该模型基于 Qwen3.5 骨干构建,集成了预训练的音频编码器,支持多达 256K 的多模态 token,并引入 Per-vGrid 实现音视频对齐,通过将匹配的视觉和音频证据与显式时间标记分组。训练过程包括三阶段监督微调,随后是 Faithful-RFT 强化阶段,该阶段抑制冗余推理轨迹,并直接使用任务可验证的奖励优化答案忠实度,同时动态 rollout 重采样和同步长度分组批处理处理异构模态批次。面向场景的能力分类体系和数据生产引擎将直播电商流映射为原子监督信号,内部评估套件验证了在业务导向任务上的强劲性能,同时在通用基准上取得了有竞争力的结果。

数据集

作者从原始电商数据和精选的通用领域数据构建全模态直播电商监督信号。由于音频、图像和视频源具有不同的噪声模式,他们使用独立的模态特定流水线,将噪声输入转换为基于任务的标注。本节未报告具体的数据集大小。

音频通路

  • 应用语音活动检测和音频归一化。
  • 使用跨模型 ASR 集成一致性获得 ASR 伪标签。
  • 使用 LLM 挖掘领域特定的低频术语,构建直播专用关键词词典用于上下文 ASR。
  • 使用音频专用说话人日志模型和 MLLM,结合文本转录和视觉线索交叉验证说话人标签,并进行时间 IoU 一致性检查;不一致之处通过视频帧和唇动进行验证。
  • 通过音频-LLM 集成生成声音、音乐、语音内容和说话人节奏维度,构建音频描述和音频问答对,然后使用 LLM 进行合并。

图像通路

  • 通过 VLM 检测器-评判器循环构建产品视觉定位数据:检测器提出候选框,评判器将不准确的框过滤为拒绝样本数据。
  • 对于开源通用检测数据,将原始文本标签聚类为标准化类别,并应用类别平衡采样。
  • 对于 Markdown 和 HTML 解析,重新渲染解析后的内容并与源图像进行比较,而不是直接信任 VLM 输出。
  • 通过源一致性过滤描述和卖点数据,使用 VLM 评判器移除无依据的描述。
  • 通过使用 VLM 生成带有推理轨迹的答案,然后使用基于规则或 LLM 评判进行评分,并保留答案与轨迹一致的样本,构建富含推理的图像问答。

视频通路

  • 使用 TransNet V2 在物理镜头边界处分割视频以进行密集描述;ASR 提取语音,VLM 描述视觉内容,LLM 将其合并为密集描述。
  • 对于视频问答和时间定位,在语义事件边界处分割视频,并使用 VLM 生成问答对和时间定位标注。
  • 应用共享的精炼流水线,包括面向场景的重采样以覆盖长尾分布,以及针对不同时长的时间校准,然后由 VLM 评判器检查事实和逻辑一致性以及时间戳对齐。
  • 从无音频视频构建富含推理的视频问答,使用 VLM 生成答案和推理轨迹,并通过基于规则的匹配验证选择题和数值答案,使用 LLM 评判器验证自由形式答案。

生成的标注用作全模态直播电商理解的基于任务的监督微调数据,涵盖音频描述、音频问答、图像定位、图像问答、密集视频描述、视频问答、时间定位和富含推理的问答。

方法

TLive-Omni 是一个仅输出文本的全模态理解模型,设计用于图像、视频、音频和文本输入。作者利用 Qwen3.5 骨干作为语言和视觉基础。对于视觉处理,空间合并为每张图像生成 (h/32)×(w/32)(h/32) \times (w/32)(h/32)×(w/32) 个视觉 token,并通过多层感知机将这些特征映射到骨干嵌入维度。为了整合音频,模型通过轻量级音频对齐器将 Qwen3-Omni 的音频 Transformer 编码器接入相同的嵌入空间。该编码器使用 128 维梅尔频谱特征,并将语音压缩为每秒约 13 个 token。

为了实现长直播理解,作者引入了 Per-vGrid,它将视频和对应的音频组织成带时间戳的视频网格序列。时间网格的视觉内容和覆盖相同时间间隔的音频片段被放置在相同的局部跨度中。Per-vGrid 在每个网格前添加显式的文本时间戳,使网格边界显式化,保持视频和音频 token 连续,并在序列层面分隔相邻网格。时间戳和音频跨度源自实际的视频采样过程,即使整数帧选择导致实际采样率与请求的采样率不同,也能保持精确的时间对齐。

参考框架图:

构建全模态直播电商理解的监督信号需要模态特定的构建,因为音频、图像和视频源具有不同的噪声模式。作者通过独立的通路处理原始电商数据,每个通路都有自己的过滤和质量控制。音频通路使用 ASR 集成中的跨模型一致性投票,并使用声学特征和视觉线索交叉验证说话人标签。图像通路采用视觉语言模型检测器-评判器循环进行产品视觉定位,并应用类别平衡采样以减少标签噪声。视频通路利用 TransNet V2 获取物理镜头边界和语义事件边界,以生成密集描述、问答对和时间定位标注。

如下图所示:

数据构建完成后,TLive-Omni 遵循三阶段监督微调方案。第一阶段冻结语言模型和音频编码器,仅在 5M 个 ASR 样本上训练音频对齐器,以建立初始映射。第二阶段引入更广泛的音频混合,使用 26M 个样本,训练音频编码器和对齐器,同时保持语言模型冻结。第三阶段在 14M 个样本上进行联合多模态监督微调,冻结编码器,优化对齐器和语言模型以应对多样化任务。

为了解决异构多模态数据因 token 长度不同而带来的批处理挑战,作者提出了一种同步长度分组采样器。该采样器按模态划分样本,按 token 长度排序,并将其分割为全局批次。这种组织方式减少了填充,同时保持固定的样本数量,确保训练过程中各工作节点的工作负载可比。

为了提升实时直播中的答案忠实度和表达质量,作者在三阶段 SFT 之后引入了 Faithful-RFT。该方法使用带有任务可验证奖励的 Group Relative Policy Optimization。数据被组织成四个流:图像、带音频视频、无音频视频和音频。对于每个多模态提示 xix_ixi,策略采样一组 GGG 个候选响应。视觉和音频编码器及对齐器保持冻结。组相对优势计算如下:

A^i,g=Ri,gmeang(Ri,g)stdg(Ri,g)+ϵs\widehat{A}_{i,g} = \frac{R_{i,g} - \mathrm{mean}_{g'}(R_{i,g'})}{\mathrm{std}_{g'}(R_{i,g'}) + \epsilon_s}Ai,g=stdg(Ri,g)+ϵsRi,gmeang(Ri,g)

实现最小化组级损失:

Li(θ)=1Gg=1G1ygt=1yg[min{πθ(yg,tx,yg,<t)πθold(yg,tx,yg,<t)A^g,clip(πθ(yg,tx,yg,<t)πθold(yg,tx,yg,<t),1ϵl,1+ϵh)A^g}+βdg,tKL]\mathcal{L}_i(\theta) = \frac{1}{G} \sum_{g=1}^G \frac{1}{|y_g|} \sum_{t=1}^{|y_g|} \left[ -\min\left\{\frac{\pi_\theta(y_{g,t} \mid x, y_{g,<t})}{\pi_{\theta_{\mathrm{old}}}(y_{g,t} \mid x, y_{g,<t})} \widehat{A}_g, \operatorname{clip}\left(\frac{\pi_\theta(y_{g,t} \mid x, y_{g,<t})}{\pi_{\theta_{\mathrm{old}}}(y_{g,t} \mid x, y_{g,<t})}, 1-\epsilon_l, 1+\epsilon_h\right) \widehat{A}_g\right\} + \beta d_{g,t}^{\mathrm{KL}} \right]Li(θ)=G1g=1Gyg1t=1yg[min{πθold(yg,tx,yg,<t)πθ(yg,tx,yg,<t)Ag,clip(πθold(yg,tx,yg,<t)πθ(yg,tx,yg,<t),1ϵl,1+ϵh)Ag}+βdg,tKL]

Faithful-RFT 抑制不必要的显式思考轨迹,而不是鼓励可见的推理轨迹。

Rollout 策略通过任务感知分桶扩展了同步长度分组采样器。样本被分配到由模态和任务标识符定义的桶中,按序列长度排序以减少输入端填充。轻量级动态重采样策略保留奖励方差非零的组,并在方差接近零的情况下重新生成候选组,以确保有意义的相对优势。

优化所需的标量奖励通过任务条件奖励路由计算。每个奖励函数声明一个适用的任务集,仅在任务匹配时进行评估。配置的权重在每个候选的有效奖励上进行归一化:

w~i,g,j={vi,g,jwjkvi,g,kwk,kvi,g,kwk>0,0,otherwise.\widetilde{w}_{i,g,j} = \begin{cases} \frac{v_{i,g,j} w_j}{\sum_k v_{i,g,k} w_k}, & \sum_k v_{i,g,k} w_k > 0, \\ 0, & \text{otherwise.} \end{cases}wi,g,j={kvi,g,kwkvi,g,jwj,0,kvi,g,kwk>0,otherwise.

最终的标量奖励为 Ri,g=j:vi,g,j=1w~i,g,jri,g,jR_{i,g} = \sum_{j: v_{i,g,j}=1} \widetilde{w}_{i,g,j} r_{i,g,j}Ri,g=j:vi,g,j=1wi,g,jri,g,j。这确保每个样本仅由适用于其任务的奖励函数评分,对确定性目标使用基于规则的奖励,对开放式回答使用 LLM 评判奖励。

实验

TLive-Omni 在涵盖语音转录、说话人归属 ASR、产品视觉定位、时间定位、密集视频描述和镜头理解的全套直播电商任务上进行了评估,同时也在广泛的通用多模态基准上进行了评估,这些基准评估图像推理、幻觉、OCR、视频理解和全模态感知。该模型在领域特定和通用评估中均取得了强劲性能,表明其对直播电商的专业化并未缩小其广泛的多模态理解能力。定性示例进一步展示了模型在直播电商和开放域场景中处理细腻的音视频-时间推理的能力。

直播电商音频结果表明,在列出的闭源系统中,Gemini Pro 模型通常优于 Flash 模型,其中 Gemini 3 Pro 在说话人归属 ASR、音频描述、幻觉和音频问答方面领先,而 Gemini 2.5 Pro 的 ASR 错误率最低。附带文本报告称 TLive-Omni-9B 在 ASR 上取得了最低的 CER,TLive-Omni-4B 紧随其后,两者均显示出有竞争力的 cpWER。总体而言,Pro 级模型和 TLive-Omni 系列在直播电商语音和音频理解方面表现更强。Gemini 2.5 Pro 在闭源 Gemini 模型中录得最低的直播电商 ASR 错误率,领先于 Gemini 3 Pro 和 Gemini 3.5 Flash。TLive-Omni-9B 在报告的对比中取得了最低的 ASR CER,TLive-Omni-4B 紧随其后,且两个模型均显示出较低的说话人归属 ASR cpWER。Gemini 3 Pro 在说话人归属 ASR、音频描述准确率、幻觉率和音频问答方面领先列出的闭源模型。Gemini 2.5 Flash 和 Gemini 3 Flash 在音频描述准确率和幻觉率上落后于 Pro 模型,无依据内容率明显更高。闭源 Gemini 模型中,音频问答准确率最高的是 Gemini 3 Pro,其次是 Gemini 3.5 Flash,而 Gemini 3 Flash 排名最低。

TLive-Omni 变体在产品图像定位和产品文本理解方面领先,包括文本定位、识别和分类,同时在直播流产品定位方面与最强的闭源模型保持竞争力。在报告的闭源模型中,Gemini 3.5 Flash 显示出最高的直播流定位能力,但 TLive-Omni 在多个产品图像和文本导向的指标上更强。结果表明其多模态能力超出了直播电商领域。TLive-Omni 变体在评估模型中取得了最佳的产品图像定位、文本定位和文本分类结果,以及最低的识别编辑距离。Gemini 3.5 Flash 在闭源模型中领先直播流产品定位,而 TLive-Omni 在该指标上保持竞争力。

在报告的 Gemini 模型中,直播电商视频任务的能力表现不均衡。Gemini 2.5 Flash 显示出最强的密集描述准确率和最低的幻觉率,而 Gemini 2.5 Pro 在视频问答和大多数镜头理解得分上领先。Gemini 3 和 3.5 模型通常改善了时间定位,但并未持续提升描述质量或幻觉控制。Gemini 2.5 Flash 在列出的模型中报告了最高的密集描述准确率和最低的幻觉率。Gemini 2.5 Pro 在视频问答准确率以及布局和镜头尺寸指标上领先。Gemini 3 Pro 和 Gemini 3.5 Flash 在时间定位 mIoU 上并列最高,略高于 Gemini 2.5 模型。镜头理解表现不一:相机理解由 Gemini 2.5 Flash 领先,而内容理解由 Gemini 3 Pro 领先。

通用图像基准结果表明,闭源模型,尤其是 Gemini 3 Pro,在大多数报告的以图像为中心的指标上领先,而 Qwen3.5-Omni Flash 在多个数学和 MMBench 任务上表现具有竞争力。据描述,TLive-Omni 保持了强大的图像推理能力,并在这些基准的大多数上相对于其 Qwen3.5 4B 和 9B 骨干有所提升。据报道,9B 变体在许多指标上取得了最佳开源结果,4B 变体通常在开源模型中排名第一或第二。Gemini 3 Pro 在大多数以图像为中心的基准上取得了列出的模型中的最高分,包括 MMMU、MathVista、DynaMath、MMBench、RealWorldQA、MMStar 和 SimpleVQA。Qwen3.5-Omni Flash 在 MMMU、MathVista、DynaMath、MMBench 和 RealWorldQA 上优于 Gemini 2.5 Flash,但在 SimpleVQA 上落后,在 MMStar 上略逊一筹。据报道,TLive-Omni 在大多数通用图像基准上相对于 Qwen3.5 4B 和 9B 骨干有所提升,其 9B 变体在许多指标上取得了最佳开源结果。

通用图像基准结果涵盖幻觉、图表理解、OCR 感知、视觉定位、具身推理和空间推理。TLive-Omni 保持了有竞争力的通用图像推理能力,在幻觉、以 OCR 为中心的感知和空间推理方面尤为突出。在不同模型规模中,9B 变体在许多报告的指标上取得了最佳开源结果,而 4B 变体也在多个基准上达到最佳或次佳开源结果。相对于其更广泛的图像基准表现,TLive-Omni 在幻觉、以 OCR 为中心的感知和空间推理任务上显示出特别优势。9B 变体在许多报告的图像基准上领先开源模型,而 4B 变体通常在开源模型中排名最佳或次佳。

在直播电商音频、产品图像和文本理解、直播电商视频以及通用图像基准中,评估将 TLive-Omni 变体与 Gemini 和 Qwen 模型进行了比较。TLive-Omni 和 Gemini Pro 级模型在直播电商音频和产品导向任务中领先,TLive-Omni 在 ASR、产品图像定位、文本定位、识别和分类方面表现出特别优势,而 Gemini 3 Pro 在多个闭源音频指标上领先。直播电商视频结果参差不齐,Gemini 2.5 Flash 在密集描述和幻觉控制方面表现出色,Gemini 2.5 Pro 在视频问答和镜头理解方面领先,而较新的 Gemini 模型仅改善了时间定位。在通用图像基准上,Gemini 3 Pro 在大多数闭源结果中领先,而 TLive-Omni 相对于其 Qwen 骨干有所提升,并在许多指标上取得了最佳开源性能,尤其是在幻觉、以 OCR 为中心的感知和空间推理方面。


用 AI 构建 AI

从创意到上线——通过免费 AI 协同编码、开箱即用的环境和最优惠的 GPU 价格,加速您的 AI 开发。

AI 协同编码
开箱即用的 GPU
最优定价

HyperAI Newsletters

订阅我们的最新资讯
我们会在北京时间 每周一的上午九点 向您的邮箱投递本周内的最新更新
邮件发送服务由 MailChimp 提供