Command Palette
Search for a command to run...
WeMM-Embedding:微信多模态嵌入技术报告
WeMM-Embedding:微信多模态嵌入技术报告
Junjie Zhou Ke Mei Lei Li Tianyi Wang Fengyun Rao Jing LYU
摘要
通用多模态嵌入正成为现代人工智能系统的核心组件,能够将异构内容表示在统一空间中,以支持检索、推荐、分类和智能体系统等应用。在本报告中,我们提出 WeMM-Embedding,这是一个通用多模态嵌入模型系列,支持文本、图像、视频、视觉文档以及任意交错的多模态输入,并具备灵活的输出维度。该系列包含 2B、4B 和 9B 三种规模变体,训练分为两个阶段:大规模多模态对齐阶段,以及随后使用精选数据、细粒度相关性监督和跨尺度知识迁移的优化阶段。在广泛的评估中,WeMM-Embedding 在多个公开基准上取得了领先性能。值得注意的是,2B 变体在 MMEB-v2 上已超越此前领先的 8B 开源基线,而 9B 变体进一步取得了 80.6 的整体得分,达到新的最优水平。WeMM-Embedding 在微信的各项应用中也展现出强大的实际性能,在包含 26 个任务的内部基准上取得了显著提升,并在 14 项在线 A/B 测试中实现了一致的改进。该模型已在推荐和搜索应用中大规模部署,覆盖微信视频号、公众号、朋友圈和电商服务等场景。我们已公开模型权重和代码,以促进未来研究。
一句话总结
腾讯微信视觉团队推出 WeMM-Embedding,一个包含 2B、4B 和 9B 参数规模的通用多模态嵌入模型家族,支持文本、图像、视频、视觉文档以及交错输入,并具备灵活的输出维度。该模型通过两阶段对齐和跨尺度知识迁移训练,在 MMEB-v2 上取得 80.6 的总体得分,达到最优水平,并已部署于微信推荐和搜索应用中。
核心贡献
- 本工作提出 WeMM-Embedding,一个包含 2B、4B 和 9B 参数规模的通用多模态嵌入模型家族,支持文本、图像、视频、视觉文档以及交错多模态输入,并具备灵活的输出维度。
- 采用两阶段训练策略:首先进行大规模多模态对齐,随后使用精选数据、细粒度相关性监督和跨尺度知识迁移进行精炼。
- 2B 版本在 MMEB-v2 上超越了此前领先的 8B 开源基线,9B 版本取得了 80.6 的最优总体得分。模型还在包含 26 个任务的内部基准上展现出提升,并在 14 项在线 A/B 测试中持续改善,已大规模部署于微信推荐和搜索应用中;模型权重和代码均已发布。
引言
多模态嵌入模型是检索、推荐、分类和 agent 系统的核心,因为它们将文本、图像和视频映射到共享的表示空间。CLIP 风格的双编码器以及后来的基于编码器的任意到任意模型虽然有效,但当输入混合多种模态或任务需要更通用的联合表示时,它们仍然存在局限。多模态大语言模型提供了更灵活的基础,但将其隐状态转化为强大的通用嵌入仍需仔细的对齐和相关性训练。作者提出了 WeMM-Embedding,一个 2B 到 9B 的模型家族,分两阶段训练:首先在大规模异构多模态对上实现广泛对齐,随后在精选语料上使用更难的负例、更丰富的相关性监督和跨尺度知识迁移,以实现更细粒度的匹配。
数据集
数据集构成与处理
- 总体规模与来源: 作者收集并合成了数亿训练样本,涵盖文本、图像、视频和交错多模态输入。来源包括公开数据集、网络规模弱监督源、面向任务的合成数据以及内部收集的数据。
- 统一模式: 每个样本表示为 zi=(Ii,qi,ci,Ni,yi), 其中 qi 是源实例,ci 是配对目标,Ii 是可选的 task instruction,Ni 是可选的难负例集合,yi 是可选的等级相关性分数。qi 和 ci 均可包含文本、图像、视频或交错组合。
- 主要数据类型与监督:
- 弱监督对: 来自公开和网络规模源的大规模图像-文本和视频-文本对,具有自然出现的对应关系而非显式描述。
- Caption 对: 图像和视频与描述实体、属性、关系、空间上下文、动作和事件的显式 caption 配对。
- 检索对: 查询与相关候选项配对,涵盖文本、图像、视频和交错输入,包括组合查询、推理、长上下文、空间定位、时间定位和 agent 相关检索。
- 分类对: 分类数据集重新格式化为源-标签对,其中目标是类别名称或自然语言类别描述。
- 多模态问答对: 文本或多模态问题与答案目标配对,涉及视觉感知、关系和空间理解、OCR、知识密集型理解、推理、文档和图表理解以及事件理解。
- 等级相关性对: 源-目标对带有手动分配的离散相关性等级,支持面向排序的训练。
- 大规模处理: 所有样本被转换为共享的成对格式,并组织为任务特定的批次。标准成对数据将批次中的其他目标用作批次内负例。对于共享目标空间(如分类),通过语义目标掩码去除假负例。
- 精选子集: 构建了一个规模约为大规模数据十分之一的精选集合,以改善语义平衡、数据质量和监督。
- 语义 ID 引导的重采样: 每个对通过中间 WeMM-Embedding 检查点进行嵌入,然后使用三级残差 k-means 模型量化,产生三元素语义 ID。来自密集语义编码的样本被降采样,而来自稀疏编码的样本以更高比例保留。
- 质量过滤: 多模态大语言模型检查每个源-目标对是否符合预期的关系,并过滤不匹配的样本。它还根据需要修正文本字段,例如纠正弱监督图像-文本和视频-文本对中的事实不一致,同时保留 alt-text 风格和细节。
- 难负例构建: 对于文本目标,多模态 LLM 生成看似合理但不正确的候选项。对于图像和视频目标,中间 WeMM-Embedding 检查点从任务特定的候选项池中检索语义相似的候选项。一个较小的子集获得重排序模型给出的相关性分数,用于更细粒度的监督。
- 在模型中的使用: 大规模和精选集合均在统一的多任务训练流程中使用。等级相关性值用于构建相对排序约束,显式难负例提高了对相似候选项的区分能力。提供的摘录未报告单独的训练/验证划分或精确混合比例,仅说明精选集约为大规模集合的十分之一。
- 裁剪或增强细节: 此摘录中未指定图像特定的裁剪和增强细节。处理重点在于统一成对格式、语义重采样、质量过滤和难负例丰富。
方法
模型架构
作者基于原生多模态 Qwen3.5 骨干构建了 WeMM-Embedding 模型家族,包含 2B、4B 和 9B 参数规模。该架构旨在将文本、图像和视频的任意组合编码为统一的稠密表示。一个输入实例可包含可选的 task-specific instruction 以及有序的多模态片段序列:
D=⟨Iinst,x1,x2,…,xm⟩,其中 Iinst 表示可选的 instruction,每个 xi 可以是文本、图像或视频。文本片段通过原生 tokenizer 和嵌入层转换为 token embeddings,视觉片段通过原生视觉流水线处理。token 序列按原始片段顺序排列,并追加一个专用的 <embedding> token:
整个多模态序列随后由 LLM 骨干 Gθ 处理:
H=Gθ(S)=[h1,h2,…,hN,hemb].<embedding> token 的最后一层隐状态用于 last-token pooling,并经过 L2 归一化产生输出表示:
因果注意力机制还允许在不同位置插入多个 <embedding> token。例如,对于一段视频及其自动语音识别转录,可以在视频 token 之后放置一个 token,在序列末尾放置另一个 token。这使得可以在一次前向传播中提取仅视频和联合视频-文本的表示。
WeMM-Embedding 进一步通过 Matryoshka Representation Learning 支持灵活的嵌入维度。给定最终隐状态 hemb∈RD,通过保留前 d 个维度并应用 L2 归一化,可获得维度为 d≤D 的嵌入:
eD(d)=∥hemb,1:d∥2hemb,1:d,d∈DMRL.这允许通过前缀截断和重新归一化,从一次前向传播中生成多个支持维度的嵌入。
精选数据构建
除大规模收集外,作者还构建了一个专注于语义平衡、数据质量和更丰富监督的精选数据集。构建过程包括语义 ID 引导的重采样、质量控制和选择性难负例丰富。
在语义 ID 引导的重采样中,每个源-目标对被映射到离散的语义 ID。序列化 token 序列较长的一侧使用中间 WeMM-Embedding 检查点编码。然后对得到的表示拟合三级残差 k-means 量化器,产生三元素语义 ID。分配到密集编码的样本以较低比例采样,而映射到稀疏编码的样本以更高比例保留。这减少了对频繁语义模式的重复暴露。
重采样后的样本进一步通过多模态大语言模型精炼。模型评估每个源-目标对是否反映预期的匹配关系,并过滤不匹配的样本。它还纠正嘈杂或事实不准确的文本描述,同时保留原始风格和细节水平。
一部分精炼样本被显式难负例丰富。对于文本目标,多模态大语言模型基于源和正目标生成看似合理但不正确的候选项。对于图像和视频目标,中间 WeMM-Embedding 检查点从任务特定的候选项池中检索语义相似的候选项。一个较小的挖掘候选项子集由重排序模型进一步评分,以在困难候选项中提供更细粒度的监督。
第一阶段:大规模多模态对齐
第一个训练阶段使用大规模多任务对齐建立通用的多模态嵌入空间。每个批次从一致的数据源构建,而来自不同任务的批次在训练过程中交错进行。标准成对样本使用对比学习优化,带有原生等级相关性标注的样本使用分数差距加权的排序目标。
对于标准成对数据,作者使用 InfoNCE 目标优化源-目标对齐。每个源将其配对目标作为正例,将与其他样本关联的目标作为批次内负例。当有显式难负例时,它们被加入负例池。令 Cj={cj+}∪Nj 表示与源 qj 关联的候选项。对比目标为:
LCL=−B1i=1∑Blogexp(s(qi,ci+)/τ)+∑j=1B∑c∈Cj∖{ci+}Mi,j,cexp(s(qi,c)/τ)exp(s(qi,ci+)/τ),其中 s(⋅,⋅) 表示归一化嵌入之间的余弦相似度,τ 是可学习的温度。为处理近重复源或目标引起的冲突,应用重复感知掩码:
Mi,j,c=⎩⎨⎧0,1,if j=i and s(qi,qj)>τdup,or if s(ci+,c)>τdup,otherwise.源侧掩码排除与近重复源关联的候选项,目标侧掩码排除与当前正目标密切匹配的候选项。
对于带有离散相关性等级标注的对,作者使用分数差距加权的 CoSENT 风格排序目标。对于两个样本 i 和 j,相关性差距权重为
wij=max(∣yi−yj∣,ϵ),样本 i 的排序损失为
LiRel=log1+j:yi>yj∑wijexp(γ[sj−si])+j:yj>yi∑wijexp(γ[si−sj]).批次目标是所有样本的平均。这鼓励更高相关性的对获得更高相似度,并对标签差距较大的比较赋予更大权重。
Matryoshka Representation Learning 同时应用于对比训练和等级相关性训练。对于每个批次,在每个支持的嵌入维度上独立评估相应目标:
LXMRL=d∈DMRL∑αdLX(d),X∈{CL,Rel}.第二阶段:精选微调与蒸馏
第二阶段在精选数据集上继续训练。对比和等级相关性目标仍在使用,同时由重排序模型和更大的嵌入教师提供额外监督。
专用的多模态重排序模型在包含正目标和挖掘难负例的候选项集上提供查询特定的排序信号。重排序分数取代手动分配的相关性等级,比较仅在关联同一查询的候选项之间构建。对于源 qb 及其候选项集 Cb,重排序分数诱导出有序对集合
Pb={(i,j)∣y^b,i>y^b,j}.重排序目标为
LRank=B1b=1∑Blog1+(i,j)∈Pb∑ωb,ijexp(γ[s(qb,cb,j)−s(qb,cb,i)]),其中 ωb,ij=max(∣y^b,i−y^b,j∣,ϵ)。重排序监督仅限于能带来可靠改进的设置。
嵌入蒸馏利用批次级源-目标相似度分布,从更大的教师模型传递在线软目标。对于包含 B 个源和大小为 K 的目标池的批次,教师和学生的相似度矩阵定义为
AijT=τTsT(qi,cj),AijS=τSsS(qi,cj).同时构建正目标与源之间的反向相似度矩阵:
AˉijT=τTsT(ci+,qj),AˉijS=τSsS(ci+,qj).通过 softmax 获得行向关系分布,双向蒸馏损失为
LEmb=2B1i=1∑B[DKL(PT,iq→c∥PS,iq→c)+DKL(PT,ic→q∥PS,ic→q)].这使得教师和学生的相似度分布在源到目标和目标到源两个方向上对齐。与 one-hot 对比监督不同,教师分布保留了候选项之间的相对相似度差异。
对于每个第二阶段批次,根据可用的监督选择任务目标:
LTask=⎩⎨⎧LCLMRL,LRelMRL,LRankMRL,for standard paired or hard-negative batches,for graded-relevance batches,for reranker-scored batches.第二阶段总体目标为
LStage2=LTask+λEmbLEmb,其中 λEmb 控制蒸馏权重。对于 2B 和 4B 版本,冻结的 9B WeMM-Embedding 模型作为嵌入教师。对于 9B 版本,使用互补的数据混合和配置训练多个专门的第二阶段变体,然后通过模型合并进行组合。
实验
WeMM-Embedding 在涵盖 MMEB 系列(用于通用多模态和 agent 中心任务)、公开跨模态检索数据集以及真实微信应用的全面基准套件上进行评估。该模型在图像、视频、视觉文档、文本和 agent 检索方面均取得领先性能,经常超越更大的开源和商业基线。消融和累积研究表明,任务一致的批处理、精选数据、重排序监督和嵌入教师蒸馏是精炼通用多模态表示的关键,而 Matryoshka 学习在降低维度以提升效率的同时保持了高性能。在大规模推荐和搜索系统中的真实部署持续改善内容匹配和用户参与度,证实了超越基准的实际价值。
在评估的 2B 参数多模态嵌入模型中,RzenEmbed 取得了最高的总体得分,这得益于其在图像分类和视觉定位上的卓越表现。VLM2Vec-V2 和 Ops-MM-embedding-v1 总体得分均超过 59 分,其中 VLM2Vec-V2 相比其前身有显著提升,尤其在视觉文档方面。基线结果揭示了不同模型在检索和视觉定位任务上的巨大差距,凸显了这些任务对紧凑多模态表示的挑战。RzenEmbed 以 67.2 的总体平均分领先所有 2B 模型,比第二名 Ops-MM-embedding-v1 高出 2.6 分。图像分类的差异最大:RzenEmbed 达到 90.3,而 GME 仅为 55.5。VLM2Vec-V2 较原版 VLM2Vec 总体提升 11.5 分,其视觉文档得分几乎翻倍,从 44.0 升至 69.2。检索仍是大多数 2B 模型的薄弱环节;GME 在图像检索上仅得 29.9 分,即便表现最好的 Ops-MM-embedding-v1 也仅达 47.6。
WeMM-Embedding 2B 在 MMEB-v3 上取得了最高的总体得分(56.0),以明显优势超越所有列出的基线,但由于不支持音频输入,音频任务得分为零。其优势源于强大的文本和 agent 中心性能,尤其在指令遵循、长上下文检索以及工具和记忆相关的 agent 子任务上增益显著。更大版本进一步扩大了领先优势。WeMM-Embedding 2B 的 V3-All 得分为 56.0,比次优模型(Qwen3-VL-Embedding,50.9)高出 5 分以上,尽管不支持音频。在 53 个文本任务上,WeMM-Embedding 达到 45.3,超过所有基线,指令遵循(49.3)和长上下文检索(61.9)的领先幅度尤为突出。agent 任务性能最高,为 45.1,其中工具检索(46.2)和记忆检索(47.2)相比 Qwen3-VL-Embedding 的 42.6 和 28.4 有大幅提升。WeMM-Embedding 和若干不支持音频的基线在音频任务上得分为零,而 Omni-Embed-Nemotron 和 E5-Omni 获得了非零音频分数。根据论文分析,扩展至 4B 和 9B 后,V3-All 分别提升至 58.2 和 59.5,进一步拉大了与现有模型的差距。
在报告的跨模态检索基准上,WeMM-Embedding 各版本与商业专有嵌入模型具有竞争力。WeMM-Embedding 9B 模型在 MSCOCO 和 DOCCI 上取得了最佳的文本到图像召回率,WeMM-Embedding 4B 在所列模型中取得了 MSCOCO 上最佳的图像到文本召回率。在平均文本到图像召回率上,WeMM-Embedding 9B 几乎与顶级商业模型持平,而 2B 模型已超越更大的 Qwen3-VL-Embedding。WeMM-Embedding 9B 在 MSCOCO 和 DOCCI 上录得最高的文本到图像检索分数,在这些基准上超越了专有模型。WeMM-Embedding 4B 在 MSCOCO 的图像到文本检索上领先,WeMM-Embedding 2B 在平均文本到图像召回率上击败了更大的 Qwen3-VL-Embedding 8B。
WeMM-Embedding 在内部基准上优于 Qwen3-VL-Embedding 基线,取得了更高的平均分以及所有五个任务类别中更高的分数。优势在跨域内容匹配和分类上尤为明显,而视频相关性的差距相对较小。WeMM-Embedding 在分类、搜索、跨域内容匹配、文章相关性和视频相关性上均领先。跨域内容匹配相比基线的类别级提升最大,视频相关性的提升最小。
使用 2B 模型进行的小规模第一阶段消融实验显示,每个评估的设计选择都对 MMEB-v2 性能有贡献。任务一致的批处理影响最大,移除后总体平均分下降 3.4 分,而移除任务特定指令和重复感知掩码则产生较小但一致的下降。完整配置在图像、视频和视觉文档任务上取得了最高的平均性能。移除任务一致的批处理导致总体下降最大,其中图像任务的降幅最大。任务特定指令对视觉文档任务最为重要,移除后该任务的下降幅度大于图像或视频任务。重复感知掩码提供了适度的益处,移除后总体和图像性能略有下降。
评估涵盖多个多模态嵌入基准,包括 MMEB-v3、跨模态检索和内部测试套件,以评估紧凑模型并验证设计选择。在 2B 参数模型中,RzenEmbed 凭借强大的图像分类和定位能力总体领先,而检索仍是普遍弱点。WeMM-Embedding 各版本在文本和 agent 中心任务上取得最高分,并有效扩展,9B 模型在文本到图像检索上可与专有系统匹敌。消融实验证实,任务一致的批处理、任务特定指令和重复感知掩码均对性能有贡献,其中批处理的影响最大。