HyperAIHyperAI

Command Palette

Search for a command to run...

视觉对比自蒸馏

Yijun Liang Yunjie Tian Yijiang Li Yuqi Jia Furong Huang Tianyi Zhou Di Fu

摘要

同策略自蒸馏(OPSD)因无需同策略蒸馏(OPD)所需的外部教师而颇具前景,但仍需在教师与学生之间构建非对称信息,以确保自教师提供比学生更强的学习信号。现有方法通过特权答案或视觉证据来创造这种非对称性。我们探讨能否同时去除这两者,从而得到一种纯粹由输入条件驱动的更简洁的 OPSD 形式。为此,我们提出视觉对比自蒸馏,即 VCSD,它将图像内容移除转化为同策略自蒸馏信号。在学生生成的每个响应前缀处,EMA 教师在同一提示和前缀下产生两个下一词元分布——一个以原始图像为条件,另一个以内容擦除的对照为条件。它们的逐词元对数概率差凸显了那些因实例级视觉内容而似然性得到特定提升的候选词元。我们利用这一对比,在教师的合理支撑集内锐化其原始图像分布,并将得到的全分布目标蒸馏给学生。在 ViRL39K 数据集上,VCSD 在 Qwen3-VL 和 Qwen3.5 模型上一致优于匹配的 OPSD。例如,在 Qwen3-VL 上,它将七个基准的聚合分数从 2B 的 62.27% 提升至 67.04%,从 4B 的 71.30% 提升至 73.16%,从 8B 的 72.51% 提升至 76.26%。此外,VCSD 无需外部教师、特权答案、视觉证据信号、推理轨迹或额外的推理时成本。

一句话总结

马里兰大学帕克分校、加州大学圣地亚哥分校、杜克大学和 MBZUAI 的研究人员提出视觉对比自蒸馏(Visual Contrastive Self-Distillation,VCSD),一种基于策略的自蒸馏方法,通过计算 EMA 教师模型在原图和内容擦除图像分布上的 token 级对数概率差异,仅靠输入条件对比生成更强的教师信号以锐化目标。利用 ViRL39K 数据集,VCSD 将 Qwen3-VL 在七项基准上的综合得分从 62.27% 提升至 67.04%(2B)、从 71.30% 至 73.16%(4B)、从 72.51% 至 76.26%(8B),且无需外部教师、特权答案、视觉证据信号、推理轨迹或额外的推理成本。

核心贡献

  • 匹配输入条件对比为基于策略的自蒸馏提供了所需的不对称性,通过对比模型在原图和内容擦除版本下的预测,消除了对特权答案或视觉证据的依赖。
  • 视觉对比自蒸馏(VCSD)从教师模型在原图和内容擦除控制下的 next-token 分布的 token 级对数概率差中构建锐化的全分布目标,并将该目标蒸馏至学生模型。
  • 在七项视觉-语言基准上,VCSD 一致地提升 Qwen3-VL(2B、4B、8B)和 Qwen3.5 模型,超越基线和同等的基于策略的自蒸馏基线,综合得分从 62.27% 升至 67.04%(2B)、71.30% 升至 73.16%(4B)、72.51% 升至 76.26%(8B),并在 Qwen3.5 上带来 2.9% 到 4.3% 的增益。

引言

基于策略的蒸馏训练视觉语言模型(VLM)时使用其自身生成的前缀,但移除外部教师的自蒸馏会因教师和学生看到相同信息而难以奏效。先前方法通过辅助信号(如特权答案或裁剪的视觉证据)来制造必要的师生不对称性,但这些方法任务特定、需要额外流水线或依赖外部模型。作者利用成对的输入条件:他们在原图和内容擦除控制下将相同的前缀馈送给 EMA 教师,然后对比两种 token 级对数概率分布。这种视觉对比锐化了原图分布在合理支持集内的概率,为基于策略的自蒸馏产生了解耦的全分布目标。该方法称为视觉对比自蒸馏(VCSD),无需外部教师、标注或特权信息,在 2B 到 9B 规模的 Qwen3-VL 和 Qwen3.5 模型上,于七项视觉-语言基准中均实现一致改进。

方法

作者提出 VCSD,一种通过匹配视觉条件构造基于策略自蒸馏所需目标不对称性的方法。在此设置中,使用一个可训练的学生模型 πθ\pi_{\theta}πθ 及其指数移动平均教师 πϕ\pi_{\phi}πϕ。教师充当停止梯度的目标模型,不直接接收梯度更新。对于数据集中的每个提示-图像对 (P,J)(P, J)(P,J),学生采样一个基于策略的响应 yπθ(P,J)y \sim \pi_{\theta}(\cdot \mid P, J)yπθ(P,J)。在每一步生成 ttt,两个模型均在学生生成的相同前缀 y<ty_{<t}y<t 上进行评估。

参见框架图

为构建更具信息量的教师目标,作者引入视觉条件对比。他们生成一个内容擦除的控制图像 Jctrl=C(J)J_{\mathrm{ctrl}} = \mathcal{C}(J)Jctrl=C(J),即等尺寸黑色 RGB 图像,保留分辨率、多模态输入接口和视觉 token 数量,同时去除具体实例的内容。每个固定前缀 y<ty_{<t}y<t 处,EMA 教师产生两个 next-token 分布:一个以原图为条件 pϕ,tJ(v)=πϕ(vP,J,y<t)p_{\phi, t}^J(v) = \pi_{\phi}(v \mid P, J, y_{<t})pϕ,tJ(v)=πϕ(vP,J,y<t),另一个以控制图像为条件 pϕ,t0(v)=πϕ(vP,Jctrl,y<t)p_{\phi, t}^0(v) = \pi_{\phi}(v \mid P, J_{\mathrm{ctrl}}, y_{<t})pϕ,t0(v)=πϕ(vP,Jctrl,y<t)。词表级别的对数概率对比为:

Δt(v)=logpϕ,tJ(v)logpϕ,t0(v)\Delta_t(v) = \log p_{\phi, t}^J(v) - \log p_{\phi, t}^0(v)Δt(v)=logpϕ,tJ(v)logpϕ,t0(v)

正的 Δt(v)\Delta_t(v)Δt(v) 表示 token vvv 在原图下获得更大支持。这一对比描述了教师 next-token 偏好如何随实例特定视觉内容变化。

然而,较大的相对变化并不能保证 token 在原图下概率高。为解决此问题,作者仅对原图教师分布下被认为足够可能的候选者施加对比塑形。他们定义了一个相对合理性支持集:

St(β)={vV:pϕ,tJ(v)βmaxuVpϕ,tJ(u)}\mathcal{S}_t(\beta) = \left\{v \in \mathcal{V}: p_{\phi, t}^J(v) \geq \beta \max_{u \in \mathcal{V}} p_{\phi, t}^J(u) \right\}St(β)={vV:pϕ,tJ(v)βuVmaxpϕ,tJ(u)}

其中 β\betaβ 控制支持阈值。对比塑形的教师目标构造为:

qt(v)=1[vSt(β)]pϕ,tJ(v)exp(αΔ~t(v))uSt(β)pϕ,tJ(u)exp(αΔ~t(u))q_t^\star(v) = \frac{\mathbf{1}[v \in \mathcal{S}_t(\beta)] p_{\phi, t}^J(v) \exp(\alpha \widetilde{\Delta}_t(v))}{\sum_{u \in \mathcal{S}_t(\beta)} p_{\phi, t}^J(u) \exp(\alpha \widetilde{\Delta}_t(u))}qt(v)=uSt(β)pϕ,tJ(u)exp(αΔt(u))1[vSt(β)]pϕ,tJ(v)exp(αΔt(v))

其中 α0\alpha \geq 0α0 控制塑形强度,Δ~t\widetilde{\Delta}_tΔt 等于 Δt\Delta_tΔt,除了将序列终止 token 的对比值设为零以保证稳定性。原图分布决定了允许的候选集和初始概率,而 Δ~t\widetilde{\Delta}_tΔt 根据视觉证据调整相对概率。

利用全分布的前向 KL 散度将对比塑形的目标蒸馏至学生模型,作用于学生生成响应的每个位置:

LVCSD=TKD2E(P,J)Dyπθ(P,J)[1yt=1yDKL(sg[qt]pθ,t)]\mathcal{L}_{\mathrm{VCSD}} = T_{\mathrm{KD}}^2 \mathbb{E}_{\substack{(P,J)\sim \mathcal{D} \\ y\sim \pi_{\theta}(\cdot |P,J)}} \left[ \frac{1}{|y|} \sum_{t=1}^{|y|} D_{\mathrm{KL}}\left(\operatorname{sg}[q_t^\star] \parallel p_{\theta,t}\right) \right]LVCSD=TKD2E(P,J)Dyπθ(P,J)y1t=1yDKL(sg[qt]pθ,t)

其中 sg[]\operatorname{sg}[\cdot]sg[] 表示停止梯度,TKDT_{\mathrm{KD}}TKD 为蒸馏温度。梯度仅流经学生分布。每次学生更新后,教师参数通过 ϕμϕ+(1μ)θ\phi \leftarrow \mu \phi + (1 - \mu) \thetaϕμϕ+(1μ)θ 更新。

从理论角度看,条件对数比 Δt(v)\Delta_t(v)Δt(v) 充当隐式视觉证据奖励。对比塑形目标对应一步 KL 正则化策略更新的唯一解,其中原图预测作为参考策略。此外,Δt(v)\Delta_t(v)Δt(v) 近似于候选 token 与观测图像之间的条件逐点互信息。最大化该目标鼓励学生在 next-token 分布中保留图像依赖的证据,从而强化对实例特定视觉证据的依赖,同时保留教师编码的流畅性。

实验

实验在 2B 至 9B 规模的 Qwen3-VL 和 Qwen3.5 上评估 VCSD,并在覆盖通用感知、数学、高分辨率和幻觉任务的七项基准上与基线模型和基于答案提示的 OPSD 对比。VCSD 持续优于 OPSD,证明输入条件对比目标比特权答案提示更有效;该方法通过将概率移向图像依赖的 token,稳健地改进视觉定位。消融实验确认合理性支持可防止递归目标扭曲,对比强度在 α=1 附近不敏感,前向 KL 蒸馏最优,而控制图像构造方式基本可互换。原图锚点降低了语言漂移而几乎不影响精度,训练动态显示 VCSD 比 OPSD 更能抵抗后期性能退化。

VCSD 在所有被测的 Qwen3-VL 和 Qwen3.5 模型规模上均持续超越基线模型和 OPSD,平均准确率较基线提升 +1.86% 至 +4.77%。增益涵盖通用视觉感知、数学推理、高分辨率任务和幻觉基准,表明广泛的视觉定位而非孤立的改进。该方法对继续训练表现出更高的鲁棒性,后期退化更少。在 Qwen3-VL-2B 上,VCSD 在每项基准上均优于 OPSD,HallusionBench 提升 +4.32%,MMStar 提升 +3.00%。在 Qwen3.5 模型上,OPSD 较基线无一致增益,而 VCSD 在所有测试规模上均有改进,并在全部六种配置中取得最高综合准确率。

在蒸馏对比塑形目标时,前向 KL 散度持续产生最高综合准确率,优于 Jensen-Shannon 散度和反向 KL。前向 KL 在七项基准中的六项排名第一,表明覆盖众数的目标能更好地为此视觉条件蒸馏任务保留完整的目标分布。前向 KL 取得最佳总体准确率,超出 JSD 0.79 点,超出反向 KL 2.27 点。在七个评估基准中,前向 KL 在六项上居首,而其他替代方案在多数任务中落后。

不同的控制图像构造(纯黑、高斯噪声、高斯模糊和无图像)在七项基准上产生高度相似的平均准确率,均处于不到 0.9 点的狭窄范围内。对比信号对不同退化方式稳健,共同需求是去除实例特定视觉内容而非特定模式。所有四种控制图像变体的综合准确率落在 66.24 至 67.14 之间,差距小于一个点。无论通过纯黑图像、噪声、模糊还是缺失图像来去除内容,均足以实现有效的对比塑形。对比目标对确切的控制构造不敏感,因为定性不同的输入产生可比的结果。

移除 VCSD 中的原图锚点,Qwen3-VL-2B 的综合准确率几乎不变,七项基准差值仅 0.26 点。逐基准偏移小且不一致,表明能力增益来自对比塑形组件而非锚点。锚点主要在训练中正则化语言一致性,如降低的语言漂移所示。无锚点时七项基准平均准确率为 66.78,几乎与完整 VCSD 方法的 67.04 相同。移除锚点使 BLINK 准确率下降 1.42 点、MathVista 下降 0.90 点,但 V* 准确率提升 2.09 点。论文将此结果解释为能力增益主要来自对比塑形,而锚点提升语言稳定性。

在多项基准上对 Qwen3-VL 和 Qwen3.5 模型的实验表明,VCSD 相对于基线带来广泛增益,前向 KL 散度为最佳蒸馏目标。对比信号对控制图像类型不敏感,锚点主要保持语言稳定性而非提升准确率。


用 AI 构建 AI

从创意到上线——通过免费 AI 协同编码、开箱即用的环境和最优惠的 GPU 价格,加速您的 AI 开发。

AI 协同编码
开箱即用的 GPU
最优定价

HyperAI Newsletters

订阅我们的最新资讯
我们会在北京时间 每周一的上午九点 向您的邮箱投递本周内的最新更新
邮件发送服务由 MailChimp 提供