HyperAIHyperAI

Command Palette

Search for a command to run...

VAD:多模态同策略蒸馏中面向目标重构的视觉证据归因

摘要

多模态同策略蒸馏(OPD)通过使用特权视角教师监督学生生成的轨迹来传递细粒度视觉知识。然而,其逐 token 校正信号是来源混合的,将视觉信号与语言先验及教师特有效应结合在一起。关键挑战在于估计哪些校正有视觉证据支持,而不仅仅是确定在何处或以多大强度进行蒸馏。我们提出视觉归因蒸馏(VAD),这是一种反事实目标重构算法,用于估计教师校正中可归因于视觉的部分。在每个学生生成的前缀处,VAD 分别在相关证据存在和移除的条件下评估同一个固定教师。中心化对数概率的相应变化定义了 ut,这是一个带符号的视觉证据方向代理量,用于估计揭示性证据如何支持或反驳候选 token。VAD 将原始校正投影到该代理量上,以获得与干预对齐的分量和一个代理量无法解释的残差,然后从前一分量重构出以学生为锚点的目标。在训练过程中,这一重构目标提供主要的监督信号,而特权教师则贡献一个弱正则化项。在 4B 和 9B 规模的六个细粒度视觉基准上,VAD 均优于直接特权视角蒸馏和视觉优势加权方法。Token 级别和受控目标分析表明,与代理量对齐的分量富含任务相关的视觉校正,并能产生更强的目标偏移,尤其是在证据反驳错误答案时。这些结果支持将反事实目标重构作为来源混合监督的一种有效替代方案。

一句话总结

来自上海交通大学、小红书、香港中文大学、浙江大学和东南大学的研究团队提出了视觉归因蒸馏(VAD),这是一种反事实目标重建方法,通过反事实评估固定教师模型来计算有符号代理量 utu_tut,从而在多模态在策略蒸馏中分离视觉证据,然后从代理对齐分量中重建学生锚定目标,并在六个细粒度视觉基准上证明,在4B和9B规模下,VAD 优于直接特权视角蒸馏和视觉优势加权。

核心贡献

  • 视觉归因蒸馏(VAD)通过对比教师模型在证据存在和移除时的输出,估计教师校正中可归因于视觉的部分,并定义有符号代理量 utu_tut,随后将原始校正投影到该代理量上,重建学生锚定目标。
  • VAD 丢弃了无法由受控证据解释的教师变化,仅使用与干预对齐的分量,从而避免了先前在策略蒸馏方法中源混合的监督问题。
  • 在4B和9B规模下的六个细粒度视觉基准上,VAD 优于直接特权视角蒸馏和视觉优势加权,而 token 级别和受控目标分析表明,代理对齐分量丰富了任务相关的视觉内容,并增强了正确 token 的促进和错误 token 的抑制。

引言

多模态大语言模型(MLLMs)经常失败,因为细微的感知错误(一个遗漏的单词、混淆的属性或误读的空间关系)会级联成流畅但无视觉根据的响应。通过更强的教师模型进行在策略蒸馏可以通过在自己的生成回滚上监督学生来缓解这些错误,但现有的特权视角方法要么蒸馏教师完整的下一 token 分布,这混合了视觉和非视觉校正,要么应用视觉优势加权,但仍然留下源混合信号,无法恰当地捕捉基于证据的错误 token 驳斥。作者提出了视觉归因蒸馏(VAD)来分离视觉校正:对于每个学生前缀,他们用和不用细粒度证据视图查询同一个教师,推导出一个有符号代理方向,指示哪些候选 token 得到证据支持或反驳,然后仅使用代理对齐分量重建学生锚定目标,同时保留一个弱正则化项。VAD 明确地将视觉支持与反驳分离,在六个细粒度视觉基准上,对于4B和9B学生模型,均优于直接教师匹配和视觉优势加权。

方法

作者提出了视觉归因蒸馏(VAD),一种从在策略学生前缀中学习,同时仅利用反事实教师视图构建监督目标的方法。该方法的流程概念如下图所示。

过程从生成在策略反事实视图开始。设 x0x^0x0 表示学生可用的完整图像。学生策略 πθ\pi_\thetaπθ 采样一个响应 yπθ(x0)y \sim \pi_\theta(\cdot | x^0)yπθ(x0),所有教师查询都重用学生前缀 y<ty_{<t}y<t。初始模型的一个固定副本 πθˉ\pi_{\bar{\theta}}πθˉ 作为教师。作者构建了两个仅用于训练的视图:一个证据存在的裁剪 x+x^+x+ 和一个证据移除或降质的裁剪 xx^-x。在位置 ttt,三个下一 token 分布计算如下:

pS0=πθ(x0,y<t),pT+=πθˉ(x+,y<t),pT=πθˉ(x,y<t).\begin{array}{r} p_S^0 = \pi_\theta(\cdot | x^0, y_{<t}), \\ p_T^+ = \pi_{\bar{\theta}}(\cdot | x^+, y_{<t}), \\ p_T^- = \pi_{\bar{\theta}}(\cdot | x^-, y_{<t}). \end{array}pS0=πθ(x0,y<t),pT+=πθˉ(x+,y<t),pT=πθˉ(x,y<t).

由于教师参数和文本前缀完全相同,差异 pT+pTp_T^+ - p_T^-pT+pT 分离出当相关视觉证据可见时教师分布变化的响应。训练实现中,所有三个分布都在一个紧凑的共享坐标集 VtV_tVt 上评估,该集合由学生的 top-K 候选项构建。每个受限分布被映射到 RVt\mathbb{R}^{|V_t|}RVt 中的中心化对数概率向量:

ϕt(p)=log(p[Vt]+ϵ)mean(log(p[Vt]+ϵ)).\phi_t(p) = \log(p[V_t] + \epsilon) - \text{mean}(\log(p[V_t] + \epsilon)).ϕt(p)=log(p[Vt]+ϵ)mean(log(p[Vt]+ϵ)).

中心化消除了一个共同的对数偏移,同时保留了共享支持上的成对对数几率。

接下来,作者将教师校正归因于视觉证据。特权教师校正及其对视觉干预的响应定义为:

rt=ϕt(pT+)ϕt(pS0),ut=ϕt(pT+)ϕt(pT).r_t = \phi_t(p_T^+) - \phi_t(p_S^0), \qquad u_t = \phi_t(p_T^+) - \phi_t(p_T^-).rt=ϕt(pT+)ϕt(pS0),ut=ϕt(pT+)ϕt(pT).

这里,rtr_trt 表示特权教师指定的完整校正。向量 utu_tut 作为位置 ttt 处核心视觉信息的代理。rtr_trt 中与该视觉响应一致的部分通过单侧投影保留:

βt=[rt,ut]+ut22+ζ,rtvis=βtut,rtres=rtrtvis,\beta_t = \frac{[\langle r_t, u_t \rangle]_+}{\|u_t\|_2^2 + \zeta}, \qquad r_t^{\text{vis}} = \beta_t u_t, \qquad r_t^{\text{res}} = r_t - r_t^{\text{vis}},βt=ut22+ζ[⟨rt,ut]+,rtvis=βtut,rtres=rtrtvis,

其中 [a]+=max(a,0)[a]_+ = \max(a, 0)[a]+=max(a,0)ζ\zetaζ 稳定投影。如果 rtr_trtutu_tut 不一致,则 βt=0\beta_t = 0βt=0,不应用视觉偏移。这就产生了一个单侧监督目标:

qT,tone=softmax(ϕt(pS0)+clip(rtvis,c,c)).q_{T,t}^{\text{one}} = \text{softmax}(\phi_t(p_S^0) + \text{clip}(r_t^{\text{vis}}, -c, c)).qT,tone=softmax(ϕt(pS0)+clip(rtvis,c,c)).

与直接教师匹配不同,该目标从学生当前分布出发,仅改变归因于视觉干预的 token 几率。

为了进一步细化目标,一个轻量级的预算支持与抑制机制将支持和抑制坐标解耦。作者定义:

ut+=[ut]+,ut=[ut],st±=[rt,ut±]+,Zt=st++st+ϵ,ωt+=min(st+Zt,τ+),ωt=stZt,\begin{array}{c} u_t^+ = [u_t]_+, \qquad u_t^- = [u_t]_-, \qquad s_t^\pm = [\langle r_t, u_t^\pm \rangle]_+, \\ Z_t = s_t^+ + s_t^- + \epsilon, \qquad \omega_t^+ = \min\left(\frac{s_t^+}{Z_t}, \tau_+\right), \qquad \omega_t^- = \frac{s_t^-}{Z_t}, \end{array}ut+=[ut]+,ut=[ut],st±=[⟨rt,ut±]+,Zt=st++st+ϵ,ωt+=min(Ztst+,τ+),ωt=Ztst,

其中 [ut]+=max(ut,0)[u_t]_+ = \max(u_t, 0)[ut]+=max(ut,0)[ut]=min(ut,0)[u_t]_- = \min(u_t, 0)[ut]=min(ut,0)。一致性分数将视觉校正预算 Bt=rtvis2B_t = \|r_t^{\text{vis}}\|_2Bt=rtvis2 分配到两个有符号分支。最终的校正和目标为:

rtVAD=Bt(ωt+ut+ut+2+ϵ+ωtutut2+ϵ),qT,tVAD=softmax(ϕt(pS0)+clip(rtVAD,c,c)).\begin{array}{rl} r_t^{\text{VAD}} &= B_t \left(\omega_t^+ \frac{u_t^+}{\|u_t^+\|_2 + \epsilon} + \omega_t^- \frac{u_t^-}{\|u_t^-\|_2 + \epsilon}\right), \\ q_{T,t}^{\text{VAD}} &= \text{softmax}(\phi_t(p_S^0) + \text{clip}(r_t^{\text{VAD}}, -c, c)). \end{array}rtVADqT,tVAD=Bt(ωt+ut+2+ϵut++ωtut2+ϵut),=softmax(ϕt(pS0)+clip(rtVAD,c,c)).

最后,建立训练目标和推理过程。给定重建目标 qqq 和学生分布 ppp,令 m=(q+p)/2m = (q + p) / 2m=(q+p)/2。主要监督是标准的 token 级别 Jensen-Shannon 目标:

Lvis=1TtTDJS(stopgrad(qT,tVAD),pS0),\mathcal{L}_{\text{vis}} = \frac{1}{|\mathcal{T}|} \sum_{t \in \mathcal{T}} D_{\text{JS}}(\text{stopgrad}(q_{T,t}^{\text{VAD}}), p_S^0),Lvis=T1tTDJS(stopgrad(qT,tVAD),pS0),

其中 T\mathcal{T}T 是有效响应位置集。单独使用 Lvis\mathcal{L}_{\text{vis}}Lvis 可能导致语言和输出漂移。为缓解此问题,作者添加了一个弱特权教师正则化项。其 token 权重在完整校正中视觉归因部分较小时更大:

ρt=rtVAD2rt2+ϵ,at=stopgrad(clip(1ρt,0,1)),Lreg=1TtTatDJS(stopgrad(pT+),pS0),L=Lvis+λLreg.\begin{array}{rl} \rho_t &= \frac{\|r_t^{\text{VAD}}\|_2}{\|r_t\|_2 + \epsilon}, \qquad a_t = \text{stopgrad}(\text{clip}(1 - \rho_t, 0, 1)), \\ \mathcal{L}_{\text{reg}} &= \frac{1}{|\mathcal{T}|} \sum_{t \in \mathcal{T}} a_t D_{\text{JS}}(\text{stopgrad}(p_T^+), p_S^0), \qquad \mathcal{L} = \mathcal{L}_{\text{vis}} + \lambda \mathcal{L}_{\text{reg}}. \end{array}ρtLreg=rt2+ϵrtVAD2,at=stopgrad(clip(1ρt,0,1)),=T1tTatDJS(stopgrad(pT+),pS0),L=Lvis+λLreg.

该正则化项弱锚定语义、格式、响应长度和停止,同时保留重建的视觉目标作为主要信号。所有目标侧量在优化过程中被分离。推理时,VAD 作为标准全图学生策略运行,不引入额外的模型调用或视觉视图。

实验

在4B和9B规模的 Qwen3.5 模型上评估视觉归因蒸馏(VAD),这是一种后训练方法,使用反事实图像裁剪将教师校正归因于视觉证据,然后重建最终的学生目标。在匹配数据和计算量下,VAD 在一系列细粒度视觉基准上始终优于替代目标甚至更大的模型,同时在保留任务上保持基础泛化水平。分析表明,归因校正选择性地集中了视觉属性和决策语义,且该方法对超参数选择具有鲁棒性,Jensen-Shannon 散度在各项任务中提供了最均衡的结果。

VAD 在所有比较模型中实现了最高的细粒度感知平均分,在4B规模上超过闭源 Gemini 3 Flash 1.0 分,在9B规模上超过 2.6 分。在匹配数据和后训练预算下,VAD 始终领先其他基于 Qwen3.5 的方法,且其相对于正则化单侧投影及其仅目标变体的增益体现了联合归因重建和弱正则化的益处。VAD 在4B规模上达到 Avg₆ 78.32,在9B规模上达到 79.93,超过最佳闭源基线 Gemini 3 Flash(77.32)和最强的“带图像思考” Agent SenseNova-MARS(72.10)。在受控的 Qwen3.5 家族内,VAD 在4B规模上比次优方法高 0.80 分,其消除目标变体仅高出 0.26 分,表明完整蒸馏目标的价值。

将蒸馏目标从直接教师分布逐步细化到标量收缩、单侧,最终到完整的 VAD 目标,在多个基准上稳定提升准确率,完整 VAD 达到最高平均分。弱教师锚定为单侧和 VAD 目标均提供了一致的增量改进,VAD 方向在 token 级别的支持和抑制上带来了最大的有利变化。完整 VAD 达到 78.32% 的平均准确率,比正则化单侧投影高 0.80 分,比未正则化 VAD 目标高 0.26 分。添加弱正则化将单侧目标从 77.06% 提升到 77.52%,VAD 从 78.06% 提升到 78.32%,显示出持续的小幅增益。VAD 目标相对于直接教师分布,在正确 token 支持(+7.89 分)和错误 token 抑制(+6.61 分)的综合改进上最大。

在评估的后训练视觉模型中,VAD 是唯一在两个测试规模上均保持或略高于基础模型保留任务泛化性能的方法,而其他所有方法都有不同程度的平均性能退化。分解式 OPD 在小规模上接近,但在大规模上出现显著下降,更简单的后训练变体表现更明显的衰减。VAD 在4B和9B规模上均取得了相对于规模匹配基础模型的正面增益,使其成为唯一在保留基准上实现净改进的后训练方法。分解式 OPD 在4B规模上几乎与基础模型持平,但在9B规模上显著落后。其他后训练方法(如 GRPO 和 VA-OPD)始终将保留平均分数降低到基础水平以下。

对称 Jensen-Shannon 散度在4B和9B模型规模下,在六个细粒度基准上都取得了最高的综合准确率。JSD 在大多数单项任务上领先,但 Reverse KL 在9B规模下的 HRBench-8K 和 MME-EN 上展现出竞争力。Forward KL 在总体平均分上始终逊于其他两种散度。JSD 在两个规模下获得了最佳平均分,在4B规模下领先六个基准中的五个,在9B规模下领先四个。在4B规模下,Forward KL 在 V* 上略优于 JSD,但 JSD 在所有其他任务上明显领先。在9B规模下,Reverse KL 在 HRBench-8K 和 MME-EN 上超过了 JSD,缩小了差距但未能克服 JSD 的总体优势。Forward KL 在两个模型规模下都产生了最低的总体平均分,均落后于对称和反向 KL 变体。

本文评估了 VAD,一种视觉后训练方法,它联合重建 token 归因并应用弱正则化,在六个细粒度感知基准和保留任务泛化上进行了测试。VAD 超越了所有比较模型,包括闭源 Gemini 3 Flash 和其他基于 Qwen3.5 的方法,并且是唯一在保留数据上保持或改进基础模型的后训练技术。消融研究证实,使用 Jensen-Shannon 散度的完整 VAD 目标提供了正确 token 支持和错误 token 抑制的最佳平衡,从而实现了最高的平均准确率。


用 AI 构建 AI

从创意到上线——通过免费 AI 协同编码、开箱即用的环境和最优惠的 GPU 价格,加速您的 AI 开发。

AI 协同编码
开箱即用的 GPU
最优定价

HyperAI Newsletters

订阅我们的最新资讯
我们会在北京时间 每周一的上午九点 向您的邮箱投递本周内的最新更新
邮件发送服务由 MailChimp 提供