HyperAIHyperAI

Command Palette

Search for a command to run...

Evidence-RL:迈向证据密集型的视觉推理

Haojie Huang Xinlei Yu Chengming Xu Zhangquan Chen Cheng Yang Qingdong He Yu Yang Jiangning Zhang Xiaobin Hu

摘要

视觉语言模型(VLM)应基于具体的图像证据作答,而非依赖语言先验、数据集捷径或不相关的视觉上下文。现有的感知感知型后训练方法通过全局扰动或注意力代理来鼓励图像利用,但并未检验采样得到的答案是否因果地依赖于支撑该答案的局部证据。我们提出反事实证据解耦(CED),一种用于 VLM 接地的训练时证据审计方法。对于每个回答,CED 会中和一个以对象为中心的证据区域,并将其导致的支撑度下降与匹配的非证据区域进行比较。我们将该信号与答案正确性结合在 GRPO 框架内,奖励那些依赖证据路径而非捷径或干扰路径的正确回答。CED 使用弱对象级提议,无需问题特定的证据标注,且不增加推理时开销。在九个公开基准和四种骨干模型上,CED 均优于先前基于强化学习的后训练方法,针对性的分析验证了其以对象为中心的信号。

一句话总结

新加坡国立大学、浙江大学及其合作者提出反事实证据解耦 (Counterfactual Evidence Disentanglement, CED),这是一种训练时证据审计方法,它中和对象级证据区域,并度量其支持度下降相对于非证据区域的程度,将这一信号与答案正确性一起融入 GRPO 中,以此奖励依赖证据的答案,无需问题特定标注或推理开销,并在九个基准上展示其优于先前基于强化学习的后训练方法的表现。

核心贡献

  • 提出反事实证据解耦 (CED) 作为一种训练时审计方法,测量 VLM 对对象级证据的因果依赖。它中和证据区域,将支持度下降与匹配的非证据区域进行比较,仅使用弱对象提议,无需问题特定标注。
  • CED 被集成到 GRPO 中,构成 EVIDENCE-RL 后训练框架,该框架奖励正确且高证据依赖度的答案,且不增加推理时开销。
  • 在四个模型主干和九个基准上,EVIDENCE-RL 优于先前的基于 RL 的后训练方法;收益来源于对象中心的证据依赖,同时文本推理能力得以保持,在八个文本基准上平均准确率变化为 −0.27 个百分点。

引言

视觉语言模型 (Vision-language models, VLM) 正越来越多地被部署为通用视觉推理器,然而它们看似正确的答案往往依赖于语言先验或数据集捷径,而非图像中实际的视觉证据。这种缺乏依据的现象持续存在,因为仅观察文本输出的后训练信号无法区分正确答案是由相关证据导致,还是由非证据路径导致,作者将这一问题形式化为证据封闭自演化 (evidence-closed self-evolution)。先前的感知觉知方法如 PAPO 和 VPPO 重新引入图像信息,但仅通过全局扰动或注意力代理针对粗略的视觉依赖,而非特定局部的证据,一旦移除该证据便会改变答案。作者提出反事实证据解耦 (CED),这是一种训练时诊断方法,测试当针对性的证据区域被中和时,模型对答案的支持是否比中和匹配的非证据区域时下降更多,具体通过视觉 tokens 的结构化均值替换来实现。CED 与 GRPO 结合后,在不增加问题特定标注或推理开销的情况下,奖励具有因果图像依据的正确答案。

方法

作者提出 EVIDENCE-RL,一种后训练框架,旨在让视觉语言模型依据特定的视觉证据,而非依赖语言先验或无关上下文。为形式化该问题,他们分解了导向候选答案的因果路径。候选答案可能由目标视觉证据支持,也可能由无关视觉上下文、或由语言与世界先验支持。标准的后训练信号通常无法区分这些路径,因为它们最终导出相同的观测输出。下图中的定性案例展示了所提机制如何将原本由捷径先验驱动的答案重定向至视觉证据。

EVIDENCE-RL 通过引入反事实证据解耦 (CED) 来解决这一歧义,CED 测试响应是否特定依赖于证据路径。整体训练流程总结在框架图中。

给定图像 III、问题 qqq 以及由策略模型采样的候选答案 yyy,框架识别出一个提议的证据区域 Ωev\Omega^{\mathrm{ev}}Ωev 以及 KKK 个非证据区域 {Ωknon}k=1K\{\Omega_k^{\mathrm{non}}\}_{k=1}^K{Ωknon}k=1K。证据区域是一个从数据集元数据(如对象级标注)解析出的弱空间提议。非证据区域作为样本局部的零分布,其面积与证据区域匹配,且在空间上与证据区域分离。

为了测量证据敏感性,作者在空间合并后的特征空间进行干预。对于某个区域 Ω\OmegaΩ,其视觉 tokens 被替换为邻居 tokens 的均值 μT\boldsymbol{\mu}_TμT

h~i={μTif iT(Ω),hiotherwise,\tilde{\mathbf{h}}_i = \begin{cases} \boldsymbol{\mu}_T & \text{if } i \in \mathcal{T}(\Omega), \\ \mathbf{h}_i & \text{otherwise}, \end{cases}h~i={μThiif iT(Ω),otherwise,

其中 T(Ω)\mathcal{T}(\Omega)T(Ω) 将空间区域映射到视觉 token 索引。这种特征空间均值替换移除了区域特定信息,同时保留了局部表示流形,相比置零或注入噪声减少了伪影。

yyy 对区域 Ω\OmegaΩ 的证据敏感性定义为反事实对数似然下降:

s(Ω)=logπθ(yI,q)logπθ(yI~Ω,q).s(\Omega) = \log \pi_\theta(y \mid I, q) - \log \pi_\theta(y \mid \tilde{I}_{\setminus \Omega}, q).s(Ω)=logπθ(yI,q)logπθ(yI~Ω,q).

如果模型无需检查 Ω\OmegaΩ 即可支持 yyy,则 s(Ω)s(\Omega)s(Ω) 接近零。为获得有界且对比性的分数,框架比较证据区域敏感性与参考区域敏感性,计算证据裕度 (evidence margin):

m(I,q,y)=tanh(s(Ωev)μ(snon)σ(snon)+ϵ),m(I, q, y) = \tanh \left( \frac{s(\Omega^{\mathrm{ev}}) - \mu(s^{\mathrm{non}})}{\sigma(s^{\mathrm{non}}) + \epsilon} \right),m(I,q,y)=tanh(σ(snon)+ϵs(Ωev)μ(snon)),

其中 snon={s(Ωknon)}k=1Ks^{\mathrm{non}} = \{s(\Omega_k^{\mathrm{non}})\}_{k=1}^Ksnon={s(Ωknon)}k=1Kμ(snon)\mu(s^{\mathrm{non}})μ(snon)σ(snon)\sigma(s^{\mathrm{non}})σ(snon) 为非证据区域的均值和标准差。正向裕度表明候选答案相比于面积匹配的非证据区域,更多地依赖于所提议的证据区域。

激励该方法的因果分解详述于下图。

最后,作者将该裕度作为以正确性为锚的奖励,集成到群体相对策略优化 (Group Relative Policy Optimization, GRPO) 中。训练奖励定义为:

Rtrain=Ransg(m)+εtiem,g(m)=12(1+tanh(mτg)),R_{\mathrm{train}} = R_{\mathrm{ans}} \cdot g(m) + \varepsilon_{\mathrm{tie}} m, \qquad g(m) = \frac{1}{2} \left( 1 + \tanh \left( \frac{m}{\tau_g} \right) \right),Rtrain=Ransg(m)+εtiem,g(m)=21(1+tanh(τgm)),

其中 τg=0.20\tau_g = 0.20τg=0.20εtie=0.10\varepsilon_{\mathrm{tie}} = 0.10εtie=0.10RansR_{\mathrm{ans}}Rans 是答案正确性得分。当答案正确时,g(m)g(m)g(m) 倾向于拥有更强证据区域支持的响应。当答案错误时,证据项作为有界平局决胜因子。经过组内归一化后,正确性仍是主导梯度驱动因素,而 CED 根据证据支持度对同等正确的 rollout 进行排序。

实验

实验证实,反事实奖励提供了细粒度证据依赖信号,使 RL 能够在九个基准上改善视觉依据,且无负迁移,优于匹配的主干模型及近期基线。去除该信号会导致一般推理上的净负 delta;Answer-CED 变体避免了思维链长度的奖励黑客行为,并跨模型系列泛化。鲁棒性测试表明奖励依赖于结构化的局部干预,并在扰动下保持稳定。

计数任务呈现高奖励方差和频繁的奖励冲突,而存在性任务表现为低方差但强负向效应。CoT-CED 在计数任务上遭遇思维链长度坍缩,而 Answer-CED 通过仅对最终答案片段评分来避免此问题。在计数任务上,99.5% 的样本产生非常值原始奖励,且 90% 的样本对相同答案获得不同奖励,表明信号灵敏度高。存在性任务显示 79% 的零方差奖励和平均 0.777 的负向效应,反映出稳定但对极性敏感的信号。CoT-CED 思维链在计数任务上缩减至平均 3.6 个 token,退化为对象线索简写而非有依据的推理。Answer-CED 通过仅对最终答案片段评分,消除了思维链长度自由度,防止通过提前截断进行的奖励黑客行为。

所提出的 Answer-CED 方法在所有比较模型中取得了最高平均分数和相对于其 Qwen2.5-VL-7B 基线的最大平均提升。它是唯一基于 RL 且从未降低性能的方法,收益集中在如 VLMsAreBlind 和 FREAK 等感知密集型基准上,而一般推理任务保持稳定。这表明该奖励成功鼓励了对视觉证据的依赖,而没有牺牲广泛的迁移性。该方法取得了最高平均分数和相对于共享的 Qwen2.5-VL-7B 基线的最大平均改善,同时超越了 VLM 主干和 RL 基线。它是唯一在所有九个基准上性能变化非负的 RL 方法,在感知密集型任务上获益最大。

在匹配的数据、模型和计算条件下,仅 Answer-CED 在依据和一般推理基准上均产生正向迁移。仅正确性方法和 VPPO 改进了依据但损害了一般推理,导致净负平均增益,而 PAPO 因重复循环而严重退化。Answer-CED 平均优于仅正确性基线 12.58 分,尤其是在 FREAK 和 Hallusion 等证据敏感任务上改善最大。Answer-CED 在所有九个基准上均相对于仅正确性基线取得改善,平均增益达 12.58 分。仅正确性方法和 VPPO 相对于冻结基线产生负的平均 delta,因为依据基准上的收益被一般推理上的下降所抵消。

该方法在所示的两个 Qwen2.5-VL 主干上的每个基准均取得非负增益,最大绝对改善出现在视觉依据任务上。在 Qwen2.5-VL-3B 上,九个基准的平均改善为 4.59 分,主要源于 FREAK 和 VLMsAreBlind 的强劲增益,而 CountBench 保持不变。在 Qwen2.5-VL-3B 上,FREAK 提升 14.37 分,VLMsAreBlind 提升 7.05 分,而 CountBench 无变化 (0.00)。Qwen2.5-VL-3B 的所有九个基准的 delta 均为非负,得出平均增益 4.59 分。

Answer 变体在 Qwen3.5-9B 上产生的平均增益 (+11.34) 略高于 CoT 变体 (+10.60),并且对如 MMMU 等一般推理基准的迁移更强。尽管 CoT 在训练中获得更大奖励,但它遭受奖励黑客行为,模型缩短推理轨迹,削弱了视觉依据和下游性能;Answer 通过仅评分最终答案避免了这一点。Answer-CED 在 MMMU 上超过 CoT-CED 超过 7 分 (75.67 vs. 68.23),展示出更好的复杂多模态推理迁移。CoT-CED 在依据基准如 SpatialEval (92.90 vs. 93.90) 和一般推理任务如 MathVista (81.88 vs. 83.75) 上均落后于 Answer-CED,因为其思维链长度操纵削弱而非强化了视觉依据。

评估框架将 Answer-CED 与 CoT-CED 及其他基于 RL 的基线进行比较,分析了跨多个视觉语言模型的奖励信号属性和思维链长度行为。Answer-CED 仅对最终答案片段评分,避免了 CoT-CED 在高方差计数任务上的思维链长度坍缩和奖励黑客行为,同时在存在性任务上保持稳定且对极性敏感的信号。在所有实验中,Answer-CED 是唯一从未降低性能的方法,在视觉依据基准上实现正向迁移而不损害一般推理,并且它在感知密集型和多模态推理任务上始终优于仅正确性基线及 CoT-CED 基线。


用 AI 构建 AI

从创意到上线——通过免费 AI 协同编码、开箱即用的环境和最优惠的 GPU 价格,加速您的 AI 开发。

AI 协同编码
开箱即用的 GPU
最优定价

HyperAI Newsletters

订阅我们的最新资讯
我们会在北京时间 每周一的上午九点 向您的邮箱投递本周内的最新更新
邮件发送服务由 MailChimp 提供