Command Palette
Search for a command to run...
BEACON:洞悉何时以及如何进行智能体视觉推理
BEACON:洞悉何时以及如何进行智能体视觉推理
摘要
智能体视觉推理的根本目标是提升多模态大语言模型(MLLM)在复杂任务上的成功率,而非仅仅为其配备一套复杂但低效的推理范式。本文从工具使用的两个关键维度重新审视智能体视觉推理:模式适应性与工具效果。模式适应性刻画了 MLLM 能否识别何时真正需要工具并相应调用,从而在提升需要工具辅助的难题性能的同时,避免不必要的计算开销。工具效果则刻画了工具使用的实际影响:工具应扩展模型在纯文本推理无法解决的问题上的能力,同时避免在模型已能独立解决的问题上引入额外错误。我们进行了全面分析以量化这两个特性,并通过实验揭示,现有智能体视觉推理模型表现出有限的模式适应性,且工具使用在困难样本上产生的增益,在很大程度上被其在模型已能解决的简单样本上引入的损害所抵消。受这些观察启发,我们提出了 Beacon,一种新颖的智能体视觉推理模型,它实现了更强的整体性能、改进的模式适应性以及真正的工具驱动性能增益。Beacon 的核心在于强化学习阶段中的必要性感知自适应奖励和提示引导能力扩展机制,它们分别鼓励基于任务必要性进行自适应工具调用,并增强模型在最具挑战性问题上的工具使用能力。在多个基准上的广泛实验证明了 Beacon 强大的整体性能及其在模式适应性和工具效果两方面的显著提升。
一句话总结
北京大学及合作者提出 Beacon,一个 agentic 视觉推理模型,在强化学习阶段引入 Necessity-Aware Adaptive Reward 和 Hint-Guided Capability Expansion,使模型能自适应地调用工具,并在复杂任务上实现真正的性能提升,从而克服了先前多模态大语言模型在模式适应性和工具效果方面的局限性。
核心贡献
- 本文引入模式适应性和工具效果,系统评估模型是否恰当地调用工具以及工具使用是否将能力扩展至纯文本推理之外。对现有模型的系统分析表明其适应性有限,且困难问题上的收益往往被简单问题上的损失所抵消。
- 所提出的模型 Beacon 融合了 Necessity-Aware Adaptive Reward 以鼓励基于任务必要性的自适应工具调用,以及 Hint-Guided Capability Expansion 以在强化学习过程中从最困难的样本中恢复学习信号。
- 在 13 个多样化基准上的广泛实验表明,Beacon 取得了强劲的整体性能,模式适应性和工具效果均大幅提升,工具使用带来了真正的能力增益。
引言
作者们研究 agentic 视觉推理,这是一种多模态大语言模型调用外部工具(如用于图像操作和数值计算的 Python 代码)以生成辅助中间结果支持最终答案的范式。先前工作展示了经验上的收益,但很大程度上忽略了模型能否自适应地决定何时真正需要工具,以及工具使用是否真正扩展了非工具推理之外的能力。通过系统评估,作者发现现有模型存在工具调用适应性有限的问题,并且工具使用带来的增益往往被引入的错误所抵消,导致相比纯文本推理几乎没有提升。为此,他们提出 Beacon,该模型通过强化学习框架训练,结合了必要性感知自适应奖励(鼓励仅在问题无法无需工具解决时使用工具)和提示引导的 rollout 策略,使模型在困难问题上接触到有效的工具使用轨迹。Beacon 在 13 个多样的视觉推理基准上取得了最先进的平均性能,并展现出更强的工具调用适应性,同时工具使用的净收益显著更大。
数据集
作者们从开源数据集构建训练数据池,然后根据模型难度将其划分为监督微调(SFT)和强化学习(RL)子集。
-
源数据组成 共 16 个基准和数据集,涵盖真实世界感知、图表理解、OCR、STEM、空间推理和真实世界 agentic 推理。大多数数据集具有人工标注标签。所有与评估测试集重叠的样本均被移除以避免污染。
-
SFT 数据构建 基础模型(Qwen3-VL-8B-Instruct)对每个样本进行五次提示。最多正确回答两次的样本被保留为“困难”样本。 对于每个困难样本,Gemini 3.1 Pro 生成包含 Python 代码和执行输出的代码辅助推理轨迹;仅保留产生正确答案的轨迹。 使用 Gemini 3.1 Pro 进行细化步骤以进一步提升轨迹质量。
-
RL 数据构建 对得到的 SFT 模型在相同数据池上评估,每个样本采样五次响应。模型正确回答不超过三次的样本被选为 RL 训练集。 在 RL 训练过程中,奖励信号同时考虑答案正确性和工具使用的有效性。
-
统计与更多细节 数据集大小和流程的其他细节见表 5 和附录 B。
方法
作者们提出 Beacon,一种视觉-语言模型,学习自主决定何时调用代码执行来进行视觉推理。训练采用 SFT-后-RL 的范式。首先,通过监督微调在合成轨迹上赋予模型基本的代码使用技能。然后,借助必要性感知奖励和提示引导 rollout 机制的强化学习进一步优化模型的自适应推理和工具使用带来的真正收益。
训练数据构建。 数据池由 16 个多样化基准构建,涵盖感知、图表理解、OCR、STEM、空间推理和 agentic 任务。对于 SFT,基础模型(Qwen3-VL-8B-Instruct)在源数据上评估,仅保留具有挑战性的样本(五次尝试中最多正确两次)。专家模型(Gemini 3.1 Pro)为这些困难样本生成代码辅助推理轨迹,并由同一专家模型进一步细化以提升质量。所得轨迹构成 SFT 数据集。对于 RL,将 SFT 模型在相同数据池上评估,未解决的样本(五次中最多正确三次)被选为 RL 训练集。
冷启动 SFT。 使用标准交叉熵损失,代码输出(<tool_call> 和 </tool_call> 之间的内容)被遮蔽。为防止模型偏向代码使用并减轻遗忘,将基础模型生成的少量正确纯文本轨迹注入 SFT 数据。
强化学习。 RL 阶段以 GRPO 为基础算法,并引入两个关键组件。
Necessity-Aware Adaptive Reward (NAAR)。 一个核心挑战是抑制不必要的工具使用而不损害模型用代码解决困难问题的能力。NAAR 为纯文本推理设定软偏好。对于每个 rollout 组,如果存在至少一个正确的纯文本响应,则正确的纯文本响应获得满分奖励(1),而正确的基于代码的响应获得降低的奖励(0.25)。如果没有纯文本响应正确,则正确的基于代码的响应获得满分奖励。这种设计鼓励模型在文本推理足够时避免工具调用,同时仍奖励在文本单独失败时有效的基于代码的解决方案。
Hint-Guided Capability Expansion (HCE)。 策略在有限次 rollout 内无法解决的困难样本提供的学习信号很少。HCE 通过将专家生成的提示注入 rollout prompt 来挽救这些样本。对于每个问题,首先从原始 prompt 采样一组响应。如果全部不正确,则由强大的专家模型(Gemini 3.1 Pro)生成一条验证过的代码辅助推理轨迹,并提取不含答案的提示,仅包含中间指令、预期子目标和工具使用策略。该提示附加到原始问题后,策略在带提示的 prompt 下再采样一组响应。在策略优化时,提示从模型输入中移除,但保留带提示生成的轨迹,从而将能力迁移到无提示的策略。
策略优化。 每个响应的奖励结合了格式奖励(确保每个代码块后跟一个观察结果,最终答案放在 <answer>...</answer> 中)和自适应奖励:
对于每个组,计算组内相对优势。actor 损失采用裁剪的 GRPO 目标。对于正常组,重要性采样比使用原始 prompt 计算;对于带提示组,比为当前策略使用原始 prompt,同时保持旧策略上下文中带提示的 prompt,确保离策略稳定性。训练中过滤掉未提供准确度优势(所有响应全对或全错)或无自适应优势(所有响应采用相同推理模式)的组。
实验
实验首先评估现有 agentic 视觉推理模型的工具使用行为,揭示它们表现出有限的模式适应性和微弱的工具使用净收益,往往无法根据问题难度调整推理模式。随后,Beacon 在多样化的挑战性基准上接受评估,它持续优于开源基线,且相比其基础模型平均提升 6.07 分。Beacon 的设计融合了必要性感知自适应奖励和提示引导的能力扩展,带来了最强的模式适应性和工具带来增益与损害之间的明确正差距,证明它能够有效利用工具解决困难问题而不损害简单问题的性能。
在高分辨率视觉搜索和空间推理基准上,闭源模型 Gemini 3.1 pro 取得了最高的总体平均分,在困难的 BabyVision 感知任务上领先尤其明显。在开源模型中,Beacon-RL-8B 提供了最佳平均性能,在 13 个基准中的 11 个上排名第一,相比其基础模型 Qwen3-VL-8B-Instruct 提升了 6.07 分。虽然基础模型已展现出较强的视觉搜索结果,但所有开源模型在 BabyVision 上均表现挣扎,得分低于 15%。Gemini 3.1 pro 以平均 73.66 分领先所有模型,其 BabyVision 得分 48.45 远超任何开源竞争对手。Beacon-RL-8B 相比 Qwen3-VL-8B-Instruct 平均提升 6.07 分,在 13 个基准中的 11 个上获得开源排名第一。Qwen3-VL-8B-Instruct 在列出的开源模型中取得了最佳的高分辨率视觉搜索成绩,V* 为 84.85,HR-Bench 4K 为 78.13。BabyVision 是最具挑战性的基准:所有开源模型得分均低于 15%,而 Gemini 3.1 pro 达到 48.45。
开源模型 Beacon-RL-8B 平均得分 50.04,在开源条目中领先,比其 Qwen3-VL-8B-Instruct 基础模型提升 6.07 分,并在 13 个基准中的 11 个上排名第一。闭源模型 Gemini 3.1 Pro 平均 76.23 分远超所有模型,其他开源模型中,Qwen3-VL-8B-Instruct (43.97) 优于 Pixel-Reasoner-7B (38.11) 和 Thyme-7B (33.76)。Beacon-RL-8B 取得了开源最高平均分(50.04),比其基础模型 Qwen3-VL-8B-Instruct (43.97) 高 6.07 分。Gemini 3.1 Pro 以 76.23 领先,在 GameQA(81.00 对 Qwen3-VL-8B-Instruct 的 36.70)和 TIR-Bench(47.57 对 19.01)上差距尤为巨大,表明组合性和 agentic 推理对开源模型而言难度很高。
Beacon 在评估模型中展现出最强的模式适应性和工具效果。当工具可用时,它持续提高其无工具推理准确率,实现了最大的平均准确率增益(+1.96%)和最高的工具带来增益与损害之间的正差距(Δ_TE = +3.14%)。相比之下,其他模型仅表现出微弱的工具收益和接近零的工具效果差异。Beacon 在 HRBench4K 上实现了 100% 的 Text-Retain,即所有通过纯文本推理解决的问题在工具可用时仍保持正确,而其他模型的保留率较低。Beacon 的工具效果优势(Δ_TE)在 HRBench4K 上达到 +5.51,总体平均 +3.14%,远超竞争模型接近零的数值,表明工具使用有效且损害最小。
结合必要性感知自适应奖励和提示引导能力扩展的完整 Beacon 方法取得了最高的总体准确率。单独使用自适应奖励可获得最佳模式适应性,而添加提示引导能力扩展则相比 GRPO 基线持续提升工具效果指标。二者结合产生了工具带来增益与损害之间最大的正差距。仅使用必要性感知自适应奖励即可获得最高的模式适应性得分,显著高于仅 GRPO 基线。向 GRPO 添加提示引导能力扩展提升了工具效果指标,表明工具使用更有效。融合两个组件的完整方法在基准测试中取得了最佳平均总体准确率和最大的工具效果正差距。
评估涵盖高分辨率视觉搜索、空间推理和组合性 agentic 基准,比较闭源 Gemini 3.1 Pro 与开源视觉-语言模型。Gemini 3.1 Pro 总体占优,尤其在困难的 BabyVision 感知任务上,而开源模型中,Beacon-RL-8B 取得最高平均分并优于其基础模型 Qwen3-VL-8B-Instruct。Beacon 进一步展现出最强的模式适应性和工具使用,融合必要性感知自适应奖励和提示引导能力扩展的完整方法取得了最佳总体准确率和工具带来增益与损害之间最大的正差距。