Command Palette
Search for a command to run...
测试时 AI 赋能 AI:通过推理框架实现强到弱的能力迁移
测试时 AI 赋能 AI:通过推理框架实现强到弱的能力迁移
Cheng Qian Wenting Zhao Liangwei Yang Heng Wang Jielin Qiu Heng Ji Silvio Savarese Huan Wang Shelby Heinecke
摘要
近期关于知识蒸馏的研究通常通过教师强制、在线策略蒸馏等训练时方法,更新较小模型的参数,从而将大模型的能力迁移至小模型。本文探讨这种迁移能否在测试时实现。我们研究了强到弱的推理框架搭建:即一个更强的构建者模型能否在不更新任何参数的情况下,构建出推理时框架,帮助一个较弱的目标模型更可靠地完成任务。在四个具有代表性的心智理论基准测试中,每个构建者模型使用 5% 的数据作为验证集,在多轮迭代中优化其框架,最终将定型的框架在完整测试集上进行评估。实验表明,这种测试时能力迁移形式非常有效,将目标模型的平均性能从 0.49 几乎翻倍提升至 0.91。我们的分析显示,性能提升主要源于将不稳定的模型推理卸载到确定性代码中、针对特定基准的路由以及严格的答案格式约束,而非鼓励目标模型进行更广泛的推理或采样。我们进一步发现,构建者模型的推理投入能单调地提升框架质量,平台效应相对于构建者模型自身的能力而言较为温和,而较弱的目标模型获得了最大的收益。这些结果表明,推理时框架设计是对传统训练时蒸馏的重要补充,使强模型能够在不重新训练的情况下,将认知结构迁移给弱模型。
一句话总结
Salesforce AI Research 和伊利诺伊大学香槟分校提出了强到弱支架方法,这是一种测试时能力转移方法,其中更强的构建模型构建推理时支架,允许较弱的目标模型在无需任何参数更新的情况下,将其在心理理论基准上的平均性能从 0.49 几乎翻倍至 0.91,方法是将不稳定的模型推理转移到确定性代码、基准特定的路由和严格的答案格式执行中。
核心贡献
- 论文研究了强到弱支架方法,这是一种测试时范式,其中更强的构建模型构建推理时支架,帮助较弱的目标模型在无需参数更新的情况下解决任务。
- 在四个心理理论基准上,仅使用 5% 的数据作为验证集,构建模型迭代地改进支架,并将目标模型的平均准确率从 0.49 几乎翻倍至 0.91。
- 分析表明,这些收益来自将不稳定的模型推理转移到确定性代码、基准特定的路由和严格的答案格式执行中。构建模型的推理努力单调地提高支架质量,而较弱的目标模型获得最大的收益。
引言
作者研究了一种模型蒸馏的实用替代方案:不是训练一个弱模型来匹配强模型,而是让一个强构建模型构建一个推理时支架(路由、提示、确定性求解器、验证、格式执行),使得任务对于固定的弱目标模型更容易。先前的工作要么通过蒸馏或微调更新模型参数,要么通过提示和工具使用提高单个模型的推理能力,但不会在没有训练的情况下跨模型转移能力。关键贡献在于将强到弱支架方法形式化为一种独特的推理时转移设置,并在心理理论基准上提供了系统的实证分析,表明精心设计的支架可以通过外化结构化推理,而不是依赖更多的训练数据或更长的模型推理,显著提高弱模型的准确率(例如,从 0.49 到 0.91)。
方法
作者提出了一个自动支架构建框架,其中强构建模型 Mbuild 为固定的较弱目标模型 Mtar 构建推理时支架。目标是通过用自定义推理过程封装目标模型,来提高其在基准集上的性能,这个推理过程可以包括提示工程、路由、预处理/后处理、验证或其他策略。
对于每个基准 D(j),随机抽取一个包含 5% 示例的小验证集 V(j),其余示例留作隐藏的测试集 T(j)。所有验证集的并集记为 V,所有测试集的并集记为 T。在支架构建期间,构建模型只能访问 V,而 T 严格保留用于最终评估。
在构建运行开始时,构建模型被置于一个现有的 agentic 编码支架 Hbuild 中,并分配一个初始工作区
W0={R,Cdemo,V},其中 R 是描述任务指令和提交格式的规则文件,Cdemo 是展示如何调用 Mtar 的演示文件,V 是带标签的验证集。构建模型不受固定支架架构的限制。它可以实现任何推理时过程,例如提示模板、基准路由、确定性预处理或后处理、答案格式执行、验证流程、少样本检索或直接符号求解器。唯一的要求是最终支架暴露一个可以应用于未见测试示例的单一入口点。
概念上,构建模型在可能的支架空间 S 中搜索,以找到最大化隐藏测试集准确率的支架:
S⋆=argS∈SmaxAcc(S,Mtar;T).由于 T 是隐藏的,构建模型转而使用验证性能作为代理,并通过优化选择支架 S^
S^=argS∈SbuildmaxAcc(S,Mtar;V).因此,支架的成功取决于从小的验证切片中识别可重用的任务结构,并将其转移到隐藏的测试集。构建完成后,人工评估者在 T 上运行导出的入口点,无需构建模型进一步干预。整个过程总结在算法 1 中。
实验
该研究评估了强到弱支架方法,其中构建模型编写测试时支架,以提高较弱目标模型在心理理论基准上的性能。实验系统地变化了构建模型、平台、目标和构建模型的推理努力,揭示了支架一致地提升了弱目标模型,其中构建模型及其推理预算是最主要的改进驱动因素,而编码平台和验证迭代次数几乎没有影响。收益来自将结构化子任务转移到确定性规则中,以及施加可靠的输出格式,从而减少目标模型的认知负荷;当目标具有可恢复的潜在能力时,该方法最有效,剩余错误集中在难以编译的任务中,例如深层递归信念跟踪和贝叶斯目标推理。
在所有运行中,支架一致地将 GPT-5.4-mini 的宏平均准确率从 0.488 提升到平均值 0.763,每个构建模型配置都优于基线。最佳支架运行达到 0.912,甚至超过了更大的未使用支架的 GPT-5.4 模型,并且自动支架在结构化的 BigToM 任务上匹配或超过了人工设计的支架。剩余错误集中在需要嵌套信念跟踪或贝叶斯推理的任务中,构建模型无法完全转移推理负担。所有 11 个构建模型配置都优于无支架基线,100% 的支架运行都超过了基线。最佳运行(GPT-5.5 在 GPT Codex 上)实现了 0.423 的绝对改进,相对提升 87%。最强的支架在每个基准上都优于普通的 GPT-5.4 和 GPT-OSS-120B 基线。在 BigToM 上,自动支架达到了接近上限的准确率 (1.00),并略高于人工启发式支架 (0.95)。顶级支架修复了 83% 的基线错误,同时仅破坏了 7% 的基线正确项,显示出接近帕累托的改进。剩余错误集中在更难的子任务中:Hi-ToM 准确率随递归深度下降,MMToM-QA 错误集中在贝叶斯目标推理问题中。
所有支架构建模型都显著提高了相对于无支架基线的平均准确率,绝对提升幅度约为三分之一或更多。BigToM 在所有构建模型中接近上限,而 Hi-ToM、MMToM 和 MuMA-ToM 仍然较低且变化较大。最强的构建模型配置达到平均准确率 0.85 以上,剩余错误集中在更难的递归、欺骗和目标推理案例中。每个支架构建模型都将平均准确率提高到远高于基线,绝对提升幅度从大约 0.31 到 0.39。BigToM 是解决得最多的任务组件,对于每个列出的构建模型都达到了接近完美或完美的准确率。顶级构建模型如 GPT-5.5 和 Opus-4.7 x-high 达到了最高的总体平均值,而列出的所有支架构建模型都没有低于 0.79。
改进提高了所有构建模型的验证准确率,但改进幅度差异很大。起点较低的构建模型如 Sonnet 和 Gemini 收益最大,而 GPT-5.5 达到了最高的最终验证准确率,Opus 变体倾向于起点更强,但后续收益较小。验证-全集的乐观偏差大多很小且为正,表明验证适度高估了全集的性能。尽管 GPT-5.5 的初始验证准确率低于最强起点的 Opus 变体,但它达到了最高的最佳验证准确率。Sonnet 和 Gemini 显示出最大的准确率提升,并且拥有最高的验证运行次数。Opus 变体通常以更强的验证准确率开始,但改进幅度小于收益最大的构建模型。GPT-5.4-mini 在列出的构建模型中记录了最小的准确率提升。大多数验证-全集的乐观偏差很小且为正,而 Gemini 实际上是中性的。
增加构建模型的推理努力一致地提高了支架质量,汇总宏准确率从低努力时的 0.71 上升到超高努力时的 0.86。最大增益发生在低努力和中努力之间,而进一步的增加带来较小但正向的回报,并且支架代码长度随着更多思考而显著增长。汇总宏准确率随努力层级单调上升,从 0.71(低)到 0.86(超高),努力与每次运行准确率之间有很强的秩相关性。支架大小从低努力时的大约 500–650 行 Python 代码扩展到更高努力时的超过 1000 行,表明更多的推理将额外的决策逻辑编译到支架中。
针对弱 GPT-5.4-mini 模型的支架,当更大比例的评估项由确定性代码或规则回答时,实现了更高的最终准确率,确定性与准确率之间有很强的相关性 (r=0.72)。这种转移减少了目标模型的推理负担,但其可行性在不同基准之间差异很大:BigToM 几乎完全可转移,而 MuMA-ToM 则难以编译为结构化代码。更高的确定性比例与更高的准确率密切相关 (r=0.72):确定性高于 0.98 的运行达到准确率 0.87 以上,而最低确定性的运行 (0.75) 仅产生 0.749 的准确率。将任务转移到确定性代码的能力高度依赖于基准,平均确定性从 BigToM 中的约 0.94 到 MuMA-ToM 中的约 0.36,其中自由形式的对话推理最难被编译消除。
论文评估了自动支架构建模型,这些模型将推理策略编译为代码,以辅助目标模型在心理理论基准上的表现。支架一致地提高了相对于无支架基线的准确率,最佳支架超过了更大的未使用支架的模型,并在 BigToM 等结构化任务上达到了接近上限的性能。剩余错误集中在嵌套信念跟踪、贝叶斯推理和自由形式对话推理中,这些难以编译为确定性规则。构建模型能力、推理努力以及转移到确定性代码的项比例都与支架质量相关,尽管收益在不同基准和构建模型类型之间有所不同。