Command Palette
Search for a command to run...
基于错误定位的测试时扩展方法
基于错误定位的测试时扩展方法
Rajiv Shailesh Chitale Rahul Madhavan Taneesh Gupta Deepanway Ghosal Aravindan Raghuveer
摘要
扩展推理时的计算量已成为提升大语言模型在复杂推理与编程任务上性能的可靠方法。然而,独立采样和顺序多轮修正等标准方法缺乏词元级别的贡献分配,导致计算效率低下,因为有效的推理前缀经常被丢弃。本文提出基于错误定位的测试时扩展(TTEL),这是一种利用固定反馈或环境反馈进行词元级错误定位的推理时算法。通过比较有信息反馈下的条件概率与空上下文基线,TTEL 能够定位错误发生的步骤。随后,算法截断轨迹并分支生成新的内容,从而最大限度地重用有效前缀。大量评估表明,TTEL 在顺序推理领域中,以 pass-at-k 与生成词元成本为度量,建立了严格占优的帕累托前沿。在 LiveCodeBench 上使用 Qwen3-8B 时,TTEL 的 pass@64 达到 71.0%,而生成的词元数量约为独立采样的一半(360.4k 对比 735.0k)。在数学基准 AIME-2025 和 HMMT-2025 上的泛化实验中,TTEL 在 Qwen3-8B 和 Qwen3-4B-Thinking-2507 上均明显优于其他测试时基线方法。
一句话总结
Google DeepMind 提出通过错误定位实现测试时扩展(Test-Time Scaling via Error Localization, TTEL),这是一种推理时算法,通过比较在知情反馈下的条件概率与空上下文基线来进行 token 级错误定位,以隔离错误、截断轨迹并分支新的生成,同时最大限度地重用有效前缀,从而在包括 LiveCodeBench、AIME-2025 和 HMMT-2025 在内的序列推理基准上,使用 Qwen3-8B 等模型建立了占优的帕累托前沿,其中该模型取得了 pass@64 为 71.0% 的成绩,同时生成的 token 数量约为独立采样的一半。
核心贡献
- TTEL 通过比较在知情反馈下的条件概率与空上下文基线来进行 token 级错误定位,隔离发生错误的步骤。
- 通过仅截断并分支错误的后缀,TTEL 最大限度地重用有效的推理前缀,并消除了冗余探索。
- 在 LiveCodeBench 上,使用 Qwen3-8B 的 TTEL 以大约独立采样一半的 token 成本取得了 pass@64 为 71.0% 的成绩,并且在 AIME-2025 和 HMMT-2025 上,使用 Qwen3-8B 和 Qwen3-4B-Thinking-2507 均干净利落地优于其他测试时基线方法。
引言
扩展推理时计算能提升大型语言模型在复杂推理任务上的表现,但主流的 K 选优策略效率低下:它生成独立样本而不从先前的失败中学习,导致冗余探索。序列式精炼尝试利用环境反馈,但模型常常重复犯错或无法精确定位推理偏离的位置。核心问题在于反馈是轨迹条件性的,能提供关于特定失败路径的信息,但现有方法将其视为全局修正信号,或依赖于缺乏细粒度错误定位的粗粒度、启发式驱动的搜索。
作者提出了 TTEL,一种无需梯度更新的推理时搜索算法,可进行 token 级贡献分配。当解决方案失败时,TTEL 利用知情反馈与非诊断性反馈之间的提示词对数概率对比来识别最大分歧的位置,从而定位置信度最高的错误。然后,它在该点截断推理轨迹,并从保留的有效前缀分支生成新的内容。这种反馈引导的树搜索重用了正确的推理片段,并将计算导向修正特定错误,在竞争性编程和数学推理基准上,相比标准采样实现了显著更高的 token 效率。
方法
作者提出了 TTEL,一种 token 级测试时搜索算法,该算法在同时充当生成器和评估器的单一预训练语言模型上运行。其核心思想是重新利用自蒸馏训练中使用的 token 级分歧信号,不是用于权重更新,而是用于动态剪枝和分支推理时搜索树。该方法分两个阶段进行:检测并过滤 token 级错误信号,以及利用这些信号引导候选解决方案的分支策略。
在第一阶段,即尖峰检测与过滤阶段,模型在标准自回归解码下生成一条候选轨迹,并记录学生 token 概率。随后,在同一条轨迹上,在反馈增强的上下文中重新评分以获得教师 token 概率,其中反馈通常包含环境衍生的信息,如编译器错误或失败的测试用例。原始的反馈条件尖峰定义为每个 token 位置处学生概率与教师概率之差。一个大的正尖峰表明,在观察到反馈后,模型对其原始 token 选择分配了显著更低的概率。
然而,原始尖峰可能会将真正的语义重评估与因在上下文窗口中追加任何文本而引起的通用概率偏移混为一谈。为了隔离反馈特有的分歧,作者引入了一个包含非诊断性指令的空反馈字符串。在同一条轨迹上,在此空反馈下重新评分,以计算基线 token 概率和相应的基线尖峰。然后,过滤后的尖峰分数定义为原始尖峰与基线尖峰之差,有效地减去了在非诊断性反馈下同样会出现的上下文诱导偏移。仅当教师尖峰超过一个阈值,而空反馈尖峰保持在另一个阈值以下时,才保留 token 位置,从而产生一个局部化的错误集,该集合捕获了模型表现出反馈特有分歧的位置。
在第二阶段,即搜索与分支阶段,算法在局部化错误集中选择具有最强过滤后尖峰分数的 token 作为分支点。搜索树在分支点前一个位置截断失败的轨迹,并从保留的前缀启动新的生成。该机制重用了轨迹中位于最强局部化错误信号之前的部分,而非丢弃整个生成内容。当局部化错误集为空时,表明可用反馈未能定位任何可操作的 token 级错误,算法将从原始提示词重新开始。
完整的 TTEL 过程维护一棵搜索树,其根节点对应空前缀。每次迭代中,选择一个叶子前缀并生成完整的候选续写。执行环境返回反馈以供重新评分和后续重新生成。尖峰检测通过在真实反馈和空反馈下重新评分来进行,从那些在真实反馈下概率急剧下降但在空反馈下未下降的 token 位置构建局部化错误集。如果该集合非空,则选择具有最大过滤后尖峰分数的分支点,并将保留的前缀添加到树中以供后续生成。否则,将空前缀添加回去以鼓励继续探索。该过程重复进行,直到推理时预算耗尽,然后返回生成的候选集以供评估。
一项理论分析形式化了相对于标准序列式重启的分支优势。在自回归前缀一致性假设下,分支的成功率等于以恢复锚定前缀为条件的重启成功率。该定理表明,只要在到达正确前缀后成功的可能性更高,分支就严格优于重启,因为重启策略可能永远不会自然地回到必要的中间状态,使得轨迹条件性反馈变得无用。
实验
实验框架在需要多步数学推理和代码生成的基准上评估 TTEL,并将其与独立采样、多轮精炼和递归自聚合基线进行比较。TTEL 建立了一条严格占优的计算最优帕累托前沿,通过从保留的前缀分支并避免冗余的重新生成,以显著更低的 token 消耗实现了更高的 pass@k 率。消融研究揭示,保留完整的推理轨迹并引入显式的环境反馈对于精确的错误定位至关重要,而空反馈基线过滤器对于将真正的错误驱动修正与上下文诱导的概率偏移隔离开来是严格必要的。总体而言,TTEL 作为一种领域无关的测试时扩展方法,最大限度地重用有效的推理前缀,以同时提升效率和准确率。