Command Palette
Search for a command to run...
DecoEvo:文本空间中求解器与评分标准生成器技能的解耦评分协同进化
DecoEvo:文本空间中求解器与评分标准生成器技能的解耦评分协同进化
摘要
文本空间优化通过编辑外部自然语言制品而非模型权重来适配大语言模型(LLM),因此优化后的制品保持可审查性,且模型可被视为黑盒。然而,现有的大多数文本空间方法保持评估方式固定不变。在开放式任务中,这可能成为瓶颈:一旦求解器在评分标准所衡量的指标上取得进步,被忽略的维度对优化信号而言便不可见。仅凭当前求解器的得分来选择和进化评分标准也不可靠,因为表面上的进步可能源于评分标准变得更容易满足。我们提出 DecoEvo(解耦协同进化),该方法在无金标准评分标准的情况下,基于解耦的目标协同进化求解器技能和评分标准生成器技能。求解器技能利用准则级反馈进行更新,而评分标准生成器技能则通过对需求覆盖度和响应区分度的补充审计进行修正,这些审计独立于求解器的综合得分。这种分离使生成器的更新聚焦于求解器新暴露的弱点,减少对求解器已满足准则的重复强调。在各基准的官方评估下,DecoEvo 在五个基准和三种 LLM 骨干网络上均优于所有对比方法,在五个基准的平均性能上相较于 SkillOpt 取得了 2.8% 至 5.0% 的相对提升。
一句话总结
清华大学等机构的研究者提出 DecoEvo,一种文本空间协同进化方法,通过准则级反馈和独立的覆盖度/区分度审计,将求解器与评分标准生成器的技能更新解耦,防止评分标准简化,在五个基准和三种 LLM 骨干上相对 SkillOpt 取得 2.8–5.0% 的提升。
核心贡献
- 本文将文本空间求解器-评分标准协同进化形式化为分数耦合问题,并为持久的求解器和评分标准生成器技能引入分离的更新目标,使评估信号能够自适应,而不奖励那些偏袒当前求解器的评分标准变更。
- 本文通过任务条件化结构审计和评分标准盲化的近似平局审计来操作这一分离,将遗漏的需求和缺失的区分转化为可复用的评分标准生成原则,既不需要黄金评分标准监督,也不需要模型权重更新。
- 在五个基准和三种 LLM 骨干上,包括两次领域内跨基准迁移,DecoEvo 在所有 15 个骨干-基准组合中均取得对比方法中最高的平均分数,相对 SkillOpt 的平均提升为 2.8–5.0%。
引言
在文本空间优化中,冻结的大语言模型通过编辑外部自然语言工件进行适配,但现有方法通常保持评估评分标准固定。在开放式任务上,静态评分标准可能忽略重要的质量维度,导致求解器过度适应被测量的准则,而评分标准失去区分价值。将评分标准生成器与求解器联合更新存在分数耦合的协同适应风险:提升求解器分数的生成器修订可能偏向求解器已满足的准则,从而虚增代理分数而并无真实质量提升。作者提出 DecoEvo,一种分数解耦的协同进化框架,在冻结骨干下同时修订求解器和评分标准生成器技能。它利用任务条件化结构审计和评分标准盲化的近似平局比较,检测遗漏的需求和缺失的区分,并将其提炼为可复用的生成器技能修订,使得评分标准更新不会因偏袒当前求解器而获得奖励。
方法
作者提出 DecoEvo,一个维护两种可编辑自然语言技能而保持底层模型参数固定的框架。求解器技能 s 存储可复用的任务策略,而评分标准生成器技能 g 存储构建问题特定评分标准的原则。所有优化角色,包括求解器、评分标准生成器、准则级评判器、审计器和技能重写器,均使用同一冻结骨干,并配备固定的角色特定提示。这种角色分离改变了提示和更新目标,而不修改底层模型。
如下图所示:
训练过程分为求解器技能进化的内循环和生成器技能进化的外循环。
内循环:求解器技能进化 在内循环中,求解器使用当前求解器技能 st 回答训练池中的一批问题,同时生成器产生问题特定的评分标准 Rq(gt)。一个固定的准则级评判器根据每条评分标准评估每个回答,返回分数分解和文本形式的失败原因。选定的失败案例传递给求解器技能重写器,它将可复用的诊断整合为候选技能 s′,而非附加问题特定的修复。候选技能仅在 JVs(s′,gt)>JVs(st,gt)+ε 时被接受,其中 ε>0 为边际。该比较在相同的验证问题上配对进行,并缓存每个问题的评分标准,从而将求解器技能编辑与评分标准生成噪声隔离。若被拒绝,则保留当前技能,并递增停滞计数器以触发外循环。
外循环:通过双视角审计进行生成器技能进化 外循环在求解器停滞时执行,遵循审计-提炼-验证流程。关键的是,生成器更新是分数解耦的,即生成评分标准下的聚合求解器分数从不作为生成器目标。相反,框架依赖两个冻结的、角色分离的审计来诊断当前生成器。
首先,任务条件化结构审计评估生成的评分标准是否基于公开的任务描述和评估指令遗漏了关键维度。结构审计器接收任务规范、问题和生成的评分标准,返回充分性分数、基于证据的理由和修复建议。
其次,近似平局对比审计探查当前评分标准在实践中未能区分的内容。求解器为每个探查问题采样多个随机输出,并由当前评分标准评分。框架识别分数差距低于阈值的近似平局对。对于每一对,审计器首先进行评分标准盲化比较,以确定偏好和理由。仅在确定此偏好后,审计器才接收生成的评分标准,解释为何它未能捕捉差异,并提出缺失或权重不足的原则。
最后,生成器技能重写器接收来自两个视角的审计记录,将局部发现提炼为候选生成器技能 g′ 的可复用原则。提议和接受使用不相交的数据。候选技能通过帕累托式验证规则评估。仅当 ∃k∈Kt:Δk>δ 且 ∀j∈Kt:Δj≥−η 时被接受,其中 δ>0 为改进边际,η≥0 为退化容忍度。该方法避免将异构审计分数聚合成单一标量,并确保生成器进化以解决冻结审计器识别的特定区分。部署时,仅保留优化后的求解器技能。
实验
评估在医学和写作基准上将 DecoEvo 与零样本、仅求解器优化和分数耦合协同进化进行比较,并测试跨基准迁移。DecoEvo 始终优于所有基线,其提升可在无进一步微调的情况下迁移,而分数耦合更新常常降低性能。消融实验证实对比审计和结构审计、留出验证以及跨样本提炼均至关重要,且替代解释(任务先验、额外计算、直接审计路由)无法解释性能提升,表明进化的生成器技能编码了持久的、可复用的评估准则。训练动态和评分标准对齐分析揭示,协同进化产生的评分标准与黄金标准具有更高的保真度,从而在不增加宽松度的情况下提升回答质量。
DecoEvo 在所有模型-基准组合中始终取得最高分数,相对 SkillOpt 的平均提升在 2.8% 到 5.0% 之间。SkillOpt 本身在几乎所有情况下都优于零样本提示,表明固定评分标准生成器有帮助,但仍有改进评分标准覆盖度的空间。分数耦合协同进化常常降低性能,表明使用进化的内部分数作为选择信号可能抹去仅求解器优化的提升。DecoEvo 在单个基准上相对 SkillOpt 取得 2.7–8.6% 的相对提升,在每个骨干和任务上均领先。SkillOpt 在 15 个案例中的 14 个超越零样本,证实即使是静态评分标准生成器也能提高求解器性能。跨基准迁移提升(LLMEval-Med 上 1.4–4.5%,Creative Writing 上 2.7–3.9%)表明 DecoEvo 学习到可复用的策略,而非源特定的修正。SC-CoEvo 在 15 个案例中的 13 个表现不如 SkillOpt,并在 7 个案例中低于零样本,表明将分数选择耦合到进化生成器可能逆转提升。配对分析证实,经过多重比较校正后,DecoEvo 相对 SkillOpt 的平均提升具有统计显著性。
消融每个组件均会降低所有模型规模下的性能,证实每个机制都有贡献。移除验证导致最大下降(2.4-2.9 分),而对比审计比结构审计更重要,表明对合理输出进行细粒度区分是主要剩余挑战。移除验证在所有骨干上导致最大分数惩罚(2.4-2.9 分)。对比审计消融损失 1.7-2.1 分,而结构审计消融损失 1.3-1.7 分,显示区分合理输出的价值。评分标准盲化和近似平局采样各贡献 1.0-1.5 分,证明盲判和对构造均有帮助。提炼贡献 1.4-1.8 分,表明可复用的评估原则优于情景化建议。
在 HealthBench 上的对照实验表明,提供更丰富的任务先验或匹配 DecoEvo 的计算预算均不能解释其大幅性能提升;两者仅比 SkillOpt 略有改善。直接将审计记录提供给求解器能恢复较大部分提升,但仍落后于 DecoEvo,表明持久进化生成器技能将情景化反馈转化为更有效、更持久的评分标准准则。任务先验和预算匹配各自仅比 SkillOpt 增加 0.4–0.7 分,而 DecoEvo 提升 1.6–3.6 分。直接审计优于技能先验和基于预算的变体,但仍比 DecoEvo 低 0.8–1.6 分。直接审计与 DecoEvo 之间的差距表明,将审计反馈存储在进化的生成器技能中,比一次性求解器重写更能改善未来求解器指导。
在匹配计算预算下比较方法时,DecoEvo 大幅优于替代方案,尽管使用与预算匹配和 SC-CoEvo 相同的 token 乘数。直接审计在不进化评分标准生成器的情况下路由求解器反馈,恢复了大部分提升,但 DecoEvo 中的持久进化增加了额外的性能边际,表明反馈的存储位置很重要。在相同的 1.89 倍 SkillOpt token 预算下,预算匹配仅略微改善,SC-CoEvo 性能下降,而 DecoEvo 取得最大分数提升。直接审计以几乎相同的 token 捕获了 DecoEvo 的大部分改进,表明求解器审计信号具有信息量,但持久进化评分标准生成器解释了剩余差距。
在所评估的方法中,DecoEvo 与留出的黄金评分标准在准则级重叠上最高,在每个基准上 F1 值比 SkillOpt 高出约 12 个百分点。精确率和召回率同时上升,表明评估覆盖度更好,而非仅仅产生更多准则。相反,SC-CoEvo 将 F1 降低约 5–6 点,与分数耦合更新丢弃重要行为区分一致。DecoEvo 在 HealthBench、WritingBench 和 ResearchQA 上将准则级 F1 相对 SkillOpt 提高约 12 点。使用 DecoEvo 时,精确率和召回率均增加,排除了提升仅来自生成更大准则集的假设。SC-CoEvo 在每个基准上均产生比 SkillOpt 更低的精确率、召回率和 F1,F1 下降 5–6 点。相同的相对排序在所有三个不同的源基准上均成立。
DecoEvo 在基准和骨干上始终优于 SkillOpt 和零样本基线,其提升可跨任务迁移,并源于评分标准生成器的进化,而非静态反馈或计算扩展。消融和对照实验证实所有组件,特别是验证和对比审计,都是必要的,且将反馈存储在进化的生成器技能中比一次性审计记录提供持久益处。准则级分析揭示,DecoEvo 通过同时提高精确率和召回率来改善评估覆盖度,而分数耦合协同进化则因丢弃重要区分而降低覆盖度。