HyperAIHyperAI

Command Palette

Search for a command to run...

LLM
Agent

双层协调反思:多智能体 LLM 系统的博弈论方法

Yihang Chen Yuxiang Chen Yuxuan Huang Meng Fang Weilin Luo Jun Wang

摘要

多智能体 LLM 系统通常使用一个编排器将任务分解给一组工作智能体,然后通过文本反思进行改进。尽管取得了强大的实证结果,这些系统缺乏对协调、记忆改进和外部验证作用的统一解释。我们将编排器与工作智能体之间的交互建模为双层协调博弈:在有界耦合下,工作智能体的局部更新博弈是一个近似势博弈,其均衡松弛由分解质量控制。然后,我们将反思分析为语义记忆状态上的随机运动。对于自由形式的反思,我们推导了一个有限时间上界,证明了最坏情况下的紧致性,并在可证伪的持续危害条件下给出了一个正下界。我们进一步证明了一个信息论不可能性结果:任何仅观察生成文本的门控都无法在文本不可区分环境中统一改进,而环境接地门控可以。受这一分离的启发,我们引入了随机反思记忆上升(SRMA),它仅在接地评估风险严格降低后才接受候选记忆。在校准和非退化纠正质量下,SRMA 精确收敛,几何或多项式速率;匹配构造表明两种速率机制都是阶紧的。我们还为随机评估提供了置信门控,并为分段平稳环境提供了重新锚定保证。实验用环境接地指标实例化了这些对象,并测试了预测的协调和漂移规律。在 500 个 SWE-bench 实例上,完整的基于 Kimi 的系统解决了 72.2%,而公开的 mini-SWE-agent 参考为 70.8%。代码可在 https://github.com/YihangChen9/ Bilevel-Coordinated-Reflection 获取。

一句话总结

来自UCL人工智能中心、利物浦大学和华为的研究人员将编排者与工作线程之间的交互建模为双层协调博弈,证明了反思的收敛性与不可能性结果,并引入了随机反思记忆上升(SRMA),该算法仅在基于环境的风险严格下降时接受记忆更新,在500个SWE-bench实例上达到72.2%72.2\%72.2%,而参考基线为70.8%70.8\%70.8%

核心贡献

  • 引入随机反思记忆上升(SRMA),一种基于环境的门控机制,仅在固定评估协议认证验证器风险严格下降时才提交候选记忆,在校准和非退化修正质量条件下以阶紧的几何或多项式速率实现精确收敛,并针对分段平稳环境提供置信门控和重新锚定扩展。
  • 为编排者-工作线程LLM系统提供统一的博弈论和随机逼近基础:将交互建模为双层协调博弈,其中工作线程均衡松弛由分解质量控制,推导自由形式反思的双侧漂移界(最坏情况紧上界和在持续有害承诺下的通用下界),并证明信息论不可能性结果,表明仅基于转录的门控无法在文本不可区分环境中实现一致改进,而基于环境的门控可以。
  • 在隐藏容量资源竞赛、具有精确BFS价值表的Overcooked以及SWE-bench上验证理论,完整的Kimi系统解决了500个实例中的72.2%(361/500),而公开的mini-SWE-agent参考为70.8%,并在提供的代码仓库中发布代码。

引言

多Agent LLM系统越来越多地用于单个模型难以承担的大型任务,其中编排者分解问题,工作线程解决子任务,团队通过将批评和经验写入共享文本记忆来改进。由于模型权重被冻结,记忆编辑是主要的适应渠道,这些循环通常依赖外部测试框架或模拟器进行环境 grounding。然而,现有框架是程序性的,指定了通信模式,但没有指定Agent稳定下来的战略目标或反思改进的量,留下了关于分解质量、反思何时达到平台期以及为什么外部验证器可以优于更强的纯文本评论者等开放问题。

作者通过统一框架解决这些差距,将编排者-工作线程管道建模为具有近似势博弈的跟随者子博弈的双层协调博弈,并将文本记忆编辑建模为离散语义状态空间上的随机过程。他们在单侧漂移条件下推导了自由形式反思的有限时间上界,表明仅无条件承诺不足以实现通用正下限,除非存在额外的持续危害条件。他们还证明了一个不可能性定理:在具有相同文本生成规律但相同反思含义相反的环境中,任何仅基于转录的门控(包括理想的纯文本评判者)都无法同时改进两者,而基于环境的验证器可以区分它们并实现几何收敛。

基于这一分离,作者引入了随机反思记忆上升(SRMA),该算法仅在固定基于环境的评估协议认证验证器风险严格下降时才提交候选记忆。SRMA在校准和非退化修正质量条件下以阶紧的几何或多项式速率收敛,并针对随机探针提供置信门控,针对分段平稳性提供重新锚定。该理论在隐藏容量资源竞赛、具有精确BFS价值表的Overcooked以及SWE-bench上得到验证,完整的Kimi系统解决了361/500个实例(72.2%),而公开的mini-SWE-agent v2参考为70.8%。

方法

3 方法论

作者将复杂用户查询的解决形式化为双层协调博弈。在朴素单Agent范式中,整个输出通过冻结的LLM内核直接从查询生成,对于大型任务会导致上下文稀释和推理退化。当代系统改为让编排者在工作线程之间划分任务。作者将其建模为领导者-跟随者结构:编排者(领导者)生成策略配置,将子任务分配给工作线程,每个工作线程(跟随者)根据分配的子任务生成局部子解。全局输出随后由这些局部子解组装而成。

与理想化的独立分解不同,真实多Agent LLM系统表现出非平凡的跨工作线程交互:共享变量、公共接口和联合约束。作者采用弱耦合分解,其中全局效用具有可分离形式:局部工作线程目标之和加上由策略配置诱导的交互图上的成对耦合项。耦合强度和最大邻域大小共同量化分解质量。当耦合为零时,系统退化为独立情形。

在此公式下,工作线程的子博弈被证明是近似势博弈,其有界松弛线性依赖于最大邻域大小和耦合强度。这意味着工作线程的迭代最优响应更新在有限步内收敛到近似纯策略纳什均衡。编排者预见到这一均衡,求解一个包含显式分解质量权衡的领导者目标:好的分解同时提高可达局部效用并缩小耦合惩罚。因此,领导者最大化一个在可达局部效用与耦合之间权衡的下界。

3.1 双记忆漂移动力学与幻觉下限

由于LLM权重被冻结,适应通过编辑外部非参数记忆进行:工作线程共享的执行记忆和编排者使用的策略记忆。作者分析了反思提交到记忆的两种不同机制。在第一种机制中,自由形式反思,每个生成的反思无条件追加,将修正信息与幻觉信息混合在同一更新中。在单侧漂移条件下,作者推导了期望次优性的有限时间上界,表明平均误差收敛到一个与残差误差负载与修正漂移率之比成正比的下限。该上界在最坏情况下被证明是紧的:存在满足漂移条件的过程,其界被精确达到。

通用下界需要下漂移条件,这可以通过将自由形式轨迹中的下一步误差对当前误差进行回归直接检验。在持续有害承诺下,作者证明无论初始条件如何,平均误差都无法低于正下限。结合两个界得到双侧误差管:渐近平均误差位于下误差负载与上漂移率之比和上误差负载与下漂移率之比之间。当两个条件漂移界匹配时,平均误差精确收敛到公共比率。

在较慢的时间尺度上,领导者的外层循环遵循类似的仿射递归。作者仅使用领导者有限回合的陈述,不提出渐近遗憾声明。

3.2 为什么需要 Grounding:自包含门控的不可能性

基本的信息需求是 grounding:访问一个其规律依赖于环境而非仅依赖于生成转录的信号。作者通过一对在文本层面不可区分的环境来形式化这一点。自包含门控是任何仅相对于生成文本过程及其内部随机性可测的接受规则,而基于环境的门控可以额外观察环境相关信号,如实现奖励、模拟器状态、测试执行或形式验证器结果。

作者构造了一对模糊环境,其中相同的文本在一个环境中是修正性的,在另一个环境中是有害的。对于每个自包含门控和每个时间范围,两个环境中的最大期望误差至少为初始误差。此外,如果初始误差严格低于二分之一且门控以正概率接受至少一个模糊提议,则不等式是严格的。相比之下,接受所有内容的自由形式规则在两个环境中都将误差驱动到二分之一,而观察环境相关信号的基于环境的门控仅接受修正类别并将误差几何驱动到零。不可能性结果是对文本不可区分环境的极小极大结果:当转录本身认证正确性时,文本自评估仍然有用,但当真相依赖于外部状态时,评判者能力不能替代 grounding。

3.3 SRMA:验证器门控反思

不可能性结果确立了门控必须访问环境分离信号的原因。精确收敛还要求门控比较记忆状态的固定误差泛函,而不是比较来自随机生成器的两个不受控的一次性样本。因此,作者将随机提议机制与基于环境的评估协议分离。

验证器是确定性映射,为候选输出生成诊断分数。记忆的验证器风险是在该记忆下计算的确定性评估输出的分数。验证器和评估协议的配对独立于反思提议分布固定。当分数依赖于不能仅由生成转录确定的环境信号时,该配对是 grounded 的。

验证器门控更新如下进行。给定当前执行记忆,作者计算评估输出及其诊断分数。然后以输出、诊断、子任务和当前记忆为条件采样反思,形成候选记忆。仅当候选的验证器风险严格低于当前风险时才接受候选;否则保留当前记忆。对两个随机一次性输出进行门控是不够的,因为样本变异可能接受期望性能更差的记忆。因此,精确保证假设确定性或精确期望风险评估。

在验证器校准下,零验证器风险认证零任务次优性。在非退化修正质量假设下,接受概率由当前风险的幂次下界限定。在比例接受递减假设下,接受时的期望风险减少至少是当前风险的常数比例。这些假设产生单调乘法漂移:期望下一步风险以当前风险减去与当前风险幂次成比例的项为上界。这导致精确收敛,速率取决于指数:指数为零时几何收敛,指数为正时多项式收敛。速率在时间尺度上被证明在常数因子内是紧的。

当确定性风险评估不可用时,作者提供置信门控随机评估程序。当前和候选风险用独立探针估计,仅当候选估计加置信裕度严格低于当前估计减相同裕度时才接受。以高概率,每个接受的更新严格降低真实期望验证器风险。作者还处理分段平稳环境:当验证器风险变化有限次时,收敛保证适用于最终平稳段,具有适当的范围和初始风险。

漂移条件中的指数是可观测的:几何机制是log风险对时间的线性关系,而多项式机制是log风险对log时间的线性关系,斜率为指数的负倒数。从接受频率和轨迹衰减估计该指数可实现闭环校准。在实践中,算法在相同固定协议下探针候选并仅提交严格改进;重新计算当前风险可在分段平稳变化下重新锚定,在随机评估下接受测试替换为置信门控程序。

实验

评估涵盖Resource Contest、Overcooked和SWE-bench,使用环境真值或仓库测试框架作为验证器。基于环境的SRMA持续优于纯文本或无门控基线:在Resource Contest中达到oracle奖励的98.5-99.5%,同时将平均遗憾削减60.8%,在各布局中将Overcooked分数提高14-30%,并通过更好的门控选择性将最终风险减半。自适应门控以少64%的验证器调用匹配固定样本可靠性,重新锚定可实现漂移最优值的快速检测。在SWE-bench上,具有基于环境门控的双层SRMA解决了72.2%的实例,而无门控协调为58.4%,增益归因于基于环境的门控协调而非原始模型强度。

在所有Overcooked布局中,基于环境的SRMA方法在匹配交互和模型调用预算下持续达到最高分数,优于贪婪、无记忆、自由形式和自门控基线。性能差距在centre_pots布局中最为显著,基于环境的方法将贪婪基线分数提高一倍以上,在cramped_room中差距最小,所有方法受益于更高的绝对分数。结果表明,使用确定性验证器进行环境 grounding 并对记忆更新进行门控,相对于无门控和自门控替代方案提供了稳健改进。基于环境的SRMA在每个布局中均达到最高分数,在centre_pots中相对贪婪的最大增益为260对40。自门控记忆持续优于自由形式记忆,但基于环境的SRMA超过两者,显示了基于验证器的 grounding 的价值。基于环境的SRMA相对于自门控的改进在各布局中相似,约40分,表明 grounding 带来一致收益。贪婪分数在所有布局中最低,在cramped_room中与其他方法的差距最小,表明布局复杂性调节了协调的收益。

在Resource Contest基准上,提出的SRMA方法在所有难度设置下持续优于epsilon-greedy和无记忆变体,接近oracle级性能。执行记忆消融表明,添加记忆可提高平均奖励并显著减少遗憾,突显了记忆对协调的重要性。SRMA在所有RC设置中达到oracle奖励的98.5%至99.5%,优于epsilon-greedy和无记忆基线。执行记忆平均增加2.6个奖励点,并将平均遗憾削减60.8%,从4.33降至1.70。

基于环境的SRMA相比自由形式或自门控方法大幅减少有害提议接受和风险,同时提高有益接受。自适应门控以远少于固定验证的验证器调用实现可比可靠性,重新锚定对于快速适应偏移最优值至关重要。基于环境的SRMA将有害接受从100%(自由形式)降至6.2%,风险从0.42降至0.14,同时将有益接受从72.8%提高至85.4%。自门控已将有害接受降至34.5%,风险降至0.28,但基于环境的SRMA进一步将风险减半并将有害接受减少五倍以上。自适应门控以少63.6%的验证器调用匹配固定K=5验证的可靠性(7.1%对6.8%误接受)。与陈旧锚定变体相比,重新锚定基于环境的门控将偏移后遗憾削减67.0%,切换时间削减67.9%,而纯文本门控完全无法检测偏移。

在SWE-bench上,具有基于环境门控的双层系统在两个骨干模型上均优于自由形式多Agent反思和单Agent基线。增益归因于基于环境的验证器门控,该门控过滤未经验证的反思并在匹配预算下提高解决率。具有Kimi K2.5的双层SRMA解决了72.2%的实例,超过自由形式多Agent反思(58.4%)和公开单Agent参考(70.8%)。使用DeepSeek时,基于环境的门控仍提供明显优势(71.4%对68.2%),表明该效果不依赖于特定骨干模型。自由形式无门控变体表现最差,表明尽管具有相同的多Agent设置,未经验证的反思会损害性能。

在Overcooked、Resource Contest和SWE-bench上,基于环境的SRMA方法在匹配预算下持续优于贪婪、自由形式和自门控基线,在协调密集型布局中增益最大,并在Resource Contest上接近oracle级性能。通过确定性验证器进行 grounding 并对记忆更新进行门控可减少有害提议接受和风险,同时提高有益接受,自适应门控以远少于固定验证的验证器调用匹配固定验证可靠性。重新锚定基于环境的门控对于适应偏移最优值至关重要,大幅削减偏移后遗憾和切换时间。在SWE-bench上,具有基于环境门控的双层系统在两个骨干模型上提高了解决率,超过自由形式反思和单Agent基线,确认未经验证的反思是有害的,基于验证器的 grounding 提供了稳健且与骨干模型无关的收益。


用 AI 构建 AI

从创意到上线——通过免费 AI 协同编码、开箱即用的环境和最优惠的 GPU 价格,加速您的 AI 开发。

AI 协同编码
开箱即用的 GPU
最优定价

HyperAI Newsletters

订阅我们的最新资讯
我们会在北京时间 每周一的上午九点 向您的邮箱投递本周内的最新更新
邮件发送服务由 MailChimp 提供