Command Palette
Search for a command to run...
智能体系统中的协同进化:迈向超越人类设计的自主演化
智能体系统中的协同进化:迈向超越人类设计的自主演化
摘要
人们日益期望智能体系统在部署后能够持续改进,然而单实体自演化往往受限于静态的学习情境,例如固定的任务与反馈。本综述聚焦于智能体系统中的协同进化,这是一种多组件形式的自演化,其中多个智能体及其环境相互施加适应性压力。为梳理现有文献,我们提出了一种递进式的三阶段分类法,用以追踪系统如何逐步摆脱人类设计的约束。智能体间协同进化研究智能体如何通过动态同伴进行适应,包括对抗性、协作性与组织性适应。智能体与环境协同进化将这一循环扩展至随智能体一同变化的自适应任务、反馈与交互空间。元协同进化则进一步探索使演化机制本身可演化的可能性。我们还讨论了在评估此类系统、跨多组件扩展它们,以及确保日益自主的演化过程安全可控等方面的开放性挑战。本综述为构建鲁棒且开放的智能体系统提供了统一基础,使其能够超越固定的人类设计路径实现改进。
一句话总结
香港科技大学、伊利诺伊大学厄巴纳-香槟分校、香港中文大学、香港大学和北京大学的研究人员提出了一份关于Agent系统中协同演化的综述,提出了一种渐进式三阶段分类法,涵盖Agent与Agent、Agent与环境以及元协同演化,追溯了多组件间的自适应压力如何逐步摆脱人为设计的约束,并讨论了在评估、扩展和确保此类系统安全性方面的开放挑战,以构建稳健、开放式的Agent系统,使其能够超越固定的人为设计路径不断改进。
核心贡献
- 该综述给出了协同演化的正式定义,要求至少两个组件之间存在相互演化压力,并通过渐进式三阶段分类法来组织该领域:Agent与Agent、Agent与环境以及元协同演化。
- 针对协同演化系统提出了一种动态评估范式,超越静态基准,通过衡量组件层面的改进、跨玩法可迁移性,并使用保留的评估器来检测利用行为。
- 元协同演化,即演化机制本身变得可演化,被确定为减少人为干预、实现开放式、自我改进的Agent系统的关键前沿。
引言
随着AI系统从孤立模型转向能够自主使用工具、记忆和技能的Agent系统,一个核心挑战是如何在部署后实现持续改进。自我演化让Agent能够从经验中更新自身,但它仍受限于固定的外部条件,这种局限性类似于红皇后效应。目前尚无综述将协同演化——即多个组件共同适应并重塑彼此演化的过程——作为核心焦点。作者通过首次聚焦于Agent系统中的协同演化来填补这一空白,并以一种渐进式三阶段分类法整理文献,该分类法从Agent与Agent协同演化,到Agent与环境协同演化,再到演化机制本身变得自适应的元协同演化,逐步扩展演化自由度。
方法
作者提出了一种三阶段分类法,该分类法遵循系统被允许演化的范围逐步扩大,逐步移除人为设计的约束。
第一阶段聚焦于Agent与Agent协同演化。当Agent不再针对静态对手学习时,协同演化便开始了。随着Agent彼此响应,每个Agent的进展会改变其同伴面临的挑战和机遇,而集体也可能重新组织其结构Π。这在Agent集体内部创造了一个耦合的演化过程,定义为:
At+1=({ait+1}i=1n,Πt+1)=Ω(At,E,τt).第二阶段将这一概念扩展到Agent与环境协同演化。虽然第一阶段的耦合过程不断改变Agent,但环境保持固定,限制了新的经验。第二阶段允许Agent行为重塑随后塑造Agent的全部条件:
(At+1,Et+1)=Ω(At,Et,τt).第三阶段引入元协同演化。在第二阶段中,演化机制仍然是人为设计的。元协同演化被定义为一个阶段,其中较低层次的协同演化系统通过自我生成的修订过程Γt进一步修订其演化机制:
Ωt+1=Γt(St,Ωt,τt),St+1=Ωt+1(St,τt).这种递归提供了一条通向开放性的路径,其特点是持续的新颖性Ωt+1=Ωt,以及具有自适应能力H的无界发散,满足limt→∞H(St,Ωt)=∞。作者将演化机制分解为五个自适应决策:演化什么选择适配目标,何时演化在失败或停滞后触发更新,如何演化通过训练或修订产生变体,何处演化涵盖领域和设置,以及如何评估判断演化质量。
如下图所示,第一阶段和第二阶段在大多数设置下提升了性能,但随着演化接近停滞,收益变小。通过允许演化机制改变,元协同演化超越了这一瓶颈,并开辟了新的改进方向。