HyperAIHyperAI

Command Palette

Search for a command to run...

Agentopia:智能体社会中的长期生活模拟与学习

摘要

人类从社会生活中学习。利用大语言模型驱动的智能体模拟这一过程是一个有前景的研究方向,并引出一个自然的问题:大语言模型能否从这种模拟的社会经验中学习,从而更好地理解和复现人类行为。然而,此前的智能体社会模拟通常以天为时间尺度运行,限制了社会互动的深度与长期成长。本文研究智能体社会中的长期生活模拟与大语言模型学习,目标有二:(1)探究终身模拟中涌现的社会行为;(2)通过多年的模拟社会经验,发展大语言模型的拟人化能力,尤其是社会生活智能。具体而言,我们提出 Agentopia,一个面向多智能体社会长期生活模拟的综合框架,其中 100 个智能体在 10 个模拟年份内自主追求个人成长、发展社会关系并满足自身需求与目标。我们定义生活奖励以反映人类福祉,并利用该奖励通过拒绝采样训练大语言模型。大量实验表明,智能体展现出丰富的涌现社会行为。此外,生活奖励训练有效增强了底层大语言模型,既提升了模拟中智能体的福祉,又泛化到下游角色扮演基准,取得 +15.6% 的提升。代码见 https://github.com/Neph0s/Agentopia

一句话总结

复旦大学等机构的研究者提出 Agentopia,一个长期多智能体生活模拟框架,其中 100 个 agent 在 10 个模拟年内自主追求个人成长、人际关系和目标;通过定义生活奖励并使用拒绝采样训练大语言模型,该框架能够涌现社会行为,并将角色扮演基准提升 15.6%。

核心贡献

  • Agentopia 是一个长期多智能体生活模拟框架,其中 100 个 agent 在 10 个模拟年内自主追求个人成长、发展社会关系并满足需求与目标。
  • 生活奖励信号对 agent 的福祉进行建模,并通过对高优势轨迹的拒绝采样,利用该奖励训练底层大语言模型。
  • 在三个不同世界中的实验显示出涌现的社会行为和模拟内福祉的提升;生活奖励训练还改善了下游角色扮演表现,在 CoSER Test 上总体提升 15.6%,其中拟人化(+23.7%)和角色保真度(+16.4%)提升最大。

引言

作者针对基于大语言模型的人物模拟与角色扮演展开研究。该方向对 AI 伴侣、数字游戏和内容创作具有重要意义,但在使模型与人类认知和行为对齐方面仍存在困难。此前的工作大多仅模拟 agent 社会数天或在单次对话中进行模拟,通常关注底层物理行为而非长期社会动态,并且在优化上高度依赖昂贵的人类数据。为克服这些局限,作者提出 Agentopia,这是一个支持跨模拟年份长期生活模拟的多智能体框架,定义生活奖励来建模人类福祉,并利用该奖励进行无数据训练,从而同时改善模拟内社会结果和下游角色扮演能力。

方法

Agentopia:框架与优化方法

作者提出 Agentopia,一个用于 agent 社会长期生活模拟的统一框架。该设计围绕三个核心概念组织模拟:模拟流程、agent 和独立的环境模型。Agentopia 不通过硬编码规则来编码社会动态,而是使用大语言模型同时处理角色行为和环境反馈。周是基本模拟单位。一个模拟年包含 nwn_wnw 周,每周由四个阶段组成:计划、联系、活动和回顾。在每个模拟年结束时,框架执行档案更新、职位申请和生活奖励计算。

Agent 设计

每个 agent 扮演一个特定的人物角色,由档案、社会关系和动态状态组成。档案存储相对稳定的身份信息,如背景故事、性格特征、才能、初始职位和资产。这些属性每个模拟年更新一次。社会关系不以显式图结构或关系标签表示,而是作为角色间记忆进行维护。每个 agent 存储关于其他 agent 的自由文本记忆,并可以自主更新这些记忆。该设计通过相同的记忆机制统一了朋友、对手、陌生人及其他关系类型。动态状态包括活力、满足感、技能、职位和资产。满足感基于马斯洛需求层次理论,捕捉情绪、物质、社交和尊重维度上的满意程度。根据享乐适应理论,满足感每周自然衰减。满足感和活力的变化由环境模型根据活动内容确定。

Agentopia 还包含一个三层上下文管理机制。角色扮演提示包含 agent 的人物角色、作为短期记忆的近期周记、长期记忆文件摘要、世界观规则和角色扮演原则。阶段提示添加阶段特定指令和上下文。消息历史记录当前阶段内的多轮消息、函数调用结果和紧凑推理。

对于长期记忆,agent 维护基于文件系统的存储。每个 agent 管理三类文件:general.txt 用于个人笔记和计划,characters/<who>.txt 用于关于特定人物的知识,others/<name>.txt 用于其他主题。agent 使用 read_fileupdate_filelist_files 函数调用来管理记忆。先读后写约束确保只有在同一次调用中已经读取目标文件后,才允许更新该文件。

模拟流程与调度

由于大语言模型 agent 一次生成一个响应,模拟是回合制的。Agentopia 抽象掉了移动和物体操作,聚焦于社会互动、规划和决策。在计划阶段,每个 agent 根据记忆和当前状态制定周计划,通过记忆文件调用回顾以往计划,并选择该周的消费水平。

在联系阶段,agent 通过多轮通信安排共同的日程。通信是两两进行的。每周包含 ncn_cnc 个联系轮次。agent 接收新到达的消息和过去三周的联系历史,然后决定联系谁以及生成什么动作。agent 动作包裹在 <role_action> 标签中,包括 contactpropose_joint_activityrespond_invitationcancel_joint_activity。在所有联系轮次结束后,系统解析收集到的动作,以确定哪些联合活动成功创建。公共活动在联系阶段之前安排,此时环境模型创建公共事件,agent 报名参加符合其兴趣的事件。偶遇活动在联系阶段之后为当天仍空闲的 agent 安排。

在活动阶段,agent 每个活动日执行一项活动,每个周循环有 ndn_dnd 个活动日。活动分为联合、独自、偶遇或公共活动。在回顾阶段,agent 反思每周经历并将其总结为周记。agent 还可以通过函数调用更新记忆文件。周记会包含在后续上下文中,以便 agent 回忆过往经历。

活动执行

联合活动建模多智能体、多轮交互。它们通过联系阶段的邀请和协商创建。环境模型提供环境描述并在每一轮选择下一个发言者。agent 可以将生成的内容标记为公开、私密或选择性可见,其中选择性内容仅对指定人员可见。agent 还可以赠送礼物或提前退出。环境模型应用响应过滤,以评估每个响应是否符合涵盖拟人化、角色保真度和可行性的角色扮演原则。

独自活动是 agent 没有其他日程时的默认活动。它们采用单轮格式,agent 描述一个意图动作,环境模型根据角色背景评估可行性并返回结果。独自活动还支持消费,允许 agent 购买商品或服务并获得物质满足感。

偶遇活动是环境模型为空闲 agent 创建的偶然相遇。它们采用与联合活动相同的多轮对话格式,但不会出现在 agent 日程中。偶遇可以引入陌生人,也可以让具有有意义情节关联的 agent 相遇。公共活动是以共同兴趣为中心的开放社区活动。它们遵循与独自活动类似的流程,但结束时参与者可以看到其他参与者做了什么,并可能形成新的社会联系。

环境模型与支持系统

环境模型是一个无状态大语言模型,充当生成式环境引擎。它在活动期间提供反馈、判断可行性、评估结果、在联合活动中选择下一个发言者、生成公共活动和偶遇活动、为职位申请排序候选人、在年末更新档案并执行响应过滤。这种方法以学习到的生成式环境行为取代了大量硬编码规则。

经济系统为 agent 提供来自基于职位的周薪、角色特定周收入以及活动期间额外工作的收入。支出来自每周生活标准选择和消费活动。职位系统为每个 agent 分配一份工作或社会角色,提供收入和技能成长。每年一次的职位申请流程允许 agent 申请新职位,结果由环境模型根据能力和职位要求确定。位置系统为 agent 提供有依据的环境感知。环境模型为每个世界创建位置,联合活动和偶遇活动必须指定位置。

生活奖励

在每个模拟年结束时,Agentopia 从三个维度为每个 agent 计算生活奖励:社会、主观和经济。这些奖励由外部确定,而非自我报告。

社会奖励基于其他 agent 的感知来衡量 agent 的社会地位。遵循温情-能力模型,每个 agent 私下以 0 到 100 的分数对其社交圈中的每个人在喜爱和尊重两个维度上打分。分数经过排序重标定,以消除个体评分尺度差异。这些分数形成两个加权有向图,分别对应喜爱和尊重。在每个图上应用加权 PageRank 来计算初始社会地位分数。然后加入互惠喜爱加成。agent iii 的最终地位分数为

Si=jNin(i)wji(1+αwij)Sj,S_i^\prime=\sum_{j\in\mathcal N_{in}(i)} w_{ji}(1+\alpha w_{ij}) S_j,Si=jNin(i)wji(1+αwij)Sj,

其中 SjS_jSj 是 agent jjj 的原始 PageRank 分数,Nin(i)\mathcal N_{in}(i)Nin(i) 是认识 iii 的 agent 集合,wjiw_{ji}wji 是从 jjjiii 的归一化边权重,α\alphaα 是互惠喜爱系数。该机制放大互惠关系的贡献。社会奖励是喜爱分数和尊重分数的平均值:

rsocial=12Saff+12Sresp.r_{\mathrm{social}}=\frac{1}{2}S_{\mathrm{aff}}^\prime+\frac{1}{2}S_{\mathrm{resp}}^\prime.rsocial=21Saff+21Sresp.

主观奖励根据 agent 在四个维度上的满足感历史计算。惩罚机制对满足感或活力低于同一周所有 agent 中第 25 百分位阈值的 agent 进行惩罚。主观奖励为

rsubj=w=1nwd=1Dfw,dnpλpnwD,r_{\mathrm{subj}}=\frac{\sum_{w=1}^{n_w}\sum_{d=1}^{D} f_{w,d}-n_p\lambda_p}{n_w D},rsubj=nwDw=1nwd=1Dfw,dnpλp,

其中 DDD 是满足感维度数,fw,df_{w,d}fw,d 是第 www 周维度 ddd 的满足感值,npn_pnp 是该年内惩罚实例总数,λp\lambda_pλp 是惩罚权重。

经济奖励是 agent 存款在一年内的净变化:

recon=depositenddepositstart.r_{\mathrm{econ}}=\mathrm{deposit}_{\mathrm{end}}-\mathrm{deposit}_{\mathrm{start}}.recon=depositenddepositstart.

总奖励对每个维度应用 z-score 归一化,并将其组合为

r=λsocialzsocial+λsubjzsubj+λeconzecon.r=\lambda_{\text{social}}z_{\text{social}}+\lambda_{\text{subj}}z_{\text{subj}}+\lambda_{\text{econ}}z_{\text{econ}}.r=λsocialzsocial+λsubjzsubj+λeconzecon.

生活奖励训练

由于生活模拟的长时程特性使得 PPO 等端到端方法不切实际,作者提出一种基于拒绝采样的训练方法。每个 agent 轨迹在每个模拟年涉及数百次大语言模型调用,而完整模拟跨越多年。对于模拟年第 ttt 年的每个 agent iii,回报为

Gi,t=k=0Ttγkri,t+k,G_{i,t}=\sum_{k=0}^{T-t}\gamma^k r_{i,t+k},Gi,t=k=0Ttγkri,t+k,

其中 γ\gammaγ 是折扣因子,TTT 是最终时间步。由于每个 agent 只产生一条生活轨迹,学习评论家或对多次 rollout 取平均都很困难。因此 Agentopia 使用每个 agent 自身先前的回报作为自参照基线。在跨时间步归一化回报后,优势定义为

Ai,t=Gi,tnormGi,t1norm.A_{i,t}=G_{i,t}^{\mathrm{norm}}-G_{i,t-1}^{\mathrm{norm}}.Ai,t=Gi,tnormGi,t1norm.

该优势衡量 agent 的预期未来生活奖励相对于自身过去是否有所改善。在每个奖励周期内,按优势选择前 25% 的 agent,并将这些 agent 在该周期内的所有轨迹纳入训练数据。由于选择基于自我改进而非绝对表现,该方法避免偏向初始条件本身就更好的 agent。

响应过滤会移除动作格式错误或参数无效的 agent 响应。联合活动和偶遇活动中的响应还会根据角色扮演原则进行检查,违规响应会被排除。为减轻灾难性遗忘,该方法使用自蒸馏。模型对 Tulu 3 数据集中通用指令的响应与 Agentopia 轨迹按输出 token 计量以 50:50 的比例混合。

实验

实验使用 Qwen3.5-397B-A17B 作为主要模型,在三个不同的社会世界中模拟 100 个 agent 十年。长期分析显示,主观奖励和经济奖励平均有所提升,而社会奖励保持稳定,并且各奖励维度与预期行为驱动因素一致。通过生活奖励进行微调改善了经济奖励和主观奖励、社会认可、若干满足感维度以及通用角色扮演能力,但也使 agent 转向被奖励的行为,同时降低未被奖励行为的优先级。计算成本分析揭示,不断增长的记忆和输入 token 成为长时程社会模拟中的主要瓶颈。

与先前的 agent 社会系统相比,Agentopia 支持持续数年的模拟,而此前列出的系统运行在数天或数周尺度上。它将自由形式动作和大语言模型生成的环境反馈与基于文件的记忆、技能成长和经济机制相结合。大多数先前系统则依赖预定义动作、基于规则的反馈和检索记忆。Agentopia 是唯一具有年尺度时间跨度的系统,其他系统仅限数天或数周。Agentopia 和 BookWorld 是仅有的具有自由形式动作空间和大语言模型生成环境反馈的系统。Agentopia 结合了基于文件的记忆、技能成长和经济系统,这一组合未被此前列出的系统共享。

热力图表明,token 使用量和联系相关交互指标与特定奖励维度具有最强的正相关,而函数调用计数在各设置中保持弱相关。这些关联因环境而异,在 The Campus 中 token 和联系相关性通常强于 Arcane Academy。在合并平均值中,token 量和联系次数与同一奖励维度的关联最为清晰。在合并平均值中,输入和输出 token 量以及主动和被动联系次数都显示出与同一奖励维度的最强正相关。函数调用计数在所有奖励维度和世界中都保持在零附近,而 token 和联系相关性在 The Campus 中通常强于 Arcane Academy。

生活奖励训练改善了跨世界社会模拟中的经济福祉和主观福祉,agent 也获得了更广泛的同伴认可。情绪、社交和尊重需求的满足感有所提升,但物质满足感下降,活动模式转向公共参与,远离独自活动和技能提升。经济奖励和主观奖励上升,而物质满足感随着储蓄相对支出的增加而下降。更多同伴尊重和喜欢这些 agent,尊重方面的相对增幅大于喜爱方面。公共活动参与增加,而独自活动和技能提升大幅下降。

Qwen3.5-397B-Agentopia 相较于其 Qwen3.5-397B 基础模型显示出明显提升,其中拟人化和角色保真度的相对提升最大。其平均角色扮演分数也超过 Claude-4.5-Sonnet,但仍落后于 Claude-4.5-Opus 和 Gemini-3-Pro。结果表明,生活奖励训练迁移为更强的通用拟人化和角色扮演能力。Claude-4.5-Opus 录得最高平均角色扮演分数,Gemini-3-Pro 紧随其后。Qwen3.5-397B-Agentopia 在平均值上超过 Claude-4.5-Sonnet,主要得益于更高的拟人化和故事情节质量。与基础 Qwen3.5-397B 相比,训练后的模型在拟人化和角色保真度方面提升最大。

在三个世界中对 100 个 agent 进行 10 年模拟消耗了大量计算资源,其中输入 token 在总体使用中占主导地位。记忆和人物角色上下文推高了输入需求,并且随着 agent 随时间的记忆积累,运行时间稳步增长。这使得上下文和记忆管理成为长时程社会模拟的核心瓶颈。在所有三个世界中,输入 token 以较大差距主导 token 消耗。The Campus 世界具有最高的总体 token 成本和最长的运行时间,而 The Apartment 具有最高的大语言模型调用次数。随着 agent 记忆和上下文的增长,每周年运行时间在模拟十年间大幅增加。

实验将 Agentopia 作为长时程社会模拟平台进行评估,将其与先前系统进行比较,并考察行为相关性、生活奖励训练效果、角色扮演质量和计算成本。token 使用和联系交互与奖励结果的关联最强,尤其是在 The Campus 中,而函数调用仍保持弱相关。生活奖励训练改善了经济、主观福祉、同伴认可和公共参与,但降低了物质满足感并减少了独自或技能导向活动。训练后的 Qwen 模型在拟人化和角色保真度方面获得显著提升,且长期模拟表明,记忆和人物角色上下文使输入 token 和不断增长的运行时间成为主要可扩展性瓶颈。


用 AI 构建 AI

从创意到上线——通过免费 AI 协同编码、开箱即用的环境和最优惠的 GPU 价格,加速您的 AI 开发。

AI 协同编码
开箱即用的 GPU
最优定价

HyperAI Newsletters

订阅我们的最新资讯
我们会在北京时间 每周一的上午九点 向您的邮箱投递本周内的最新更新
邮件发送服务由 MailChimp 提供