Command Palette
Search for a command to run...
EvolvingWorld:面向交互式文学世界中角色扮演智能体与世界模型协同演化的开放模式框架
EvolvingWorld:面向交互式文学世界中角色扮演智能体与世界模型协同演化的开放模式框架
Qing Zong Yue Guo Mengxin Yang Yiwen Guo Yangqiu Song
摘要
本文提出 EvolvingWorld,一个用于交互式文学世界中角色与世界协同演化的框架与基准。现有系统或将交互式文学模拟视为静态角色模仿,或将其视为孤立的场景生成,未能捕捉角色与世界如何随时间共同演化。为解决这一问题,EvolvingWorld 将文学模拟建模为一个长程过程,其中角色进行交互、场景推进,且角色与世界状态被持续更新。与依赖固定模式的先前系统不同,EvolvingWorld 采用开放模式框架,以支持跨多样化文学世界的模拟。该框架由两个耦合模块组成:一个用于多角色扮演与持久角色档案演化的角色智能体,以及一个基于大语言模型的世界模型,用于全局及地点/实体级状态维护与场景推进。基于此架构,我们为场景初始化、交互生成和状态更新制定了 7 个可训练任务。我们从 57 本书籍中构建了一个数据集,生成了 138,596 个有监督训练样本和 222 个测试快照。此外,我们引入了一个涵盖 10 个维度和 20 项指标的轨迹级 LLM-as-Judge 评估协议。实验表明,EvolvingWorld 能够通过有效维护持久、连贯的角色与世界发展来改善长程模拟。
一句话总结
来自香港科技大学、LIGHTSPEED、华中科技大学和一位独立研究员组成的团队提出EvolvingWorld,一个开放模式框架,将角色Agent与基于LLM的世界模型配对,用于互动文学世界中的协同演化角色扮演和世界模拟,引入七个可训练任务和一个基于57本书构建的基准,并通过LLM-as-Judge评估协议验证了改善的长程连贯发展。
核心贡献
- 该论文介绍了EvolvingWorld,一个模拟框架,将开放模式的角色Agent与隐藏追踪器(用于多时间尺度档案演化)以及基于LLM的世界模型(用于持久状态维护和场景推进)相结合。该框架被分解为七个涵盖初始化、交互和更新的可训练任务。
- 这项工作从57本书构建了一个基准,提供了138,596个监督训练样本和222个测试快照。它还提出了一个轨迹级LLM-as-Judge评估协议,包含10个维度和20个指标,用于量化持久角色和世界发展。
- 实验表明,EvolvingWorld减少了先前框架中观察到的长程性能退化,证明了角色和世界状态的协同演化导致了更连贯和持久的长程模拟。
引言
大型语言模型使得构建能够维持基于人格的对话的agent成为可能,但模拟整个文学世界跨越长故事弧需要更深入的东西:随着情节展开,角色必须更新他们的信念、动机和关系,而世界本身在改变地点、物体和社会秩序。现有的角色扮演系统存在不足,因为它们依赖静态人格档案、无法跨不同故事扩展的手动构建沙盒,以及无法跟踪完整角色档案演化或地点和实体级世界变化的部分状态更新。作者引入EvolvingWorld,一个框架,将开放模式的角色agent与隐藏追踪器(用于多时间尺度档案演化)和基于LLM的世界模型(维护全局、地点和实体状态)耦合,全部分解为七个可训练任务。他们还从57本书构建了一个基准,并配备轨迹级评估框架,衡量超越单场景角色扮演质量的持久角色和世界发展。
数据集
作者从57本按时间顺序叙述的书籍中构建了EvolvingWorld数据集,选择遵循Wang等人的方法。他们使用Gemini-2.5-Pro作为提取LLM,自动生成结构化场景、角色档案和世界状态。按时间顺序的叙述结构允许后续场景作为前瞻证据,将状态变化建立在实际文本基础上,而非模型先验知识。
数据集组成和处理细节:
- 来源:57本按时间顺序叙述的书籍。
- 提取:每本书被分割成文本块。对于每个块,LLM构建结构化场景,包含摘要、场景、关键角色和多轮交互。当一个场景在块边界被截断时,截断的文本被前置到下一个块,以便LLM可以继续同一场景。
- 角色处理:LLM将不同的名字提及统一为一致的字符,从最初几个相关场景构建初始的开放模式档案和隐藏追踪器,并利用后续叙述证据作为前瞻,逐场景更新这些状态。例如,如果一个角色在失败后反思,随后的场景显示持续的努力,确认了真实的状态变化。
- 世界状态处理:LLM跟踪两个级别。全局世界状态捕获故事级设置和系统条件;地点级状态描述每个地点的属性和重要的非角色实体。后续的交互和场景为全局状态变化提供证据,而在同一地点发生的交互和下一个场景为物理状态变化提供证据。地名被标准化,两个世界状态都在交互后初始化和更新。
- 数据集大小和分割:提取的序列沿时间线连接,产生138,596个监督训练样本,涵盖七个任务(论文中描述)。测试分割包含222个样本,从特定时间点选取,每个样本包含当前角色和世界状态,可以从中继续模拟。测试数据进一步分为来自部分见过的书籍的域内(ID)样本和完全排除在训练之外的书籍的域外(OOD)样本。
论文如何使用数据:数据集为学习预测角色和世界状态变化提供监督训练数据。训练样本用于训练模型执行七个状态跟踪任务,而ID和OOD测试样本评估在熟悉和全新叙事世界中的泛化能力。
方法
作者引入EvolvingWorld框架,模拟在持久角色和世界状态上的逐场景交互,从选定的叙事点展开一本书,成为一个不断演化的互动文学世界。
如下所示:
该框架构建在两个核心组件之上,旨在驱动开放模式、长程演化:角色Agent和世界模型。
角色Agent用开放模式档案表示每个角色,允许大型语言模型根据书籍的类型和风格选择、合并或引入新字段。为了支持持久的档案演化,agent将档案中的每个维度视为潜在可演化的。它引入了一个隐藏追踪器,与主档案分开记录弱证据或新兴证据。这种设计模拟了多时间尺度演化,防止过早更新,同时允许跨场景的重复信号累积成后来的变化。角色Agent还支持环境和角色组作为特殊的行动单元。
世界模型维护全局世界状态和地点级物理状态。全局状态使用开放模式设计捕获世界级设置,如历史背景和社会制度。此外,世界模型显式地模拟每个地点的物理状态,跟踪详细描述和重要的非角色实体。地点可以嵌套或分离,全局和地点级状态都通过角色交互自动更新。
作者制定了一个协同演化模拟管道,组合这些组件。在场景步骤t,模拟器维护全局世界状态,每个地点ℓ∈L的地点状态,以及每个角色i∈I的角色状态。地点ℓ的世界状态表示为Swℓ,(t)=(G(t),Lℓ,(t)),其中G(t)是开放模式全局世界状态,Lℓ,(t)存储地点描述和实体状态。角色状态为Sci,(t)=(Pi,(t),Hi,(t),Mi,(t)),包括开放模式档案、隐藏追踪器和场景级动机。从这些状态构建模块特定的观察。
模拟每个场景通过七个任务的序列进行:
- scene_cast:世界模型选择参与的角色集zt⊆I。
- location_scenario:给定角色集,世界模型生成一个场景计划,指定地点ℓt和场景rt。
- motivation_update:角色Agent为每个参与者准备一个场景特定的动机Mi,(t)。
- next_character:在场景中,世界模型从角色集选择下一个行动角色it,k。
- interaction_gen:角色Agent生成交互yt,k,可能混合思考、言语和行动。
- world_update:每一次交互后,世界模型更新全局和地点状态。
- character_update:场景结束后,每个参与角色状态更新为Sci,(t+1)。
这些任务定义了在持久状态和交互上的一个场景级转换。重复的转换产生完整的轨迹τ,旨在生成一个扎根的长程轨迹,其中场景内容、角色演化和世界状态变化保持相互一致。
对于数据集构建,作者选择按时间顺序叙述的书籍,并使用提取LLM构建结构化场景。提取管道将书籍分割成文本块,并提取摘要、场景、关键角色和多轮交互。角色和世界状态通过使用后续叙述证据作为前瞻参考,逐场景初始化和更新,以确保扎根的状态变化。提取的状态沿每个时间线连接,为七个任务创建监督训练样本,以及域内和域外测试分割。
实验
EvolvingWorld评估框架通过两个分数族(CHARACTER和WORLD)评估模拟质量,覆盖10个维度,使用LLM-as-Judge评分。实验在EvolvingWorld数据上微调多个开源模型,并将它们与闭源API、角色扮演基线和BookWorld框架在长程模拟中进行比较。结果表明,EvolvingWorld训练相比仅角色扮演的方法,提高了角色一致性、演化和环境扎根,而它的结构化世界状态跟踪产生了比BookWorld更好的场景连续性和长程演化,BookWorld在较长轨迹上性能会退化。
现有角色扮演框架依赖静态角色档案和有限的世界建模,缺乏自动档案更新和实体级状态跟踪。EvolvingWorld引入了开放模式角色和世界演化,显著改善了长程角色扮演,特别是在角色一致性、演化和环境扎根方面。用EvolvingWorld监督训练的模型在世界建模任务上甚至超过了一些更大的通用模型,展示了结构化状态跟踪对于连贯多agent模拟的价值。所有先前的框架缺乏自动档案更新和开放模式角色状态,且没有支持环境消息或群体行动。只有一个现有框架支持多角色场景,没有一个提供自动场景初始化。EvolvingWorld训练提高了角色一致性和演化,具有更好的特征保存和更平滑的事件驱动档案更新。环境意识增加,尽管环境利用率较低,表明更准确的扎根,而不是随意使用细节。对于世界建模,最大的收益在于长程场景连续性、回合/场景编排和地点级状态更新。EvolvingWorld优于BookWorld基线,特别是在角色演化指标如PUF、PES和MQ上,并减轻了长轨迹上的性能退化。用EvolvingWorld训练的Qwen-32B模型在世界模型平均得分上达到59.87,超过Claude-4.6-Sonnet和Gemini-2.5-Flash。
闭源模型评估显示Gemini-2.5-Pro在整体角色agent性能上达到最高,具有强角色一致性和交互进程。即使是顶级模型,动机相关指标和档案演化平滑度仍是弱点,突出显示了EW训练方法旨在解决的长程角色一致性挑战。Gemini-2.5-Pro以85.20的整体平均分领先闭源模型,超过下一个最佳模型约3分。强模型在角色一致性和交互一致性上相对较高,但动机等级和动机深度明显较低,表明维持角色动机是一个持续的困难。档案演化平滑度差异显著;Gemini-2.5-Pro达到86.06,而GPT-4o仅有74.15,表明处理角色随时间更新是一个关键区分因素。与表格相关的论文报告说,EW训练改善了受控的角色演化和环境意识,弥补了这些闭源基线中观察到的弱点。
世界模型评估表明,显式结构化状态跟踪对通用模型具有挑战性,闭源世界模型平均分从59.76到72.37。有针对性的EW训练大幅提高了长程场景连续性、回合编排和地点级更新,使Qwen-32B模型达到59.87,超过Gemini-2.5-Flash和Claude-4.6-Sonnet。这些收益来自建模耦合的角色和世界状态演化,而不是仅模仿对话。EW训练的Qwen-32B在世界模型平均分上达到59.87,超过Gemini-2.5-Flash(59.76)和Claude-4.6-Sonnet。在闭源模型中,Gemini-3.1-Pro-P以72.37的平均分领先,驱动因素是回合/场景编排得分85.55。
EvolvingWorld在所有测试骨干上在角色agent指标上一致优于BookWorld,在角色演化指标如PUF、PES和MQ上获得最大增益。优势反映了开放模式状态更新对于在长模拟中维持连贯角色发展的好处。EvolvingWorld在评估的每个骨干上,包括大型和小型模型,都实现了比BookWorld更高的平均角色agent得分。最大的相对改进出现在角色演化指标PUF、PES和MQ,表明在EvolvingWorld框架下更有效的档案更新和演化质量。
EvolvingWorld在所有骨干上在世界模型指标上一致优于BookWorld,在长程场景连续性和回合/场景组织上获得最大增益。改进在最弱的骨干上最为明显,其中EvolvingWorld将某些分数提高了一倍以上,表明结构化世界状态更新对于稳健的长程模拟至关重要。EvolvingWorld在每个测试骨干上实现了比BookWorld更高的场景连续性(SCC)和回合/场景组织(TSO)分数。在最小骨干上,EvolvingWorld将TSO提高了超过60%,并将平均角色状态回忆(Avg. CSR)大致翻倍,与BookWorld相比。
EvolvingWorld在角色agent和世界建模任务上与现有框架和闭源模型进行了评估。它引入了开放模式角色和世界演化,显著改善了长程角色扮演一致性、角色演化和环境扎根。用EvolvingWorld训练使Qwen-32B模型在世界建模上超过更大的闭源模型,并一致地在角色和世界指标上优于BookWorld基线,最大的增益在档案演化和场景连续性上。该框架还解决了在顶级闭源模型中观察到的弱点,如维持角色动机和随时间平滑档案更新。