Command Palette
Search for a command to run...
LLM 智能体能否遵循剧本?面向交互式叙事中长程一致性的基准测试
LLM 智能体能否遵循剧本?面向交互式叙事中长程一致性的基准测试
Yingpeng Ma Jianhao Yan Bei Shi Ka Hou Kam Runnan Wang Xuebo Liu Yulong Chen Yue Zhang Derek F. Wong
摘要
大语言模型(LLM)的快速发展正通过实现开放、流畅的交互式叙事,为游戏 AI 带来革命性变化。然而,现有研究在很大程度上忽视了在不受约束的用户干预下,维持长程逻辑一致性与叙事完整性的关键挑战。为此,我们将这一挑战形式化为叙事承诺保持(Narrative Commitment Preservation, NCP),并以交互式叙事作为实验平台。我们推出了 NCP-Bench,一个基于电影梗概构建的、包含 100 个叙事环境的基准测试集。每个环境都包含一个结构化的叙事规范(轨迹、承诺和初始事实),我们可以在玩家智能体与叙述者智能体的整个交互过程中自动对其进行核验。在多种最先进 LLM 上的实验揭示了一个显著的长程一致性差距:高语言质量并不能保证承诺的保持;即使性能强大的模型,在对抗性干预下也频繁生成逻辑冲突的内容,表现最佳的模型(GPT-5.2)在 20 轮对话后的存活率仅为 42%,各模型的事实冲突率介于 40% 至 68% 之间,且仅有极少数运行能在 100 轮限制内满足所有成就承诺。
一句话总结
作者提出了NCP-Bench,一个包含100个叙事环境的基准,这些环境源自电影剧情简介并配有结构化规范,旨在系统性地评估LLM驱动的交互式叙事中长程叙事承诺保真性,结果表明,即使是最强的模型(GPT-5.2)在20轮后存活率仅为42%,各模型的事实冲突率在40%到68%之间。
核心贡献
- 叙事承诺保真性(NCP)被形式化为开放式交互叙事中维护逻辑承诺的任务,提供了一个领域无关的抽象,要求在每个应用中实例化承诺、状态和违规检查。
- 引入NCP-Bench,一个由100个叙事环境构成的基准,环境基于电影剧情简介构建,每个环境包含结构化的叙事规范(轨迹、承诺、初始事实)以及自动化审计协议,用于评估agent交互过程中的承诺保真性。
- 在六种最先进的LLM上的实验表明,表现最好的模型(GPT-5.2)在20轮后存活率仅为42%,事实冲突率在40%到68%之间,仅有孤立的几次运行在100轮内满足所有成就承诺,表明语言流畅性并不能保证长程逻辑一致性。
引言
作者处理的是AI游戏中的交互式叙事,其中基于LLM的叙述者agent必须维持连贯的故事世界,并在自由形式的用户输入下遵守情节约束。虽然LLM能生成流畅的文本,但往往无法维护逻辑一致性,允许用户行为与已确立的事实相矛盾或跳过必要的情节里程碑。为此,作者将叙事承诺保真性(NCP)形式化为一个长程约束满足问题,并引入NCP-Bench,该基准包含100个叙事规范,并配备显式的事实账本和承诺,支持状态一致性的自动审计。实验表明,即使像GPT-5.2这样的最先进模型也难以在20轮后存活,事实冲突是失败的主要模式,从而揭示流畅性并不能保证可靠的逻辑承诺。
数据集
作者构建了NCP-Bench,一个用于评估交互式叙事环境中叙事承诺保真性的基准。该数据集基于CMU电影摘要语料库构建,包含100个精心策划的环境,每个环境都基于一部电影剧情简介和特定的故事内角色,该角色的视角限制了可用信息。
数据集构成与来源
- 来源:CMU电影摘要语料库,使用经典电影角色(不一定是主角)的子集。
- 初始的(电影,角色)候选池经过清洗和去重处理。
- 经人工清洗和筛选后,选出100部电影以最大化流派多样性和叙事质量。
- 每个最终的环境包含一个结构化的叙事规范:初始事实账本、一组叙事承诺和一个记录主要情节步骤的有序参考轨迹。
每个子集的关键细节
- 数据集包含单一的100个环境,没有预定义的训练/验证/测试划分。
- 每个环境都绑定于一个玩家角色,所有标注都限制在该角色的视角下(无全知信息)。
- 每部电影手动分配两个流派标签(主、次);最终集合涵盖18个流派(例如动作、科幻、喜剧、犯罪、西部)。
- 叙事规范格式使用三种组件类型:
- 初始事实账本:在开始时世界状态和玩家知识,严格隔离未来信息。
- 承诺集:必须遵守的规则(不变量、排序约束)或必须满足的目标(成就);违规或未满足的成就导致失败。
- 参考轨迹:有序的情节步骤,每个步骤包含描述、触发事件和关键增量。
- 质量验证:构建完成后,三位专家独立审查了全部100个规范,仅指出七处局部歧义(无重复出现的错误)。
论文如何使用数据
- NCP-Bench被用作承诺保真性任务的评估基准。
- 该任务被建模为玩家(模型)与叙述者agent之间的自由形式、开放式交互。
- 基准为每个环境提供结构化规范;模型必须在交互中保持给定的承诺,成功与否取决于所有成就承诺是否被满足且无任何违规。
- 不应用训练混合比例或数据集划分,因为数据集仅用于评估。
处理与裁剪细节
- 清洗:人类专家移除重复/近似重复条目,解决角色与电影不匹配问题,并过滤掉过于不完整而无法支持交互的剧情简介。
- 多样性导向的筛选:从清洗后的候选中手动选择100部电影,以覆盖正交的叙事风格和流派,优先选择详细、连贯的剧情简介。
- 流派标注:每部电影手动分配两个标签,以指导选择并便于后续分析。
- 未应用裁剪或降采样;评估中使用全部100个环境。
- 叙事规范按环境生成并由专家审查;存在重大问题的规范被重新生成,小问题则被修正。
方法
作者将交互式叙事视为一种回合制交互,其中叙述者agent充当游戏主持人,在回应玩家的自由形式动作的同时维持一个连贯的故事世界并遵守作者设定的情节约束。在第t回合,交互由对话历史Ht和不断演变的故事世界表征。玩家产生一个自由形式的表述或动作ut,agent输出叙事延续yt。agent的回应承担两个耦合功能:逻辑反应,承认动作并更新叙事状态;以及叙事引导,将交互引导至情节相关事件,同时保留玩家自主性。
为了可靠地评估这种开放式任务,作者将其建模为承诺保真性任务并构建NCP-Bench。他们从CMU电影摘要语料库开始,收集候选电影和角色对。经人类专家清洗和去重以去除噪声并解决不匹配后,他们手动选择100部电影,以最大化覆盖正交的叙事风格和流派。
最终的基准由这100个精心策划的剧情简介和玩家角色对构建而成,确保广泛的流派覆盖,涵盖18个不同类别。对于每个剧情简介,关联的角色被指定为玩家角色,所有标注都限制在该角色的视角下,以避免全知信息泄露。
该方法的核心是叙事承诺保真性(NCP),它维护故事状态、叙事约束和轨迹进展的显式表示:
st=(Ft,it,C,R)其中Ft是一个事实账本,记录当前已确立的世界状态,C是一组承诺,R是一个有序参考轨迹,it记录沿该轨迹的进展。每个轨迹节点代表一个显著的情节步骤,通过其触发事件和关键增量进行评估。
评估框架将待评估的叙述者agent与固定的、外部定义的审计协议分离开。叙述者agent生成叙事文本,而一组提示固定的评估组件确定一致性,更新显式状态,并跟踪进展。
该框架通过四个不同的步骤评估每个回合。首先,冲突检查会检查叙述者agent的回应中是否存在与活动账本的事实冲突、承诺冲突以及玩家输入冲突。任何最初检测到的冲突都会经过二次确认步骤,以减少LLM审计器产生的误报。其次,事实更新从回应中提取增量更新,包括新增和否定的事实,仅在冲突检查通过后才将其提交到事实账本。第三,轨迹节点更新判断当前节点的触发事件和关键增量是否已发生,若两者均已明确完成则推进索引。最后,承诺检查跟踪每个承诺的满足条件是否已达到,将其标记为PENDING或SATISFIED。若确认有任何违规,交互将终止并视为失败;否则,当所有成就承诺均无矛盾地被满足时,即视为成功。
实验
评估框架将叙述者agent与一个固定的、现成的审计协议配对,该协议检查事实冲突、承诺违规和玩家输入确认,同时跟踪轨迹进展。在作为叙述者评估的多个最先进LLM中,存活率随交互长度急剧下降,事实幻觉成为主要失败模式,即使最好的模型在20轮后存活率也仅为42%。定性分析表明,模型常常过早揭示情节关键信息、改写已确立的故事事实或忽略玩家动作。消融研究证实,这些发现对审计器选择是稳健的,且无论是记忆增强还是合作性玩家输入都不能解决在长程中保持叙事承诺的核心困难。
所有模型在长交互中均难以保持承诺,在远未达到100轮限制时存活率就接近零,总体满足承诺的百分比也较低。GPT-5.2实现了平均最长的交互,但情节进展较慢,而DeepSeek-V3.2推进更为激进,达到更远的轨迹节点,并在较少回合下实现了最高的满足承诺百分比。事实冲突是主要失败模式,GPT-5.2整体冲突率最低。GPT-5.2维持最长的交互(平均32.92回合),但轨迹进展和承诺满足度低于每回合推进更远的DeepSeek-V3.2。事实冲突在失败模式中占主导地位,从GPT-5.2的40%交互到Qwen3-235B-A22B的68%。
事实冲突在所有评估模型中占主导地位,至少占所有冲突的40%,而承诺冲突和玩家输入冲突的差异更大。对GPT-4o-mini输出的人工验证确认,评估器错误很少,且主要限于细微的事实转换边界情况,在承诺或玩家输入冲突类别中未发现争议。事实冲突是每个模型中最常见的失败模式,GPT-5.2占比最低(40%),Qwen3-235B-A22B最高(68%)。对GPT-4o-mini的人工审查发现,仅4%的事实冲突案例存在争议,均出现在状态变化或认知更新边界,且在承诺或玩家输入冲突中无错误。
当评估相同的叙述者agent时,三个不同的审计器模型产生大致一致的冲突分布,事实、承诺和玩家输入冲突率落在狭窄范围内。虽然GPT-5.2更严格,未记录任何成功运行且轨迹进展较低,但所有审计器得出的结果高度相关,证实评估结论并非依赖于单一骨干模型。人工验证显示错误罕见,仅限于边界情况的事实冲突。事实冲突率在不同审计器间相似,范围为60%至67%。承诺和玩家输入冲突率保持可比,变化不超过15个百分点。GPT-5.4-mini和Gemini-2.5-Flash各报告了5次成功运行,而GPT-5.2记录为零。轨迹进展GPT-5.4-mini最高(16.64%),GPT-5.2较低(7.67%),但满足承诺率均保持在10–11%左右。两两皮尔逊相关系数均高于0.96,表明审计器之间高度一致。对100次运行的人工审查仅发现4例事实冲突误报,均出现在细微状态变化情况,且在承诺或玩家输入冲突中无错误。
集成层次化记忆会大幅减少承诺冲突,但显著增加玩家输入冲突,整体成功率下降。记忆增强的agent实现更长的交互,但在任何运行中都未能满足所有成就承诺,展现了长程情节跟踪与局部输入保真度之间的权衡。HiAgent将承诺冲突从26%降至4%,但玩家输入冲突从13%倍增至38%。满足所有成就承诺的运行数从使用普通GPT-4o-mini时的2次降至使用HiAgent时的0次,无冲突运行从5次降至3次。事实冲突率几乎相同(60% vs 59%),而平均回合数从22.16增至30.05。
从对抗性玩家输入切换到自然玩家输入使平均交互长度增加一倍以上,并大幅减少承诺冲突,但满足所有成就承诺的运行数降至零。即使合作性游戏也无法消除冲突:大多数交互仍以冲突告终,表明对抗性输入放大了难度但不是根本原因;长程承诺保真性的核心挑战依然存在。自然输入使平均回合数增加一倍以上(从22.16到46.08),达到100轮限制的运行数从3次增至19次。承诺冲突从26%降至9%,但满足所有成就承诺的运行数从2次降至0次。玩家输入冲突从13%增至18%,可能因为合作性玩家产生了更多叙述者必须确认的输入。尽管转换为合作性游戏,大多数交互仍以冲突结束,证实对抗性难度并非唯一障碍。
所有模型在长交互中都无法保持情节承诺,事实冲突在所有测试系统中成为主要失败模式。GPT-5.2维持最长的交互但进展较慢,而DeepSeek-V3.2推进更激进并实现更高的承诺满足度。层次化记忆急剧减少承诺冲突但放大了玩家输入问题,并且切换到合作性游戏使交互长度翻倍以上,却仍无法产生满足所有承诺的运行,表明长程一致性的核心挑战是内在的,而不仅仅是对抗性的。