HyperAIHyperAI

Command Palette

Search for a command to run...

7 天前
Agent
LLM

VibeLifeBench:你的生活智能体能否在动态世界中保持主动与持续?

摘要

大语言模型(LLM)智能体正越来越多地被部署为个人助理。然而,现有评估大多使用静态环境中的简短、自包含请求。日常生活的辅助则截然不同:一项任务持续数周而非数分钟;世界在智能体未被提示时持续变化;许多约束从未被明确说明。一个仅对眼前请求做出回应的智能体将无法胜任此类任务。真正需要的是一个保持主动且行为一致的智能体,它能自行决定何时行动、何时询问、何时保持沉默,能察觉无人告知的变化,并能从始至终维持连贯的计划。目前尚无基准测试能衡量这些能力。为此,我们推出了 VibeLifeBench,一个涵盖十个日常生活领域、包含 200 个长周期任务的基准测试。每个任务都是一个在由 22 个模拟服务构成的虚拟世界中、按脚本编排的多周时间线。世界按照自己的时钟推进,其中许多变化是静默发生的,因此只有重新审视世界的智能体才能发现它们。每个任务都通过细粒度、加权的检查项进行评分,这些检查仅读取智能体实际留下的痕迹,涵盖最终状态、行动的及时性以及是否遵守了隐性约束。我们评估了七个前沿模型,它们的得分均很低,这表明当前智能体距离辅助真实生活还有很大差距。我们将开源所有任务、环境和评估框架。

一句话总结

小红书Dots Studio与Evolvent AI联合推出VibeLifeBench,这是一个包含200个多周日常任务的基准测试,在由22个模拟服务构成的仿真世界中,agent必须主动行动、检测静默变化并在隐式约束下保持一致性,评估结果显示七款前沿大语言模型得分均偏低,突显了当前助手与真实生活中主动型agent之间的差距。

核心贡献

  • 本文提出VibeLifeBench,一个涵盖十个日常生活领域、共200个长周期任务的基准测试,每个任务在由22个模拟服务构成的仿真世界中跨越数周时间线展开,世界会独立且静默地演化,要求agent主动行动并维持连贯的计划。
  • 提出一种阶段感知的加权评分方法,仅基于agent的可观测轨迹,同时衡量终态正确性、主动行动的及时性以及未告知的世界变化是否被忠实传播。
  • 在七款前沿模型上的实验表明,所有模型在该基准上得分均偏低,任务、环境及评估框架将开源,以支持持续、主动型生活agent的研究。

引言

尽管大语言模型agent越来越多地部署在编程和办公等专业场景中,日常生活辅助尽管对普通用户意义重大,却仍未被充分探索。此前的基准测试集中于在静态环境中被动执行显式任务,无法捕捉主动性、对动态变化世界的适应能力以及跨越多周生命周期的长周期连贯性。作者提出VibeLifeBench,一个包含200个任务、横跨十个日常生活领域的基准测试,每个任务构建为一个多周模拟生活世界,配备22个模拟服务后端和288个工具接口。世界通过脚本化事件自主演化,要求agent主动重新检查变化、维持不断更新的计划,并决定何时行动或通知用户。阶段感知评分包含超过12,000项检查,同时评估终态正确性和主动行为,结果表明即使是最强的前沿模型也仅达到32.5的average@3得分,揭示了可靠、长期生活辅助领域的显著差距。

数据集

作者提出VibeLifeBench,一个精心策划的评估套件,包含200个长周期任务,用于衡量agent助手在数周模拟时间中保持主动、可信和持久的能力。以下详细介绍数据集的构成、关键统计数据及其使用方式。

数据集包含的内容

  • 每个任务是一个自包含的目录,包含五个组成部分:
    • 初始世界状态 – 22个模拟服务的种子数据,创建一个逼真的起始点(例如,预订、账户、日历项)。
    • 事件时间线 – 一系列阶段,每个阶段包含带时间戳的事件(用户消息、通知、世界观察和静默变更)。
    • 启用的服务 – 该任务激活的22个模拟后端子集(例如,邮件、银行、旅行预订)。
    • 角色与工作区 – 定义用户身份、偏好、约束和授权边界的背景文件。
    • 评分标准 – 一组加权、确定性检查,用于检查agent的输出产物(服务的终态、文件、邮件、回复),绝不窥探其内部推理过程。

来源与构建

  • 任务从日常生活场景(出国旅行、租房纠纷、装修)中手工构建,均匀分布在10个领域(每个领域20个任务),涵盖旅行、金融、购物、健康、职业等。
  • 统一的流水线将每个场景转化为可复现的测试:
    1. 场景与角色 – 确定用户身份、隐式约束、安全红线及授权限制。
    2. 时间线编写 – 将故事展开为按阶段组织的事件时间线。大量变化是静默变更(共1,483个),在不触发回合的情况下改变世界,迫使agent主动重新检查。
    3. 环境实例化 – 为每个任务所需的服务填充种子数据,并加入大量干扰项,使所有关键实体只能通过工具调用来发现。
    4. 评分标准 – 编写加权检查,要求具体证据(数值计算、状态变化)而非关键词匹配,分为每阶段、跨阶段和最终三个层级。

关键统计

  • 任务周期:模拟持续时间中位数29天(最长可达约111天),压缩为24个阶段的中位数。
  • 事件:整个套件共7,453个事件,每个任务中位数36个。构成:30.1%为用户消息,25.8%为通知/提醒,24.1%为世界观察,19.9%为静默变更(1,483个事件)。总体而言,69.9%的事件由环境驱动,而非用户提示。
  • 服务:22个模拟后端提供288个工具接口。每个任务使用中位数7个服务(最多12个)。通用服务如邮件(198/200个任务)、日历(195个)和笔记(162个)几乎无处不在;领域特定后端(银行、航班预订、签证等)出现在相关集群中。
  • 评分12,261项加权检查,每个任务中位数58项(范围31至135项)。每阶段检查占检查数量的80.8%,但跨阶段和最终检查占总权重的26.8%,对安全违规、预算超支或信息泄露施以严厉惩罚。

数据集的使用方式

  • VibeLifeBench是一个纯粹的评估基准,不提供训练数据或训练/测试划分。200个任务作为固定的测试集发布。
  • agent策略在任务的整个时间线上运行。在每个回合中,它可以发出工具调用、写入工作区文件或发送回复。其可观测轨迹(服务、文件、邮件和回复文本的终态)随后与确定性评分检查进行比较。
  • 总体得分是通过的加权检查的比例,以0–100分制报告。这奖励了长周期中的部分能力,并确保单一关键失败(例如泄露个人数据)不会被大量常规成功所掩盖。

处理与可复现性

  • 所有任务共享相同的22个模拟服务后端,每个后端在冷启动时从种子数据启动。世界模拟完全离线、确定性且可复现。
  • 构建过程有意将安静间隔压缩为稀疏的阶段,使得一个多周任务可以在可管理的检查点数量内进行评估,同时保留长期记忆和主动性要求。
  • 角色和工作区文件嵌入了agent必须推断并遵守的隐式约束和授权边界;设置了诱人的捷径以测试合规性。

方法

VibeLifeBench框架建立在以下前提之上:一个任务不是单个提示,而是一个随时间推进的世界。agent被置于一个持久的情景中,配备一组工具和一个或多个需要服务的角色,时间开始向前推进。底层世界状态无论agent是否关注都会发生变化,agent必须决定何时行动、何时重新检查以及何时保持沉默。这一设计产生了三个核心承诺:世界静默推进以衡量主动性;任务嵌入隐式约束和安全红线以测试可信度;共享且可复现的服务后端结合每个任务的初始数据,在真实性与确定性之间取得平衡。

每个任务被形式化为一个五元组

τ=(W0,E,K,P,R),\tau = (W_0, \mathcal{E}, \mathcal{K}, P, R),τ=(W0,E,K,P,R),

其中各组成部分为:

  • W0W_0W0:初始世界状态,由为每个启用的服务后端提供的种子数据决定。
  • E={e1,e2,}\mathcal{E} = \{e_1, e_2, \dots\}E={e1,e2,}:事件时间线,按阶段分组,并在每个阶段内按时间戳排序。
  • K{k1,,k22}\mathcal{K} \subseteq \{k_1, \dots, k_{22}\}K{k1,,k22}:agent可用的服务能力(工具后端)集合。
  • PPP:角色与工作区,包括用户身份、偏好、授权策略以及在开始时给出的任何背景材料。
  • R={(ci,wi)}i=1mR = \{(c_i, w_i)\}_{i=1}^mR={(ci,wi)}i=1m:评分标准,一组关于可观测世界的加权确定性谓词。

一次运行使agent策略按时间槽逐一推进时间线。设WjW_jWj为处理第jjj个分发项后的世界状态。状态按下式演化:

Wj=apply(Wj1,ej,aj),ajπ(obsj,Hj1),W_j = \text{apply}(W_{j-1}, e_j, a_j), \quad a_j \sim \pi(\cdot \mid \text{obs}_j, H_{j-1}),Wj=apply(Wj1,ej,aj),ajπ(obsj,Hj1),

其中aja_jaj是agent在该回合中采取的动作序列(工具调用、文件写入、回复),Hj1H_{j-1}Hj1是其历史记录。对于静默变更,不产生回合,aj=a_j = \emptysetaj=,世界的改变仅由事件本身引起。agent的输出不是单一答案,而是整个可观测轨迹:每个阶段后端服务、工作区文件、笔记、日历、已发送邮件和回复的终态。评分仅基于这些产物。

世界由22个模拟服务后端模拟,代表agent需要交互的日常应用。它们分为通用服务(邮件、日历、笔记、通知中心)和领域服务(银行、旅行预订、电商、物流、法律检索等)。每个服务是一个自包含的产品后端,定义自己的数据模型,在冷启动时从种子数据启动,并暴露一组稳定的工具。它们共提供288个工具接口。一个任务仅配置自己的场景数据和事件节奏;后端本身在任务间保持不变,确保可复现性的同时使评估完全离线且确定性。

事件时间线按阶段组织,每个阶段是一个检查点,agent可能需要在此行动,或评分器在此检查世界。事件按时间戳顺序分发,共有四种类型:用户消息、外部世界公告、通知和静默变更。前三种类型开启一个回合并捕获agent的回复;而变更则直接应用于相关服务状态,没有任何伴随消息或通知。这一缺口是衡量主动性的核心机制。变更静默地改变世界,后续阶段依赖该变化。只有持续自主重新检查世界的agent才能及时检测并响应这一差异。该基准测试在各任务中嵌入了1,483个此类后台变更。

评分通过针对最终世界状态和产生的产物评估RRR中的加权检查来进行。检查是确定性谓词,从不读取模型的隐藏推理过程。它们分为三个层级:奖励及时行为的每阶段检查、强制执行整个周期约束(预算上限、安全红线)的跨阶段检查,以及检查agent留下的终态的最终检查。得分是获得的检查总权重占比,缩放至0–100分。权重有意不均匀:单次关键失败,如泄露个人信息或突破硬性预算上限,其权重远超一次表面疏忽,因此agent无法通过常规任务完成来掩盖不安全行为。

测试集通过统一流水线构建,将日常场景转化为客观、难以取巧的任务。流水线分为四个阶段:

  1. 场景与角色设计:每个任务从一个真实生活情境出发(例如,出国旅行、租房纠纷)。确定角色及其工作区,包含身份、偏好和隐式约束,包括安全红线。
  2. 时间线编写:将场景展开为按阶段组织的事件时间线。四种事件类型交错排列,大量世界变化作为静默变更安排,以迫使主动重新检查。
  3. 环境实例化:为每个启用的服务准备每个任务的种子数据。初始状态填充干扰项以防止浅层猜测,所有关键实体通过工具调用可发现,而非硬编码到评分中。
  4. 评分标准编写:编写阶段感知的加权检查,使每项检查都能做出有区分力的判断(例如,计算具体数值,验证真实状态变化),且不会被关键词的单纯出现所欺骗。

这一流水线确保每个任务逼真,主动性和可信度对于获得高分至关重要,且评估在200个不同任务中保持完全客观和可复现,所有任务共享相同的22个后端。

实验

评估使用VibeLifeBench,一个包含200个长周期生活任务的基准测试,agent必须在多次运行中保持状态、响应未告知的世界变化并满足阶段感知检查。在七款前沿模型上的实验表明,所有模型表现均不佳,即使是最强的模型也无法持续维护跨阶段产物或主动适应动态环境,这突显了单轮工具使用与真实世界生活辅助所需的持久、主动行为之间的根本差距。

现有的编程、办公和网页任务agent基准测试不需要主动决策或动态环境,且仅有少数部分涉及长周期规划。VibeLifeBench专门衡量这些缺失的维度,实验表明当前模型在无提示情况下主动发起行动、维持持久状态以及适应独立演化的世界方面存在困难。在长周期任务中,表现随时间推移而下降,且没有模型能够可靠覆盖所有日常生活领域。在所有评估模型中,主动性得分均偏低,表明agent很少在没有提示的情况下自行决定何时行动。持久性与记账能力(需要维护跨阶段产物)得分也偏低,表明模型倾向于被动且一次性响应。当环境独立变化时,agent通常无法重新检查并传播这些变化,传播与恢复得分与主动性和持久性一同处于最低水平。每个模型的通过率从长周期任务的前三分之一到后三分之一均出现下降,降幅为10至15个百分点。没有模型在所有十个生活领域中都表现出能力,且模型间一致的从易到难排序凸显了真实世界生活辅助的广度挑战。现有基准测试在主动性和活体世界方面被标记为不满足,在长周期方面仅部分满足,与VibeLifeBench的设计形成对比。

实验定义了四种事件类型:用户消息、世界观察和通知均开启agent回合,而变更则静默地改变世界状态而不触发回合。这一区分塑造了agent行为——agent必须主动重新检查世界以检测和传播变更,这是当前模型所缺乏的能力,导致主动性和持久性得分偏低。变更是不触发agent回合的后台状态变化,要求agent主动重新检查世界。agent通常会错过变更,因为在没有明确提示时不重新检查世界,使得适应活体世界成为核心弱点。所有模型的主动性和持久性得分均偏低,agent被动响应,很少维护跨阶段、可审计的产物。即使检测到变更,模型也难以将变化传播到其计划中,限制了其处理动态环境的能力。

评分标准从五个维度评估agent:工具使用、后端状态、持久产物、回复一致性和跨阶段连贯性。实证分析表明,模型在持久产物和跨阶段一致性方面最为困难,通常无法生成持久记录、主动重新检查世界或在长任务周期中维持约束。要求持久产物的检查几乎从未通过,表明模型很少生成评分标准所要求的跨阶段关联文件和笔记。跨阶段一致性维度(将运行中的账本总额与绝不可逆转的安全红线等产物联结起来)暴露了在各阶段之间维持可审计状态的普遍失败。所有模型的主动性和持久性均偏低,因为许多检查依赖于agent在没有提示的情况下重新检查世界并将变更传播到其计划中。每个模型在任务后期阶段的检查通过率均出现大幅下降,这是由维持约束的困难而非单纯的任务长度所驱动的。

VibeLifeBench任务模拟持续20至48天的生活场景,每个任务被分解为多个阶段和数十个事件。金融领域每个任务需要中位数94项检查,远超其他任何领域,凸显了对持久、跨阶段记账的需求。在所有领域中,任务涉及5至8个不同的服务,表明agent必须在整个长周期中协调多个工具。职业领域的中位数模拟周期最长,为48天,而金融领域需要中位数94项检查,强调了对长周期连贯性和持久审计轨迹的需求。所有领域的中位数均为24至28个阶段和30至44个事件,表明难度源于多阶段协调而非单纯的任务持续时间。

Claude Opus 5取得最高平均分并生成最多的输出token,但更大的资源消耗并不能保证顶级表现。GPT-5.5在使用最少输出token和上下文的情况下排名第二,而Gemini 3.5 Flash读取最多上下文、进行最多回合却落在中游。结果表明,成功取决于精力的使用方式,而非token或交互的绝对数量。Claude Opus 5以最高平均分和最大的输出token数、工具调用数及每轮运行回合数领先。GPT-5.5以顶级模型中最小的输出和上下文预算排名第二,却进行了最多的工具调用。Gemini 3.5 Flash读取最多上下文、进行最多回合,但得分仅处于中游。DeepSeek-V4-Pro以最低的上下文预算取得21.1分,展现出节俭而稳健的特征。

VibeLifeBench在长周期日常生活场景中评估agent,其中世界通过静默变更独立演化,要求主动重新检查和持久的跨阶段记账。实验表明,当前模型始终无法在没有提示的情况下主动发起行动、维护持久产物以及传播世界变化,且其表现无论领域如何都随时间推移而下降。没有模型能够可靠覆盖所有生活领域,成功更多取决于高效推理而非token或交互的数量,这凸显了这些基准测试在衡量主动性、持久性和动态适应能力方面所填补的空白。


用 AI 构建 AI

从创意到上线——通过免费 AI 协同编码、开箱即用的环境和最优惠的 GPU 价格,加速您的 AI 开发。

AI 协同编码
开箱即用的 GPU
最优定价

HyperAI Newsletters

订阅我们的最新资讯
我们会在北京时间 每周一的上午九点 向您的邮箱投递本周内的最新更新
邮件发送服务由 MailChimp 提供