HyperAIHyperAI

Command Palette

Search for a command to run...

2 小时前
Agent
基准
LLM

MatrAIx:基于 83 亿人格智能体的世界模拟

摘要

对人工智能(AI)系统和数字产品进行人工评估成本高昂、速度缓慢且难以大规模扩展。离线评估虽然更具可扩展性,但往往忽略了人类的多样性和交互行为。为此,我们提出了 MatrAIx,一个面向人口规模、支持异构用户测试 AI 系统与数字产品的模拟用户评估基础设施。MatrAIx 包含三个核心组件:第一,Persona 8B 拥有 83 亿条人格记录,通过包含 1290 个类别维度的模式进行表示。记录可从保留关联属性的依赖图中采样,或从人工编写的档案中生成。我们发布了一个经过质量过滤的约 100 万条人格核心集,包含 599,847 条基于真实人类的记录和 400,000 条合成记录。第二,MatrAIx Playground 提供了四种环境,供多样化用户评估数字产品并与之交互:问卷、AI 聊天机器人、网页和应用。第三,MatrAIx 提供了 1010 个应用任务,涵盖商业、软件、金融和医疗等超过 25 个领域。我们在八个代表性任务上进行了 18,189 次评估试验。人格智能体由三种大语言模型驱动:Claude Opus 4.8、GPT 5.5 和 Claude Haiku 4.5。由此产生的反馈捕捉了决策和偏好如何随人格背景而变化,包括价格上涨后的犹豫、AI 助手失败后继续使用的意愿以及延迟容忍度。我们进行了两项主要验证研究:第一,一项包含 400 次试验的受控研究,在全部四种环境中评估了十种行为属性的人格一致性。在 366 次试验(91.5%)中,所声明的行为得到了表达或被正确抑制。第二,人类和大语言模型(LLM)评判员评估了基于真实人类的人格提取质量。总体而言,MatrAIx 提供了一个端到端的基础设施,用于利用多样化的模拟人类用户评估 AI 系统和数字产品。

一句话总结

MatrAIx 引入了一个人口规模仿真用户评估基础设施,结合 Persona 8B 的 83 亿条 persona 记录(1290 个类别维度)和四种交互环境,使得能够在超过 25 个领域的 1010 项任务中测试 AI 系统和数字产品,其中由 Claude Opus 4.8、GPT 5.5 和 Claude Haiku 4.5 驱动的 persona agent 在一项 400 次试验的对照研究中达到了 91.5%91.5\%91.5% 的 persona 一致性,且基于人类的 persona 经过人类和 LLM 评委的验证。

核心贡献

  • Persona 8B 包含 83 亿条 persona 记录,涵盖 1290 个类别维度,通过从保留跨属性相关性的依赖图中采样生成,或从人类撰写的档案中提取记录。一个经过质量筛选的约一百万条 persona 的核心集已发布,包含 599,847 条基于人类的记录和 400,000 条合成记录。

  • MatrAIx 游乐场在四种交互环境(Survey、AI Chatbot、Web 和 App)中运行 persona agent,以捕捉如价格上涨后的犹豫、AI 助手失败后的继续意愿以及延迟容忍度等行为。

  • 提供了一个包含 1010 项应用任务的库,涵盖超过 25 个领域(商业、软件、金融、医疗)。在 18,189 次试验中使用三种 persona agent 模型进行了验证,其中包括一项对照一致性研究(91.5% 正确)和一项人类评估,对基于人类的 persona 的平均提取质量得分为 4.135(满分 5 分)。

引言

人类评估对于捕捉真实用户体验至关重要,但昂贵且缓慢,而离线基准测试虽然可扩展,却仅测量任务结果,不建模不同用户如何表述请求、交互和反应。先前基于 persona 的仿真工作通常缺乏从人口抽样到交互试验的完整评估流程,且现有仿真器可能无法保留跨属性依赖或可靠地遵守指定的行为。作者介绍了 MatrAIx,这是一个人口规模的基础设施,结合了 83 亿条记录的 persona 数据集、四种交互式评估环境(Survey、AI Chatbot、Web、App)以及一个包含超过 25 个领域的 1000 多项可重用任务的库,能够使用异构用户画像进行大规模测试,并揭示聚合分数所忽略的子群级差异。

数据集

作者介绍了 Persona 8B,一个包含 83 亿条 persona 记录的人口规模 persona 数据集,旨在为 MatrAIx 仿真用户评估基础设施提供动力。该数据集并非旨在重建真实个体,而是提供一个共享框架,用于描述人类差异、查询记录和抽样评估队列。当 persona 记录与模型配对时,便成为 persona agent,随后评估会将抽样的 agent 分配给任务。

框架与组成

  • 所有记录共享 1290 个类别维度,分为五个方面:背景、心理、能力、行为与生活方式。每个维度使用有限的值集(例如年龄区间、英语熟练度、风险承受能力)。该框架基于涵盖人口统计、经济、教育、劳动、健康、价值观和技术使用的公开来源(如联合国世界人口展望、世界银行指标、ILOSTAT、公开调查、开发者生态系统统计)。

合成 persona 生成

  • 为避免独立采样导致的不一致画像,作者构建了一个基于有向无环图(DAG)的依赖感知概率模型,覆盖 1290 个维度。每个维度根据其父节点条件采样,且仅当来源直接报告了条件关系时才添加边。对于给定维度,候选值通过结合总体先验、父依赖调整和二元兼容性掩码来评分。这将可能上下文的调整与硬性约束(例如,母语为英语的 persona 不能具有“无”的英语熟练度)分开。合成记录通过在拓扑顺序中进行前向采样生成,从具有类别先验的根属性开始。

基于人类的记录

  • 为了补充合成人口,作者将现实世界的证据映射到同样的 1290 维框架中。仅填充有来源支持的赋值;无支持的维度保持为空。使用了六种来源:
    • 维基百科传记
    • 亚马逊评论(按评论者分组)
    • Stack Overflow 开发者调查(通过确定性对照表映射)
    • 通用社会调查(GSS)回答(编码答案直接映射)
    • PRISM Alignment(编码的人口统计和自我描述)
    • MatrAIx Persona 调查(通过社交媒体和大学邮件列表收集的 355 份知情同意自述,不含直接标识符)
  • 来自维基百科、亚马逊评论和 PRISM Alignment 的自由文本内容通过基于 LLM 的约束提取处理。

质量控制和公开的 1M 核心集

  • 合成记录经过跨属性冲突过滤;基于人类的记录检查无支持的赋值和来源。基于人类的记录通过精确哈希和基于 MinHash 的模糊检测进行去重。合成记录通过比较 14 个高信息属性进行去重;在所有 14 个属性上取值完全相同的记录被视为重复,仅保留一条。由于基于人类的来源不具人口代表性,作者通过选择合成记录来校准公开的 1M 核心集,使组合集近似于已发布的年龄区间、地区、性别认同和城市化程度统计。缺失字段不进行插补。最终确定性核心集包含 599,847 条基于人类的记录和 400,000 条合成记录。这一划分是发布设计选择,而非对真实世界比例的估计。

数据集的使用方式

  • Persona 8B 是 MatrAIx 仿真用户评估基础设施的基础。它不用于模型训练。在评估中,单个 persona 记录与模型配对来创建 persona agent。然后任务被分配给这些 agent 的抽样队列,实现对模型行为的大规模、接近人口的测试。

方法

作者开发了一个人口规模 persona 数据集和一个评估基础设施,二者共同支持运行真实、可控的人类行为仿真。该方法包含三个相互连接的组件:用于合成 persona 生成的依赖感知概率模型、仿真执行框架以及正式的任务规范合同。

基于 DAG 采样的合成 Persona 生成

生成一致的合成 persona 需要保留人口统计和行为属性之间复杂的依赖关系。仅匹配边缘分布会产生不合理的档案,例如年龄与教育程度或地区与语言组合不匹配的个体。为解决这一问题,作者在 1290 个 persona 维度上构建了一个有向无环图(DAG),其中每条边编码一个存在直接来源的条件依赖。令 G=(D,E)G = (\mathcal{D}, E)G=(D,E) 为该图,Pa(i)\mathrm{Pa}(i)Pa(i) 为维度 XiX_iXi 的父节点。则建议分布分解为

pθ(x)=i=1dpθ(xixPa(i)).p_{\theta}(x) = \prod_{i=1}^{d} p_{\theta}\big(x_i \mid x_{\mathrm{Pa}(i)}\big).pθ(x)=i=1dpθ(xixPa(i)).

这种分解明确了局部依赖假设,每个属性仅条件于其相关的前驱。对于根维度,局部条件概率分布(CPD)是一个从总体统计中得出的类别先验 πi(ν)\pi_i(\nu)πi(ν)。对于非根维度,候选值 ν\nuν 通过结合先验、父依赖调整和兼容性掩码进行评分:

pθ(Xi=vxPa(i))πi(v)ri(v;xPa(i))mi(v;xPa(i)).p_{\theta}(X_i = v \mid x_{\mathrm{Pa}(i)}) \propto \pi_i(v) \, r_i(v; x_{\mathrm{Pa}(i)}) \, m_i(v; x_{\mathrm{Pa}(i)}).pθ(Xi=vxPa(i))πi(v)ri(v;xPa(i))mi(v;xPa(i)).

调整项 rir_iri 使用基于来源的似然比,以提升在给定父上下文下常见的值的权重,并降低罕见值的权重。二元掩码 mi{0,1}m_i \in \{0,1\}mi{0,1} 强制执行硬兼容性约束:不可能的组合(例如,当母语为英语时,英语熟练度为“无”)被赋予零掩码并移除,而不寻常但合理的值仍符合条件。标准化分数后得到最终 CPD。合成 persona 通过拓扑顺序 τ=(τ1,,τd)\tau = (\tau_1, \dots, \tau_d)τ=(τ1,,τd) 的前向采样生成:

xτkpθ(XτkxPa(τk)),k=1,,d.x_{\tau_k} \sim p_{\theta}\big(X_{\tau_k} \mid x_{\mathrm{Pa}(\tau_k)}\big), \qquad k = 1, \dots, d.xτkpθ(XτkxPa(τk)),k=1,,d.

根属性从其有根据的先验中抽取,每个下游属性从其归一化的局部 CPD 中抽取,确保每次抽取都使用其所依赖的上下文。这种方法产生了一个连贯的合成人口,同时保留了稀有但有效的档案。基础先验和依赖边来源于可信来源,图构建经过仔细审查,避免编造不存在的联合分布。

仿真配置与执行

一旦 persona 可用,评估基础设施便通过一个集中式游乐场编排仿真。一次仿真从一个群体查询和一个应用任务规范开始。游乐场在运行清单中记录合格的 persona 池、抽样程序、任务版本、agent 接口和底层模型。然后并行启动独立试验,每个 persona 一个。每个试验表示为一个元组 τ=π,θ,α,μ,σ\tau = \langle \pi, \theta, \alpha, \mu, \sigma \rangleτ=π,θ,α,μ,σ,其中 persona π\piπ 通过 agent 接口 α\alphaα 使用模型 μ\muμ 和种子 σ\sigmaσ 执行任务 θ\thetaθ。试验产生一个规范的工件包 A=α(π,θ;μ)A = \alpha(\pi, \theta; \mu)A=α(π,θ;μ),包含 persona 的提交以及(如适用)交互轨迹和环境状态。任务所属的验证器将该工件包映射为类型化发现 Vθ(A)V_\theta(A)Vθ(A)。试验是无状态的,因此完全可并行化。运行清单同时保存请求的群体和实现的队列,而类型化发现将 persona 保真度、产品结果和执行失败区分开来,防止任务成功与人类有效性混淆。

应用任务规范

每个仿真任务由一个可移植合同定义,该合同指明评估目标(例如,AI 模型、聊天机器人、网站或本地应用)、persona 队列、面向用户的场景与目标,以及算作有意义结果的证据。这种分离确保产品凭证和评分规则不会泄漏到 persona 指令中。任务还指定保留哪些工件以及如何评估它们。Survey 任务产生结构化答案和理由;AI Chatbot 任务记录对话和运行后反馈;Web 任务保留浏览的页面、采取的操作和最终提交;App 任务可以捕获导出文件、权限更改和最终应用状态。然后,任务特定的验证器将这些工件转换为结构化发现。程序化检查评估可直接观察的结果,而人类或 LLM 评委使用记录的提示和评分标准评估解释性属性。报告总结完成率、结果分布、不确定性和子群差异,同时保留指向底层轨迹的链接。这种设计将产品结果、仿真用户行为和 persona 保真度保持在分离的分析通道中,从而能够对不同人群进行严格、可复现的 AI 系统评估。

实验

MatrAIx 评估基础设施提供四种环境(Survey、AI Chatbot、Web、App)和一个包含超过 1000 项规范的任务库,用于仿真用户与产品的交互。验证实验确认任务能够可靠执行,当属性与任务相关时,persona 效应可在不同模型间恢复,绝大多数试验中宣称的行为得到遵循,且基于人类的 persona 记录实现了高提取质量。这些结果支持端到端执行、persona 一致性和多维报告,其中 persona agent 模型被报告为一个关键配置因素。

Persona 8B 框架包含 1290 个类别维度,分为五个主题组。生活方式属性构成最大的组,而行为与交互属性构成最小的组,每个组都依赖于不同的基础来源,从人口统计到经过验证的心理测量工具。生活方式维度最多(387 个),行为与交互维度最少(124 个)。背景属性基于人口统计和住户调查,而心理属性依赖于经过验证的工具和价值观调查。能力属性涵盖领域专长和编程,基于职业分类和技术/开发者调查。不同组的基础来源在种类和强度上各不相同,且并不为每个值提供直接的人口估计。

公开的 Persona 1M 核心集包含来自六种提取来源的 599,847 条基于人类的记录,其中维基百科以 323,438 条居首,以及 400,000 条合成记录,这些记录被选择用于将组合集校准到年龄、地区、性别认同和城市化程度的人口边缘分布。基于人类的部分本身并不具有人口代表性,60/40 的划分是发布设计选择。维基百科提取是最大的基于人类的来源,提供了 599,847 条中的 323,438 条。合成记录占核心集的 400,000 条,使总数达到约一百万个记录,旨在改善人口统计学对齐。

任务库包含 1010 项独特规范,分布在四种环境中。Survey 任务以 621 项占主导地位,其后是 AI Chatbot 的 371 项,而 Web 和 App 合计仅贡献 18 项任务。商业、软件、金融和医疗等锚定领域在 Survey 中覆盖良好,而 AI Chatbot 任务则高度集中在涵盖超过 25 个额外领域的“其他”类别中。验证运行对每个环境使用了两项任务,App 任务因原生交互成本较高而限制在少得多的 persona 上。Survey 任务占任务库的 61%,并均匀分布在四个锚定领域。AI Chatbot 任务几乎全部在“其他”领域,该领域汇总了超过 25 个不同领域。Web 和 App 环境任务稀疏,分别只有 12 项和 6 项。验证对每个环境执行了两项任务;App 任务每个模型仅使用 20–24 个 persona,而其他环境则约为 1000 个。

在一项对照行为一致性测试中,persona 驱动的 agent 在四个环境中的 400 次试验中,有 91.5% 表达了或抑制了预期属性。大多数属性在多数环境中一致性很高,但 App 环境显示出一致性较低,尤其是在礼貌、故事讲述和幽默方面。Survey、Chatbot 和 Web 环境在 10 个属性中的 9 个达到成功阈值,而 App 仅在 10 个中的 6 个达到。总体而言,40 个属性×环境组合中有 33 个在两个实验组中均取得了至少五次中的四次成功。App 环境表现最差,cog-礼貌性得到 5/10,cog-故事讲述性得到 6/10。Survey、Chatbot 和 Web 环境在 10 个属性中的 9 个均表现出很强的遵循性。

Persona 8B 框架将 1290 个类别维度组织为五个主题组,具有不同的基础来源,而 Persona 1M 核心集则结合了基于人类和合成的记录,以实现更好的人口统计学对齐。任务库包含分布在四种环境中的 1010 项规范,主要由调查和 AI 聊天机器人任务主导。一项对照行为一致性测试表明,persona 驱动的 agent 在跨环境的试验中,有 91.5% 可靠地表达了预期属性,尽管 App 环境在礼貌、故事讲述和幽默等社交属性上表现出一致性较低。


用 AI 构建 AI

从创意到上线——通过免费 AI 协同编码、开箱即用的环境和最优惠的 GPU 价格,加速您的 AI 开发。

AI 协同编码
开箱即用的 GPU
最优定价

HyperAI Newsletters

订阅我们的最新资讯
我们会在北京时间 每周一的上午九点 向您的邮箱投递本周内的最新更新
邮件发送服务由 MailChimp 提供