Command Palette
Search for a command to run...
VOICEMEM:面向实时交互的流式双脑记忆系统
VOICEMEM:面向实时交互的流式双脑记忆系统
Zhifei Xie Jiaqi Lang Ze An Yifan Zhao Dongchao Yang Kai Li Ziyang Ma Mingbao Lin Chunyan Miao Shuicheng Yan
摘要
对话系统,如双工语音语言模型(SLMs),仍然缺乏一个流式、准确且富有同理心的记忆系统作为其灵魂。我们提出了 VOICEMEM,一种简单的记忆架构,具有并行的信息性左脑、情感性右脑以及流式记忆输入/输出机制。我们进一步构建了一个完整的流程,用于记忆感知的 SLM 训练、长时程评估以及可互换记忆后端的解耦部署。实验和实际部署展示了三个优势:i) 准确性:在 top-5 检索下,左脑比经典系统(如 MEM0 在 top-200 下的表现)高出近 30 个百分点;ii) 情感与个性化:右脑通过短时和长时程情感归因以及双节点人格建模,在三个个性基准上达到了最先进的性能,并将综合得分比之前最佳系统提高了 1.89 分;iii) 实时与低成本:VOICEMEM 在 134 毫秒内完成检索,完全在标准 VAD 延迟范围内,不增加额外对话延迟,同时保持高准确性和低成本。这些结果表明,VOICEMEM 为实时、个性化和情感感知的语音交互提供了实用的记忆基础。
一句话总结
VOICEMEM 由南洋理工大学、新加坡国立大学、清华大学和香港中文大学联合开发,提出了一种流式双脑记忆架构,包含并行的信息性与情感性组件,支持记忆感知的语音语言模型训练、长时程评估和解耦部署。该架构在 top-5 检索中比 MEM0 提升近 30 个百分点,在人格基准上取得最优结果并带来 1.89 的聚合增益,且检索仅需 134ms,不增加对话延迟,为实时、个性化和情感感知的语音交互提供了实用基础。
核心贡献
- 提出 VOICEMEM,一种流式双脑记忆架构,将事实记忆(左脑)与情感记忆(右脑)分离,并通过跨脑关联和流式记忆输入输出设计,面向实时语音语言模型。
- 左脑采用两级模式-实体索引,结合查询驱动的簇涌现机制,在严格的 top-5 检索预算下保持准确性;右脑通过独立与跨实体人格节点,结合短时程和长时程情感归因对用户建模,在三个人格基准上取得最优结果,并较此前最优系统带来 1.89 分的聚合提升。
- 通过四阶段流式查询将检索隐藏在标准 VAD 延迟之内,在 430 个记忆 token 下完成检索仅需 134 ms,在 LoCoMo 上达到 91.2,并提升三种不同记忆后端 15.8 至 29.5 分,展示了不增加对话延迟的实用部署能力。
引言
记忆是将对话系统从智能工具转变为人本伙伴的关键,然而近期记忆系统和语音对话模型的进展尚未融合为完整解决方案。三个障碍阻碍了这一整合:同时具备信息性与情感性智能的统一架构、零延迟下的高信息密度(现有检索超出 500 ms 实时预算,且 top-100 输出会压垮语音模型),以及两个领域快速演进时所需的基础设施可演化性。作者提出 VOICEMEM,一种面向实时语音交互的流式双脑记忆框架。左脑采用两级模式-实体架构,通过涌现机制管理事实记忆;右脑通过独立与跨实体节点,结合短时程和长时程情感归因对情绪和人格建模。四阶段流式查询将检索隐藏在标准 VAD 延迟之内,框架采用解耦设计,支持通过 SLM 验证的黑盒 OPD 训练进行模型适配,并提供可跨后端迁移的独立记忆引擎。实验表明,VOICEMEM 在信息记忆(较 Mem0 提升 +46.1%)、人格记忆(+16.8%)和长时程音频记忆(+41.3%)上均持续优于此前最优方法,同时支持 top-5 预算下的低延迟流式检索。
数据集
数据集构成与来源
- 作者构建了大规模、依赖记忆的对话数据集 CHATMEM-400K,用于训练和评估长时程语音助手。
- 数据集通过黑盒在线蒸馏流水线构建,其中专有模型(Qwen2.5-Omni、Qwen3-Omni 和 Step-Audio2-Mini)作为教师模型,目标模型(分别为 Qwen3.5-Omni 和 Step-Audio2)从中蒸馏得到。
- 构建过程分为四个阶段,每个阶段为最终数据集贡献不同组成部分。
各子集的关键细节
- CHATMEM-400K:大规模依赖记忆的对话语料,通过迭代流水线生成,包括:
- 基于核心人格构建的合成用户历史,按“人格 → 背景 → 事件 → 消息 → 记忆”逐步实例化。
- 覆盖知识、情感或人格导向目标的对话,并包含回忆、指代消解、矛盾检测和多记忆推理等挑战。
- 对比蒸馏对,用于比较不同记忆使用行为下的回答。
- 验证步骤,筛选必要性、忠实性和质量。
- CHATMEM-BENCH:人工精选的基准子集,包含从 15,314 轮、53 小时对话中抽取的 316 个问题。每个会话均由人工策划,从主题选择到记忆世界构建和挑战设计。该基准覆盖四个维度、14 个细粒度类别:信息、人格、情感归因以及副语言与环境。
论文对数据的使用方式
- 训练流水线使用 CHATMEM-400K 进行迭代循环中的监督微调(SFT),每轮验证后更新生成器。
- 加入人工策划的更难样本,包含更丰富的情感和人格动态以及多模态输入(如声学问题),以增强训练。
- CHATMEM-BENCH 作为最终模型的主要评估基准,因为现有基准无法完全反映真实语音助手的需求。
处理与元数据构建
- 作者采用在线蒸馏以缓解适配过程中的灾难性遗忘,即训练数据在循环中生成和验证,而非静态语料。
- 验证步骤对生成的对话进行必要性、忠实性和质量筛选,确保仅保留高质量的依赖记忆的对话。
- 基准构建需要大量人工投入,作者指出基准和标注流水线的详细介绍将在后续技术报告中单独给出。
- 基准从四个维度评估模型,类别包括更新追踪、时间推理、综合归纳、弃答、画像约束、偏好对齐推荐、隐含需求推断、情感目标归因、依恋引导决策、情感感知措辞、背景声音回忆、声学场景推断、多用户对话记忆和声学风格适配。
方法
3 VoiceMem:流式双脑架构
作者将所提出的流式双脑架构实例化为 VOICEMEM,以满足三项要求:在有限记忆预算下最大化信息密度;在学习感知和适配情绪与态度的同时,建立对人格的长期理解;不向实时语音对话增加可感知的延迟。该架构包含两个并行的认知结构:左脑负责事实记忆的高效访问,右脑维护人格和情感知识。两个脑并行运行,通过跨脑关联连接,在对话过程中实现联合检索。
3.1 左脑:高效记忆访问
VOICEMEM 中的左脑在在线语音交互的严格上下文和延迟预算下支持高效记忆存储和检索。现有系统面临两个关键挑战。第一,检索最多 top-100 候选可提升覆盖率,但会压垮语音语言模型有限的上下文容量;而将检索限制在 top-5 则可能遗漏相关记忆。第二,传统记忆流水线通常需要 2 至 3 秒完成检索和处理,而实时对话仅允许 100 至 200 毫秒的额外延迟以保持自然的轮流说话节奏。
为应对这些挑战,作者将存储在 MEM0 中的后端记忆项与构建在其之上的轻量级语义索引解耦。该索引在访问底层记忆之前,将检索范围缩小到紧凑且语义连贯的候选集。左脑索引采用两级层次结构,包括用于粗粒度语义路由的模式和用于定位具体人物、事件或概念的实体。形式上,左脑定义为:
GL=(S,V,E),v=(dv,Nvmicro,Iv),s=(ds,Nsmacro,Vs).每个实体 v∈V 恰好属于一个模式 s∈S,其中 dv 和 ds 为文本描述,Iv 索引关联的后端记忆项,Vs 包含分配给模式 s 的实体。边集 E=Emicro∪Emacro 支持轻量级语义扩展:Nvmicro 链接相关实体,而 Nsmacro 链接相关模式。作者直接编码模式成员关系,而非引入显式的模式-实体边,从而避免递归遍历,使检索保持紧凑且语义聚焦。
在检索过程中,流式匹配器在用户说话时从部分转录文本中识别相关模式和实体,然后通过强和弱一跳连接扩展匹配实体以及匹配模式所包含的实体:
(Vt,St)=Match(x≤t,V,S),Zt=Vt∪VSt∪N1strong(Vt∪VSt)∪N1weak(Vt∪VSt).这里,Vt 和 St 分别表示匹配的实体和模式;VSt 表示分配给匹配模式的实体;Zt 是通过一跳强边和弱边获得的扩展实体集。随后,相应的记忆项被索引并检索如下:
CtL=z∈Zt⋃Iz,RtL=MemSearch(qt,Ct;K).后端仅在该候选池中搜索,而非在整个记忆 M 中搜索。通过保留与匹配实体及其邻居实体关联的记忆,同时大幅缩小搜索空间,所提出的索引能够实现准确且高效的 top-5 检索。
每轮对话结束后,异步更新器提取新事实,并通过 ADD、UPDATE、DELETE 或 KEEP 操作与邻近记忆进行联合协调。随后在关键路径之外更新关联的模式、实体和关系。
作者进一步引入簇涌现机制以处理不断增长的记忆簇。随着簇的增长,其信息密度下降,而频繁的基于规则的拆分可能割裂相关记忆并降低检索覆盖率。相反,连贯的子簇从重复的检索模式中涌现。设 Q 为会话内观察到的查询,Aq 为查询 q 激活的实体,H 为当前簇中实体的连通子集。查询连贯性度量如下:
ρ(H)=∣Q∣1q∈Q∑∣Aq∪H∣∣Aq∩H∣.高分表示 H 中的实体被反复共同检索。若最大合格子图超过阈值 α,则 LLM 裁判进一步评估其相关性、重要性和完整性,然后将其提升为新簇。
3.2 右脑:了解用户
左脑记录发生了什么,右脑则捕捉用户是谁。右脑并行运行,维护人格记忆:稳定的倾向、情感倾向和基于具体人物、事件或概念的态度。此类证据跨越多个时间尺度,从轮次内的即时反应到跨会话巩固的持久属性。
右脑维护两种互补的人格节点:
GR=(VI,VC),vI=(dvI,IvI)∈VI,veC=(dv,eC,Iv,eC,ρv,e)∈VC,e∈V.这里,d 为人格描述,I 索引其支持的后端记忆项。独立节点 vI 编码用户内在属性,包括持久倾向、行为规律和由纵向证据支持的情感倾向。跨实体节点 veC 则捕捉依赖上下文的情感,其中 ρv,e 将每个节点链接到左脑实体 e∈V。这一区分至关重要:vI 解释持久的用户特征,而 veC 保留情感所指向的对象或内容。将两者合并要么会把情境性反应误认为稳定特质,要么会移除赋予情感意义的现实原因。
流式匹配器从部分转录文本中联合激活独立和跨实体人格节点。这些匹配结果与链接到左脑激活实体的跨实体节点合并:
(VtI,VtC)=Match(x≤t,VI,VC),ZtR=VtI∪VtC∪{veC∈VC:e∈Zt},CtR=⋃z∈ZtRIz,RtR=MemSearch(qt,CtR;K).这里,Zt 是左脑生成的扩展实体集。所得候选池结合了对话直接暗示的人格证据,以及基于当前相关现实实体的态度,而无需搜索完整的人格记忆。
对于短时程归因,情感估计器为每个对话输入 xt 生成情感表示 et=ϕ(xt)。配对 (xt,et) 为添加、编辑或合并人格节点提供即时证据:
et=ϕ(xt),GtR=Modify(Gt−1R;xt,et),t=1,…,T.短时程归因保留当前情感及其情境目标和原因,使人格图能够在持续交互中自适应。
每轮会话结束后,长时程归因联合分析序列 (x1,e1),(x2,e2),…,(xT,eT),并将反复出现的证据整合为稳定的独立人格节点:
VI←Consolidate(VI;(x1,e1),(x2,e2),…,(xT,eT)).该过程并非积累每个瞬时状态,而是识别持久的情感和行为模式,从而对用户是谁提供稳定的描述。
3.3 流式双脑检索
VOICEMEM 的流式检索过程是其近零额外延迟的核心。共引入四个阶段:聆听、语音尾部、预判和搜索。在聆听和语音尾部阶段(0 至 200 ms),用户说话期间,系统以流式方式获取转录文本 x≤t、双脑的匹配实体和模式,以及说话人身份 pt:
in real timex≤t=ASR(a≤t),(Vt,St),(VtI,VtC)=Match(x≤t)∣(i) if delayedpt=ψ(a≤t).在预判阶段(200 至 400 ms),一旦静音达到 200 ms,系统假定回复即将到来。系统提取查询嵌入并扩展双脑的上层图:
qt=Embed(x≤t),Zt=GL(Vt,St),ZtR=GR(VtI,VtC,Zt).在搜索阶段(400 至 500 ms),仅剩后端搜索。双脑均被搜索并合并:
RtL=MemSearch(qt,CtL;K),RtR=MemSearch(qt,CtR;K),Rt=Prompt(RtL,RtR).VAD 阈值通常设置为 500 ms,在回复开始前留有 400 ms 窗口。VOICEMEM 在该预算内仍有富余,因为密集双脑检索本身仅需 134 ms。
3.4 音频记忆扩展
VOICEMEM 将记忆从文本扩展到音频,支持多说话人区分、副语言分析和环境声音记忆。启用后,agent 选择性地将音频保留为说话人声纹、声学嵌入或原始波形,并将其作为多模态节点附加到相应实体节点上。
4 基础设施:模型训练、验证与部署
作者提供了 VOICEMEM 在真实场景中的实现细节,聚焦两个方面:模型训练,即将原本面向语音输入/文本输出的 Qwen2.5-Omni、Qwen3-Omni 和 Step-Audio2-Mini 模型家族,通过在线黑盒同策略蒸馏转换为具备显式记忆访问能力的记忆增强语音语言模型,从而得到首批具备显式记忆访问能力的语音语言模型;部署,即设计一种可演化的两层系统架构,将记忆层与底层搜索引擎解耦。
4.1 黑盒 OPD 训练
为最大化模型性能,作者使用专有模型作为教师,并采用在线蒸馏以缓解适配过程中的灾难性遗忘。具体而言,Qwen2.5-Omni 和 Qwen3-Omni 从 Qwen3.5-Omni 蒸馏,而 Step-Audio2-Mini 从 Step-Audio2 蒸馏。训练流水线包含四个阶段。
阶段 I 为每个合成用户构建连贯的长期记忆世界。从核心人格出发,流水线按“人格 → 背景 → 事件 → 消息 → 记忆”的顺序逐步实例化背景信息、生活事件、消息和在线记忆。这为下游对话生成提供时间上一致的用户历史。
阶段 II 执行 SLM 验证的在线蒸馏。依赖记忆的对话通过迭代流水线生成:任务与主题采样选择知识、情感或人格导向的目标;场景初始化构建当前上下文;挑战与策略引入回忆、指代消解、矛盾检测和多记忆推理;对比蒸馏比较不同记忆使用行为下的回答;验证筛选必要性、忠实性和质量;SFT 更新为下一轮迭代更新生成器。重复该循环得到 CHATMEM-400K,即大规模依赖记忆的对话语料。
阶段 III 涉及人工策划。人工标注者进一步精炼语料,并构建包含更丰富情感和人格动态以及多模态输入(如声学问题)的更难样本。这些示例增强训练,同时将具有挑战性的子集策划为 CHATMEM-BENCH。
阶段 IV 使用 CHATMEM-BENCH 作为评估最终模型的主要基准之一进行验证,因为现有基准无法完全反映真实语音助手的需求。该基准覆盖四个维度(信息、人格、情感归因以及副语言与环境),共 14 个细粒度问题类别。
4.2 解耦的上层路由-下层引擎架构
底层记忆引擎正在快速演进,参数化和潜在记忆机制也正成为有前景的方向。因此,作者避免将实时记忆架构与任何特定后端紧密耦合,否则将阻碍及时采用更新的记忆算法。为此,他们围绕解耦架构对 VOICEMEM 进行了实质性重新设计:重点放在上层路由、并行双脑组织和流式推理上,而由 MemSearch 抽象的底层引擎保持完全可替换。在当前实现中,MEM0 因其通用性和强大的最优性能而被用作后端。
实验
VoiceMem 在文本、人格和长时程音频基准上对十个基线系统进行评估,在大多数类别上持续优于基线,尤其在时间推理和声学相关任务上,纯文本基线在这些任务上表现不佳。该系统在较小的检索预算(K=5)下实现高准确率,且延迟随 K 增加保持平稳(得益于模式路由)。消融实验确认每个组件,尤其是上层索引和情感右脑,在各数据集上均有显著贡献。该索引还可跨不同记忆后端迁移,在无需重新调参的情况下将三种测试存储提升 15.8 至 29.5 分。
VOICEMEM 在事实记忆基准上优于现有记忆引擎和全上下文处理,在大多数信息子类别中领先并取得最高平均分。其增益在需要整合多条记忆的任务(如时间推理)上最大,在单条近期记忆即可满足的任务(如更新追踪)上最小。VOICEMEM 在 11 个信息子类别中的 7 个上领先,并在平均分上大幅超过全上下文处理。相对基线提升最大的任务为时间推理,最小的为更新追踪。与其自身存储后端 Mem0 相比,VOICEMEM 将平均事实记忆得分提升超过 24 分。
VOICEMEM 在人格记忆基准上优于所有基线,取得最高平均分。其优势在冲突检测和用户建模任务上最为显著,而全上下文处理在这些任务上表现不佳。该方法在大多数人格子类别上也持续优于 Mem0 和 Zep 等记忆引擎。VOICEMEM 取得最高的人格记忆平均分,以微弱优势超过最强基线 MemOS。在 ES-MemEval 上,VOICEMEM 在冲突检测和用户建模上远高于全上下文处理,而全上下文处理在这些任务上得分极低。与 Mem0 相比,VOICEMEM 在信息提取、时间推理和冲突检测等多个子类别上均有大幅提升。该方法在大多数人格子类别上也以较大优势超过 Zep 和 LangMem。
VoiceMem 在大多数 ChatMem-Bench 类别上优于基于文本的记忆系统,最大增益出现在声学和副语言回忆上,因为转录文本在这些任务中不提供任何证据。文本基线在情感归因上仍具竞争力,因为词语选择承载了大部分信号,而 VoiceMem 的优势体现在依恋引导决策和情感感知措辞上。VoiceMem 在 14 个类别中的 11 个上领先,最大差距出现在副语言与环境类别。文本系统在声学类别上的得分为 3.23 至 26.92,而 VoiceMem 达到 45.16 至 53.84。情感归因相对均衡,文本基线保持竞争力,而 VoiceMem 在依恋引导决策和情感感知措辞上实现针对性提升。
所提出的方法在所有测试后端上均持续提升准确率,其中在 Mem0 上的增益最大。该方法还在远少于最强基线的记忆 token 数下实现更高准确率,且性能在不同检索预算下保持稳定。消融研究表明每个组件均有贡献,其中上层索引最为关键。各后端的准确率增益约为 16 至 30 分,最大提升出现在 Mem0 上。在相同检索预算下,该方法以约 4 倍更少的记忆 token 数超过最强基线 8 分以上。检索延迟随预算增加几乎保持不变,因为排序前的搜索空间已受限。该方法在适中预算下取得最佳准确率;进一步增加预算仅带来边际收益。移除上层索引导致最大准确率下降,其次是移除情感/人格组件。涌现聚类和双时程更新在会话更长的数据集上影响最大,在会话较短的数据集上影响最小。
VOICEMEM 在事实、人格和声学基准上持续优于现有记忆引擎和全上下文处理,最大增益出现在需要记忆整合或副语言线索的任务上,而在更新追踪等单条近期记忆任务上增益较小。它在大多数信息子类别中领先,并相对 Mem0 实现显著提升,尤其在冲突检测和时间推理上。该方法还在所有存储后端上提升准确率,尤其在 Mem0 上最为突出,同时使用远更少的记忆 token 并保持稳定的检索延迟。消融表明上层索引是最关键的组件,而涌现聚类和双时程更新在较长会话上收益最大。