HyperAIHyperAI

Command Palette

Search for a command to run...

全交互智能体技术报告

摘要

在本工作中,我们提出了 Gander,一个端到端模型,将全模态感知、实时交互和智能体能力统一在单一框架内。与传统的基于轮次的范式不同,Gander 持续接收跨多种模态的流式输入,包括视频、语音和文本,从而在日常对话和复杂的工作流导向的智能体场景中实现自然的全双工交互。用户可以随时打断模型,而模型也可以主动提供中间反馈或提出后续问题。为了原生支持这些能力,Gander 采用了两个关键的架构设计:1) 它采用小脑-大脑协作框架,其中小脑负责实时交互和全模态对话能力,而大脑处理复杂推理和更高层次的智能体任务。这两个组件通过工具调用和智能体编排运行时持续交互。2) 小脑构建于流式思考者-说话者架构之上,用户输入和模型输出在块级别进一步展平为有序的令牌流,为低延迟、持续交互提供了统一的表示。我们对 Gander 在四个维度上进行了全面评估:对话能力、全模态理解、交互能力和智能体智能。内部人工评估表明,Gander 保持了最先进开源模型的自然且富有表现力的口语对话能力,同时在全模态交互方面取得了有竞争力的性能。Gander 还在具有挑战性的现实场景中表现出鲁棒性,包括背景噪声干扰、多方交互和反馈沟通。我们发布了 Gander 及其模型、代码和数据,以促进社区的进一步研究和发展。

一句话总结

来自腾讯、浙江大学、上海交通大学、香港中文大学和南洋理工大学的研究人员提出了 Gander,一个端到端模型,通过基于流式 Thinker-Talker 架构的小脑-大脑协作框架,统一了全模态感知、实时交互和 Agent 能力,支持全双工、可打断的多模态交互,并在嘈杂、多方对话和反馈信号场景中展现出稳健性能。

核心贡献

  • 提出 Gander,一个端到端模型,在单一框架中统一了全模态感知、实时交互和 Agent 执行,支持跨视频、语音和文本的全双工流式输入,允许用户打断并支持模型主动反馈。
  • 结合小脑-大脑协作设计,其中小脑负责实时交互和对话能力,大脑负责复杂推理和 Agent 任务,并采用流式 Thinker-Talker 架构,将输入和输出展平为有序的块级 token 流,以实现低延迟的持续交互。
  • 在对话能力、全模态理解、交互能力和 Agent 智能方面对 Gander 进行评估,在口语对话性能上与 SOTA 开源模型相当,并在背景噪声、多方交互和反馈信号通信中表现出稳健性;发布了模型、代码和数据。

引言

大语言模型正从基于文本的问答转向能够在真实环境中感知、推理和行动的自主 Agent。然而,当前人机交互仍局限于基于文本的轮流对话范式,这与人类交流的流畅、多模态和可打断特性存在根本差异。现有系统依赖 VAD 等外部模块来管理交互时序,无法处理自发打断、主动参与、嘈杂环境或多方对话,并且通常将实时交互与复杂 Agent 推理分离。

作者提出了 Gander,一个全模态交互 Agent,在单一端到端模型中统一了实时多模态交互与 Agent 智能。他们认为交互性必须是模型的内在属性,而非编排层,因此 Gander 将流式音视频输入和生成的文本作为时间对齐的块进行处理,并显式预测每个块中是倾听还是说话。为了解决低延迟对话与长时程推理之间的权衡,他们采用了大脑-小脑架构,其中小脑负责实时交互,大脑作为无需训练的可插拔组件,通过工具调用执行更深层的异步推理。这种解耦设计允许在不重新训练的情况下集成更强的推理模型,为同时提升响应速度和智能水平提供了可扩展的路径。

数据集

作者为 Gander 构建了一个大规模训练语料库,分为四个数据族:语音交互、音视频交互、Agent 交互以及鲁棒性和负样本数据。该语料库不仅训练模型的通用语音和多模态理解能力,还训练其判断何时倾听或说话、如何响应不断演变的音视频上下文,以及如何在长时程任务中与独立的后脑协同。

数据构成与来源

  • 语音交互数据(约占语料库的 37%): 涵盖通用对话、口语指令跟随、问答、全双工交互和同声传译。全双工部分称为 InteractionSpeech,通过专门的四阶段流水线合成:对话收集、交互事件标注、音频渲染和质量控制。

    • 对话来源: 使用两个互补来源。首先,11.2K 个覆盖 45 种日常和任务导向场景(如教育、医疗、旅行、金融、客服)的场景和主题种子,使用 DeepSeek-V4-Pro 扩展为多轮口语对话,限制为 8-18 轮且说话时间不超过 96 秒。其次,来自真实助手日志和公开语料库的现有多轮对话,在通过口语适配性过滤(拒绝包含 Markdown、代码、URL 或说话密度不合理的轮次)后转换为双工形式。每个对话基于五种交互画像之一进行条件化:约束澄清、过程控制、用户纠正、服务入口失败以及安全或紧急停止。
    • 交互事件: 标注两种事件。竞争性打断发生在用户在助手完成前强行插入时,助手剩余的话语形成隐藏延续,与用户语音重叠但从未被听到。支持性反馈发生在用户发出简短确认而助手不中断地继续时。反馈信号仅当嵌入在当前话语中、低于长度阈值(8 个中文字符或 6 个英文单词)且匹配包含 266 个中文和 170 个英文表达、覆盖 11 个意图类别的双语词典时才被接受。
    • 渲染与时序: 仅将用户通道使用语音克隆 TTS 渲染为音频,助手轮次保持文本形式作为时长占位符。每一轮都有全局起始时间、持续时间和重叠区间,提供显式的时序监督。仅保留两种标记:打断标记和反馈标记。
    • 质量控制: 基于规则的过滤器丢弃不合理的打断点、退化重叠、内容泄露或未解决的交互。随后 LLM 评审器对幸存样本的自然度、助手连贯性、打断合理性和反馈合理性进行评分。最终语料库包含 260.8K 个对话,打断起始时间分布广泛。
  • 音视频交互数据(约占语料库的 40%): 将实时交互扩展到多模态环境。从 JoyAI-VL、LiveCC 和 Streamo 收集,组织为流式视频问答、流式视频解说和主动视觉响应。所有样本经过质量过滤和使用 Qwen3.5-297B-A17B 的时间对齐精化,产生约 110 万个高质量音视频交互对。目标响应使用 DeepSeek-V4-Pro 重写,将响应长度规范化为平均每秒 8 个 token,用户话语使用 Qwen3-TTS 合成为语音。

  • Agent 交互数据: 将交互扩展到用户、前端小脑和后脑之间的协同设置。包含三个类别:音频 Agent 交互、全模态 Agent 交互和少量工具辅助推理数据。

    • 音频 Agent 数据: 通过种子驱动的轨迹合成构建。从任务类别、领域、类别和任务族中采样结构化任务种子,覆盖执行、信息搜索和先搜索后执行等工作流。口语用户请求和交互轨迹使用 DeepSeek-V4-Pro 合成,然后进行任务一致性、交互有效性和质量过滤。
    • 全模态 Agent 数据: 将协同扩展到视觉基础任务。GUI 和视频轨迹来自爬取的交互轨迹、现有 GUI 数据集和 Codex 生成的轨迹,总计约 36K 个示例。Qwen3.5-297B-A17B 将这些转换为环境状态和任务进度的结构化描述,DeepSeek-V4-Pro 合成口语用户请求和交互。轨迹经过时间一致性、任务有效性和交互质量过滤。
  • 鲁棒性和负样本数据: 涵盖无关视觉上下文、无指令环境、声学和对话干扰以及多方交互。无关视频负样本将网络爬取的视频与无关用户指令配对。抗干扰和多方示例来自 Hy-Realtime 生产数据。这些数据鼓励模型忽略无关事件、在没有有效请求时保持沉默、抵抗噪声和重叠干扰,并在多方场景中跟踪说话者和受话者。

数据在模型中的使用

  • 语料库用于训练模型的实时交互行为,包括话轮转换、打断、重叠语音和响应时序。
  • 全双工数据显式监督交互时序,而非从轮流对话语料中继承。
  • 音视频数据训练模型持续整合传入的视觉证据与进行中的交互,并将响应基于当前信息。
  • Agent 数据训练前端小脑在异步任务执行过程中保持持续用户交互,同时与后脑协调,覆盖从任务启动到结果交付的完整任务生命周期。
  • 鲁棒性和负样本数据减少虚假响应,提升在复杂真实环境中的可靠性。

方法

Gander 是一个端到端全模态交互 Agent,架构上由前端小脑、Agent 编排运行时和后脑组成。参考框架图:

前端小脑是一个基于 Thinker-Talker 架构的实时全双工多模态模型,负责持续的多模态感知和交互式通信。后脑是一个通用任务执行 Agent,无需任务特定训练,由 Claude Code 和 Codex 等通用 Agent 实例化。Agent 编排运行时作为前端小脑和后脑之间的协调层,共同管理实时多模态推理和异步后台任务的编排。通过这种职责分工,三个组件共同支持持续实时交互和复杂长时程任务执行。

前端小脑动态判断请求是可以在本地解决还是需要委派给后脑。如下图所示:

简单对话和短时程任务由前端小脑直接处理,而涉及多步推理、外部工具使用或长时程执行的复杂工作流则委派给后脑。这种委派机制通过结构化工具调用形式化,将前端小脑的任务级决策暴露给 Agent 编排运行时。该接口定义了三个主要操作:task_start、task_send 和 task_resolve,分别对应任务创建、增量任务交互和确定性工具状态控制。Agent 编排运行时支持两种控制模式:精简模式和协调器模式。在精简模式下,运行时直接执行前端小脑分类的任务动作。协调器模式在前端小脑和网关之间引入独立的控制平面模型来生成执行指令。网关作为运行时的持久化编排核心,围绕五个持久化实体组织后端执行,并管理任务状态转换、工作线程调度和权限处理。

前端小脑基于 Thinker-Talker 架构,接收流式音频和视频输入,并生成文本和音频输出。参考详细架构图:

在此设计基础上,作者引入了用于端到端交互的流式块展平机制,将感知输入和生成输出展平为统一的块流,使模型能够在每个块上动态决定是倾听还是说话。前端小脑通过两个并发运行的模态编码器感知环境,一个处理视觉流,一个处理声学流。视觉路径采用任意分辨率分区方案,每帧分解为切片,由 SigLIP 视觉 transformer 编码,并通过基于查询的重采样器压缩。声学流由流式分块语音编码器处理,随后是应用时间下采样的轻量 MLP 投影器。为了让前端小脑在单一自回归过程中感知和响应,连续交互被划分为固定的一秒窗口,每个窗口组装为一个块。每个块是编码音频和视觉 token、预测控制 token 和文本 token 的展平拼接。控制 token 取三个值之一:倾听 token、说话 token 或打断 token。上下文通过 128 个块的固定预算使用滑动窗口管理。对于语音生成,前端小脑将语义规划与声学实现解耦,将波形生成委派给语音 token 解码器,随后是流式 flow matching 解码器。

为了训练 Gander,作者构建了一个大规模语料库,包含实时语音交互、音视频交互和 Agent 交互数据。Agent 交互数据的构建流水线如下图所示:

Agent 交互数据将设置扩展到用户、前端小脑和后脑之间的协调交互。音频 Agent 交互数据通过种子驱动的轨迹合成流水线构建,采样结构化任务种子和多样化交互模式。全模态 Agent 交互将这种协调扩展到视觉基础任务,从爬取的交互轨迹、现有 GUI 数据集和使用 Codex 生成的 GUI 轨迹中组装底层 GUI 和视频轨迹。这些轨迹被转换为环境状态、任务进度和交互上下文的结构化描述,随后合成口语用户请求和相应交互。

实验

Gander 在三个维度上进行了评估:带工具使用的全双工交互、口语对话和全模态理解。在全双工交互中,它实现了最佳的话轮转换行为,没有漏接话轮且过早打断很少,尽管在任务准确率上略逊于基线;仅后脑条件表明执行层不是限制因素。在口语对话中,Gander 在知识导向问答上领先全双工组,并与轮流对话系统相当,表明流式公式本身不会损害知识保持。在全模态理解中,尽管仅经过交互训练,它仍保持竞争性性能,消融实验显示真正的音视频融合而非依赖单一模态,尽管细粒度感知推理出现一定退化。

Agent 编排运行时中的网关管理核心实体,如项目、任务、运行、工作线程事件和交付,共同支持长生命周期工作流和结果交付。运行时提供两种控制模式,精简模式和协调器模式,在延迟和确定性之间与灵活性和监督之间取得平衡。协调器模式为动态执行指令添加了独立控制平面,而精简模式依赖预配置的任务处理。网关管理持久化项目、逻辑任务、具体运行实例、工作线程事件和面向用户结果的交付记录。精简模式提供更低的延迟和更高的确定性,但限制了推理强度或监督策略的动态适应。协调器模式引入独立的控制平面来生成声明式执行指令,增加了延迟和非确定性,同时实现了灵活的监督和权限策略。

Gander 的训练语料库以流式视频问答和解说数据为主,共同构成最大比例,而语音交互数据涵盖话轮转换、打断和口语问答。语料库还包括面向鲁棒性和负监督的数据,以提升在挑战性条件下的可靠性,例如多方场景和模型应保持沉默的情况。流式视频问答和解说构成最大的数据族,占语料库的 40% 以上。语音交互数据包括全双工话轮转换、打断和多轮交互,占语料库的近 10%。语料库包含负监督数据,以教导模型何时保持沉默或抑制不必要的响应。

Gander 在工具选择、参数准确率、响应质量和 pass@1 上落后于大多数全双工基线,但在全双工模型中实现了最低的打断率。其接话率与级联流水线持平,但后者是文本驱动的,在交互指标上不可直接比较。尽管整体质量分数较低,Gander 在全双工模型中拥有最低的打断率。Gander 与级联流水线的接话率持平,但级联基线因其文本驱动特性而不可直接比较。Gander 的工具选择和参数准确率低于所有全双工基线,表明交互性和任务性能之间存在权衡。

Gander 在 SpokenQA 子集上领先全双工组,但在 VoiceBench 指标上落后,尽管在流式约束下运行,其分数仍与轮流对话模型具有竞争力。评估未调用后脑,因此结果仅反映前端小脑的性能。Gander 在全双工组中两个 SpokenQA 子集上均优于 Audio-Interaction 和 Moshi。Gander 的 SpokenQA 分数在所有九个系统中总体排名第二,紧随领先的轮流对话模型之后。在 VoiceBench 上,Gander 在其组内 AlpacaEval 和 SD-QA 上排名第二,略落后于 Audio-Interaction。评估期间从未使用后脑,因此所有分数仅来自前端小脑。

仅经过交互训练的 Gander 保持了竞争性的全模态理解能力,在 WorldSense 上得分 49.62,在 Daily-Omni 上得分 78.53。在 Daily-Omni 上与其 MiniCPM-o 4.5 初始化的差距在 1.67 分以内,但在 WorldSense 上下降了 6.08 分,这一退化归因于训练奖励时间音视频推理而非静态属性检查。Gander 在 Daily-Omni 上仍领先 Qwen3-Omni(78.53 对 70.70),同时与其自身基础模型保持接近。WorldSense 的下降并非由于视觉编码,因为视觉塔是冻结且不变的。交互训练对时间音视频推理(Daily-Omni)的保持优于细粒度感知属性任务(WorldSense)。

实验评估了 Gander 相对于轮流对话和级联基线的全双工交互能力。Gander 在打断率和接话率等交互指标上表现出色,但在工具选择和参数准确率上有所权衡,并且在流式约束下仍保持口语问答和全模态理解的竞争力。运行时架构支持精简模式和协调器模式,在延迟和确定性与灵活性之间取得平衡,而训练语料库优先考虑流式视频问答和语音交互数据,包括抑制不必要响应的负监督数据。


用 AI 构建 AI

从创意到上线——通过免费 AI 协同编码、开箱即用的环境和最优惠的 GPU 价格,加速您的 AI 开发。

AI 协同编码
开箱即用的 GPU
最优定价

HyperAI Newsletters

订阅我们的最新资讯
我们会在北京时间 每周一的上午九点 向您的邮箱投递本周内的最新更新
邮件发送服务由 MailChimp 提供