Command Palette
Search for a command to run...
中间模型:迈向 AI 原生实时通信
中间模型:迈向 AI 原生实时通信
Ziqian Liu Minghao Li Yiming Qiu
摘要
全双工全模态模型正在将人机交互从轮流式对话转变为连续的多模态会话,其中说话、聆听和推理同时展开。我们并不将模型视为人类端点的替代品,而是提出一种新视角:模型是以人为中心的反馈回路中的一个有状态计算中间件,网络传输、模型服务和用户播放共同塑造着交互的演进方式。这一视角打破了围绕局部目标设计的传统阶段边界。AI 原生的实时协议栈不应孤立地优化各个阶段,而应允许每个阶段的状态影响其他阶段的行为。我们探索了三种跨阶段协同机会:网络感知的推理调度、执行感知的传输优先级划分,以及兼顾网络和模型可变性的播放控制。我们正在构建 CONFLUX 以探索这些想法,初步结果显示,在网络质量下降的情况下,响应延迟和播放截止时间遵守度均有显著改善。更广泛地,我们呼吁构建一个 AI 原生的实时通信协议栈,以解决横跨通信、计算和播放的联合控制问题。
一句话总结
香港大学的研究人员提出,将以人为中心的反馈回路中的全双工全能模型重新定义为有状态的计算中间件,并在CONFLUX中引入跨阶段协调机制,其中包括网络感知的推理调度、执行感知的传输优先级和回放控制,以联合优化通信、计算和回放,从而在网络性能下降的情况下改善响应延迟并遵守回放截止时间。
核心贡献
- 本文提出了一个概念上的转变:将以人为中心的反馈回路中的全双工全能模型视为有状态的计算中间件,这打破了网络传输、推理服务和回放阶段之间的传统界限。
- 本文介绍了CONFLUX,一个AI原生的实时通信框架,它通过网络感知的推理调度、执行感知的传输优先级以及适应网络和模型可变性的回放控制,来联合协调这些阶段。
- CONFLUX的初步实验表明,在网络性能下降的情况下,响应延迟和回放截止时间的遵守情况有了显著改善,为跨阶段优化的收益提供了证据。
引言
作者们探讨了从基于回合的语言模型向实时、全双工多模态交互的转变,在这种交互中,用户可以在模型持续监听和响应时说话、插话并分享视觉上下文。这种闭环范式打破了网络传输、模型服务和回放之间的传统分离,揭示了当网络延迟、推理时间和用户体验紧密耦合时,局部优化的组件会损害端到端质量。先前的系统缺乏跨阶段协调,并且现有尝试使用语义线索进行联合优化的方法成本高昂且不切实际。作者引入了CONFLUX,一个AI原生的通信框架,它将块作为通用的协调基础。块携带执行级别的信号(例如剩余延迟预算)穿过传输、推理和回放,使各阶段能够在无需解释内容的情况下,共同决定传输、调度和呈现时机。该框架建立在三个见解之上:网络和会话感知的推理调度;基于模态紧迫性和可靠性的模型定义的传输需求;以及自适应的每响应回放启动,它平衡了首次响应时间与截止时间错过。其结果是一个实用、无语义的协调层,可在受限网络下提高交互质量。
方法
作者们提出了CONFLUX,这是一个旨在协调全双工AI媒体中的传输、推理和回放的系统。如框架图所示,CONFLUX作为一个端到端的控制回路运行,它从三个域收集信号:模型信号(模态需求、推理延迟、吞吐量)、网络信号(RTT、带宽、抖动)和回放信号(首次响应时间、截止时间错过)。
这些信号由一个中央收集器聚合,以驱动三个协调的运行时操作:发送端跨层传输、网络感知的模型推理和接收端回放调度。该架构确保系统能动态适应不断变化的交互状态。
全双工全能模型将块作为基本的传输对象。如下图所示,该过程从上行链路开始,其中每个块代表一个有界的交互间隔,包含对齐的模态,如音频、视频帧和文本。
这些块通过WebRTC等通道传输。在服务器端,输入块进入模型流水线,在那里它们被排队、批处理并由推理引擎处理。自回归LLM采样一个动作,例如静默、委派或响应。如果生成了响应,则会由模态特定的生成器渲染,并打包成输出块用于下行链路传输。时间线展示了从最后一次输入捕获到回放开始的关键路径,定义了首次响应时间。下行链路上的延迟到达会导致间隙和用户感知的卡顿。
发送端充当此回路中的第一个控制点。它利用模型中心的规范,该规范定义了可用的媒体通道、可调参数(如比特率和分辨率)以及自适应策略。通过观察运行时信号,如网络RTT和服务器端背压,发送端应用策略来做出联合传输决策。它决定哪些块需要降级、延迟或丢弃。例如,语音和控制事件优先于不太紧急的视觉内容。自适应策略允许发送端首先降低不太关键的维度,例如在降低音频比特率之前降低视频分辨率,以维持交互质量。
为了处理网络条件影响的模型行为,推理调度器维护轻量级的每会话上下文,包括双工阶段、轮次状态、最近的体验质量(QoE)和网络质量。调度器不是仅仅依赖请求到达顺序,而是为每个待处理的块分配一个优先级分数。此分数反映了该块是否改变了模型状态,例如插话事件,并考虑了交互质量差或网络状况降级的会话。调度器聚合候选批次中的优先级。如果总优先级超过阈值,则立即接纳该批次以缩短紧急事件的批处理延迟;否则,它将等待以提高服务效率。
接收端通过在第一个输出块到达后设置回放缓冲时长来控制最终阶段。这平衡了响应性和流畅性。接收端从近期的回放动态中得出拥塞信号,并使用受拥塞控制启发的策略来自适应缓冲区时间 bt:
bt=⎩⎨⎧min{γbt−1,bmax}max{bt−1−δ,bmin}bt−1Lt>ϕhigh,Lt<ϕlow,otherwise,这里,Lt 是观测到的端到端延迟,γ>1 是乘性增加因子,而 δ>0 是加性减少步长。阈值 ϕhigh 和 ϕlow 定义了一个滞后区域。如果延迟超过 ϕhigh,缓冲区会快速增加以吸收间隙。如果延迟降至 ϕlow 以下,缓冲区会逐渐减少以提高响应性。这可以防止因小的延迟波动而引起的振荡。
实验
使用部署在云实例上的MiniCPM-o-4.5对CONFLUX进行了初步评估,网络条件从高带宽、低延迟到严重受限的链路不等。结果表明,与基线相比,CONFLUX显著降低了首次响应时间和每块回放延迟,在网络状况降级的情况下收益最大。这些发现表明,即使在恶劣的网络条件下,该设计也能增强初始响应性并严格遵守回放截止时间。
一个插话示例表明,系统可以成功中断正在进行的响应以回答新问题,但也可能无法中断并继续之前的回答,揭示了不一致的插话行为。在成功案例中,模型立即停止对大型语言模型的初始描述,并回答关于手上物体的插话问题:“是一个白色的杯子。”在失败案例中,模型忽略了相同的插话请求,并继续生成关于人工智能的先前响应。
随着网络条件从好变差,用户插话影响模型输出的延迟大幅增加。在良好条件下,插话延迟约为半秒,但在严重受限的链路下,它会膨胀到五秒以上,导致模型继续产生陈旧的响应。从好到差的网络配置下,插话延迟增长了9倍以上,超过5秒。从有限到差条件的跳跃最为明显,延迟几乎翻了两番。
模态表现出不同的传输需求:控制事件和音频是紧急的,而视频和文本则不是。可靠性和可替换性差异很大,控制和文本要求高可靠性且不可替换,视频是可替换的且可靠性要求低,而音频则具有部分适应性。这些差异促使将模态特定的约束暴露给传输层,以实现高效、精度受限的传输。控制事件和音频被归类为紧急,而视频和文本仅具有中等紧急程度。控制事件和文本要求高可靠性且不可替换,而视频是可替换的且可靠性要求低。音频和视频是可适应的,但控制事件和文本则不是,这限制了它们在传输过程中的调整方式。
一个使用CONFLUX的对话AI系统在四种网络配置下进行了测试,范围从高带宽、低延迟(L1)到严重受限(L4)。它在所有配置下都保持了快速的首次响应时间(TTFR)和非常低的回放延迟,并且随着网络质量的下降,相对于基线的收益显著增加。CONFLUX在所有配置下将TTFR保持在1.39到1.88秒之间,而基线的范围为1.77到5.41秒。从最佳网络(L1)下的21.3%到最受限制网络(L4)下的74.4%,TTFR相对基线的改进有所增加。CONFLUX在每个配置下都将每块回放延迟保持在10毫秒以下,而随着网络状况恶化,基线延迟从46毫秒上升到94毫秒。L4下的TTFR低于L3,这表明调度策略在不同情况下反应不同,并为进一步调优留出了空间。
对对话AI系统中插话行为和传输调度的评估表明,在较差的网络条件下,响应性会急剧下降,插话延迟急剧增加,模态特定的约束(紧急且可靠的控制和音频,可替换的视频)促使采用定制化的传输策略。CONFLUX系统在所有网络配置下都保持了一致的快速首次响应时间和非常低的回放延迟,并且随着网络质量恶化,其相对于基线的性能优势显著增加。