HyperAIHyperAI

Command Palette

Search for a command to run...

2 小时前
LLM
多模态

LLMRouter:用于开发、评估和部署 LLM 路由器的统一基础设施

摘要

没有任何单一的大语言模型(LLM)能够在所有查询和预算约束下都表现最优,因此模型路由对于实现高成本效益的 LLM 部署至关重要。现有路由器涵盖二值质量预测器、成本感知级联、基于图的路由器以及智能体式路由器,但它们形式化方式各异、实现互不兼容,加之缺乏标准化的评估流程,阻碍了公平比较和进一步扩展。本文将 LLM 路由统一形式化为一个序贯决策过程。在该形式化下,路由器可以通过五类组件来刻画:上下文编码器、模型编码器、评分函数、决策规则和学习信号。现有方法据此可以归纳为单轮、多轮和个性化路由三个家族。基于这一形式化,我们开发了一条自动化流程,通过在多个基准上系统运行一组候选模型来构建路由监督信号,并在统一协议下从响应质量和推理成本两个维度评估路由器。由此得到的基准 xRouteBench 涵盖通用 LLM 任务、记忆增强、视觉(图像和视频)、时间序列以及个性化路由场景。依托该形式化和流程,我们提出了 LLMRouter,这是一个用于标准化和模块化实现 LLM 路由器的开源基础设施,用户只需实现一个路由方法和一个损失函数即可添加新路由器,并可访问覆盖全部三个家族的 16 种以上代表性路由器的内置实现。利用该库和基准,我们对 LLM 路由进行了系统的实证研究,发现学习型路由器相较于最强的固定模型基线取得了 14.6% 的相对提升;在更严格的成本约束下,路由器排名发生反转,轻量级设计更占优势;而基于用户条件的路由则持续带来个性化收益。

一句话总结

伊利诺伊大学厄巴纳-香槟分校的研究人员与合作者提出了 LLMRouter,这是一个统一的序贯决策表述和开源基础设施,包含用于标准化开发与评估 LLM 路由器的 xRouteBench,支持 16 个以上模块化路由器,并表明学习型路由器相比最强固定模型基线取得 14.6%14.6\%14.6% 的相对提升,在更严格成本约束下出现排名反转,并获得一致的个人化收益。

核心贡献

  • 论文引入统一表述,将 LLM 路由描述为序贯决策过程,用上下文编码器、模型编码器、评分函数、决策规则和学习信号刻画路由器,并将现有方法组织为单轮、多轮和个性化路由家族。
  • 论文开发了一条自动化流水线,通过在基准上运行候选模型来构造路由监督,并在响应质量和推理成本上评估路由器,产生覆盖通用 LLM、记忆增强、视觉、时间序列和个性化路由场景的 xRouteBench 基准。
  • 论文提供 LLMRouter,一个开源模块化库,内置 16 个以上统一在一个接口后的路由器,并报告系统性研究,表明学习型路由器相比最强固定模型基线取得 14.6% 的相对提升,轻量路由器在更严格成本约束下排名更好,用户条件路由带来一致的个人化收益。

引言

随着大型语言模型发展成一个异构生态系统,其成本和任务特定能力差异很大,将每个查询路由到合适的模型对于成本有效的部署、质量匹配和用户特定适配已变得至关重要。先前路由研究产生了许多方法,但它们在不同形式化体系、独立代码库、不兼容接口和不一致评估栈下开发,难以确定真正影响性能的因素。现有基准还为固定候选池预计算响应,并侧重单轮路由,缺乏针对多轮和个性化设置的标准化成本感知评估,也缺乏面向新任务或候选模型的监督流水线。作者引入 LLMRouter,这是一个统一基础设施,通过通用组件形式化路由器,在一个接口后支持单轮、多轮和个性化方法,在可配置候选池上自动化路由监督与评估,并提供在一个协议下覆盖多个场景的 xRouteBench 基准。

数据集

数据集描述:xRouteBench

组成与来源

  • 该基准包含跨 五个赛道4,767 个实例
  • 通用 LLM 任务混合来自 MMLU、MMLU-Pro、ARC-Challenge、OpenBookQA、CommonsenseQA、BoolQ、HellaSwag 和 SQuAD 的知识与常识问答,来自 GSM8K、MATH 和 AIME 的数学推理,以及来自 MBPP 和 HumanEval 的代码生成。
  • 记忆使用来自 LoCoMo 和 LongMemEval 的长程对话问答,其中输入历史主导 token 成本。
  • 视觉使用 Geometry3K 和 MathVista 进行图像锚定的数学推理,并使用 Charades-Ego 进行第一人称视频理解。
  • 时间序列使用 TSRBench,每个时间序列同时渲染为文本和图像,使路由器也选择模态编码。
  • 个性化使用来自 Chatbot Arena 和 MT-Bench 的开放式提示,与用户画像关联,并由以画像为条件的 LLM 评判器评分。

处理与模式

  • 所有任务都通过 LLMRouter 数据引擎构建,并共享相同的查询模式、监督格式和评估协议。
  • 查询从源基准中采样,归一化为统一模式,并划分为训练集和测试集。
  • 每个非文本资产由转换脚本转换为自包含的文本查询,并带有指向源图像、视频或时间序列的可选指针。这使纯文本和多模态候选模型可以接收相同的文本输入。
  • 除源采样和归一化外,未报告单独的过滤规则。
  • 未描述裁剪策略;非文本资产被转换为带有可选源指针的文本查询。

响应收集与评分

  • 每个查询被分发到配置文件中声明的候选池中的每个候选模型。
  • 收集响应及其 token 计数。
  • 每个响应都根据其任务指标评分,并根据其 token 计数定价。
  • 结果是一个密集的查询-模型性能与成本矩阵,用作路由监督和测试平台。
  • 内置指标包括精确匹配和近似匹配、多项选择准确率、token 级 F1、数学答案验证和基于执行的代码评估。还支持基于 LLM 的可选评判。
  • 多轮和 agentic 分解与聚合调用被计入轨迹成本。

数据使用方式

  • 训练/测试划分来自查询整理,但所述部分未指定混合比例。
  • 评估期间,测试查询仅发送到路由器选择的候选模型,而不是整个候选池。
  • 查询-模型矩阵提供同时捕获响应质量和推理成本的监督。
  • 对于个性化赛道,监督是偏好反馈,而不是逐点正确性。

方法

作者将 LLM 路由形式化为序贯决策过程,以统一不同的路由策略。在第 ttt 步,路由器观察到状态 st=(q,u,ht)s_t = (q, u, h_t)st=(q,u,ht),包括输入查询 qqq、可选用户上下文 uuu 和累积交互历史 hth_tht。路由器采取动作 atM{}a_t \in \mathcal{M} \cup \{\perp\}atM{},其中分发到候选模型 mmm 会把响应附加到历史中,终止动作 \perp 将响应聚合为最终答案。目标是找到使性能-成本权衡最大化的策略 π\piπ

π=argmaxπEq,τπ[perf(yq)λc(τ)]\pi^{\star} = \arg \max _{\pi} \mathbb {E} _ {q, \tau \sim \pi} \bigl [ \operatorname{perf} (y \mid q) - \lambda \cdot c (\tau) \bigr ]π=argπmaxEq,τπ[perf(yq)λc(τ)]

其中 perf(yq)\operatorname{perf}(y \mid q)perf(yq) 聚合任务特定的质量指标,c(τ)c(\tau)c(τ) 对路由轨迹的货币或 token 成本求和,λ\lambdaλ 控制权衡。

有关该统一表述的概览,请参见框架图。

在该表述下,路由器由五个关键组件刻画。上下文编码器 EqE_qEq 将路由状态映射为表示,该表示可以基于嵌入(例如句子嵌入或图节点)或基于文本(例如语言化提示)。模型编码器 EmE_mEm 使用静态元数据、历史行为、学习到的嵌入或语言化描述来刻画候选模型。评分函数 ggg 衡量编码状态与候选模型之间的兼容性,决策规则 ddd 将评分转换为路由动作,例如贪心选择或成本感知阈值。最后,学习信号 LLL 使用逐点标签、成对比较或轨迹级奖励,将这些组件拟合到最优策略。

为了将该表述付诸运行,作者引入了 LLMRouter,这是一个集成数据构建、训练、推理和评估的可执行系统。

系统架构如下图所示:

该基础设施围绕查询-模型矩阵组织为六个模块:

  1. 数据引擎:实现由查询整理、响应收集以及指标评分与定价组成的三阶段流水线。它将声明的任务和候选池转换为密集的查询-模型矩阵,同时用作路由监督和测试平台。
  2. 路由器库:为超过 16 个路由器提供统一的 MetaRouter 接口。用户继承 MetaRouter 实现路由逻辑,封装上下文编码器、模型编码器、评分函数和决策规则。
  3. 训练器:通过 BaseTrainer 将训练与路由解耦。它把学习信号定义为逐点损失、成对损失或轨迹级奖励,以针对加权目标优化路由器。
  4. 路由引擎:通过将查询分发到选定候选模型并为多轮策略聚合响应来驱动推理,直到产生终止动作。
  5. 评估:在相同测试查询、候选池和指标上对路由器评分,扫描权衡权重 λ\lambdaλ 以绘制性能-成本前沿。
  6. 部署:将路由器暴露为 OpenAI 兼容服务器,用于实时单 agent 和多 agent 流量。

为支持多样化场景下的标准化评估,数据引擎构建了 xRouteBench。所有任务共享相同模式和评估协议,将非文本资产转换为文本查询,以将路由与感知分离。

所构建基准的任务分布如下图所示:

该基准覆盖五个赛道:用于传统单轮文本设置的通用 LLM 任务,用于 token 成本由历史控制的长程对话问答的记忆,用于图像和视频输入的视觉,用于模态选择的时间序列,以及用于基于偏好的反馈的个性化。该设计确保路由决策在输入 token 成本、模态能力和用户偏好存在根本差异的场景中得到评估。

实验

论文引入了自动化 LLM 路由评估流水线和 xRouteBench 基准,该基准在统一成本感知协议下覆盖通用、记忆、视觉、时间序列和个性化任务。实验在十八个模型上比较了超过十六种路由器,包括仅质量、成本加权、真实用户和多 agent 部署设置。结果显示,没有一个路由器能在所有任务上占优,多轮路由并不持续优于单轮路由,路由器排名会随成本偏好发生显著变化。用户上下文可改善个性化,但模拟偏好仅部分迁移到真实用户;在多 agent 系统中,学习到的每 agent 路由通常优于始终选择最大模型。

表格通过指定路由状态、编码器、动作规则和学习信号,将三个路由器家族分解到统一序贯决策框架中。单轮路由器仅使用查询,并拟合每个候选模型的质量-成本奖励;多轮路由器包含交互历史并优化完整轨迹。个性化路由器加入用户上下文,并从模型响应之间的成对偏好比较中学习。单轮路由仅以查询为条件,选择得分最高的候选模型。多轮路由以查询和累积历史为条件,并以回合级回报进行优化。个性化路由进一步以用户上下文为条件,并在成对偏好上训练。三个路由器家族共享相同的底层目标,即在响应质量与推理成本之间进行权衡。

在仅性能设置下,没有一个路由器能在所评估的赛道上全面占优:RouterDC 在通用 LLM 任务上表现最好,SVMRouter 在 LoCoMo 上表现最好,GraphRouter 取得最佳平均值,但并未持续优于所有其他路由器。学习型单轮路由器可优于基于规则的基线;与学习到的路由相比,仅使用最大模型的性能平庸。多轮路由并不总是可靠地优于单次路由决策,并可能引入冗余计算。获胜路由器因任务而异,RouterDC 在通用 LLM 任务上领先,SVMRouter 在 LoCoMo 上领先。GraphRouter 在 xRouteBench 上取得最佳平均值,但并未在所有任务上持续优于其他路由器。学习到的路由可以压过始终调用最大模型,因为许多可由更小或更便宜模型解决的查询被最大模型错过。多轮路由相比单轮路由未带来一致收益,一次良好选择的路由通常已足够。

在个性化路由赛道上,感知用户上下文的路由器表现最好,GMTRouter 领先于 PersonalizedRouter 和最强的用户无关路由器 EloRouter。两种个性化方法之间的差距表明,如何编码和整合用户上下文比单纯使用它更关键。静态和用户无关基线通常落后于个性化方法。GMTRouter 和 PersonalizedRouter 分别排名第一和第二,证实以用户上下文为条件的路由决策可提高画像评判准确率。EloRouter 是最好的用户无关路由器,但仍落后于两种个性化方法;最大 LLM 和最小 LLM 等简单选择基线得分低得多。GMTRouter 与 PersonalizedRouter 之间的较小准确率差距表明,对用户上下文建模的方式仍然重要。

在留出的真实用户会话上,PersonalizedRouter 在匹配成对偏好方面达到最高准确率,而微调的 CausalLM 路由器排名最后。若干学习型路由器优于静态模型规模基线;模拟排名不能完全迁移到真实反馈,GMTRouter 下降至第六。PersonalizedRouter 在留出路由准确率上以明显优势领先。微调的 CausalLM 路由器在与人类偏好一致方面最弱。GMTRouter 从模拟排名的顶部跌至真实用户会话的第六,表明部署验证很重要。

在各种协调拓扑中,使用学习型路由器对每个节点独立路由通常比始终选择最大模型有性能提升。MFRouter 取得最高平均值,紧随其后的是 SVMRouter 和 kNNRouter;GraphRouter 是平均上唯一落后于最大模型基线的学习型路由器。Graph 拓扑往往产生最强的单拓扑结果。七个学习型路由器中有六个在平均上超过最大模型基线,MFRouter 领先。Graph 拓扑为若干学习型路由器带来最强的单拓扑得分,而 GraphRouter 是显著例外,总体表现不如基线。

实验在统一的序贯决策框架中评估单轮、多轮和个性化路由器,该框架在响应质量与推理成本之间进行权衡。仅性能结果显示,没有一个路由器在通用 LLM 任务和 LoCoMo 上全面占优;学习到的单轮路由可优于基于规则和最大模型基线;多轮路由带来不一致的收益。个性化路由受益于用户上下文,个性化方法在模拟设置中优于用户无关基线;留出的真实用户会话进一步表明模拟排名迁移并不完全。在多节点协调中,多数学习型路由器优于始终选择最大模型;Graph 拓扑通常产生最强的单拓扑结果,但 GraphRouter 是显著例外。


用 AI 构建 AI

从创意到上线——通过免费 AI 协同编码、开箱即用的环境和最优惠的 GPU 价格,加速您的 AI 开发。

AI 协同编码
开箱即用的 GPU
最优定价

HyperAI Newsletters

订阅我们的最新资讯
我们会在北京时间 每周一的上午九点 向您的邮箱投递本周内的最新更新
邮件发送服务由 MailChimp 提供