HyperAIHyperAI

Command Palette

Search for a command to run...

FreeToken:面向边缘原生的带宽自适应 MoE 高效推理系统

摘要

前沿开放权重模型日益普及,但其推理服务在很大程度上仍以数据中心基础设施为前提。本文提出 FreeToken,一个边缘原生的 MoE 推理系统,它不再将个人机器视为一块小型 GPU,而是将其作为一个统一、弹性的推理平台。FreeToken 围绕本地 AI 的两个现实情况对完整推理栈进行协同设计,包括模型布局与加载、专家驻留、CPU–GPU 执行、智能体状态复用以及运行时内存管理:智能体工作负载会持续改变其执行模式,且边缘硬件所暴露的异构资源在不同机器之间差异显著。FreeToken 并不固守某种固定的卸载策略,而是持续将计算和模型状态映射到实际可用的资源上。FreeToken 支持 20 余种 MoE 模型以及真实的编码和工具使用智能体,覆盖从 8 GB 笔记本 GPU 到单工作站 GPU 的多种硬件。更重要的是,它改变了这些机器实际可服务的模型规模:从笔记本上的 35B 模型,到游戏台式机上的 284B 模型,再到单工作站 GPU 上的 753B GLM-5.2。FreeToken 将开放权重转化为可部署的本地软件,使用户已有的机器成为支撑前沿规模智能的实用平台。

一句话总结

作者提出 FreeToken,一个边缘原生的专家混合(Mixture-of-Experts)服务系统,它协同设计模型加载、专家驻留、CPU-GPU 执行和内存管理,以将计算和模型状态持续映射到可用的异构资源上,而不是固定卸载,支持 20 多个 MoE 模型,并能在笔记本电脑上运行 35B 模型,在单个工作站 GPU 上扩展到 753B GLM-5.2。

核心贡献

  • FreeToken 是一个边缘原生 MoE 服务系统,将个人机器视为跨 GPU、CPU、主机内存和互连的统一弹性推理平台,支持超过 20 个 MoE 模型以及真实编码和工具使用 agents,硬件范围从 8 GB 笔记本 GPU 到单个工作站 GPU。
  • 系统引入了带宽自适应的 CPU 协同执行和弹性全专家缓存,并统一 prefill/decode 驻留;从实测带宽中推导 CPU/GPU 划分,作为闭式比例,并使其在捕获的 CUDA 图中保持设备驻留;同时对专家池应用分层内存管理,而不是固定卸载或主机端启发式策略。
  • FreeToken 使 35B 到 753B 参数模型能够在个人硬件上运行,包括在游戏台式机上运行 284B 模型,以及在单个工作站 GPU 上运行 753B GLM-5.2,同时持续优于现有边缘服务系统,并为多轮 agentic 会话提供跨请求前缀复用。

引言

开放权重模型如 DeepSeek-V4-Flash 和 GLM-5.2 正在缩小与专有系统的能力差距,但运行它们仍然昂贵,因为前沿模型通常需要数据中心 GPU 或昂贵的托管 API,且 agentic 应用增加了推理需求。专家混合模型通过每个 token 仅激活少数专家,使本地服务变得更加可行,但完整专家池仍然超过消费级 GPU 内存,造成严峻的 prefill、decode 和资源管理问题。现有边缘服务系统只解决该问题的部分内容,并且在长 prefill 期间面临稠密专家工作集、没有原则性 CPU/GPU 划分的缓存未命中,以及消费级硬件变化下的固定策略等问题。作者提出 FreeToken,一个将异构消费级机器视为统一推理平台的服务系统,结合带宽自适应执行、语义感知缓存和弹性资源管理,在个人硬件上服务前沿规模的 MoE 模型。

方法

作者提出 FreeToken,一个旨在通过围绕两级专家内存层次组织计算来优化边缘专家混合(MoE)服务的系统。在该架构中,CPU 驻留专家池保存完整的路由专家权重并作为权威来源,而非专家权重保留在 GPU 上。剩余 GPU 内存被转换为一个在所有 MoE 层之间共享的弹性专家缓存。该缓存中的每个槽位存储计算一个层-专家对所需的全部张量,使驻留、查找和执行能够基于逻辑标识符而非张量分片进行。

参考框架图:

在 prefill 阶段,FreeToken 通过两个专门机制解决大规模专家传输和冗余重复计算的瓶颈。首先,系统采用全层双缓冲,将传输延迟隐藏在计算之后。由于 prefill 几乎激活每一层的整个专家集,FreeToken 从全局槽位池中分配两个全层缓冲区。当 GPU 从一个缓冲区计算第 lll 层的路由专家时,专用传输流同时将第 l+1l+1l+1 层的完整专家集加载到另一个缓冲区中。这保证了后台权重持续移动。其次,为处理会使循环状态失效的 agentic 上下文编辑,作者引入了语义感知状态缓存。该机制维护一小池附加到基数前缀树节点的循环状态检查点。检查点被策略性地放置在语义锚点处,例如标记思考段或工具调用的 special-token 边界。当上下文编辑发生时,系统从最深仍存活的检查点恢复,使全注意力层重用其 KV cache,循环层从该锚点恢复,从而仅对新的后缀重新 prefill。

在 decode 阶段,FreeToken 利用连续步骤之间观察到的强时间专家局部性。系统不是使用静态专家放置,而是维护一个共享 LRU 驻留空间,持续跟踪路由器选择的专家。缓存命中会刷新专家的最近使用状态,而淘汰会移除最久未被请求的专家,确保稀缺的 GPU 内存跟随当前工作集。

为处理由于冷启动或容量限制而不可避免地发生的缓存未命中,FreeToken 实现了由 qq^\starq 策略控制的带宽自适应执行策略。该机制根据实测的 pinned 专家传输带宽 (BPB_PBP) 和主机端专家处理带宽 (BHB_HBH),在 PCIe 传输和 CPU 执行之间动态划分 mmm 个缺失专家。未命中被分为缓存填充集 F\mathcal{F}F 和 CPU 执行集 C\mathcal{C}CF\mathcal{F}F 中的专家被传输到 GPU 缓存并在其中执行,而 C\mathcal{C}C 中的专家直接从 CPU 驻留池执行。最优划分比例 qq^\starq 被推导出来以平衡并发分支:

qmBPBHq^\star \approx m \frac{B_P}{B_H}qmBHBP

这个公式确保缓存填充以完整 PCIe 速率进行,同时 CPU 利用剩余主机带宽,将其转化为进展而不暂停缓存更新。CPU 和 GPU 分别计算各自的部分和并合并,以保持精确的 MoE 输出。

在这些阶段之下,弹性专家内存生命周期将 GPU 缓存容量视为可在运行时调整的资源。FreeToken 支持运行时缓存重配置,使系统能够在任何调度器安全点针对修订后的 VRAM 预算重建 GPU 专家缓存,而无需重启引擎。此外,快速引擎启动通过将专家权重直接读入最终主机布局并仅在填充后固定内存来实现,从而消除了预热阶段的需要。

从实现角度看,作者确保所有依赖路由的控制严格保持在 GPU 上,以避免昂贵的设备同步。对于每个 MoE 层,单遍内核会去重路由专家、根据驻留表对其分类、推导 fetch 数量 qqq,并选择淘汰对象。这种动态控制以数据形式表示在静态捕获的 CUDA 图内部。带宽自适应执行的 CPU 分支也被捕获到同一个图中,利用固定到物理核心的持久 C++ 工作线程池。为实现快速加载,系统将模型特定的检查点布局归一化为 FreeToken Weight (FTW) 格式,该格式将专家权重合并存储到运行时 bank 布局中,支持并行直接 I/O 直通到大小精确的主机 bank。

实验

评估在六块边缘和工作站 GPU 上,将 FreeToken 与 llama.cpp、Ollama、KTransformers 和 MoE-Infinity 进行比较,这些 GPU 在四个 agentic 工作负载(包括数学推理以及编码和电子邮件 agents)上服务超过 VRAM 的大型 MoE 模型。主要结果表明,在 agentic 服务下,FreeToken 提供更高且更稳定的 decode 吞吐量,并且尾部 time-to-first-token 远低于基线。分解实验将这些收益归因于流水线化 prefill 重叠和全局专家缓存局部性,而跨硬件测试表明,从 8 GB 笔记本 GPU 到工作站 GPU 上的前沿规模模型,该优势持续存在。

被测系统涵盖消费级和工作站 GPU,覆盖了广泛的 PCIe 传输带宽和 CPU 端专家内核带宽范围。在所有列出的系统中,有效的 CPU 端专家内核带宽都高于主机到设备的 PCIe 传输带宽。租用的服务器配置被限制并 pinned 以模拟边缘级主机,其 CPU 端带宽落在与真实台式机和笔记本系统相同的范围内。PCIe 传输带宽从笔记本的 PCIe 4.0 x8 链路,经 PCIe 4.0 x16 系统,扩展到 PCIe 5.0 x16 系统。CPU 端专家内核带宽与 PCIe 传输带宽之间的差距在笔记本上最大,其中 CPU 端带宽比 PCIe 带宽高数倍。工作站系统提供最大的内存容量和最高的 CPU 端专家内核带宽,远高于消费级平台。

评估覆盖消费级笔记本、台式机、工作站,以及为模拟边缘级主机而受限的租用服务器配置,涵盖从 PCIe 4.0 x8 到 PCIe 5.0 x16 链路。在所有系统中,有效的 CPU 端专家内核带宽始终高于主机到设备的 PCIe 传输带宽。该差距在笔记本上最大,其中 CPU 端带宽比 PCIe 带宽高数倍,而工作站提供最大的内存容量和最高的 CPU 端专家内核带宽。


用 AI 构建 AI

从创意到上线——通过免费 AI 协同编码、开箱即用的环境和最优惠的 GPU 价格,加速您的 AI 开发。

AI 协同编码
开箱即用的 GPU
最优定价

HyperAI Newsletters

订阅我们的最新资讯
我们会在北京时间 每周一的上午九点 向您的邮箱投递本周内的最新更新
邮件发送服务由 MailChimp 提供