Command Palette
Search for a command to run...
Qwen3.8-Next 架构设计:评估、效率与训练稳定性
Qwen3.8-Next 架构设计:评估、效率与训练稳定性
在线运行 Qwen3.8-Flash-Next-FP8 多模态大模型
摘要
我们描述了 Qwen3.8-Flash-Next 的架构及其消融实验,这是一个稀疏混合专家模型,拥有 1250 亿参数,每个 token 激活 60 亿参数,并额外包含 510 亿参数的 n-gram 嵌入表,这些表存放在加速器之外。在十四个预训练基准上,该模型在八个基准上优于其前身 397B-A17B,在其余基准上最多落后 2.6 个点,而激活参数仅为前者的 1/3,训练 token 为 1/3,训练 FLOPs 约为 1/9。Token 混合采用逐层混合的 Gated DeltaNet(GDN)和全局注意力,每四层中有一层为全注意力层;在持续预训练阶段,这些全注意力层被替换为 Qwen 稀疏注意力(QSA),后者通过压缩的轻量级索引器在微块粒度上对上下文进行评分。残差流被拓宽为四个分支,并通过逐元素门控进行读取,我们称这种设计为门控残差(GR)。容量通过单个 n-gram 嵌入层在主干之外添加,其表从主机内存预取。我们从三个维度评估每个候选更改:损失及下游基准;更改在训练、预填充和解码中的成本;以及其对最优超参数和训练稳定性的影响。损失和下游准确率并不总是同步变化:扩大 n-gram 词汇量会单调降低损失,而下游准确率则趋于饱和。该架构与 Muon 优化器共同将最优学习率和批量大小向上移动,使批量大小预热变得不必要,并显著提高了压力测试下的稳定性。损失、基准、效率和稳定性构成一个统一的设计问题。通过联合求解,我们得到了一种同时更高效、更有能力且更稳定的方案。
一句话总结
Qwen团队推出Qwen3.8-Flash-Next,这是一个125B参数的稀疏MoE模型,具有6B激活token和51B的n-gram嵌入参数。该模型在十四个基准测试中的八个上超越了其397B-A17B前代模型,而激活参数仅为前者的31,训练token为前者的1/3,FLOPs约为前者的91。该模型采用Gated DeltaNet与全局注意力的逐层混合(在继续预训练阶段由Qwen Sparse Attention替代)、四分支Gated Residual流以及预取n-gram表,并通过Muon优化器联合优化损失、下游准确率、效率和稳定性。
核心贡献
- 提出Qwen3.8-Flash-Next,一个125B参数的稀疏混合专家模型,每个token激活6B参数,在十四个预训练基准上匹配或接近此前397B-A17B旗舰模型的性能,同时仅使用三分之一的激活参数、三分之一的训练token和约九分之一的训练FLOPs。
- 结合了Gated DeltaNet与全局注意力的逐层混合,在继续预训练阶段以Qwen Sparse Attention替代全注意力,通过逐元素门控读取的四分支Gated Residual流,以及主机内存中的n-gram嵌入层;这些变化将最优超参数上移、消除了batch size预热需求并提升了稳定性,压力测试显示在四倍最优学习率下新方案保持稳定而旧结构出现尖峰。
- 证明损失与下游准确率并非总是同步变化,扩大n-gram词汇表可单调降低损失而下游准确率趋于饱和,并通过损失、基准测试、训练/预填充/解码成本和稳定性的联合评估验证了设计,最终得到同时更高效、更强且更稳定的方案。
引言
作者提出Qwen3.8-Flash-Next,一个总参数125B、每token激活6B的稀疏混合专家模型,另有51B参数存储于加速器外的n-gram嵌入表中。目标是匹配此前397B-A17B旗舰模型的质量,同时仅使用约三分之一的激活参数、三分之一的训练token和约九分之一的训练FLOPs。此前的工作面临权衡困境:架构变化会同时影响下游性能、训练与服务成本以及稳定性,而简单的修复在后期评估或压力测试下往往失效。作者的主要贡献是四个组件的耦合设计:用于token混合的Gated DeltaNet与全局注意力逐层混合、用于高效长上下文预填充的Qwen Sparse Attention、通过逐元素门控加宽残差流以提升容量和稳定性,以及在不增加每token计算量的情况下提供额外参数的n-gram嵌入层。他们还针对新优化器和架构重新拟合了缩放律,并通过压力测试验证了稳定性,这些测试暴露了中等规模下的不稳定问题。最终得到的基座模型在十四个基准中的八个上领先前代,其余基准上最多落后2.6分,且全规模训练期间无损失尖峰。
方法
作者通过引入Gated DeltaNet(GDN)与全局注意力的逐层混合,解决了高效局部处理与持久内容相关记忆之间的张力。GDN将前缀压缩为固定大小的循环状态,并根据当前内容更新该状态,而交错分布的全局注意力层保留直接的token级检索。具体而言,每四层中放置一层全注意力,其余三层使用GDN。
GDN的token混合路径如下所示。
给定归一化后的残差流输入,GDN使用学习得到的投影后接短深度因果卷积来计算内容特征。查询和键经过L2归一化以约束量级并稳定秩一delta变换。循环状态通过门控delta规则更新,其中数据相关的衰减门全局控制现有状态的寿命,写入门控制delta更新。这种定向擦除-写入操作使GDN区别于纯加性线性注意力。头输出随后经过归一化并由sigmoid输出门调制。为提高效率,GDN内核使用融合线性注意力内核库进行优化。
为缓解softmax注意力在长上下文场景中的二次计算瓶颈,作者采用Qwen Sparse Attention(QSA)。QSA使用轻量级索引器将序列压缩为微块表示,估计其重要性,并选择最相关的上下文进行注意力计算。
如下图所示:
压缩轻量级索引器采用多查询注意力结构。键被划分为不重叠的块,在应用部分旋转位置编码之前通过平均池化进行压缩。通过块因果评分获得块级重要性分数,使每个查询仅对完整可见的块进行评分。在给定token预算下,选择得分最高的块,展开为原始token索引,并与尾部token合并进行核心注意力计算。
QSA的训练在继续预训练期间包含两个阶段。第一阶段为密集蒸馏,将骨干网络的全序列注意力分布蒸馏到索引器中。token级教师分布通过最大池化对齐到块级索引器分数,并最小化KL散度来训练索引器。第二阶段为稀疏训练,整个骨干网络在索引器引导下训练以适应稀疏注意力模式。索引器KL损失仅对选定的top-k块计算。
该训练过程的有效性通过训练损失曲线展示。
QSA与全注意力的损失曲线高度一致,整体损失差异在10−4量级。
架构消融实验凸显了QSA中层层内压缩的优势。
QSA在相对索引器延迟为0.25时匹配全注意力基线,优于跨层索引共享方法。此外,QSA在少量索引器查询头下仍能保持性能。
QSA在长序列长度下的效率提升十分显著。
通过压缩键序列,QSA降低了索引器复杂度,并在预填充和解码阶段相比密集分组查询注意力实现了显著的内核级加速。
为解决预归一化网络中的信号衰减问题,作者引入Gated Residual(GR)连接,将残差流加宽为多个并行分支。GR以读取算子替代块预归一化,该算子从所有分支预测每个分支和通道的逐元素门控分数,将门控分支平均后作为块输入。块输出通过每个分支的数据相关标量写入所有分支。这种设计允许特定分支在多层间保留早期注意力输出,而其他分支保持局部性,从而同时提升训练稳定性和下游性能。
在优化方面,作者使用基于矩阵的优化器Muon,对二维权重应用Newton-Schulz迭代来正交化动量。融合参数(如注意力查询-键-值投影)在正交化前按头粒度拆分,以避免混合不相关子块的奇异方向。此外,开发了更新的超参数缩放律,预测出显著更大的batch size和学习率。新方案消除了batch size预热需求,因为Muon在更大batch size下保持数据效率,从而带来更稳定高效的大规模训练。
实验
实验在关键组件层面验证了Qwen3.8-Flash-Next架构。GDN混合注意力在大多数基准上优于全注意力和SWA基线,而QSA稀疏注意力在短上下文任务上匹配全注意力性能,并在长上下文检索中带来显著提升,在1M上下文下内核级加速最高达7.6倍。n-gram嵌入消融实验表明Layer 2的单层即足够,扩大其词汇表可改善损失和中文基准但下游收益不一致。超参数缩放实验确认了新方案预测的batch size和学习率接近最优,训练稳定且无需batch size预热。压力测试表明门控残差和Muon优化器相比AdamW基线提供了较大的稳定性裕度,完整模型以约九分之一的训练成本取得了与更大基线相当的结果。
GDN混合架构在大多数基准上优于全注意力和SWA混合基线,尤其在推理、数学和代码任务上。虽然全注意力在一些通用知识基准上领先,但GDN混合在全部九个任务上取得了最高平均分。GDN混合相对全注意力在9个基准中的8个上有所提升,相对SWA混合在9个中的7个上有所提升。GDN混合在数学和代码基准(如MATH和EvalPlus)上增益最大。全注意力在MMLU-Pro上保持优势,而SWA混合在MMLU和SuperGPQA上领先。GDN混合在全部九个基准上取得了最佳平均分。
用Qwen Sparse Attention(QSA)替换全注意力在大多数基准上保持或略微提升性能,最大增益出现在推理和代码任务上。唯一明显的下降出现在SuperGPQA基准,而所有类别的平均分均略有提升。QSA相对全注意力提升了平均性能,主要由推理和代码基准的增益驱动。QSA在MATH基准上取得了最大相对提升,而SuperGPQA略有下降。多语言和STEM结果也随QSA有所改善,但增益小于推理和代码任务。
将Qwen Sparse Attention(QSA)应用于模型可提升RULER和MRCR基准上的平均长上下文检索性能,最大增益出现在较长序列长度下。虽然全注意力在一些较短范围和MRCR设置下仍略有优势,但QSA在最具挑战性的512K–1M和512K/1M MRCR场景中带来显著提升。QSA将两个基准的平均分从78.76提升至80.93。QSA在RULER上的最大增益出现在512K–1M范围,分数从90.08跃升至93.00。在MRCR上,QSA在512K处将全注意力分数翻倍以上(从30.66提升至40.53),并将1M分数从20.71提升至26.44。全注意力在MRCR的128K和256K处仍略优,但QSA缩小差距并在更长长度上胜出。
在四步推测解码下,用Qwen Sparse Attention(QSA)替换全注意力在所有评估基准上产生略高的平均MTP接受长度。增益一致但温和,平均接受长度从4.06提升至4.07。这表明QSA在降低注意力索引开销的同时保持或略微提升解码效率。QSA将平均MTP接受长度从4.06提升至4.07(相对全注意力)。每个基准上均观察到增益,最大相对提升出现在MT-Bench(从3.44到3.47)。改进一致但较小,表明QSA在降低索引成本的同时保持解码质量。
使用多分支加宽残差流在所有评估基准上均优于标准pre-norm。分支权重的动态门控优于静态加权,进一步细化的门控变体(GR)取得最佳整体结果,尤其在STEM和多语言任务上。所有加宽残差变体相比pre-norm基线均降低损失并提升基准分数。动态分支权重在知识、STEM、推理和多语言基准上始终优于静态加权。细化门控变体(GR)取得最高平均MMLU以及STEM和多语言任务上的最佳分数,且在对比配置中损失最低。
实验在多样化基准上验证了所提出的混合注意力和架构修改。GDN混合注意力在九个任务上取得最佳平均性能,在推理、数学和代码上增益显著,但全注意力在一些通用知识任务上仍保持优势。用Qwen Sparse Attention(QSA)替换全注意力在大多数基准上保持或略微提升分数,最大增益出现在推理和代码任务,同时改善长上下文检索,尤其在512K和1M序列长度下。在推测解码下,QSA保持解码效率,接受token长度略有提升。最后,使用多分支和动态门控加宽残差流始终优于标准pre-norm基线,细化门控变体取得最佳整体结果。