HyperAIHyperAI

Command Palette

Search for a command to run...

xHC:扩展超连接

摘要

超连接(HC)将Transformer的残差流扩展为N条并行流,提供了一种超越模型宽度和深度的记忆扩展形式。流形约束HC(mHC)在大规模下稳定了这一公式。从N=1到N=4的巨大收益表明,残差流扩展是一个有前景的扩展轴。然而,现有的HC系列方法通常止步于N=4。我们的实验揭示了原因:将mHC扩展至超过此点会导致性能增益递减和训练成本急剧上升。我们将这一限制归因于两个瓶颈:不断增加的流数量导致写回信息不足,以及残差混合生成成本随N呈立方增长。为解决这两个瓶颈,我们提出了xHC(扩展超连接),这是首个实现N=4以上有意义扩展的HC系列方法。xHC结合了时间特征增强以实现更丰富的写回,以及稀疏残差流架构,该架构仅更新N=16条流中的k=4条,同时保持对完整残差状态的密集访问。在18B和28B MoE模型上,xHC带来了强劲且一致的下游改进。在18B MoE模型上,xHC的平均下游得分比mHC提高了4.0分,同时相比普通基线仅增加了适度的训练FLOPs。扩展律实验表明,普通基线和mHC基线分别需要xHC的1.50倍和1.19倍计算量才能达到相同的损失。实际的大N训练还需要控制扩展残差状态带来的内存流量。因此,我们引入了xHC-Flash,它将每子层的内存流量从73.5C降低到40C,与mHC在N=4时所需的34C相当,同时保留了完整xHC的大部分收益。xHC和xHC-Flash共同使大N残差流扩展在LLM预训练中变得有效且实用。

一句话总结

上海交通大学、小红书公司及其合作者提出xHC,首个将HC族方法扩展到N=4N=4N=4以上的方法,它结合了时序特征增强与稀疏残差流架构,仅更新N=16N=16N=16个流中的k=4k=4k=4个,以克服写回和立方混合瓶颈,在18B18B18B MoE模型上实现4.0个点的下游任务提升,并相比原始基线节省1.50×1.50\times1.50×计算量,同时提出内存高效的xHC-Flash变体,将每子层内存流量从73.5C73.5C73.5C降至40C40C40C,用于实际LLM预训练。

核心贡献

  • 识别出限制超连接扩展到N=4以上的两个瓶颈:写回信息不足和立方代价的残差混合。提出扩展超连接(xHC),结合时序特征增强与稀疏残差流架构,仅更新N=16N=16N=16个流中的k=4k=4k=4个,同时保持密集读取访问。
  • 在18B和28B MoE模型上的大规模实验表明,xHC相比mHC平均下游得分提升4.0分。缩放律分析表明,原始基线和mHC基线需要xHC的1.50倍和1.19倍计算量才能达到相同的损失。
  • xHC-Flash和融合内核将每子层内存流量从73.5C降至40C,与N=4N=4N=4时的mHC(34C)相当,同时保留了xHC的大部分增益。融合实现进一步减少了内核启动开销。

引言

大语言模型架构通过注意力机制、混合专家和缩放取得了进步,但跨层传递token表示的残差流仍是一条单一恒等通路。超连接(HC)及其稳定变体流形约束HC(mHC)引入了多个并行残差流,并具有可学习的混合,表明从1个流扩展到4个流能带来显著增益,并暗示了一个新的缩放维度。然而,先前的HC族方法在4个流时停滞,因为简单增加更多流会带来快速递减的回报:信息瓶颈,即单一的写回信号无法提供足够的多样性来填充多个流;以及计算瓶颈,残差混合代价随流数量立方增长。作者提出扩展超连接(xHC),首个使残差流扩展至4个流以上既有效又可行的方法。xHC通过时序特征增强(利用相邻token的多尺度因果特征丰富写回信号)和稀疏残差流架构(仅激活部分流进行混合和写回,同时保持读取路径密集)来解决瓶颈。这种组合将扩展率转化为实用的缩放维度,以最小的额外FLOPs提供更好的损失和下游性能。

方法

作者首先回顾超连接(HC),它通过维持NNN个并行残差流来增加跨层信息流的容量,从而泛化标准残差连接。令XlRN×CX_l \in \mathbb{R}^{N \times C}XlRN×C表示第lll层的多流状态,其中CCC是隐藏维度。HC每层引入三个可学习映射:预映射Hlpre\mathcal{H}_l^{\text{pre}}Hlpre、后映射Hlpost\mathcal{H}_l^{\text{post}}Hlpost和残差映射Hlres\mathcal{H}_l^{\text{res}}Hlres。单层更新定义为:

Xl+1=HlresXl+HlpostF(HlpreXl,Wl)X_{l+1} = \mathcal{H}_l^{\text{res}} X_l + \mathcal{H}_l^{\text{post}} \mathcal{F}(\mathcal{H}_l^{\text{pre}} X_l, \mathcal{W}_l)Xl+1=HlresXl+HlpostF(HlpreXl,Wl)

为确保大规模训练稳定,流形约束HC(mHC)通过Sinkhorn-Knopp算法将Hlres\mathcal{H}_l^{\text{res}}Hlres投影到双随机矩阵的Birkhoff多胞体上。该约束保持了跨深度的恒等映射性质。

然而,作者观察到在mHC中将扩展率NNN扩大到4以上会迅速饱和。如下图所示,将NNN从4增加到16仅使损失降低0.006,而训练FLOPs增加32%。

作者识别出导致这种饱和的两个瓶颈。第一个是信息供给瓶颈。在mHC中,每层仅向所有流注入单一的写回分量。随着NNN增长,额外的流变得冗余,因为它们无法从多样化的分量中汲取信息以形成非冗余的历史。第二个是代价瓶颈。生成N×NN \times NN×N残差映射需要从NCNCNC维状态预测N2N^2N2个系数,导致输入依赖投影代价为O(N3C)O(N^3 C)O(N3C)

为使大NNN扩展既有效又可行,作者提出xHC(扩展超连接)。架构概览请参见框架图。

xHC采用两项协同设计:时序特征增强以丰富写回信号,以及稀疏残差流架构以降低混合代价。

时序特征增强

为解决信息瓶颈,xHC通过借用相邻token的低成本局部上下文信息来丰富写回基。作者对层输出应用rrr个因果深度可分离1D卷积,核大小为{κ1,,κr}\{\kappa_1, \dots, \kappa_r\}{κ1,,κr}。这些组件捕获不同上下文范围的相邻token信息,并与原始输出拼接:

outaug=[out;DWConvκ1(out);;DWConvκr(out)]RS×Kr×C\text{out}_{\text{aug}} = [\text{out}; \text{DWConv}_{\kappa_1}(\text{out}); \dots; \text{DWConv}_{\kappa_r}(\text{out})] \in \mathbb{R}^{S \times K_r \times C}outaug=[out;DWConvκ1(out);;DWConvκr(out)]RS×Kr×C

其中Kr=r+1K_r = r + 1Kr=r+1。由于深度可分离卷积按通道操作,其输出能与原始层输出保持强对齐。为防止冗余,作者对KrK_rKr个分量应用改进的Gram-Schmidt正交化。对于j=1,,rj = 1, \dots, rj=1,,r,正交化分量计算为:

vj+1=gji=1jgj,vivi,viviv_{j+1} = g_j - \sum_{i=1}^j \frac{\langle g_j, v_i \rangle}{\langle v_i, v_i \rangle} v_ivj+1=gji=1jvi,vigj,vivi

其中gj=DWConvκj(out)g_j = \text{DWConv}_{\kappa_j}(\text{out})gj=DWConvκj(out)v1=outv_1 = \text{out}v1=out。这些正交化分量用于所有后续写回操作,确保为扩展流提供多样化的信息供给。

稀疏残差流架构

为解决代价瓶颈,xHC采用非对称设计,仅kkk个活跃流(例如k=4k=4k=4)进行残差混合和写回,而所有NNN个流(例如N=16N=16N=16)保持密集读取访问。前向过程包括三个步骤:

  1. 流路由:路由器在每个子层选择kkk个流进行更新。它采用固定加路由方案,其中mmm个流始终活跃且路由权重为1,其余kmk-mkm个流通过基于全NNN流状态导出的sigmoid分数的TopK路由选择。
  2. 密集读取:每层访问全NNN流状态以形成输入: inputl=i=1Nhl,iprexl,i\text{input}_l = \sum_{i=1}^N h_{l,i}^{\text{pre}} \cdot x_{l,i}inputl=i=1Nhl,iprexl,i 这保留了跨层信息流,即使仅更新kkk个流。
  3. 稀疏残差更新:残差映射Hlres\mathcal{H}_l^{\text{res}}Hlres和后映射Hlpost\mathcal{H}_l^{\text{post}}Hlpost仅从活跃状态XactiveX_{\text{active}}Xactive生成。这将主要生成代价从O(N3C)O(N^3 C)O(N3C)降至O(k3C)O(k^3 C)O(k3C)。活跃流更新为: Xactivenew=HlresXactive+ΔXactiveX_{\text{active}}^{\text{new}} = \mathcal{H}_l^{\text{res}} X_{\text{active}} + \Delta X_{\text{active}}Xactivenew=HlresXactive+ΔXactive 其中ΔXactive\Delta X_{\text{active}}ΔXactive使用后映射组合增强的写回分量。更新后的流被散射回全状态,而非活跃流保持不变地向前传递。

参数化与实际部署

映射遵循共享的门控投影模式。可学习的门控标量α\alphaα(初始化为0.01)相对于可学习偏置缩放输入依赖项。残差映射对活跃流使用Sinkhorn归一化。后映射使用2σ()2\sigma(\cdot)2σ()缩放,以允许对各个写回分量进行衰减和适度放大。

为进一步减少训练期间的内存流量,作者引入xHC-Flash。这种轻量变体将全状态操作摊销到连续子层上。它共享路由决策,并从块入口状态联合形成子层特定的预映射。通过从注意力子层中移除残差混合并将其推迟到MLP侧,xHC-Flash实现了精确的密集读取复用。这显著降低了I/O成本,使其与N=4N=4N=4时的mHC相当,同时保留了大NNN扩展的性能优势。

实验

论文在从2.5B到28B参数的混合专家语言模型预训练中评估xHC,与多流HC(mHC)和原始残差基线进行比较。xHC在下游基准上始终优于两者,并在缩放律实验中描绘出更低的损失曲线,在相同损失下相比mHC具有1.19倍的计算优势。将扩展率N从2增加到16,xHC的损失改善且FLOPs开销极小,而mHC饱和,证明稀疏更新和时序特征增强有效解决了大N扩展的信息和代价瓶颈。消融实验确认两个组件都是必要的,且xHC在Muon优化器下仍然有效,尽管其更高的内存流量促使进一步效率优化。

xHC在18B和28B规模的语言理解和推理基准上始终优于原始残差基线和mHC。18B时平均得分从mHC的44.8提升至xHC的48.8,28B时从50.5提升至53.6,仅增加3.0%的训练FLOPs开销。在MMLU上,xHC在18B时达到57.2,28B时达到60.5,分别超过mHC 2.5和3.7分。在18B时,xHC将BBH得分提升至39.5,比mHC高5.8分,比原始基线高7.1分。

在多头循环中加入时序特征增强可改善大扩展率下的验证损失,证实了信息瓶颈的存在。稀疏残差流架构随后在保持这一增益的同时大幅减少额外训练FLOPs,使大N状态变得可行。密集读取和固定流对于稳定的稀疏更新至关重要,活跃流预算k=4提供了最佳的性能-代价权衡。时序特征增强将mHC在N=16时的验证损失从1.998降至1.984,表明丰富的写回信号有助于克服信息瓶颈。稀疏架构将额外FLOPs从20.1%降至3.3%,同时损失几乎不变(1.983),使大N扩展实用化。移除密集读取和固定流会使损失崩溃至1.997,暴露了流不可持续访问时信息断开的风险。仅移除固定流(保留密集读取)会使损失从1.983升至1.986,表明有保证的写入目标能稳定稀疏更新。活跃流预算k=4达到最佳平衡:k=2损失更差(1.991),而k=8仅带来微小改善(1.982)但代价更高。

在18B MoE模型上,xHC与Muon优化器结合(无Gram-Schmidt正交化)在语言理解和推理任务上始终优于AdamW和Muon基线。Muon基线本身比AdamW有所改善,加入xHC后进一步大幅提升,尤其在CommonsenseQA和BBH上,证明了xHC与Muon的兼容性及其在AdamW优化器之外的有效性。Muon + xHC将CommonsenseQA从49.1提升至61.3,是评估基准中最大的相对提升。在所有五个基准上,xHC在Muon基线上带来一致增益,MMLU从51.3升至56.6,BBH从36.1升至42.2。

xHC相比mHC增加了每子层内存流量,主要由于在每个子层对其更大的残差表示进行两次全状态读取。xHC-Flash变体将这些操作摊销到连续子层上,将流量降至与mHC相当的水平,同时保留xHC的大部分性能增益。在N=16、k=4时,xHC每子层内存流量约为mHC标准N=4设置的2.2倍。xHC-Flash通过在块内共享路由和预映射,将每子层流量从73.5C降至51C;其四子层扩展进一步将流量降至40C,接近mHC的34C。

xHC-Flash将完整xHC方法的内存流量降低约30%,同时保持验证损失不变。其四子层扩展进一步将流量降至接近mHC的水平,但仍保持对mHC的明显损失优势。xHC-Flash匹配完整xHC的验证损失1.983,同时将摊销每子层I/O从73.5C降至51C。xHC-Flash-4sub实现40C I/O,接近mHC的34C,其损失1.984仍远优于mHC的2.004。

实验在语言理解和推理基准上评估xHC与原始残差和mHC基线,证明在18B和28B规模下性能持续提升,仅增加3%的训练FLOPs开销。消融实验确认时序特征增强缓解了多头循环中的信息瓶颈,带有密集读取和固定流的稀疏残差流设计大幅减少额外FLOPs同时保持损失,活跃流预算k=4提供最佳权衡。xHC还被证明与Muon优化器兼容,在18B MoE模型上带来进一步改进。最后,xHC-Flash变体将内存流量摊销至接近mHC的水平,同时保留性能优势,使该方法适用于大规模部署。


用 AI 构建 AI

从创意到上线——通过免费 AI 协同编码、开箱即用的环境和最优惠的 GPU 价格,加速您的 AI 开发。

AI 协同编码
开箱即用的 GPU
最优定价

HyperAI Newsletters

订阅我们的最新资讯
我们会在北京时间 每周一的上午九点 向您的邮箱投递本周内的最新更新
邮件发送服务由 MailChimp 提供