Command Palette
Search for a command to run...
xHC:扩展超连接
xHC:扩展超连接
摘要
超连接(HC)将Transformer的残差流扩展为N条并行流,提供了一种超越模型宽度和深度的记忆扩展形式。流形约束HC(mHC)在大规模下稳定了这一公式。从N=1到N=4的巨大收益表明,残差流扩展是一个有前景的扩展轴。然而,现有的HC系列方法通常止步于N=4。我们的实验揭示了原因:将mHC扩展至超过此点会导致性能增益递减和训练成本急剧上升。我们将这一限制归因于两个瓶颈:不断增加的流数量导致写回信息不足,以及残差混合生成成本随N呈立方增长。为解决这两个瓶颈,我们提出了xHC(扩展超连接),这是首个实现N=4以上有意义扩展的HC系列方法。xHC结合了时间特征增强以实现更丰富的写回,以及稀疏残差流架构,该架构仅更新N=16条流中的k=4条,同时保持对完整残差状态的密集访问。在18B和28B MoE模型上,xHC带来了强劲且一致的下游改进。在18B MoE模型上,xHC的平均下游得分比mHC提高了4.0分,同时相比普通基线仅增加了适度的训练FLOPs。扩展律实验表明,普通基线和mHC基线分别需要xHC的1.50倍和1.19倍计算量才能达到相同的损失。实际的大N训练还需要控制扩展残差状态带来的内存流量。因此,我们引入了xHC-Flash,它将每子层的内存流量从73.5C降低到40C,与mHC在N=4时所需的34C相当,同时保留了完整xHC的大部分收益。xHC和xHC-Flash共同使大N残差流扩展在LLM预训练中变得有效且实用。
一句话总结
上海交通大学、小红书公司及其合作者提出xHC,首个将HC族方法扩展到N=4以上的方法,它结合了时序特征增强与稀疏残差流架构,仅更新N=16个流中的k=4个,以克服写回和立方混合瓶颈,在18B MoE模型上实现4.0个点的下游任务提升,并相比原始基线节省1.50×计算量,同时提出内存高效的xHC-Flash变体,将每子层内存流量从73.5C降至40C,用于实际LLM预训练。
核心贡献
- 识别出限制超连接扩展到N=4以上的两个瓶颈:写回信息不足和立方代价的残差混合。提出扩展超连接(xHC),结合时序特征增强与稀疏残差流架构,仅更新N=16个流中的k=4个,同时保持密集读取访问。
- 在18B和28B MoE模型上的大规模实验表明,xHC相比mHC平均下游得分提升4.0分。缩放律分析表明,原始基线和mHC基线需要xHC的1.50倍和1.19倍计算量才能达到相同的损失。
- xHC-Flash和融合内核将每子层内存流量从73.5C降至40C,与N=4时的mHC(34C)相当,同时保留了xHC的大部分增益。融合实现进一步减少了内核启动开销。
引言
大语言模型架构通过注意力机制、混合专家和缩放取得了进步,但跨层传递token表示的残差流仍是一条单一恒等通路。超连接(HC)及其稳定变体流形约束HC(mHC)引入了多个并行残差流,并具有可学习的混合,表明从1个流扩展到4个流能带来显著增益,并暗示了一个新的缩放维度。然而,先前的HC族方法在4个流时停滞,因为简单增加更多流会带来快速递减的回报:信息瓶颈,即单一的写回信号无法提供足够的多样性来填充多个流;以及计算瓶颈,残差混合代价随流数量立方增长。作者提出扩展超连接(xHC),首个使残差流扩展至4个流以上既有效又可行的方法。xHC通过时序特征增强(利用相邻token的多尺度因果特征丰富写回信号)和稀疏残差流架构(仅激活部分流进行混合和写回,同时保持读取路径密集)来解决瓶颈。这种组合将扩展率转化为实用的缩放维度,以最小的额外FLOPs提供更好的损失和下游性能。
方法
作者首先回顾超连接(HC),它通过维持N个并行残差流来增加跨层信息流的容量,从而泛化标准残差连接。令Xl∈RN×C表示第l层的多流状态,其中C是隐藏维度。HC每层引入三个可学习映射:预映射Hlpre、后映射Hlpost和残差映射Hlres。单层更新定义为:
Xl+1=HlresXl+HlpostF(HlpreXl,Wl)
为确保大规模训练稳定,流形约束HC(mHC)通过Sinkhorn-Knopp算法将Hlres投影到双随机矩阵的Birkhoff多胞体上。该约束保持了跨深度的恒等映射性质。
然而,作者观察到在mHC中将扩展率N扩大到4以上会迅速饱和。如下图所示,将N从4增加到16仅使损失降低0.006,而训练FLOPs增加32%。
作者识别出导致这种饱和的两个瓶颈。第一个是信息供给瓶颈。在mHC中,每层仅向所有流注入单一的写回分量。随着N增长,额外的流变得冗余,因为它们无法从多样化的分量中汲取信息以形成非冗余的历史。第二个是代价瓶颈。生成N×N残差映射需要从NC维状态预测N2个系数,导致输入依赖投影代价为O(N3C)。
为使大N扩展既有效又可行,作者提出xHC(扩展超连接)。架构概览请参见框架图。
xHC采用两项协同设计:时序特征增强以丰富写回信号,以及稀疏残差流架构以降低混合代价。
时序特征增强
为解决信息瓶颈,xHC通过借用相邻token的低成本局部上下文信息来丰富写回基。作者对层输出应用r个因果深度可分离1D卷积,核大小为{κ1,…,κr}。这些组件捕获不同上下文范围的相邻token信息,并与原始输出拼接:
outaug=[out;DWConvκ1(out);…;DWConvκr(out)]∈RS×Kr×C
其中Kr=r+1。由于深度可分离卷积按通道操作,其输出能与原始层输出保持强对齐。为防止冗余,作者对Kr个分量应用改进的Gram-Schmidt正交化。对于j=1,…,r,正交化分量计算为:
vj+1=gj−∑i=1j⟨vi,vi⟩⟨gj,vi⟩vi
其中gj=DWConvκj(out),v1=out。这些正交化分量用于所有后续写回操作,确保为扩展流提供多样化的信息供给。
稀疏残差流架构
为解决代价瓶颈,xHC采用非对称设计,仅k个活跃流(例如k=4)进行残差混合和写回,而所有N个流(例如N=16)保持密集读取访问。前向过程包括三个步骤:
- 流路由:路由器在每个子层选择k个流进行更新。它采用固定加路由方案,其中m个流始终活跃且路由权重为1,其余k−m个流通过基于全N流状态导出的sigmoid分数的TopK路由选择。
- 密集读取:每层访问全N流状态以形成输入: inputl=∑i=1Nhl,ipre⋅xl,i 这保留了跨层信息流,即使仅更新k个流。
- 稀疏残差更新:残差映射Hlres和后映射Hlpost仅从活跃状态Xactive生成。这将主要生成代价从O(N3C)降至O(k3C)。活跃流更新为: Xactivenew=HlresXactive+ΔXactive 其中ΔXactive使用后映射组合增强的写回分量。更新后的流被散射回全状态,而非活跃流保持不变地向前传递。
参数化与实际部署
映射遵循共享的门控投影模式。可学习的门控标量α(初始化为0.01)相对于可学习偏置缩放输入依赖项。残差映射对活跃流使用Sinkhorn归一化。后映射使用2σ(⋅)缩放,以允许对各个写回分量进行衰减和适度放大。
为进一步减少训练期间的内存流量,作者引入xHC-Flash。这种轻量变体将全状态操作摊销到连续子层上。它共享路由决策,并从块入口状态联合形成子层特定的预映射。通过从注意力子层中移除残差混合并将其推迟到MLP侧,xHC-Flash实现了精确的密集读取复用。这显著降低了I/O成本,使其与N=4时的mHC相当,同时保留了大N扩展的性能优势。
实验
论文在从2.5B到28B参数的混合专家语言模型预训练中评估xHC,与多流HC(mHC)和原始残差基线进行比较。xHC在下游基准上始终优于两者,并在缩放律实验中描绘出更低的损失曲线,在相同损失下相比mHC具有1.19倍的计算优势。将扩展率N从2增加到16,xHC的损失改善且FLOPs开销极小,而mHC饱和,证明稀疏更新和时序特征增强有效解决了大N扩展的信息和代价瓶颈。消融实验确认两个组件都是必要的,且xHC在Muon优化器下仍然有效,尽管其更高的内存流量促使进一步效率优化。
xHC在18B和28B规模的语言理解和推理基准上始终优于原始残差基线和mHC。18B时平均得分从mHC的44.8提升至xHC的48.8,28B时从50.5提升至53.6,仅增加3.0%的训练FLOPs开销。在MMLU上,xHC在18B时达到57.2,28B时达到60.5,分别超过mHC 2.5和3.7分。在18B时,xHC将BBH得分提升至39.5,比mHC高5.8分,比原始基线高7.1分。
在多头循环中加入时序特征增强可改善大扩展率下的验证损失,证实了信息瓶颈的存在。稀疏残差流架构随后在保持这一增益的同时大幅减少额外训练FLOPs,使大N状态变得可行。密集读取和固定流对于稳定的稀疏更新至关重要,活跃流预算k=4提供了最佳的性能-代价权衡。时序特征增强将mHC在N=16时的验证损失从1.998降至1.984,表明丰富的写回信号有助于克服信息瓶颈。稀疏架构将额外FLOPs从20.1%降至3.3%,同时损失几乎不变(1.983),使大N扩展实用化。移除密集读取和固定流会使损失崩溃至1.997,暴露了流不可持续访问时信息断开的风险。仅移除固定流(保留密集读取)会使损失从1.983升至1.986,表明有保证的写入目标能稳定稀疏更新。活跃流预算k=4达到最佳平衡:k=2损失更差(1.991),而k=8仅带来微小改善(1.982)但代价更高。
在18B MoE模型上,xHC与Muon优化器结合(无Gram-Schmidt正交化)在语言理解和推理任务上始终优于AdamW和Muon基线。Muon基线本身比AdamW有所改善,加入xHC后进一步大幅提升,尤其在CommonsenseQA和BBH上,证明了xHC与Muon的兼容性及其在AdamW优化器之外的有效性。Muon + xHC将CommonsenseQA从49.1提升至61.3,是评估基准中最大的相对提升。在所有五个基准上,xHC在Muon基线上带来一致增益,MMLU从51.3升至56.6,BBH从36.1升至42.2。
xHC相比mHC增加了每子层内存流量,主要由于在每个子层对其更大的残差表示进行两次全状态读取。xHC-Flash变体将这些操作摊销到连续子层上,将流量降至与mHC相当的水平,同时保留xHC的大部分性能增益。在N=16、k=4时,xHC每子层内存流量约为mHC标准N=4设置的2.2倍。xHC-Flash通过在块内共享路由和预映射,将每子层流量从73.5C降至51C;其四子层扩展进一步将流量降至40C,接近mHC的34C。
xHC-Flash将完整xHC方法的内存流量降低约30%,同时保持验证损失不变。其四子层扩展进一步将流量降至接近mHC的水平,但仍保持对mHC的明显损失优势。xHC-Flash匹配完整xHC的验证损失1.983,同时将摊销每子层I/O从73.5C降至51C。xHC-Flash-4sub实现40C I/O,接近mHC的34C,其损失1.984仍远优于mHC的2.004。
实验在语言理解和推理基准上评估xHC与原始残差和mHC基线,证明在18B和28B规模下性能持续提升,仅增加3%的训练FLOPs开销。消融实验确认时序特征增强缓解了多头循环中的信息瓶颈,带有密集读取和固定流的稀疏残差流设计大幅减少额外FLOPs同时保持损失,活跃流预算k=4提供最佳权衡。xHC还被证明与Muon优化器兼容,在18B MoE模型上带来进一步改进。最后,xHC-Flash变体将内存流量摊销至接近mHC的水平,同时保留性能优势,使该方法适用于大规模部署。