HyperAIHyperAI

Command Palette

Search for a command to run...

SLAI T-Rex:基于昇腾 SuperPOD 的 DeepSeek-V4 系列全参数后训练

摘要

万亿参数级混合专家(MoE)模型的全参数后训练给大规模分布式训练带来了严峻的系统级挑战,包括严重的内存压力、无法重叠的通信开销以及低效的算子执行。当前大多数大语言模型训练系统围绕 GPU 集群构建,本报告则介绍了在昇腾 NPU SuperPOD 上进行的端到端优化实践。以 DeepSeek-V4 模型系列为目标负载,我们设计了一个层次化优化框架,涵盖模型级并行、计算–通信编排以及底层算子执行。最终系统实现了 34.22% 的模型浮点运算利用率(MFU),相比开源基线方案提升 2.93 倍,同时保持了训练稳定性。在此优化基础设施之上,我们进一步为复杂的运筹学(OR)任务建立了继续预训练(CPT)和监督微调(SFT)工作流。我们将这一集成框架称为 SLAI T-Rex,它将全栈昇腾 SuperPOD 优化与基于求解器的 CPT-SFT 专业化相结合。选择运筹学建模作为目标领域,是因为它同时要求数学形式化、结构化推理和代码生成。以 DeepSeek-V4-Flash 为专业化平台,我们构建了面向 OR 的 CPT 和 SFT 数据流水线,融合了收集的领域资源与经求解器验证的合成优化文档。最终数据集包含 10K 高质量 SFT 样本,覆盖四类任务和三种问题表示。专业化模型在评估模型中取得了最高的平均零样本 Pass@1 得分,达到 71.81%,分别比 GPT-5.4-Mini 和基础 DeepSeek-V4-Flash 模型高出 3.98 和 11.27 个百分点。进一步评估表明,CPT 建立了可迁移的 OR 领域建模先验,在 SFT 后同时提升了面向求解器的可行性和结构等价性。总体而言,本工作展示了一条从昇腾基础设施上高效万亿参数模型后训练到面向求解器数学建模的领域专用 Flash 模型的全栈路径,推动了面向复杂推理的前沿模型系统发展。

一句话总结

由深圳环路研究院模型代码团队AI训练平台组开发的SLAI T-Rex,是一个面向Ascend SuperPOD优化的框架,对万亿参数DeepSeek-V4系列MoE模型进行后训练,达到34.22%34.22\%34.22%的MFU(提升2.93×2.93\times2.93×),并结合求解器锚定的CPT-SFT方法,在运筹学领域实现专业化,在零样本设定下达到71.81%71.81\%71.81%的Pass@1,比GPT-5.4-Mini高出3.983.983.98个百分点,比基础DeepSeek-V4-Flash模型高出11.2711.2711.27个百分点。

核心贡献

  • 提出了一种面向Ascend NPU SuperPOD上万亿级MoE模型全参数后训练的分层优化框架,实现了34.22%的模型FLOPs利用率,相比开源基线提升2.93倍,同时保持训练稳定性。
  • SLAI T-Rex将上述Ascend SuperPOD优化与求解器锚定的持续预训练和监督微调管线相结合,用于运筹学领域,构建了包含10K样本的高质量SFT数据集,覆盖四类任务和三种问题表示。
  • 专业化后的DeepSeek-V4-Flash模型达到了71.81%的平均零样本Pass@1分数,分别比GPT-5.4-Mini和基础模型高出3.98个百分点和11.27个百分点,并且持续预训练建立了可迁移的OR领域先验,改善了微调后求解器可执行性和结构等价性。

引言

作者针对大语言模型(LLM)面向agentic任务的后训练展开研究,该过程通常依赖基于CUDA或TPU的基础设施,并集中在数学和编程等领域。此前的工作大多忽略了在单指令多数据(SIMD)硬件(例如Ascend NPU)上训练万亿参数级的混合专家(MoE)模型,且几乎不涉及面向运筹学(OR)这一对调度、供应链和资源分配至关重要的领域的特定适配。现有的OR方法存在建模映射脆弱、基准规模小以及缺乏集成验证反馈的端到端训练等问题。为弥补上述不足,作者提出了SLAI T-Rex,这是一个全栈框架,将Ascend SuperPOD上的系统级优化与求解器锚定的持续预训练和监督微调管线相结合。这项工作证明了在Ascend NPU上大规模训练MoE模型的可行性,并通过针对性的领域适配,在结构化OR推理方面实现了显著的精度提升。

数据集

作者构建了两条主要数据流,用于后训练一个具备OR能力的模型:一个持续预训练(CPT)语料库,以及一个通过自蒸馏和AI辅助质量门控精炼的监督微调(SFT)数据集。

CPT语料库:OR-CPT数据构建与领域主导混合

  • 合成OR数据来自OR-CPT数据引擎,这是一个求解器验证的双向合成工作流。参数化生成器涵盖11个以上的族(分配、调度、设施选址、网络流、生产计划、批量计划、路径规划、覆盖、运输、投资组合优化、收入管理)。每个实例均使用Gurobi求解,记录求解器状态、目标值、变量分配以及约束诊断信息。实例级过滤器会移除不可行、退化为全零、重复参数/配置以及优化权衡较弱的样本。保留下来的实例被渲染成面向业务场景的自然语言问题(包含场景目录,但不泄露答案),随后提交给一个模型,用于重建变量、约束、目标函数及Gurobi代码。重建结果需与求解器参考结果进行核对:只有当Gurobi程序达到有效状态且目标值与参考解相匹配时,该样本才会被采纳。
  • 收集的OR资源包括OptMATH、ReSocratic、OptiBench、Text2Opt-Bench、OR-Instruct、NLP4LP、ORQA衍生数据、MAMO、OR研究论文、Gurobi建模实例以及教科书式材料。所有这些资源均被转换为统一的CPT格式,经过清洗和去重处理。
  • 规模:约100K样本作为OR数据池。
  • CPT混合策略:采用领域主导的混合方式,其中OR文档构成主要的适配信号来源。
    • 数学部分:精选的AutoMathText-V2子集(符号建模、推导、多步推理)。
    • 代码部分:NVIDIA Nemotron预训练数据(来自Nemotron Nano系列的科学代码、来自Nemotron 3 Super的代码概念数据)。
    • 通用英语:Ultra-FineWeb-L3,源自Ultra-FineWeb。
    • 精确的采样比例视为配方级别的超参数。

SFT数据集:自蒸馏OR建模数据飞轮

  • 输入是一组种子样本——原始问题、参考答案、代码、数据文件或来自高质量建模问答任务的LP文件——仅用作结构参考。
  • 三种中间表示(IR)控制合成过程:
    • L1规范IR:归一化异构种子,记录源路径、目标合约、数据接口、风险标签。
    • L2语义IR:提取数学规划语义(目标、集合、参数、变量、约束、数据接口)。
    • L3合成IR:生成一个新的建模任务抽象,变换领域、实体、目标语义、变量/约束族、参数模式、数值范围和数据形状,同时避免对种子内容的任何精确复制。
  • 泄露控制机制将候选样本与保留的评估集在表层文本和建模结构层面进行比较;语义相似度过滤拒绝近重复样本,IR层面的约束防止复用相同的目标语义、约束模式、参数模式或数值。
  • 合成IR被渲染为三种问题格式:DP(数据嵌入文本中)、DT(结构化Markdown表格)、DPS(外部数据文件,如JSON/CSV)。答案遵循带有`

方法

在Ascend SuperPOD上训练像DeepSeek-V4-Pro这样的万亿参数混合专家(MoE)模型,由于专家路由和稀疏注意力机制,会带来复杂的工作负载。作者首先通过将一个训练步骤的延迟分解为四个主要部分——有效计算、未重叠的通信、流水线气泡以及由同步和负载不均衡引起的NPU空闲时间——来刻画端到端训练瓶颈。

分析结果表明,来自张量并行(TP)和数据并行(DP)分组的局部结果收集,以及传统流水线并行带来的发送和接收延迟,构成了主要的延迟瓶颈。此外,诸如稀疏注意力在内的架构特定内核占据了主要的计算时间,因为它们是内存受限和控制受限的,而非计算受限的。

为解决这些低效问题,作者提出了一种分层三阶段优化策略,以提升端到端训练性能。

该框架包括通过优化的训练并行策略实现的最优计算-通信编排、使用AuraKernel对排名靠前的瓶颈内核进行agent驱动的优化,以及全栈算子融合以消除碎片化的内核开销。

关于并行执行策略,作者为MoE层启用了专家-张量并行(ETP),以减少张量并行(TP)引入的暴露通信开销。该方法解耦了注意力模块和MoE模块之间的并行选择。注意力层采用较低的TP度,以提升大规模稠密矩阵上的GEMM效率,而MoE层则使用ETP以保持完整的专家宽度。

如图所示,ETP token分发器结构化了MoE层,使得分发和合并操作包裹专家分组GEMM,并伴随EP全交换(all-to-all)和ETP全收集(all-gather)或规约散射(reduce-scatter)。通过MoE并行折叠,ETP作为一个单一组折叠进EP,有效地消除了独立的ETP集合通信。此外,作者采用虚拟流水线并行(VPP)来缓解流水线气泡,同时将单设备内存占用保持在硬件预算内。

在通信调度方面,MoE模块使用异步全交换集合通信实现token分发和合并,将同步推迟到通信结果被消费时。

作者进一步通过隐藏分发操作前的同步停滞来优化这一点。由于共享专家仅依赖于MoE层输入,而与路由得出的分割大小无关,其前向计算可提前执行,与同步间隙重叠。该调度策略用有效计算填充了原本空闲的时间段,有效将屏障引起的延迟转化为生产性执行。

为应对内存受限和控制受限的瓶颈内核,作者提出了AuraKernel,一个端到端的AscendC内核优化agent。

AuraKernel分三个阶段运行。首先,它使用运筹学将算子调优建模为一个带约束的性能建模问题,生成针对目标计算形状优化的切分策略。其次,它进入一个基于硬件的迭代优化循环,其中由一个测试框架编译和分析候选方案,K-Search根据分析反馈探索一个可分叉的优化方向树。最后,成功的指标-策略-代码模式被提炼为可复用的技能,使agent能够系统性地重构大型内核,并避免纯粹启发式优化的次优效率。

实验

实验评估首先分析了原始模型在求解器可执行性与结构等价性之间的不匹配,揭示出采样和提示(prompting)可减少表层错误,但结构建模失败仍然存在。算子级内核优化与融合减少了全局内存流量和启动开销,而后训练实验表明,带有数据清洗和思维链增强的SFT恢复了自然语言优化能力,基于持续预训练(CPT)初始化则在结构等价性和可执行性上带来了持续改进。完整的CPT+SFT管线展现了互补性:SFT提供协议和格式对齐,而CPT提供领域结构先验,二者结合提升了所有OR基准测试,且在使用平衡数据混合时不会牺牲通用能力。

通信延迟占设备总内核时间的52.2%,其中张量/数据并行和流水线并行占主导。张量/数据并行单独占内核总时间的25.2%,流水线并行占19.2%,而专家并行仅占7.6%。张量/数据并行与流水线并行合计占通信时间的85.1%(占内核总时间的44.4%),使得层内规约和阶段间点对点传输成为主要瓶颈。专家并行仅贡献了通信时间的14.5%(占内核总时间的7.6%),表明在此互连结构上,AllToAllV token分发与合并的额外开销极小。

在Ascend 910C上对DeepSeek-V4-Pro训练的分析揭示了一个由架构固有内核构成的沉重负载,其中仅稀疏注意力梯度计算就独占内核总时间的16.86%,而标准的MatMul和分组MoE专家GEMM则实现了高计算利用率。许多耗时较多的操作,包括逐元素操作和主导地位的稀疏注意力内核,都是受数据移动而非算术吞吐量限制,这激发了对内核调优以及对启动碎片化算子链进行融合的需求。最大的单一内核SparseAttnSharedkvGrad占用设备计算时长的16.86%,但其MAC利用率仅为9.5%,立方单元(cube)利用率仅为15.1%,表明其延迟主要由内存访问而非计算主导。MatMulV3和GroupedMatmul(MoE专家)是计算密集型操作,MAC利用率分别为52.5%和86.8%,立方单元利用率分别为85.4%和95.4%,同时其MTE2加载利用率超过96%。逐元素算子Cast和Add合计消耗超过11%的任务时长,但它们的向量计算利用率低(5.7%和14.0%),而MTE2加载利用率高(89.7%和93.4%),可归类为内存受限、启动碎片化的内核。

mHC融合套件将多算子即时(eager)执行链和通用Triton内核压缩为五个硬件优化的AscendC内核。每个内核保持精确的数学契约(按行规约、加权扩展或BMM后加法),同时在统一缓冲区内保留中间结果,发射完整的输出张量以避免散落写回,并遵循混合精度边界的数值契约。wind_rms_norm_without_weight将一个包含幂、规约、加法和倒数平方根的算子链替换为一个单独的行级规约操作,从局部数据流中产生FP32倒数缩放输出。WindHcPreBmmForward将类型转换和加权扩展收缩融合为一个切分内核,广播FP32权重,接收BF16输入并写出BF16输出。WindMhcPostPart将类型转换、加法和BMM后操作合并,在一个按行和特征维度切分的内核中完成,扩展操作保持在统一缓冲区中,直接输出BF16。两个反向内核均在一个切分遍历中完成所有梯度计算:wind_rms_norm_without_weight_backward计算一次行标量,并沿维度扩展,而WindHcPreBmmBackward执行加权扩展和规约,同时生成输入和权重的梯度。

原始的DeepSeek-V4-Flash检查点在求解器可执行性与结构正确性之间表现出显著差距:B4O-Feasible的Pass@1为60.47%,而B4O-ORGEval仅为34.26%,尽管代码/构建通过率高达79.19%。增加采样(Pass@16)提升了求解器价值基准——B4O-Feasible升至80.52%,NL4OPT升至93.77%——但B4O-ORGEval仅提升至60.66%,仍低于使用5-shot prompting获得的71.57%,这表明prompting激活了潜在建模知识,而仅仅依靠采样难以可靠地选择出来。在Pass@1下,B4O-Feasible得分为60.47%,B4O-ORGEval仅为34.26%,而79.19%的代码/构建通过率表明多数可执行解未能保留正确的优化结构。Pass@16将B4O-Feasible推高至80.52%,NL4OPT至93.77%,但B4O-ORGEval峰值也仅为60.66%,远不及5-shot prompting得到的71.57%,这证明仅靠采样无法可靠地恢复规范化的建模形式。

在所有设置中,结构等价性不匹配构成了最大比例的失败,而协议合规性错误在零样本设定下占主导,但随示例增加显著缩小。Few-shot prompting将错误组合转向比例和非线性建模问题,远离表层的格式问题。结构等价性错误总体上是主要的失败类型(占比28.3%),在Pass@16设置下更为突出(34.3%)。协议、API和模式错误在Pass@1设定下达到峰值(30.1%),但在5-shot设定下降至13.9%。比例和非线性建模错误从Pass@1的11.6%翻倍至5-shot设定下的17.9%。离散变量语义错误在Pass@16下有所下降(8.6%),但在5-shot prompting下回升至15.1%。

在Ascend 910C上对DeepSeek-V4-Pro训练的分析显示,张量/数据并行和流水线并行主导通信时间,而专家并行带来的额外开销极小,且许多计算内核受内存而非算力限制。一套融合内核通过将中间结果保留在片上并保持精确的数学契约,减少了数据移动和启动开销。对DeepSeek-V4-Flash检查点在优化基准上的评估揭示,生成可执行代码与产生结构正确的建模形式之间存在巨大差距,few-shot prompting激活了仅靠采样无法可靠恢复的潜在知识,且错误分析表明,即使在增加采样的情况下,结构等价性不匹配仍然是最主要的失败模式。


用 AI 构建 AI

从创意到上线——通过免费 AI 协同编码、开箱即用的环境和最优惠的 GPU 价格,加速您的 AI 开发。

AI 协同编码
开箱即用的 GPU
最优定价

HyperAI Newsletters

订阅我们的最新资讯
我们会在北京时间 每周一的上午九点 向您的邮箱投递本周内的最新更新
邮件发送服务由 MailChimp 提供