HyperAIHyperAI

Command Palette

Search for a command to run...

循环Loopie!

Zitian Gao Yilong Chen Yihao Xiao Xinyu Yang Ran Tao Joey Zhou Bryan Dai

摘要

我们推出Loopie系列,包含两个混合专家(MoE)模型:一个拥有200亿参数、其中20亿为活跃参数的模型,以及一个拥有60亿参数、其中6亿为活跃参数的模型。循环Transformer长期面临一个挑战:在预训练计算量增加N倍的情况下,将参数数量增加N倍通常优于将模型循环N次。Loopie解决了这一挑战。广泛的消融研究,包括与普通300亿-A30亿模型的对比,表明Loopie在相同计算预算下显著优于普通Transformer基线模型。通过一种新颖的后训练方法,Loopie发展出强大的推理能力,并达到了前沿水平的推理性能。

一句话总结

IQuest Research 推出了 Loopie 系列混合专家模型,包含一个拥有 2B 激活参数、总参数量 20B 的模型,以及一个拥有 0.6B 激活参数、总参数量 6B 的模型。这些模型克服了历史上扩展参数数量优于循环使用的挑战,在相同计算预算下显著优于普通 Transformer 基线,并借助一种新颖的后训练方法,达到了前沿水平的推理性能。

核心贡献

  • Loopie 是一系列循环式混合专家语言模型,它将层循环递归与硬件感知的规模扩展方法相结合,使得在匹配的预训练计算预算下,递归深度具有竞争力。
  • 大量的消融研究证明,在跨模型规模下,Loopie 模型在计算量匹配的条件下显著优于普通 Transformer 基线。
  • 一个包含监督式预训练和强化学习的后训练流水线,为 Loopie 赋予了强大的数学推理和编程能力,实现了前沿水平的推理性能。

引言

循环式 Transformer 在多个循环步骤中重复使用相同的层,使得模型在用远少于普通深度扩展模型的参数下,就能在推理任务上取得强大性能。然而,先前的工作在比较循环模型和非循环模型时,是基于相同的参数数量,而非在匹配的预训练计算预算下进行,忽略了循环会成倍增加训练 FLOPs 的事实。此外,大多数研究集中在稠密架构上,而非主导前沿模型的混合专家(MoE)设计。作者通过引入 Loopie(一系列循环式 MoE 语言模型)以及一种计算量匹配的规模扩展方法来填补这些空白,该方法联合优化了宽度、深度和循环次数,使其在固定的训练计算预算下保持竞争力。一种新颖的后训练流水线进一步为这些模型赋予了强大的推理能力。

数据集

在第二阶段退火中,作者从多个 Nemotron 预训练数据集中构建了一个高质量混合数据集,总计约 1.26 万亿 token。该混合数据集按以下比例组合了 SFT 风格数据、合成推理数据、代码数据、合成网页数据以及数学数据:

  • Nemotron-pre-training-SFT-v1(351B token,27.8%):一个多样化的 SFT 风格数据集,包含合成和精选示例,涵盖 STEM、学术、代码、数学和推理领域,并具备多语言覆盖。STEM 数据通过使用 Qwen3 和 DeepSeek 模型从高质量数学和科学种子数据迭代生成,产生更困难且更多样化的问题及解答。它还包含从本科/研究生教材中合成的学术问答对,以及 MMLU 风格的通用问答和推理数据。
  • Nemotron-pre-training-Specialized-v1(277B token,21.9%):用于 STEM 推理、科学编程、跨领域编程、合成维基百科和合成数学教科书的合成数据。科学编程和跨领域子集引入了研究生或研究级别的编程任务,并附有结构化解决方案,旨在增强科学推理、数学抽象和代码生成能力。
  • Nemotron-pre-training-Code-v2(262B token,20.7%):从完整的 Code-v2 数据集中随机抽取 60% 的样本。包含近期的 GitHub 源代码、合成代码知识问答、学生-教师对话、代码审查对话,以及经 LLM 改写或转译的源代码,以增加风格多样性,并使模型接触到语义等价的代码变体。
  • 高质量合成网页数据(197B token + 25B token,15.6% + 2.0%):从 Nemotron-CC-v2-High-Quality-Synthetic(197B token)中抽取 16% 的样本,该部分源自英文网页抓取文档,并由 Qwen3-30B-A3B 进行了改写;外加来自 Nemotron-CC-v2.1-High-Quality-Synthetic 的 25B token,该部分通过更新近的 Common Crawl 快照和改写的中高质量文档扩展了合成语料库。
  • 高质量网页数据(25B token,2.0%):来自 Nemotron-CC-v2.1-High-Quality,融合了最近的 Common Crawl 快照和高质量翻译数据,并通过基于 LLM 的过滤移除了无信息的翻译文档。在退火过程中保留了自然网页文本的接触。
  • 数学数据(126B token,10.0%):来自 Nemotron-CC-Math-v1,仅保留质量评分 ≥ 4 的文档。该数据通过一个保留方程、将符号转换为标准 LaTeX 格式并去除噪声的流水线从 Common Crawl 构建,增强了数学推理和符号问题求解能力。

数据使用方式: 该混合数据集是第二阶段退火阶段的唯一训练语料库。所有子集按所列 token 比例混合,未明确提及单独的验证集划分。预处理包括随机采样(针对代码和合成网页子集)、质量评分过滤(针对数学)以及合成增强(改写、重写和 LaTeX 标准化),这些均在退火运行前完成。

方法

作者采用了一个仅解码器的混合专家(MoE)Transformer 主干网络,基本遵循 Qwen3-MoE 架构。关键的架构创新在于循环计算的应用方式。与先前循环语言模型中使用的传统模型循环模式(即整个 Transformer 堆栈被递归展开)不同,Loopie 采用了层循环模式。

如下图所示:

在层循环模式中,每个层在计算移至下一层之前被递归应用。对于一个包含 NNN 层和 RRR 个循环步骤的模型,计算顺序为:先对第 1 层应用 RRR 次,然后对第 2 层应用 RRR 次,依此类推。这与模型循环形成对比,模型循环会遍历所有层然后再重复整个堆栈。作者证明,对于大规模预训练,层循环具有三个明显优势。首先,它实现了更好的经验缩放规律。虽然层循环在下游基准测试中最初可能落后于模型循环,但随着训练预算的增加,它会超越后者。

参考性能对比图:

其次,层循环提供了对基础设施友好的执行方式。同一层的重复应用在计算图中是相邻的,这缩短了参数的重用距离,并简化了激活检查点和流水线并行。第三,它创造了一种自然的参数共享模式。层循环在相邻的有效深度上复用同一层,与模型循环相比,形成了更一致的参数共享模式,后者要求单个参数集适应间隔较远的有效深度上的隐藏状态。

为了证明循环作为一种扩展策略的合理性,模型必须与在相同预训练计算预算下训练的普通 Transformer 进行竞争。作者制定了 Loopie 配方来解决这一问题。从一个强大的非循环 MoE 参考模型开始,该配方包含三个步骤:通过将存储的层数减半来构建一个循环种子模型,使用层循环(R=2R=2R=2)将每个存储的层执行两次,并利用由此节省的内存空间将每个设备的微批次大小增加一倍。然后将测量到的训练效率增益重新投入到额外的模型容量中,同时保持优化器步长时间与参考模型匹配。

作者选择 R=2R=2R=2,因为在固定计算预算下,额外循环的边际收益会迅速衰减。增加循环步数会乘以每个 token 的训练成本。为了隔离循环带来的好处,他们比较了使用 N×N\timesN× 层循环步数的模型与拥有 N×N\timesN× 倍存储层数的模型。

如扩展对比图所示:

结果表明,循环的边际收益在 R=2R=2R=2 时最大。这种设置允许每个层执行一次普通变换,然后进行一次局部细化步骤,使得计算倍乘因子足够小,从而能够进行可扩展的预训练,同时保持训练吞吐量。

预训练过程包含两个阶段。第一阶段,模型从零开始,在高质量数据上进行多轮次的大规模预训练。第二阶段,作者使用合成数据、STEM、代码、数学推理和网页数据的混合数据集进行高质量数据退火。

该退火数据池的构成如下图所示:

该混合数据集结合了高质量 SFT 风格数据、合成推理数据、代码数据和数学数据,以在退火阶段增强科学推理、数学抽象和代码生成能力。

后训练配方将基础模型转变为最终的 Loopie Thinking 模型,主要分为两个阶段。首先,作者引入了监督式预训练(SPT),这是一种将监督微调(SFT)的监督模式与语言模型预训练的优化规模相结合的训练方式。SPT 使用与 SFT 相同的 token 级目标,即仅监督目标 token 参与损失计算,但将其应用于具有大全局批次大小和 token 预算的预训练规模。这种方法减轻了灾难性遗忘,并提升了通用知识和推理指标的性能。

SPT 期间预训练指标的变化趋势如下图所示:

在 SPT 之后,作者应用了一个使用群序列策略优化(GSPO)的强化学习阶段。该阶段增强了推理能力,并使模型能够产生可靠的思维轨迹。训练按顺序在数学任务和编程任务上进行,利用序列级裁剪目标和提示级动态过滤,将优化重点放在能产生非退化策略梯度的提示上。

实验

Loopie 循环式 MoE 模型在与计算量匹配的普通基线模型对比时,最初表现落后,但随后反超并保持这一优势,覆盖了从 0.15B 到 1B 参数的扩展梯度。消融实验证实,特定的层循环递归调度至关重要,且两个循环步骤在迭代细化和计算效率之间提供了最佳权衡。后训练评估进一步表明,Loopie 实现了显著更高的 token 效率,一个在 3.5T token 上训练的 20B 模型,其性能与在 25T token 上训练的模型相当甚至更优,同时还提供了强大的推理性能。

从一个类似 Qwen3 的 30B-A3B 参考模型开始,将层数减半并应用 R=2 的层循环,在保持计算代理指标的同时,将激活内存减半。节省的内存空间允许将每个设备的微批次大小加倍,由此获得的吞吐量增益被重新投入到更宽和更深的模型中,从而实现了高达 1.65 倍的计算代理指标提升,而激活内存仅为参考模型的 69%,同时保持优化器步长时间与参考模型匹配。一个层数减半且 R=2 循环的种子模型,其计算代理指标与参考模型相同,但仅使用了参考模型 50% 的激活内存。在候选配置中,计算代理指标从 1.00 倍增加到 1.65 倍,而激活内存一直远低于参考模型,最高为 0.69 倍,这表明从循环中节省的内存可以有效地转换为额外的模型容量。

监督式预训练(SPT)仅将损失应用于监督目标 token,类似监督微调(SFT),但使用了语言模型预训练(PT)中典型的大批次大小、长序列和 token 预算。这种模式同时提升了预训练指标和推理指标,避免了多轮次 SFT 中观察到的过拟合现象,并将承担损失的 token 的选择与优化规模解耦。SPT 同时改善了预训练和推理指标,而 SFT 会使预训练指标下降,PT 则基本不改变推理能力。SPT 使用至少 1,024 的全局批次大小和至少 128K token 的序列长度,与预训练的优化规模相匹配,防止了多轮次训练中的过拟合。

Loopie-20B-A2B 在知识和通用基准测试上,与同等规模的 MoE 推理模型持平或超越,而使用的预训练 token 不到它们的七分之一。它还在后训练推理中取得了强劲表现,在 AIME 2024 和 AMC 上排名第二,并在 AIME 2025 上与一个更大规模的模型并列。该模型在相同预训练数据下展现出显著更高的 token 效率。Loopie-20B-A2B 仅使用 3.5T token 进行预训练,相比之下,Nemotron 3 Nano 和 Nemotron Cascade 2 使用了 25T,Qwen3-30B-A3B 使用了 36T。在 MMLU 上,Loopie 的得分高于两个 Nemotron 模型,并与 GPT-OSS-20B-A2B 竞争,尽管存在 token 预算差距。在 BBH 和 IFEval 上,Loopie 大幅超越 Nemotron 模型,在 BBH 上领先两位数,在 IFEval 上领先超过 5 分。在七个知识和通用能力基准测试中,它在每项任务上至少超越两个 Nemotron 模型中的一个,并在其中五项任务上超越两者。在后训练推理方面,Loopie 在 AIME 2024 和 AMC 上位列所列模型的第二名,并在 AIME 2025 上与 Qwen3-30B-A3B 并列。

层数减半且 R=2 循环的层循环设计,在保持计算对等的同时将激活内存减半,使得计算代理指标最高可达参考模型的 1.65 倍,而激活内存仅为后者的 69%。监督式预训练(SPT)仅对监督目标应用损失,使用大批次和长序列,同时提升预训练指标和推理指标,避免多轮次过拟合。Loopie-20B-A2B 结合了这些进步,在知识和推理基准测试上,以不到同等规模 MoE 模型七分之一的预训练 token,超越了它们,展现了显著的 token 效率。


用 AI 构建 AI

从创意到上线——通过免费 AI 协同编码、开箱即用的环境和最优惠的 GPU 价格,加速您的 AI 开发。

AI 协同编码
开箱即用的 GPU
最优定价

HyperAI Newsletters

订阅我们的最新资讯
我们会在北京时间 每周一的上午九点 向您的邮箱投递本周内的最新更新
邮件发送服务由 MailChimp 提供