Command Palette
Search for a command to run...
面向大语言模型基于超网络知识注入的缩放定律
面向大语言模型基于超网络知识注入的缩放定律
Nischay Dhankhar Dos Baha Abulhair Saparov
摘要
超网络为大规模知识注入提供了一种有前景的解决方案。尽管超网络通常用于测试时自适应,我们探索了其在训练时知识注入中的应用:给定一个大规模事实语料库,我们训练一个超网络来生成固定的 LoRA 适配器,当该适配器插入目标模型后,使模型能够回答关于这些事实的问题。本文研究超网络能否用于执行训练时知识注入,以及这种能力如何随规模变化。超网络本身的缩放行为在很大程度上尚未被研究。我们的设计将超网络的注入能力与目标模型的通用能力解耦,从而首次能够在知识注入场景下对超网络架构的缩放定律进行严格且受控的研究。我们刻画了损失、推理准确率和分布外(OOD)泛化能力如何作为超网络深度、宽度和目标网络规模的函数而变化。为此,我们构建了一个大规模数据集 MegaWikiQA,包含基于 Wikidata5M 示例构建的、覆盖 39 个知识领域的数千万个多跳问答示例。我们的结果揭示:(i)基于超网络的注入在所有架构维度上均展现出广泛可预测的幂律缩放规律;(ii)随着规模增大,超网络能够对未见过的实体和关系实现可靠的分布外泛化,这表明超网络自适应为 LoRA 微调和全参数微调等其他训练时自适应方法提供了一种有前景的替代方案,并在所有分布外评估中展现出更陡峭的缩放指数。这些结果共同确立了超网络作为训练时知识注入的一种原则性且可扩展的基础,并提供了首个基于实证的缩放定律,以指导面向大语言模型事实推理的超网络设计。
一句话总结
Nace AI 和普渡大学的研究人员建立了基于超网络的训练时知识注入的规模法则,其中超网络生成 LoRA 适配器,使大型语言模型能够进行事实推理,揭示了与超网络深度、宽度和目标模型大小的幂律关系,以及可靠的分布外泛化能力,优于 LoRA 微调,并得到其大规模 MegaWikiQA 数据集的支持。
核心贡献
- 引入 MegaWikiQA,这是一个包含数千万个确定性的多跳问答示例的大规模数据集,涵盖 39 个知识领域,用于受控的规模实验和知识注入中的分布外评估。
- 首次提出了针对训练时知识注入中超网络架构的系统化规模法则,描述了损失、推理准确度和分布外性能与超网络宽度、深度、目标模型大小和注入事实数量的幂律关系。
- 与 LoRA 微调或全微调相比,在匹配容量下,基于超网络的注入产生了更陡峭的规模指数,并且对未见实体和关系的分布外泛化更可靠,从而确立了其作为大型语言模型中事实推理的原理性且可扩展的方法。
引言
在医学、法律和金融等敏感应用中,大型语言模型必须可靠地内部化并泛化特定领域的知识事实;在这些场景中,全微调成本高昂,即便是参数高效的方法(如 LoRA)也会面临灾难性遗忘和分布外泛化能力差的问题。超网络通过根据事实语料生成 LoRA 风格的权重适应提供了一种替代方案,无需修改基础模型参数,但其规模行为此前未知。本文作者首次提出了基于超网络的知识注入的系统化经验规模法则,利用名为 MegaWikiQA 的大规模新数据集,分析了性能如何随超网络宽度、深度、目标模型大小和注入事实数量而变化。他们发现,随着模型规模的增大,超网络适应呈现出平滑可预测的规模规律,并且在分布外泛化方面明显优于标准微调方法。
数据集
作者完全从 Wikidata5M 知识图谱构建了 MegaWikiQA,一个用于研究知识注入的大规模数据集。
- 来源与基础: Wikidata5M 包含约 460 万个实体、822 种关系和超过 2200 万个三元组。其图结构和明确无歧义的三元组支持确定性地生成单跳和多跳问答对。
- 问题生成: 在整个图谱中随机采样 k 跳游走(k = 1–4)。基于语法的流水线使用为每种关系手动整理的模板,将每一条游走转换为自然语言问题和答案。只保留一对一和多对一的关系,以确保答案确定且无歧义。
- 过滤与平衡: 每个示例通过一个两阶段领域分类器分配到 39 个知识领域之一。领域标签不确定的示例将移除。每个跳数的初始样本池约 1000 万,随后按领域和跳数进行平衡,最终获得 125 万条训练样本。
- 训练时的事实注入协议: 每个训练样本包含一个注入事实集、一个查询和一个真实答案。事实集中包含一个相关事实(取自生成查询的 k 跳游走)和 N-1 个从全量事实集合中均匀随机采样的干扰事实。模型必须基于这个事实集进行推理并给出答案。
- 评估划分:
- 分布内 (ID):10000 个示例,按领域和跳数分层,与训练集无三元组重叠。
- 分布外 (OOD):10000 个示例,仅来自三个留出的领域(哲学、语言学、土木工程)。该集合同时包含基于原始语法的问法和经 GPT-4.1 改写的问题,以探测超出表面形式的泛化能力。
- MCQ 划分:基于相同的 OOD 示例构建,每个问题提供四个选项(一个正确答案加三个随机干扰项)。
方法
作者研究了知识注入问题,其中将大量事实语料 Ω 注入到一个冻结的、参数固定为 θ 的语言模型 Mθ 中。核心目标是生成一个答案 a,使其与注入的事实集 F 中的相关事实一致,而无需在任何时候修改基础模型参数 θ。在训练期间仅更新超网络参数 ϕ,这有助于减轻微调的高成本并促进分布外泛化。
如下图所示,所提框架利用基于 transformer 的超网络 gϕ 为目标模型生成上下文权重适配。超网络将输入事实集 F 映射为一组 LoRA 风格的权重适配,并在前向传播时应用于冻结的目标模型。目标模型在训练和推理过程中始终保持完全冻结。
超网络完全从随机权重初始化,以避免将预训练效果与架构容量混为一谈。其使用 LoRA 秩 r=4 和缩放因子 α=8。作者沿着三个独立轴系统地缩放 transformer 超网络以刻画规模法则:深度(改变 transformer 层数 LHN)、宽度(改变隐藏维度 dmodel)和事实数量(改变每个示例的注入事实数 N)。
在训练期间,每个示例包含一个自然语言查询 q 和一组 N 个注入事实 F={f1,…,fN}⊂Ω。F 中恰好有一个事实与回答 q 相关,该事实从用于生成问答对的 k 跳事实序列中随机选取。其余 N−1 个事实是从 Ω 中均匀随机采样的负例事实。这种设置促使超网络从嘈杂的输入上下文中识别并利用相关事实,将其转化为权重适配,引导冻结的目标模型给出正确答案。作者在大多数实验中固定每示例 N=4 个事实,并在专门的规模实验中研究 N 变化的影响。
实验
通过在 MegaWikiQA 数据集上使用冻结的 Qwen2.5 语言模型进行全面的规模实验,本文考察了超网络宽度、深度、目标模型大小和注入事实数量如何影响分布内损失以及三种形式的分布外泛化。所有维度均表现出平滑的幂律改进,但在单位计算量下,缩放目标模型带来的收益最大,而面对改写问题的语言鲁棒性在任一单一轴上都是最难改善的。在比较通过超网络与直接微调(LoRA 和全微调)进行知识注入时,超网络在分布外测试上的优势随目标模型大小的增加单调增长,使其在大规模可靠泛化方面越来越有利。
目标模型大小是最有效的缩放轴,其损失下降幅度比超网络宽度、深度或事实数量更陡峭。分布内损失上微调方法略微更优,但超网络在所有分布外指标上的规模表现更好,且其相对优势在较大模型规模下增大。分布外改写评估始终表现出最平坦的规模曲线,表明语言变化的鲁棒性最难通过规模扩展来改善。在所有指标中,目标模型大小的规模指数最陡,超网络在分布内验证上达到 −0.226,而宽度为 −0.096,深度为 −0.088,事实数量为 −0.080。分布外改写指标的指数在每个轴上都是最浅的(例如超网络宽度为 −0.036,事实数量为 −0.028),使得语言鲁棒性对规模扩展的响应最弱。在分布内验证上,LoRA 微调(−0.250)和全微调(−0.249)比超网络(−0.226)的规模表现略微更有利。在所有分布外划分上,超网络的规模指数均比微调更陡,尤其是在分布外改写(−0.107 vs. LoRA −0.083、全微调 −0.069)和分布外 MCQ(−0.171 vs. −0.119 和 −0.101)上。超网络的分布外优势随着目标模型规模的增大而扩大,因此在更大规模下,超网络范式变得越来越有益。
本研究对目标模型大小、超网络的宽度和深度以及知识事实进行了缩放,比较了基于超网络的方法与 LoRA 和全微调在分布内和分布外泛化上的表现。目标模型大小成为所有方法中降低损失最有效的维度。尽管微调在分布内稍好,但超网络在所有分布外指标上表现出更陡的提升,其优势在更大模型尺寸下扩大;对改写问题的语言鲁棒性仍然是任何缩放维度下最难改善的能力。