HyperAIHyperAI

Command Palette

Search for a command to run...

Skaling:Chinchilla 指数与 Kaplan 耦合的统一

Mathurin Videau Badr Youbi-Idrissi David Lopez-Paz Kartik Ahuja

摘要

神经标度律是语言模型开发的基石,但现有标准公式在数据稀缺和过度训练等极端情况下会系统性地低估或高估损失。这一缺陷源于其底层假设,即模型规模与训练数据独立地影响损失。为解决该问题,我们提出 Skaling 律(发音为 /skeɪlɪŋ/),一种将模型容量与数据通过单一交互指数耦合的广义函数形式。这一简单扩展在插值和外推场景下均将平均绝对百分比误差(MAPE)降低了 1.5 至 3 倍。当与仅限低算力区间的稀疏网格策略结合时,Skaling 律仅需均匀扫描约十分之一的算力即可实现精确的全网格外推。通过实现从小规模实验进行可靠的性能预测,Skaling 律为下一代模型训练中的算力预算分配提供了更稳健且资源高效的框架。

一句话总结

Meta 的 FAIR 团队提出了 Skaling law,一种广义的神经标度公式,通过单个交互指数将模型容量与数据耦合,在不同区间将 MAPE 降低 1.5–3 倍,并能够利用低计算量的稀疏网格实现精确的全网格外推,相比均匀扫描节省约 10 倍计算量。

核心贡献

  • Skaling law 引入了一种广义函数形式,通过单个交互指数将模型容量与训练数据耦合,修正了标准加性标度律中的独立性假设。
  • 这一单参数扩展在插值和外推区间将平均绝对百分比误差 (MAPE) 降低了 1.5–3 倍,并且在网格边界处优于更丰富的九参数形式。
  • 将 Skaling law 与低计算量边界运行的稀疏 L 形网格相结合,能够实现精确的全网格外推,相比均匀扫描节省约 10 倍计算量。

引言

语言模型性能随模型大小和训练数据的可预测标度对于做出关于预训练预算和架构的经济高效决策至关重要。广泛采用的加性标度律(如 Chinchilla 公式)将模型大小和数据量的贡献视为独立项,这迫使它们的交叉导数为零,并在两者最不平衡的训练网格边界处产生有偏的损失预测。作者引入了 Skaling law,这是一种最小扩展,添加了单个耦合指数来捕捉模型大小与数据之间的交互,修正边界误差,并能够从廉价的 L 形剖析网格(最多节省 10 倍计算量)进行精确的标度预测。

方法

作者首先分析损失曲面,以确定模型大小 (NNN) 和训练数据 (DDD) 是否交互。他们使用移动最小二乘 (MLS) 估计器估计导数。虽然一阶诊断表明接近可分离性,但混合导数 2L/ND\partial^2 L / \partial N \partial D2L/ND 是决定性检验。加性律要求该混合导数为零。然而,估计的混合导数在整个网格上非零,并呈现幂律衰减。

如下图所示:

这种非零混合导数表明存在协同效应,即同时扩展 NNNDDD 比单独扩展任一项更能降低损失,这促使采用耦合函数形式。作者引入了 Skaling 形式:

L(N,D)=(ANα+BDβ)k+EL(N, D) = \left(\frac{A}{N^{\alpha}} + \frac{B}{D^{\beta}}\right)^k + EL(N,D)=(NαA+DβB)k+E

该形式连接了加性 Chinchilla 律(当 k=1k=1k=1 时恢复)和耦合的 Kaplan 形式。通过使用单个外部指数 kkk 同时保留独立的内部指数 α\alphaαβ\betaβ,Skaling 在不绑定各轴衰减速率的情况下捕捉交互。它保持严格递减,并保留了与加性律类似的闭式计算最优分配,尽管由于拟合参数不同,最优比率有所差异。

为了高效估计参数,作者避免了以昂贵的大规模运行为主的密集全网格采样。相反,他们采用 L 形采样策略。这包括对最小模型扫描数据量 DDD 以分离数据参数,以及对最短训练周期扫描模型大小 NNN 以分离大小参数。

评估使用全面的交叉验证框架。数据被划分为验证(插值)、外推 N(更大模型)、外推 D(更多数据)和远外推(最大模型和数据)。性能通过所有集合的平均绝对百分比误差 (MAPE) 和插值的决定系数 (R2R^2R2) 来衡量。

为了测试对大规模预训练运行的预测能力(这些运行通常沿固定的 token 与参数比扩展),作者沿等比例切片进行计算外推。

参考框架图:

运行按恒定 D/ND/ND/N 分组为切片。在每个切片内,最高计算量的点被保留。标度律在所有切片的低计算量点上拟合,并在保留的高计算量运行上进行评估。此设置测试全局拟合的律能否使用廉价数据预测昂贵运行,并与在每个切片内拟合一维幂律的逐比例基线进行比较。

实验

评估使用两个预训练损失网格(Farseer 和 SK-Grid)以及一个测试插值、单轴外推和超出训练边界的远外推的交叉验证协议。与加性基线相比,Skaling law 持续减少边界误差,尤其是在不平衡的角落和稀疏剖析区间,因为其耦合函数形式捕捉了模型大小与数据之间的鞍形交互。沿固定 token 与参数比的计算外推进一步表明,Skaling 比全局基线更准确、更稳定地从低成本数据预测高成本运行,而最优分配趋势的方向取决于数据集和架构。总体而言,结果表明模型与数据标度之间的乘法耦合比纯加性公式提供了更好的预测准确性和更可靠的外推。

与加性 Chinchilla 律相比,Skaling law 显著降低了外推误差,尤其是在网格边界和远外推区间,同时实现了相当或更好的插值拟合。在 L 形网格上的稀疏训练保持了 Skaling 的准确性,但导致 Chinchilla 的误差激增,表明仅凭高插值 R2R^2R2 不足以验证标度律。在完整的 SK-Grid 上,Skaling 将远外推 MAPE 从 5.17% 降至 0.70%,在 L 形网格上从 14.63% 降至 1.15%。Chinchilla 获得了很高的插值 R2R^2R2 (0.992–0.995),但其外推误差是 Skaling 的数倍,说明内部拟合质量不能保证边界准确性。

拟合结果显示,Skaling law 始终恢复出小于 1 的耦合指数 (k ≈ 0.31–0.45),而不是坍缩为加性 Chinchilla 情况 (k=1),并且其拟合的不可约损失系统性地更低,在 Farseer 数据上几乎消失。耦合指数和不可约损失相互权衡,使得耦合形式能够吸收加性律原本通过更大的基底表示的曲率。这种稳定的耦合解释了为什么 Skaling 改善了边界预测,同时在数据接近加性时仍接近 Chinchilla。在所有网格上,Skaling law 拟合的耦合指数 k 大致在 0.31 到 0.45 之间,远离加性值 1。在 Farseer 数据上,拟合的不可约损失 E 从 Chinchilla 下的 0.45–0.59 降至 Skaling 下的 0.03–0.05,而在 SK-Grid 上仍保持较大值 (1.14–1.75)。当 k < 1 时,凹外映射使耦合的可约项在大规模时衰减更慢,吸收了加性律只能通过更大 E 捕捉的曲率。

当外推到高计算量运行时,Skaling law 在所有训练区间始终实现最低的预测误差,汇总 MAPE 为 0.60%。Chinchilla 的误差隐藏了最优区间的严重下降 (3.47%),而逐比例幂律仅在最优附近具有竞争力,但无法指导联合参数-数据分配,因为它在每个切片内单独拟合。参数更多的 Farseer 律整体上仍不如 Skaling 准确。Skaling 将外推误差相对于 Chinchilla 降低了近四倍,并在每个区间保持 MAPE 低于 0.9%,而 Chinchilla 在最优区间超过 3.4%。逐比例幂律仅在最优切片中略优于 Skaling (0.77% 对比 0.88%),但它是按配方拟合的,无法为联合标度决策提供信息。

与加性 Chinchilla 律相比,Skaling law 显著降低了外推误差,尤其是在网格边界和远外推区间,同时保持了相当的插值拟合。稀疏 L 形训练揭示,高插值 R2R^2R2 不足以验证标度律,因为在这些条件下 Chinchilla 的误差激增,而 Skaling 保持准确。拟合结果表明,Skaling 始终恢复出小于 1 的耦合指数 (k ≈ 0.31–0.45) 和系统性地更低的不可约损失,使得耦合形式能够吸收加性律原本通过更大基底表示的曲率。在所有训练区间,Skaling 在外推到高计算量运行时实现了最低的预测误差,将误差相对于 Chinchilla 降低了近四倍,并在每个区间保持 MAPE 低于 0.9%。


用 AI 构建 AI

从创意到上线——通过免费 AI 协同编码、开箱即用的环境和最优惠的 GPU 价格,加速您的 AI 开发。

AI 协同编码
开箱即用的 GPU
最优定价

HyperAI Newsletters

订阅我们的最新资讯
我们会在北京时间 每周一的上午九点 向您的邮箱投递本周内的最新更新
邮件发送服务由 MailChimp 提供