Command Palette
Search for a command to run...
从零开始扩展原生多模态预训练
从零开始扩展原生多模态预训练
Haoyuan Wu Aoqi Wu Hai Wang Jiajia Wu Jinxiang Ou Bei Yu
摘要
尽管大语言模型(LLM)展现出卓越的推理能力,但其仅依赖文本的预训练方式限制了对多模态物理世界的感知。原生多模态预训练通过从零开始在多模态输入上训练模型,避免了这一局限,从而实现深层的跨模态融合,并缓解了传统后期融合架构固有的优化不对称性。尽管具有这些优势,该范式的扩展特性仍缺乏系统性的刻画。为填补这一空白,我们在固定计算预算下,研究了训练基于 Transformer 的视觉-语言模型的最优模型规模与 token 数量。我们证明,最小目标损失遵循可预测的计算定律,而计算最优的模型规模与 token 数量则按幂律扩展。值得注意的是,语言目标与多模态目标表现出截然不同的扩展行为。语言分配定律在很大程度上不受数据构成的影响,表明无论多模态数据比例如何,语言学习均保持稳定。相反,多模态分配定律对数据构成高度敏感。具体而言,文本占比较高的混合数据仅在较大模型规模下才变得计算高效,从而将最优资源分配推向更大的模型容量。此外,通过建模数据构成对计算定律和分配指数的影响,我们推导出一条效率前沿,明确规定了模型规模、token 数量与数据混合的精确配置。下游评估进一步揭示,原生多模态预训练能引发正向跨模态迁移,从而增强纯文本空间推理能力,并实现稳健的多模态上下文学习。总之,本实证研究为可预测地扩展多模态基础模型奠定了必要的基础。
一句话总结
来自香港中文大学和腾讯的研究人员证明,从头开始的原生多模态预训练遵循不同的计算定律,分别适用于语言损失和多模态损失,文本含量较高的数据混合会将计算最优分配转向更大的模型,并定义出一个效率前沿,该前沿能够实现空间推理和上下文学习方面的正向跨模态迁移。
核心贡献
- 建立了原生多模态预训练的计算最优扩展定律,表明最小损失遵循可预测的计算定律,并且在固定计算预算下,最优模型大小和 token 数量按幂律扩展。
- 将联合目标解耦为语言和多模态两部分,揭示出语言分配定律对数据组成基本不变,而多模态分配定律则高度敏感;随后由联合计算最优前沿确定模型大小、token 数量及数据混合比例。
- 下游评估显示,原生多模态预训练带来了正向跨模态迁移,提升了纯文本空间推理能力,并实现了鲁棒的多模态上下文学习。
引言
大型语言模型在推理和生成方面表现出色,但纯文本预训练缺乏对物理世界的扎根。标准的后期融合多模态方法将预训练语言模型与单独的视觉编码器耦合,造成模态之间从不相交的分布中学习,目标不同,因而产生不对称。原生多模态预训练通过从头开始用交错数据训练单一模型来解决这一问题,但它引发一个开放性问题:当语言和多模态目标可能冲突时,如何最优分配固定的计算预算。先前的扩展定律研究仅限于单模态设置,或将多模态损失视为整体,而未分离各模态的独特行为。作者专门为原生多模态预训练建立了计算最优扩展定律。利用 IsoFLOP 曲线和训练曲线包络,他们表明语言扩展对数据组成基本不敏感,而多模态扩展则高度依赖多模态数据比例。这种差异产生了一个计算最优帕累托前沿,该前沿为给定的计算预算和数据混合指定了最优模型大小、文本 token 数量和多模态 token 数量。此外,原生多模态预训练提升了纯文本空间推理能力,并实现了鲁棒的多模态上下文学习。
数据集
作者构建了一个纯文本和多模态数据的训练混合,图像转换后总计约 3250 亿 token。
- 文本语料(2500 亿 token)
- 来源:网页、书籍、学术论文和其他通用领域文档。
- 在给定的摘录中未详述明确的过滤规则,但描述文本 token 来源于这些领域。
- 多模态语料(等值 750 亿 token)
- 来源:大规模网络爬取的图文对以及交错图文文档。
- 处理:每张图像通过单个 patch 嵌入层直接投影为连续的 patch 嵌入序列,产生多模态 token。总计 750 亿个此类 token。
- 使用方式
- 两个子集合并为单一训练混合。未指定相对比例,但从 token 数量看,约 77% 为文本 token,23% 为多模态 token。
- 未提及进一步的裁剪策略或元数据构建。
方法
作者重新审视原生多模态预训练中的计算最优分配这一基本问题。给定固定的计算预算 C,目标是在模型规模 N(定义为除嵌入外激活的非嵌入参数数量)和训练 token 总数 D 之间最优分配资源。使用标准近似 C=6ND,目标是在此约束下最小化最终预训练损失 L(N,D)。在原生多模态预训练中,语言目标 Ltext 和多模态目标 Lmm 使用共享参数同时优化。为研究这些目标是否遵循类似的扩展定律,作者根据多模态数据比例 r 将分配问题解耦,并独立分析每个目标。
为估计计算最优分配,作者采用了两种独立的方法。主要估计器是 IsoFLOP 曲线方法。在预先确定的计算预算 C 下,绘制每个模型损失随 logN 变化的图,生成 IsoFLOP 曲线。对每条曲线拟合一条抛物线,其最小值确定了最优模型规模 Nopt(C)。最优 token 数量通过代数计算得出:Dopt(C)=C/(6Nopt)。如下图所示,这些曲线在不同 r 值下展现出稳定的抛物线最小值。
第二种方法是训练曲线包络,它作为一种独立的交叉验证机制。对于固定的模型规模 N,增加 token 数量 D 会产生损失相对总计算 C 的轨迹。汇集所有评估模型的轨迹并提取下包络,即可得到任意给定计算预算 C 的最小可达到损失。如下图所示,计算前沿严格遵循幂律 L(C)=E+(Cc/C)β,其中 E 为不可约下限,Cc 为临界计算规模,β 为衰减指数。
实验设置使用了文本和多模态数据集的混合,包含 2500 亿文本 token 和 750 亿来自网络爬取图文对的多模态 token。模型架构采用基于仅解码器 Transformer 的混合专家模型。不使用传统的视觉编码器,而是通过单个 patch 嵌入层直接将图像投影为连续的 patch 嵌入。这些模型使用无辅助损失的方法进行训练。
分析扩展行为揭示出两个目标的不同动态。语言目标的计算最优分配具有高度组成不变性,这意味着最小化 Ltext 所需的参数容量严格由孤立预算 Ctext 支配,并且对引入多模态 token 保持鲁棒。相反,多模态目标严格表现出组成可变的扩展行为。随着多模态比例 r 增加,最优模型规模指数显著减小,这证实了跨模态对齐固有的数据需求特性。处理密集型多模态数据将最优计算分配强烈地转向数据扩展而非参数扩展。
为了在统一计算预算 Ctotal 下解决联合权衡问题,作者采用了一种非对称建模框架。该框架将组成不变的语言目标与组成可变的多模态目标相结合,反映了模态间的结构差异。基于文本的语言建模依赖于稳健的统计结构,而视觉 token 则提供外部上下文。因此,扩展统一的的多模态基础模型需要限制理论上的参数扩展,而倾向于使用大得多的 token 预算进行训练,以适应多模态参数扩展曲线的快速扁平化。
实验
在 16 个文本和 23 个多模态基准上的评估显示,原生多模态预训练在所有规模下都保持了核心语言能力,同时随着模型规模增大,跨模态迁移显著提升了基于文本的空间推理能力。多模态上下文学习随着扩展和持续训练自然涌现,少样本增益集中在空间和图表类任务上,而非细粒度识别。总体而言,联合优化文本和视觉目标带来了有益的协同作用,且没有对语言性能产生可测量的干扰。