HyperAIHyperAI

Command Palette

Search for a command to run...

MUSIC-JEPA:从动作中学习声音的世界模型

Ziyu Wang Kun Fang Yann LeCun

摘要

联合嵌入预测架构(JEPA)最近已成为通过预测潜在表示来学习世界模型的一种范式,为自监督学习提供了有前景的方向。尽管已有初步尝试将 JEPA 应用于音乐领域,但此类框架如何自然地支持音乐世界模型的形成仍不清楚。在本工作中,我们提出通过将音乐构建为一个动作条件系统,使用 JEPA 学习钢琴声音的世界模型:音频被视为状态,钢琴卷帘谱被视为乐器动作。给定当前音频状态和一个动作,模型预测由此产生的未来音频状态,这反映了人类如何通过交互学习音乐声音。该模型在完全离线设置下,使用成对的音频-钢琴卷帘谱数据进行训练,无需与环境交互。实验表明,学习到的模型捕捉了音乐动作与其所产生声音之间的关系。由此得到的表示支持节拍跟踪、作曲家识别和调性估计等下游任务,并通过规划实现钢琴转谱,即搜索最能解释目标声音的动作。

一句话总结

来自纽约大学、麦吉尔大学、MBZUAI等机构的研究者提出MUSIC-JEPA,一个基于JEPA的钢琴声音世界模型,将音频视为状态,钢琴卷帘视为动作,从当前音频和动作预测未来音频状态,并通过规划实现节拍追踪、作曲家识别、调性估计和钢琴转录等下游任务。

核心贡献

  • Music-JEPA是一个世界模型,通过将音频视为状态、钢琴卷帘视为动作,利用配对数据预测未来潜在表示,从而学习钢琴音频的动作条件时序动态。
  • 学习到的表示优于仅音频的JEPA基线,并在节拍追踪、作曲家识别和调性估计等下游音乐信息检索任务上达到与MERT可比的性能,同时仅使用MERT 7%的参数量。
  • 学习到的动态通过摊销规划实现钢琴转录,其中逆预测器推断动作,解码器生成输出,产生连贯的转录结果,有效捕捉连续的踏板变化。

引言

作者从主动参与的角度探讨音乐理解,人类通过与乐器互动来学习预测音乐结果。这促使构建一个音乐世界模型,通过捕捉演奏动作与产生的音频状态之间的时序动态来学习表示。现有的自监督音频模型,包括基于联合嵌入预测架构(JEPA)的模型,以被动方式处理音频,未显式建模音乐如何随时间展开,因此其对调性、和弦、节拍等音乐特定概念的敏感性尚未被充分探索。作者提出Music-JEPA,一个基于JEPA的框架,通过预测未来音频状态而不重建原始音频,学习动作条件的潜在动态。学习到的表示在钢琴音乐信息检索任务上优于仅音频的JEPA基线,虽然仅使用7%的参数量,却能与大得多的模型相媲美,并通过摊销推理实现规划,产生有意义的钢琴转录。

方法

作者提出Music-JEPA,将音乐建模为一个动态系统,其中音频在演奏动作的影响下随时间演化。该框架在钢琴音乐上实例化,使用配对的音频和控制序列(x1:T,y1:T)(x_{1:T}, y_{1:T})(x1:T,y1:T),其中xtx_txt表示2秒的音频片段,yty_tyt表示对应的钢琴卷帘和踏板信号。音频表示为对数梅尔频谱图,而动作包括编码音符力度的钢琴卷帘和与相同帧率对齐的延音踏板信号。

如下图所示:

st+1=f(st,at+1),at+1=g(at).s_{t+1} = f(s_t, a_{t+1}), \quad a_{t+1} = g(a_t).st+1=f(st,at+1),at+1=g(at).

模型学习潜在状态和动作表示st=Estate(xt)s_t = \mathcal{E}_{\mathrm{state}}(x_t)st=Estate(xt)at=Eaction(yt)a_t = \mathcal{E}_{\mathrm{action}}(y_t)at=Eaction(yt),将动态建模为:

st+1=f(st,at+1),at+1=g(at).s_{t+1} = f(s_t, a_{t+1}), \quad a_{t+1} = g(a_t).st+1=f(st,at+1),at+1=g(at).

其中,f(,)f(\cdot, \cdot)f(,)预测下一状态,g()g(\cdot)g()建模动作的时序结构。对高维钢琴控制的演化建模为动作空间提供了结构化先验。

架构遵循联合嵌入预测架构(JEPA)框架,采用Vision Transformer(ViT)作为骨干。频谱图和钢琴卷帘被视为图像式输入,并映射为基于块的表示。频谱图沿时间和频率分割为块,通过卷积层投影到D维嵌入。类似地,钢琴卷帘沿时间和音高分割为块。延音踏板信号被视为一维时序序列,用一维卷积编码,并与钢琴卷帘嵌入融合。经过块嵌入后,Transformer编码器处理状态和动作token,产生潜在表示sRKs×Ds \in \mathbb{R}^{K_s \times D}sRKs×DaRKa×Da \in \mathbb{R}^{K_a \times D}aRKa×D

状态和动作预测器也基于ViT。状态预测器f(s,a)f(s, a)f(s,a)作用于部分掩码的状态序列,以sts_tst和掩码版本的st+1s_{t+1}st+1为输入,通过自注意力预测缺失区域。每层通过交叉注意力对动作token at+1a_{t+1}at+1进行条件化。相反,动作预测器g(a)g(a)g(a)是一个标准Transformer,无交叉注意力,训练目标是从ata_tat和掩码token重建at+1a_{t+1}at+1

给定输入(xt1,yt1)(x_{t-1}, y_{t-1})(xt1,yt1)(xt,yt)(x_t, y_t)(xt,yt),训练目标表述为:

L(θ)=f(st,at+1)st+12+λg(at)at+12,\mathcal{L}(\boldsymbol{\theta}) = \| f(s_t, a_{t+1}) - s_{t+1} \|^2 + \lambda \| g(a_t) - a_{t+1} \|^2,L(θ)=f(st,at+1)st+12+λg(at)at+12,

其中λ\lambdaλ控制动作先验的强度。为防止表示坍缩,作者采用指数移动平均(EMA)策略,维护停止梯度的教师编码器,其参数θˉ\bar{\theta}θˉ按如下方式更新:

θˉEkτθˉEk+(1τ)θEk,k{s,a},\bar{\theta}_{\mathcal{E}_k} \leftarrow \tau \bar{\theta}_{\mathcal{E}_k} + (1 - \tau) \theta_{\mathcal{E}_k}, \quad k \in \{s, a\},θˉEkτθˉEk+(1τ)θEk,k{s,a},

其中τ\tauτ为动量系数。对学生和教师编码器输出均施加层归一化以控制表示尺度。

对于下游任务,模型被冻结,状态编码器用作特征提取器。除表示学习外,学习到的动态还能通过潜在空间中的规划实现钢琴转录。给定已知的潜在状态序列s1:Ts_{1:T}s1:T,问题被表述为寻找使预测误差最小化的动作a1:Ta_{1:T}^*a1:T。为处理高维动作空间,作者采用摊销优化方法,训练一个逆预测器at+1=h(st,st+1,at)a_{t+1} = h(s_t, s_{t+1}, a_t)at+1=h(st,st+1,at)来近似解。然后,使用单独训练的动作解码器将预测的潜在动作映射回观测空间。

实验

Music-JEPA在古典钢琴音乐(MAESTRO)上训练,并与仅音频的JEPA和MERT进行对比。潜在动态分析表明模型对状态和动作扰动具有强敏感性,验证了动作条件建模优于仅音频基线的优势。在下游MIR任务上,该模型优于仅音频的JEPA,并与MERT保持竞争力,而通过规划实现的转录在连续踏板估计上表现强劲,但落后于全有监督的音符级方法。

Music-JEPA对不匹配的状态转换表现出稳健的敏感性,在时序和随机扰动下均获得高胜率。AO-JEPA明显落后,尤其是在目标状态的时序扰动下,其胜率大幅下降。Music-JEPA在输入时序扰动下的胜率高于AO-JEPA,表明其能更好地检测输入时序不匹配。对于目标状态时序偏移,Music-JEPA保持近乎完美的胜率,而AO-JEPA跌至0.576,突显了时序敏感性的巨大差距。两种模型在随机扰动下均接近完美胜率,但Music-JEPA在所有条件下均一致优于AO-JEPA。

轻量级Music-JEPA模型(6M参数)在所有三个任务上均优于同规模的AO-JEPA。它在节拍追踪F1分数上取得最佳成绩,并与AO-JEPA一起在调性识别上比95M参数的MERT模型高出约10个点。在作曲家识别中,Music-JEPA获得最高的top-3和top-5准确率,而MERT在top-1准确率和加权F1上领先。Music-JEPA在70 ms和100 ms容差阈值下均取得最佳的节拍追踪F1分数。尽管仅有600万参数,Music-JEPA在调性识别和节拍追踪上仍超越了9500万参数的MERT。两个基于JEPA的模型在所有调性识别指标上均比MERT高出约10个百分点。Music-JEPA在作曲家识别中取得了最高的top-3和top-5准确率,但MERT获得了更高的加权F1和top-1准确率。AO-JEPA在每项任务上的表现均低于Music-JEPA,其中在作曲家识别加权F1上的差距最大。

所提模型在音符级转录上落后于全有监督方法,在帧、onset、onset+offset以及onset+offset+velocity等各阶段的F1分数均较低,但在连续延音踏板估计上取得最佳效果,在所有对比系统中录得最低的平均绝对误差。该模型的音符级转录F1分数在所有评估阶段均低于Yan等人和Kong等人的方法。在延音踏板估计方面,该模型取得最低MAE(0.1222),优于Zhang等人的有监督踏板模型以及其他转录系统。

Music-JEPA在多个任务上接受评估,包括状态转换敏感性、轻量级下游音乐理解以及带踏板估计的音符级转录。它对时序不匹配展现出稳健的检测能力,远超AO-JEPA,且作为6M参数模型,在调性识别和节拍追踪上超越了95M参数的MERT,但在作曲家识别top-1准确率上落后。在转录方面,该模型落后于全有监督方法,但在连续延音踏板估计上独有地取得了最低平均绝对误差,凸显了其对音乐相关结构的高效捕捉。


用 AI 构建 AI

从创意到上线——通过免费 AI 协同编码、开箱即用的环境和最优惠的 GPU 价格,加速您的 AI 开发。

AI 协同编码
开箱即用的 GPU
最优定价

HyperAI Newsletters

订阅我们的最新资讯
我们会在北京时间 每周一的上午九点 向您的邮箱投递本周内的最新更新
邮件发送服务由 MailChimp 提供