MIDI-RAE-JEPA: Hierarchical Representation Learning and Generation for Symbolic Music
作者: Scott H. Hawley
分类: cs.SD, cs.LG, eess.AS
发布日期: 2026-07-16
备注: 8 pages, 8 figures
💡 一句话要点
提出MIDI-RAE-JEPA以解决符号音乐表示的自监督学习问题
🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture)
关键词: 符号音乐表示 自监督学习 层次表示 时间平移等变性 Swin Transformer 音乐生成 情感分类
📋 核心要点
- 现有的符号音乐表示方法在自监督学习方面探索不足,尤其是在编码音乐的层次多尺度结构时面临挑战。
- 本文提出MIDI-RAE-JEPA,通过结合时间平移等变性目标与Swin Transformer V2编码器,学习符号音乐的层次表示。
- 实验结果显示,模型在重构和生成任务中表现优异,重构F1值达到0.995,并在情感分类任务中超越了基线方法。
📝 摘要(中文)
丰富的音乐结构内部表示对于音乐理解任务至关重要,尤其是在机器辅助音乐共创中。然而,符号音乐表示的自监督方法仍然未被充分探索,特别是那些能够编码音乐结构的层次多尺度特性的方法。本文提出了MIDI-RAE-JEPA,结合了音高和时间平移等变性目标、LeJEPA和Swin Transformer V2编码器,以学习符号音乐的层次表示。时间平移等变性目标促使模型内化时间上的音乐关系。编码器完全基于自监督目标进行训练,包括掩蔽嵌入预测(MEP),并通过SIGReg防止崩溃。经过训练的解码器在冻结的编码器嵌入上实现了0.995的重构F1值,基于这些嵌入的流匹配生成模型生成的音乐与条件片段的音高和节奏密度高度匹配,而不匹配的条件则产生无关但音乐上合理的输出。学习到的表示在下游情感分类任务中优于Haar散射变换基线,嵌入距离随着音高和时间平移幅度单调增加,确认了可测量的等变性。这些结果表明,基于等变性的自监督学习目标,结合足够细致的编码器能力,为符号音乐的语义丰富和生成有用的表示提供了一条可行路径。
🔬 方法详解
问题定义:本文旨在解决符号音乐表示的自监督学习不足,尤其是如何有效编码音乐的层次多尺度结构。现有方法在捕捉时间和音高关系方面存在局限性。
核心思路:论文提出MIDI-RAE-JEPA,通过引入时间平移等变性目标,促使模型学习音乐的时间关系,同时利用Swin Transformer V2编码器增强表示能力。
技术框架:整体架构包括一个自监督训练的编码器和一个解码器。编码器负责学习音乐的层次表示,解码器则基于冻结的编码器嵌入进行重构和生成。
关键创新:最重要的技术创新在于结合了时间平移等变性目标与LeJEPA,利用Swin Transformer V2编码器实现高效的层次表示学习,这与传统方法的设计思路有本质区别。
关键设计:模型采用掩蔽嵌入预测(MEP)作为自监督目标,并通过SIGReg防止崩溃。解码器在训练时使用冻结的编码器嵌入,确保生成的音乐在音高和节奏上与条件片段高度一致。实验中,嵌入距离随着音高和时间平移幅度单调增加,验证了模型的等变性。
🖼️ 关键图片
📊 实验亮点
实验结果显示,解码器在冻结编码器嵌入上实现了0.995的重构F1值,且基于这些嵌入的生成模型能够生成与条件片段音高和节奏密度高度匹配的音乐。此外,学习到的表示在情感分类任务中超越了Haar散射变换基线,展现出显著的性能提升。
🎯 应用场景
该研究的潜在应用领域包括机器辅助作曲、音乐分析和情感识别等。通过提供丰富的音乐表示,MIDI-RAE-JEPA能够帮助音乐创作者更好地理解和生成音乐,推动音乐创作的智能化进程。未来,该方法可能在音乐教育和娱乐行业中发挥重要作用。
📄 摘要(原文)
Rich internal representations of musical structure are essential for music understanding tasks such as machine-assisted music co-writing, yet self-supervised approaches for symbolic music representation remain underexplored, particularly those that encode the hierarchical multiscale nature of musical structures. We present MIDI-RAE-JEPA, combining a pitch- and time-shift equivariance objective with LeJEPA and a Swin Transformer V2 encoder to learn such hierarchical representations of symbolic music encoded as piano roll images. The time-shift equivariance objective encourages the model to internalize temporal musical relationships. The encoder is trained purely on self-supervised objectives -- including a masked embedding predictor (MEP) -- with collapse prevented via SIGReg. A separate decoder trained on the frozen encoder embeddings achieves reconstruction F1 of 0.995, and a flow matching generative model conditioned on those embeddings produces generations that closely match the pitch register and rhythmic density of the conditioning excerpt, while mismatched conditioning yields unrelated but musically plausible output. Learned representations outperform a Haar scattering transform baseline on a downstream emotion classification task, and embedding distances increase monotonically with pitch and time shift magnitude, confirming measurable equivariance. These results suggest that equivariance-based SSL objectives, combined with sufficient fine-level encoder capacity, provide a viable path toward semantically rich, generatively useful representations of symbolic music.