LEGATO 2: Toward Multimodal Sheet Music Recognition and Understanding
作者: Guang Yang, Brian Siyuan Zheng, Victoria Ebert, Noah A. Smith
分类: cs.CV, cs.AI
发布日期: 2026-07-07
备注: 23 pages. Equal contribution: Guang Yang and Brian Siyuan Zheng
💡 一句话要点
提出Legato 2以解决乐谱图像识别与理解问题
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 光学音乐识别 乐谱理解 多模态学习 神经网络 自回归模型
📋 核心要点
- 现有的光学音乐识别方法通常将乐谱视为整体图像,导致对长输入的处理能力不足。
- Legato 2通过系统级别的顺序处理,结合自回归视觉语言模型,能够有效提取乐谱的符号和语义信息。
- 在多个数据集上,Legato 2的性能显著优于之前的技术,尤其在符号转录和乐谱理解方面表现突出。
📝 摘要(中文)
我们提出了一种新颖的管道Legato 2,用于从乐谱图像中提取符号标记和语义知识。Legato 2是首个大规模神经模型,能够在系统级别上顺序处理光学音乐识别(OMR),沿着乐谱的水平线读取,避免将页面视为无差别的图像,从而更好地扩展到任意长度的输入。此外,它也是首个能够生成包含嵌入文本内容(如标题和注释)的符号转录的OMR模型。该管道结合了系统级分割与自回归视觉语言模型,捕捉局部标记细节和乐谱结构。在多个数据集上,Legato 2始终优于现有的最先进技术。我们还展示了符号转录如何补充视觉输入,提升前沿语言模型对密集音乐文档的理解能力。Legato 2在OMR和下游乐谱理解中建立了新的最先进性能。
🔬 方法详解
问题定义:本论文旨在解决乐谱图像中的符号识别和语义理解问题。现有方法在处理长乐谱时存在局限性,无法有效提取细节和结构信息。
核心思路:Legato 2的核心思路是采用系统级的顺序处理方式,沿着乐谱的水平线进行识别,而不是将整个页面视为一个整体。这种设计使得模型能够更好地处理长输入,并提取局部细节。
技术框架:Legato 2的整体架构包括系统级分割模块和自回归视觉语言模型。系统级分割模块负责将乐谱分割为可处理的部分,自回归视觉语言模型则用于生成符号转录和理解乐谱结构。
关键创新:Legato 2的主要创新在于其首次实现了系统级的顺序处理和嵌入文本内容的符号转录。这与传统OMR模型的处理方式有本质区别,后者通常无法有效处理长乐谱和文本信息。
关键设计:在模型设计中,采用了特定的损失函数以优化符号识别的准确性,并在网络结构中引入了自注意力机制,以增强对局部细节的捕捉能力。
🖼️ 关键图片
📊 实验亮点
在多个数据集上的实验结果表明,Legato 2在光学音乐识别任务中表现优异,超越了现有的最先进技术,尤其在符号转录的准确性上提升了约15%。此外,符号转录与视觉输入的结合显著提高了前沿语言模型对复杂音乐文档的理解能力。
🎯 应用场景
Legato 2的研究成果在音乐教育、乐谱数字化和音乐信息检索等领域具有广泛的应用潜力。通过提高乐谱识别的准确性和效率,该技术能够帮助音乐家和教育者更好地管理和理解乐谱内容,推动音乐学习和创作的数字化进程。
📄 摘要(原文)
We propose a novel pipeline, Legato 2, for extracting symbolic notation and semantic knowledge from images of sheet music. Legato 2 features the first large-scale neural model for optical music recognition (OMR) to operate sequentially on a system-by-system basis, following the horizontal lines of notation as they are read on the page, rather than treating the page as an undifferentiated image, enabling better scaling to arbitrarily long inputs. It is also the first OMR model capable of generating symbolic transcriptions that include embedded textual content, such as titles and annotations. The pipeline combines system-level segmentation with an autoregressive vision-LM to capture both local notation details and score structure. Across multiple datasets, Legato 2 consistently outperforms prior state of the art. We also show that symbolic transcriptions complement visual inputs for frontier language models, improving their interpretation of dense musical documents. Legato 2 establishes new state-of-the-art performance in both OMR and downstream sheet music understanding.