MADB: A Large-Scale Music Aesthetics Dataset with Professional and Multi-Dimensional Annotations
作者: Sirui Zhang, Tianle Wang, Xinyi Tong, Peiyang Yu, Jishang Chen, Liangke Zhao, Haoxin Zhang, Duo Xu, Xin Jin, Feng Yu, Songchun Zhu
分类: cs.SD, cs.AI
发布日期: 2026-07-08
🔗 代码/项目: GITHUB
💡 一句话要点
提出MADB数据集以解决音乐美学评估的挑战
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 音乐美学 数据集 多维度注释 模型评估 人类感知
📋 核心要点
- 音乐美学评估面临的核心问题是缺乏大规模、结构化的注释数据集,限制了模型的有效性和准确性。
- 论文提出的MADB数据集通过多维度的注释和统一的评估框架,旨在提升音乐美学评估的准确性和可解释性。
- 实验结果表明,当前模型的预测与人类判断存在显著差距,揭示了现有方法的局限性,并为未来研究提供了新的基准。
📝 摘要(中文)
音乐美学评估是一个具有挑战性但尚未充分探索的问题,需要模型捕捉细粒度的多维人类感知判断。由于缺乏具有结构化美学注释的大规模数据集,该领域的进展受到限制。我们介绍了MADB,一个包含9999首曲目的大规模数据集和基准,由30名训练有素的注释者进行标注。每首曲目由约10名注释者在10个感知维度和一个总体评分上进行评分,并附有额外的文本评论以进行多模态分析。我们建立了一个统一的评估框架,涵盖多个预训练模型。结果显示模型预测与人类判断之间存在显著差距,揭示了当前方法的关键局限性。MADB为人类对齐的音乐理解提供了新的基准。
🔬 方法详解
问题定义:本论文旨在解决音乐美学评估中的数据不足问题,现有方法缺乏大规模的、结构化的注释数据,导致模型无法有效捕捉人类的多维感知判断。
核心思路:通过构建MADB数据集,提供9999首曲目的多维度注释,论文希望为音乐美学评估提供一个标准化的基准,促进模型的训练和评估。
技术框架:MADB数据集由30名训练有素的注释者对每首曲目进行评分,涵盖10个感知维度和一个总体评分,此外还提供文本评论。研究建立了一个统一的评估框架,适用于多个预训练模型。
关键创新:MADB数据集的最大创新在于其大规模、多维度的注释方式,填补了音乐美学评估领域的空白,与现有方法相比,提供了更为丰富和细致的评估标准。
关键设计:在数据集构建中,注释者的选择和评分标准的制定至关重要,确保了数据的专业性和可靠性。此外,论文还设计了统一的评估框架,以便于不同模型的比较和分析。
🖼️ 关键图片
📊 实验亮点
实验结果显示,现有模型在音乐美学评估中的预测与人类判断之间存在显著差距,揭示了当前方法的局限性。具体而言,模型的预测准确率与人类评分的相关性较低,表明需要进一步优化模型以更好地对齐人类感知。
🎯 应用场景
MADB数据集的构建为音乐推荐系统、音乐创作辅助工具以及音乐教育等领域提供了重要的基础数据支持。通过更准确的音乐美学评估,相关应用可以更好地理解用户的偏好,从而提升用户体验。未来,MADB有望推动音乐理解和生成领域的研究进展。
📄 摘要(原文)
Music aesthetic assessment is a challenging yet underexplored problem, requiring models to capture fine-grained, multi-dimensional human perceptual judgments. Progress in this area has been limited by the lack of large-scale datasets with structured aesthetic annotations. We introduce MADB, a large-scale dataset and benchmark comprising 9,999 tracks annotated by 30 trained annotators. Each track is rated by around 10 annotators across 10 perceptual dimensions and one overall score, with additional textual comments for multimodal analysis. We establish a unified evaluation framework over multiple pretrained models. Results reveal substantial gaps between model predictions and human judgments, exposing key limitations of current approaches. MADB provides a new benchmark for human-aligned music understanding. Project page: https://github.com/knownree/madb