Verifier-Guided Twelve-Tone Composition: A Generate-Verify-Repair Harness for Symbolic Music Generation

📄 arXiv: 2607.11334v1 📥 PDF

作者: Congren Dai, Danni Zhao, Enyang Liu, Michael Ching Yam, Zhancheng Guo, Siyi Gu, Wentao Yang, Bo Dai, Xiaobing Li, Maosong Sun

分类: cs.AI

发布日期: 2026-07-13


💡 一句话要点

提出神经符号框架以解决十二音音乐生成中的一致性问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 音乐生成 神经符号框架 大型语言模型 一致性验证 计算机音乐

📋 核心要点

  1. 现有的大型语言模型在生成十二音音乐时,往往产生表面合法但缺乏一致性的乐谱,导致音乐质量下降。
  2. 本文提出了一种生成-验证-修复的神经符号框架,通过符号验证来提升生成乐谱的局部一致性,避免整体合法性的声称。
  3. 实验结果显示,使用该框架后,交付率从13.3%提升至48.1%,而碰撞和序列一致性检查的通过率也显著提高。

📝 摘要(中文)

大型语言模型能够生成表面上合法的十二音乐谱,但往往会陷入退化的纹理中。本文提出了一种神经符号框架,将语言模型生成器嵌入到生成-验证-修复-追踪的循环中,以实现符号验证。该完整流程在不声称整体合法性的情况下,提高了事件局部一致性。在40个控制任务和四个配对模型的实验中,使用该框架的交付率从原始生成的13.3%提升至48.1%。更严格的碰撞和序列一致性检查的通过率从33.5%提升至58.3%,而退化率保持在0.05附近,包括在探索性对抗提示下。五位专家的盲评也显示出对框架候选作品在遵循性、感知合法性、一致性和整体质量上的偏好。

🔬 方法详解

问题定义:本文旨在解决大型语言模型在生成十二音音乐时的一致性问题,现有方法生成的乐谱往往缺乏局部一致性,导致音乐质量下降。

核心思路:论文的核心思路是构建一个生成-验证-修复的循环框架,通过符号验证来提升生成乐谱的局部一致性,而不追求整体合法性。

技术框架:整体架构包括生成器、验证器和修复模块。生成器负责生成乐谱,验证器对生成的乐谱进行符号验证,修复模块则根据验证结果对乐谱进行调整。

关键创新:最重要的技术创新在于引入了符号验证机制,使得生成的乐谱在局部一致性上得到了显著提升,与传统方法相比,避免了整体合法性的限制。

关键设计:在设计中,采用了特定的损失函数来衡量乐谱的一致性,并对生成器的网络结构进行了优化,以提高生成的乐谱质量。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果表明,使用神经符号框架后,乐谱的交付率从13.3%提升至48.1%,而碰撞和序列一致性检查的通过率从33.5%提升至58.3%。退化率保持在0.05附近,显示出该方法在生成音乐质量上的显著提升。

🎯 应用场景

该研究的潜在应用领域包括音乐创作、音乐教育和计算机辅助作曲等。通过提升生成乐谱的一致性,能够为音乐创作者提供更高质量的创作工具,促进音乐创作的多样性和创新性。未来,该技术可能在自动作曲和音乐生成领域产生深远影响。

📄 摘要(原文)

Large language models can produce superficially legal twelve-tone scores that collapse into degenerate textures. We introduce a neuro-symbolic harness that wraps a language-model proposer in a generate-verify-repair-trace loop with symbolic verification. The complete pipeline improves event-local consistency without claiming whole-piece legality. Across 40 controlled tasks and four paired models, audited delivery yield rises from 13.3% under raw generation to 48.1% with the harness, which explicitly abstains otherwise. The pass rate of a narrower collision and serialisation-consistency check rises from 33.5% to 58.3%, while degeneracy remains near 0.05, including under exploratory adversarial prompting. A blinded evaluation by five experts also shows a descriptive aggregate preference for harness candidates over raw generation in adherence, perceived legality, coherence, and overall quality.