A Repeated-Measurement Study for Cultural Analytics of English Song Lyrics Using Five Large Language Models

📄 arXiv: 2609.04428v1 📥 PDF

作者: E. Cho Smith, Samuel Ho, Dawn Laux

分类: cs.LG

发布日期: 2026-09-03

备注: 6 pages, 3 figures, Conference: AIxHEART 2026


💡 一句话要点

评估五种大型语言模型在英语歌词文化分析中的可靠性

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 大型语言模型 文化分析 社会构建 自尊 自我控制 歌词分析 可靠性评估

📋 核心要点

  1. 现有方法在使用大型语言模型进行文化文本注释时,缺乏对测量可靠性的系统评估,导致结果的不确定性。
  2. 本研究通过对五种大型语言模型的重复注释,评估其在四种社会构建上的一致性和可靠性,提供了新的验证框架。
  3. 实验结果显示,自尊的测量可靠性最高,而寻求认可的稳定性较差,强调了不同构建间的模型依赖性和可转移性。

📝 摘要(中文)

大型语言模型(LLMs)在文化文本的注释中越来越受到重视,尤其是在大规模数据处理方面。然而,在将其输出视为潜在社会构建的测量之前,有必要验证这些测量的可靠性。本研究评估了五种LLMs作为零样本注释者对四种在英语歌词中表达的社会构建的可靠性,包括自尊、自我控制、寻求归属感和寻求认可。通过对大量歌词语料库的重复注释,研究了LLM测量的三个属性:重复运行的一致性、模型间的收敛性以及共识标签向监督分类的可转移性。研究结果表明,LLM测量在不同构建间的可靠性并不均匀,自尊的重复测量可靠性最强,而寻求认可则相对不稳定。自我控制和寻求归属感的可靠性介于两者之间,但依赖于模型。下游分类进一步表明,共识LLM标签包含可学习的信号,尽管可转移性本身并不建立构建的有效性。因此,在将LLM注释视为可扩展的文化分析测量之前,应报告重复测量的稳定性和跨模型的收敛性。

🔬 方法详解

问题定义:本研究旨在解决大型语言模型在文化分析中作为注释工具的可靠性问题。现有方法缺乏对模型输出一致性和有效性的系统评估,导致对社会构建的测量结果不够可信。

核心思路:通过对五种大型语言模型进行重复注释,评估其在四种社会构建(自尊、自我控制、寻求归属感和寻求认可)上的性能,建立一个可靠性验证框架,以确保模型输出的有效性。

技术框架:研究采用了对大量歌词语料库的重复注释,分析了模型输出的一致性、模型间的收敛性以及共识标签的可转移性。主要模块包括数据准备、模型注释、结果分析和分类验证。

关键创新:本研究的创新点在于系统性地评估了不同大型语言模型在文化分析中的可靠性,特别是通过重复测量和跨模型比较,揭示了不同社会构建的模型依赖性。

关键设计:在实验中,设置了多次重复注释以确保结果的稳定性,采用了适当的损失函数和评估指标来衡量模型输出的可靠性和有效性,确保了实验的严谨性。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果表明,自尊的重复测量可靠性达到了最高水平,而寻求认可的稳定性较差。自我控制和寻求归属感的可靠性表现出中等水平,且依赖于具体模型。共识LLM标签在下游分类中显示出可学习的信号,进一步验证了模型输出的有效性。

🎯 应用场景

该研究的潜在应用领域包括文化研究、社会科学和心理学等,能够为研究者提供一种新的工具,以大规模分析文化文本中的社会构建。此外,研究结果也为大型语言模型在其他领域的应用提供了重要的可靠性参考,推动了相关技术的发展。

📄 摘要(原文)

Large language models (LLMs) are increasingly used to annotate cultural texts at scales that are impractical for human coders. However, before their outputs are treated as measurements of latent social constructs, it is necessary to establish whether those measurements are reliable. This study evaluates five LLMs as zero-shot annotators of four social constructs expressed in English song lyrics: self-esteem, self-control, seeking belonging, and seeking recognition. Using repeated annotations of a large lyric corpus, we examine three properties of LLM-based measurement: consistency across repeated runs, convergence across models, and transferability of consensus labels to supervised classification. The findings show that LLM-based measurement is not uniformly reliable across constructs. Self-esteem exhibits the strongest repeated-measurement reliability across models, while seeking recognition is generally less stable; self-control and seeking belonging show intermediate but model-dependent reliability. Downstream classification further indicates that consensus LLM labels contain learnable signal, although transferability does not itself establish construct validity. Repeated-measurement stability and cross-model convergence should therefore be reported before LLM annotations are treated as scalable measurements in cultural analytics.