Where Animacy Lives in Large Language Models: Tracing the Circuits of the Animacy Concept

📄 arXiv: 2607.20995v1 📥 PDF

作者: Samuele Punzo, Giovanni Cinà, Sandro Pezzelle

分类: cs.CL

发布日期: 2026-07-23


💡 一句话要点

提出一种方法以追踪大型语言模型中的生动性概念

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 生动性概念 大型语言模型 因果机制 电路发现 自然语言处理

📋 核心要点

  1. 现有的大型语言模型在处理生动性概念时面临挑战,尤其是在复杂的上下文和选择约束方面。
  2. 论文通过构建受控数据集并进行电路发现,提出了一种追踪生动性概念的因果机制的方法。
  3. 实验结果表明,发现的生动性电路存在于模型中,但其局部性较低,且在不同任务间的泛化能力有限。

📝 摘要(中文)

在书面语言中区分生动与非生动概念不仅需要浅层文本处理,还涉及复杂的选择约束和上下文线索,如动词-论元交互。当前的大型语言模型(LLMs)似乎能够做到这一点。我们研究了LLMs的生动性敏感行为是否可以追溯到一组局部的因果相关组件和连接。为此,我们构建了一个最小对的受控数据集,并对四个开放权重模型进行了电路发现。通过深入实验和消融,我们证明了这些模型中确实存在一个处理生动性的因果机制,从而发现了一个生动性电路。同时,这个电路的局部性较其他已知电路低,并且在模型和生动性任务之间的泛化仅部分有效,确认了生动性概念的分布式、依赖上下文和某种程度的渐进特性。

🔬 方法详解

问题定义:论文要解决的问题是如何在大型语言模型中有效识别和处理生动性概念,现有方法在处理复杂的上下文和选择约束时存在不足。

核心思路:论文的核心思路是通过构建受控数据集和进行电路发现,识别出与生动性相关的因果机制,从而深入理解模型的内部工作原理。

技术框架:整体架构包括数据集构建、模型选择、实验设计和电路发现四个主要模块。首先构建最小对数据集,然后在四个开放权重模型上进行实验,最后进行电路发现以识别生动性电路。

关键创新:最重要的技术创新点在于发现了一个生动性电路,该电路在模型中并不局限于特定区域,而是表现出分布式和上下文依赖的特性,这与现有方法的局部性特征形成对比。

关键设计:在实验中,使用了多种模型架构和参数设置,损失函数设计上考虑了生动性相关的选择约束,确保电路发现的有效性和可靠性。实验还包括消融研究,以验证不同组件对生动性识别的贡献。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果显示,所发现的生动性电路在处理生动性任务时表现出显著的因果机制,尽管其局部性较低,但在不同模型间的泛化能力部分有效。这一发现为理解大型语言模型的内部机制提供了新的视角。

🎯 应用场景

该研究的潜在应用领域包括自然语言处理、智能对话系统和人机交互等。通过更好地理解生动性概念,模型可以在更复杂的语言环境中做出更准确的判断,从而提升用户体验和交互质量。未来,该研究可能推动更智能的语言理解系统的发展。

📄 摘要(原文)

Distinguishing animate from inanimate concepts in written language requires more than shallow text processing, as it involves recognizing complex selectional constraints and contextual cues, such as verb-argument interactions. Yet, current large language models (LLMs) appear to be capable of doing it. We investigate whether this animacy-sensitive behavior of LLMs can be traced to a localized set of causally relevant components and connections. To do so, we construct a controlled dataset of minimal pairs and perform circuit discovery on four open-weight models. Through in-depth experiments and ablations, we show that a causal mechanism responsible for handling animacy in these models does exist, thus discovering an animacy circuit. At the same time, this circuit appears to be less localized compared to other known ones and generalizes only partially across models and animacy tasks, confirming the distributed, context-dependent, and somewhat graded nature of the animacy concept.