Show Me How You Reason and I'll Tell You Who You Are: Reasoning Graphs for Robust LLM Authorship Attribution

📄 arXiv: 2607.14905v1 📥 PDF

作者: Zlata Kikteva, Artur Romazanov, Annette Hautli-Janisz, Ramon Ruiz-Dolz

分类: cs.CL, cs.AI

发布日期: 2026-07-16


💡 一句话要点

提出推理图方法以解决LLM作者归属问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 大型语言模型 作者归属 推理图 图神经网络 论证挖掘 文本检测 鲁棒性 混淆攻击

📋 核心要点

  1. 现有方法主要依赖表层语言特征,容易受到改写和混淆技术的影响,导致LLM作者归属的准确性不足。
  2. 本文提出了一种基于图神经网络的方法,通过提取推理图来分析LLM生成文本,旨在捕捉更复杂的作者信号。
  3. 实验结果表明,所提方法在面对混淆攻击时性能提升高达27个百分点,并在未见模型版本上提升了19个百分点,显示出更强的鲁棒性。

📝 摘要(中文)

随着大型语言模型(LLMs)在各种场景中的广泛应用,LLM生成文本的检测和作者归属问题变得愈发重要。以往的研究主要集中在表层语言特征上,这种方法容易受到改写和其他混淆技术的影响。本文超越了语言表面,提取并分析LLM生成文本中的推理结构,以捕捉更复杂的LLM作者信号。我们提出了一种图神经网络方法,利用通过论证挖掘管道提取的推理图,展示了相较于传统Longformer基线的更强鲁棒性和泛化能力。我们的方案在面对改写和反向翻译等混淆攻击时,性能提升高达27个百分点,并在未见模型版本生成的文本上提升了19个百分点,模拟了新LLM版本持续发布的现实条件。

🔬 方法详解

问题定义:本文旨在解决大型语言模型生成文本的作者归属问题,现有方法的痛点在于其对表层语言特征的依赖,容易受到改写和混淆技术的影响,导致准确性不足。

核心思路:论文的核心解决思路是通过提取和分析LLM生成文本中的推理结构,利用图神经网络来捕捉更复杂的作者信号,从而提高作者归属的准确性和鲁棒性。

技术框架:整体架构包括一个论证挖掘管道用于提取推理图,随后将这些推理图输入到图神经网络中进行分析。主要模块包括推理图提取、图神经网络建模和最终的作者归属判定。

关键创新:最重要的技术创新点在于将推理图的分析引入到LLM作者归属任务中,这与现有方法的表层特征分析形成了本质区别,能够更好地捕捉文本中的深层逻辑关系。

关键设计:在参数设置上,图神经网络的层数和节点数经过优化,损失函数采用了适应性调整的交叉熵损失,以提高模型的训练效果和泛化能力。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果显示,所提方法在面对改写和反向翻译等混淆攻击时,性能提升高达27个百分点。同时,在未见模型版本生成的文本上,准确性提升了19个百分点,显著优于传统Longformer基线,展示了更强的鲁棒性和泛化能力。

🎯 应用场景

该研究的潜在应用领域包括文本生成监测、学术不端检测以及社交媒体内容审核等。通过提高LLM生成文本的作者归属准确性,可以有效防止伪造信息的传播,提升信息的可信度和安全性。未来,该方法有望在不断演进的语言模型环境中保持其有效性,适应新出现的挑战。

📄 摘要(原文)

Given the current trend to employ large language models (LLMs) in almost any imaginable context, LLM-generated text detection and authorship attribution have become a pressing issue. Prior work has primarily focused on surface-level linguistic features, an approach shown to be susceptible to paraphrasing and other obfuscation techniques. In this paper, we go beyond the linguistic surface, extracting and analysing reasoning structures in LLM-generated texts with the goal of capturing more complex signals of LLM authorship. We propose a graph neural network approach that leverages reasoning graphs extracted by an argument mining pipeline, demonstrating improved robustness and generalisation over a traditional Longformer baseline. Our approach outperforms the baseline by up to 27 percentage points under the obfuscation attacks such as paraphrasing and backtranslation, and 19 percentage points when evaluated on the texts generated by the unseen model versions, simulating real-world conditions in which new LLM versions are continuously released.