Large Language Models for Citation Function Classification

📄 arXiv: 2607.17738v1 📥 PDF

作者: Daniel Vodička, Jakub Šmíd, Pavel Král, Christophe Cerisara

分类: cs.CL

发布日期: 2026-07-20

备注: Published at the 15th edition of the Language Resources and Evaluation Conference (LREC 2026)


💡 一句话要点

提出大型语言模型进行引文功能分类以提升文献分析

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 引文功能分类 大型语言模型 文献计量分析 数据集构建 模型比较 微调技术 上下文提取 性能评估

📋 核心要点

  1. 现有的引文功能分类方法在准确性和细粒度分类上存在不足,难以有效区分不同类型的引文。
  2. 本研究提出了一种系统比较多种大型语言模型的方法,并引入了新的数据集AC3,以提升引文功能分类的准确性和细致度。
  3. 微调后的Falcon 7B模型在ACL-ARC数据集上取得73.3%的宏F1分数,较以往方法有显著提升,展示了模型的有效性。

📝 摘要(中文)

引文功能分类在理解科学出版物之间的关系和推动文献计量分析中起着至关重要的作用。本研究对多种最先进的大型语言模型(LLMs)在引文功能分类中的表现进行了全面评估,并在ACL-ARC数据集上取得了新的SOTA结果。我们系统比较了五种模型(Mistral 7B、Orca 2-7B、LLaMA 3.1-8B、Falcon 7B和SciBERT),涵盖零样本、少样本和微调方法。微调后的Falcon 7B模型在ACL-ARC上达到了73.3%的宏F1分数,显著优于以往方法。此外,我们引入了AC3,一个具有七类注释方案的新数据集,区分中性致谢和明确的评估立场。该数据集通过四种上下文提取变体实施,以系统评估上下文范围对分类性能的影响。我们还提供了模型性能、实验配置和局限性的详细分析,以指导未来的研究。

🔬 方法详解

问题定义:本研究旨在解决引文功能分类中的准确性不足和分类细粒度不足的问题。现有方法在识别引文类型时常常无法有效区分中性和评估性引文,导致分析结果不够精确。

核心思路:论文通过系统比较多种大型语言模型在引文功能分类中的表现,提出微调模型以提高分类准确性。同时,引入新数据集AC3,提供更丰富的分类信息。

技术框架:研究的整体架构包括数据集构建、模型选择、训练与微调、性能评估等多个阶段。首先构建AC3数据集,然后选择五种不同的模型进行比较,最后通过不同的训练策略(零样本、少样本、微调)评估模型性能。

关键创新:引入AC3数据集及其七类注释方案是本研究的主要创新点,能够有效区分不同类型的引文,填补了现有研究的空白。此外,系统比较多种SOTA模型的做法也为后续研究提供了参考。

关键设计:在模型训练中,采用了不同的上下文提取策略,以评估上下文范围对分类性能的影响。微调过程中,选择了合适的损失函数和优化器,以确保模型能够有效学习引文的功能特征。具体的参数设置和网络结构细节在论文中进行了详细描述。

🖼️ 关键图片

fig_0
img_1
img_2

📊 实验亮点

本研究的实验结果显示,微调后的Falcon 7B模型在ACL-ARC数据集上达到了73.3%的宏F1分数,显著高于以往方法的表现。这一结果不仅展示了模型的有效性,也为引文功能分类领域设定了新的基准。

🎯 应用场景

该研究的潜在应用领域包括学术文献分析、科研评价和知识图谱构建等。通过提升引文功能分类的准确性,能够更好地理解文献之间的关系,促进科学研究的可持续发展。未来,该方法还可以扩展到其他领域的文本分类任务中,具有广泛的实际价值。

📄 摘要(原文)

Citation function classification plays a crucial role in understanding the relationships between scientific publications and advancing bibliometric analysis. This study presents one of the first comprehensive evaluations of multiple state-of-the-art (SOTA) large language models (LLMs) for citation function classification, achieving new SOTA results on the ACL-ARC dataset. We systematically compare five models (Mistral 7B, Orca 2-7B, LLaMA 3.1-8B, Falcon 7B, and SciBERT) across zero-shot, few-shot, and fine-tuning approaches. Our fine-tuned Falcon 7B model achieves a 73.3% macro F1 score on ACL-ARC, representing a significant improvement over previous methods. Additionally, we introduce AC3, a novel dataset featuring a seven-category annotation scheme that distinguishes between neutral acknowledgments and explicit evaluative stances (more opinion-oriented citations - criticizing, complimenting, contradicting). The dataset is implemented across four context extraction variants to systematically evaluate the impact of contextual scope on classification performance. We also provide detailed analysis of model performance, experimental configurations, and limitations to guide future research in this domain. To our knowledge, this is one of the first studies dedicated to comprehensive model comparison for citation function classification, addressing a gap identified in recent surveys.