Large language models for aspect-based sentiment analysis

📄 arXiv: 2310.18025v1 📥 PDF

作者: Paul F. Simmering, Paavo Huoviala

分类: cs.CL, cs.AI

发布日期: 2023-10-27


💡 一句话要点

利用大型语言模型提升基于方面的情感分析性能

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 大型语言模型 情感分析 微调 方面提取 性能评估

📋 核心要点

  1. 现有的情感分析方法在处理复杂的方面情感时存在性能不足和高成本问题。
  2. 论文通过评估大型语言模型在ABSA任务中的表现,提出了微调GPT-3.5作为解决方案。
  3. 实验结果显示,微调后的GPT-3.5在特定任务上取得了83.8的F1分数,显著提升了性能。

📝 摘要(中文)

大型语言模型(LLMs)提供了前所未有的文本生成能力,能够承担多种角色。本文评估了GPT-4和GPT-3.5在零样本、少样本和微调设置下的基于方面的情感分析(ABSA)任务的表现。微调后的GPT-3.5在SemEval-2014任务4的联合方面术语提取和极性分类任务中实现了83.8的最新F1分数,较InstructABSA提高了5.7%。然而,这一成果伴随着1000倍的模型参数增加和更高的推理成本。我们讨论了不同模型的成本性能权衡,并分析了它们的典型错误。结果表明,详细的提示在零样本和少样本设置中能提高性能,但对于微调模型并非必要。这些证据对面临提示工程与微调选择的从业者具有重要意义。

🔬 方法详解

问题定义:本文旨在解决基于方面的情感分析(ABSA)任务中现有方法的性能不足和高推理成本问题。现有模型在处理复杂情感时常常面临准确性和效率的挑战。

核心思路:论文提出通过微调大型语言模型(GPT-3.5)来提升ABSA任务的性能,利用其强大的文本生成能力来改善情感分类和方面提取的效果。

技术框架:整体架构包括数据预处理、模型微调和性能评估三个主要阶段。首先对数据进行清洗和标注,然后在特定任务上对模型进行微调,最后通过标准评估指标进行性能测试。

关键创新:最重要的技术创新在于微调GPT-3.5模型,使其在ABSA任务上达到最新的F1分数83.8,显著优于现有的InstructABSA方法,且在处理复杂情感时表现出更高的准确性。

关键设计:在微调过程中,采用了特定的损失函数和参数设置,以优化模型在情感分类和方面提取上的表现。模型的参数量增加至1000倍,尽管推理成本上升,但性能的提升是显著的。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果显示,微调后的GPT-3.5在SemEval-2014任务4中实现了83.8的F1分数,相较于InstructABSA提高了5.7%。尽管模型参数增加了1000倍,推理成本显著上升,但性能提升的幅度表明了微调的重要性。

🎯 应用场景

该研究的潜在应用领域包括社交媒体分析、客户反馈处理和市场情报等。通过提升情感分析的准确性,企业能够更好地理解消费者情绪,从而优化产品和服务。未来,该技术还可能扩展到多语言情感分析和实时情感监测等领域,具有广泛的实际价值。

📄 摘要(原文)

Large language models (LLMs) offer unprecedented text completion capabilities. As general models, they can fulfill a wide range of roles, including those of more specialized models. We assess the performance of GPT-4 and GPT-3.5 in zero shot, few shot and fine-tuned settings on the aspect-based sentiment analysis (ABSA) task. Fine-tuned GPT-3.5 achieves a state-of-the-art F1 score of 83.8 on the joint aspect term extraction and polarity classification task of the SemEval-2014 Task 4, improving upon InstructABSA [@scaria_instructabsa_2023] by 5.7%. However, this comes at the price of 1000 times more model parameters and thus increased inference cost. We discuss the the cost-performance trade-offs of different models, and analyze the typical errors that they make. Our results also indicate that detailed prompts improve performance in zero-shot and few-shot settings but are not necessary for fine-tuned models. This evidence is relevant for practioners that are faced with the choice of prompt engineering versus fine-tuning when using LLMs for ABSA.