Roles of Scaling and Instruction Tuning in Language Perception: Model vs. Human Attention

📄 arXiv: 2310.19084v1 📥 PDF

作者: Changjiang Gao, Shujian Huang, Jixing Li, Jiajun Chen

分类: cs.CL, cs.AI

发布日期: 2023-10-29


💡 一句话要点

探讨规模与指令调优在语言感知中的作用

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 大型语言模型 自注意力机制 指令调优 语言感知 眼动追踪 模型比较 人类注意力

📋 核心要点

  1. 现有大型语言模型在语言感知方面的表现受限于规模和指令调优的影响,但具体机制尚不清晰。
  2. 本研究通过比较不同规模的LLMs自注意力与人类眼动轨迹,探讨规模和指令调优对语言感知的影响。
  3. 实验结果显示,规模提升了模型的有效注意力,而指令调优增强了模型对指令的敏感性,但未改善语言感知质量。

📝 摘要(中文)

近年来,大型语言模型(LLMs)展现了强大的自然语言理解能力。尽管它们大多采用相同的基本结构(即变换器块),但规模和指令调优对其成功的影响尚不明确。本研究比较了几种现有LLMs(LLaMA、Alpaca和Vicuna)在不同规模(7B、13B、30B、65B)下的自注意力机制,并与人类阅读注意力的眼动轨迹进行对比,以评估规模和指令调优对语言感知的影响。结果表明,规模增强了模型与人类的相似性,并通过减少对琐碎模式的依赖提高了有效注意力,而指令调优则没有此效果,但显著增强了模型对指令的敏感性。此外,当前LLMs在注意力方面始终更接近非母语者而非母语者,表明所有模型的语言感知均处于次优状态。相关代码和数据已在GitHub上公开。

🔬 方法详解

问题定义:本研究旨在探讨规模和指令调优如何影响大型语言模型的语言感知能力,现有方法未能明确这些因素的具体作用。

核心思路:通过比较不同规模的LLMs的自注意力机制与人类的眼动轨迹,分析规模和指令调优对模型语言感知的影响。

技术框架:研究采用了多种LLMs(如LLaMA、Alpaca和Vicuna),在不同参数规模下进行自注意力分析,并与人类眼动数据进行对比。

关键创新:本研究首次系统性地揭示了规模对模型有效注意力的提升作用,并指出指令调优对模型语言感知的影响有限。

关键设计:在实验中,设置了不同规模的模型(7B、13B、30B、65B),并使用眼动追踪技术获取人类阅读注意力数据,以进行对比分析。实验结果通过定量指标评估模型与人类的相似性。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果表明,随着模型规模的增加,其有效注意力显著提升,且与人类的注意力模式更为接近。指令调优虽然未改善语言感知质量,但显著提高了模型对指令的敏感性,表明在实际应用中需重视指令调优的设计。

🎯 应用场景

该研究为大型语言模型的设计与优化提供了重要的理论依据,尤其是在教育、翻译和人机交互等领域具有广泛的应用潜力。通过理解模型的语言感知机制,可以进一步提升其在实际应用中的表现和用户体验。

📄 摘要(原文)

Recent large language models (LLMs) have revealed strong abilities to understand natural language. Since most of them share the same basic structure, i.e. the transformer block, possible contributors to their success in the training process are scaling and instruction tuning. However, how these factors affect the models' language perception is unclear. This work compares the self-attention of several existing LLMs (LLaMA, Alpaca and Vicuna) in different sizes (7B, 13B, 30B, 65B), together with eye saccade, an aspect of human reading attention, to assess the effect of scaling and instruction tuning on language perception. Results show that scaling enhances the human resemblance and improves the effective attention by reducing the trivial pattern reliance, while instruction tuning does not. However, instruction tuning significantly enhances the models' sensitivity to instructions. We also find that current LLMs are consistently closer to non-native than native speakers in attention, suggesting a sub-optimal language perception of all models. Our code and data used in the analysis is available on GitHub.