Discovering Knowledge-Critical Subnetworks in Pretrained Language Models
作者: Deniz Bayazit, Negar Foroutan, Zeming Chen, Gail Weiss, Antoine Bosselut
分类: cs.CL, cs.AI, cs.LG
发布日期: 2023-10-04 (更新: 2024-10-15)
备注: EMNLP 2024
💡 一句话要点
提出多目标可微掩蔽方案以发现预训练语言模型中的知识关键子网络
🎯 匹配领域: 支柱三:空间感知与语义 (Perception & Semantics)
关键词: 预训练语言模型 知识表示 可微掩蔽 多目标优化 稀疏网络 知识控制 GPT2
📋 核心要点
- 现有的预训练语言模型难以定位和解耦其内部知识表示,导致知识的可控性不足。
- 论文提出了一种多目标可微掩蔽方案,能够发现并移除特定的知识关键子网络,保持模型的整体性能。
- 实验结果表明,该方法在多个GPT2变体上实现了98%以上的稀疏性,成功抑制了特定知识的表达能力。
📝 摘要(中文)
预训练语言模型(LMs)在其参数中编码了隐含的知识表示。然而,如何定位这些表示并将其相互解耦仍然是一个未解决的问题。本研究探讨了预训练语言模型中是否存在各种知识关键子网络:特定的稀疏计算子图,如果被移除,可以精确抑制模型所记忆的特定知识。我们提出了一种可应用于权重和神经元的多目标可微掩蔽方案,以发现这些子网络,并展示了我们可以利用它们精确移除特定知识,同时最小化对原始模型行为的负面影响。我们在多个GPT2变体上验证了该方法,发现了对表达特定关系知识集合至关重要的高度稀疏子网络(98%以上的稀疏性)。当这些子网络被移除时,剩余网络保持了大部分初始能力,但在表示被抑制的知识时遇到困难。
🔬 方法详解
问题定义:本研究旨在解决如何在预训练语言模型中定位和解耦知识表示的问题。现有方法无法有效识别和移除特定的知识子网络,导致知识的可控性不足。
核心思路:我们提出了一种多目标可微掩蔽方案,通过对权重和神经元进行掩蔽,发现并移除知识关键子网络,从而精确抑制特定知识的表达,同时尽量减少对模型其他能力的影响。
技术框架:该方法包括以下主要模块:首先,通过可微掩蔽技术对模型的权重和神经元进行处理;其次,利用多目标优化策略来识别和评估知识关键子网络;最后,通过实验验证所发现子网络的有效性和稀疏性。
关键创新:本研究的创新点在于提出了一种新的可微掩蔽方案,使得模型能够在保持整体性能的同时,精确地移除特定的知识表示。这一方法与现有的知识移除技术相比,具有更高的灵活性和可控性。
关键设计:在实现过程中,我们设计了特定的损失函数,以平衡知识移除与模型性能之间的关系。同时,采用了高达98%的稀疏性设置,确保了识别出的子网络在表达特定知识时的关键性。通过这些设计,模型在移除特定知识后仍能保持大部分初始能力。
🖼️ 关键图片
📊 实验亮点
实验结果显示,所提出的方法在多个GPT2变体上成功发现了98%以上的稀疏性子网络,这些子网络对特定关系知识的表达至关重要。当这些子网络被移除时,模型在保持大部分初始能力的同时,表现出对被抑制知识的显著困难。这表明该方法在知识控制方面的有效性。
🎯 应用场景
该研究的潜在应用领域包括自然语言处理中的知识控制、模型压缩和可解释性研究。通过识别和移除特定知识子网络,研究者可以更好地理解模型的知识结构,并在特定任务中实现更高的灵活性和可控性。未来,这一方法可能对开发更智能的对话系统和知识驱动的应用产生深远影响。
📄 摘要(原文)
Pretrained language models (LMs) encode implicit representations of knowledge in their parameters. However, localizing these representations and disentangling them from each other remains an open problem. In this work, we investigate whether pretrained language models contain various knowledge-critical subnetworks: particular sparse computational subgraphs that can, if removed, precisely suppress specific knowledge the model has memorized. We propose a multi-objective differentiable masking scheme that can be applied to both weights and neurons to discover such subnetworks and show that we can use them to precisely remove specific knowledge from models while minimizing adverse effects on the behavior of the original model. We demonstrate our method on multiple GPT2 variants, uncovering highly sparse subnetworks (98%+ sparsity) that are critical for expressing specific collections of relational knowledge. When these subnetworks are removed, the remaining network maintains most of its initial abilities but struggles to represent the suppressed knowledge.