Towards Mechanistically Understanding Why Memorized Knowledge Fails to Generalize in Large Language Model Finetuning

📄 arXiv: 2607.08393v1 📥 PDF

作者: Lu Dai, Ziyang Rao, Yili Wang, Hanqing Wang, Hao Liu, Hui Xiong

分类: cs.AI, cs.CL

发布日期: 2026-07-09


💡 一句话要点

提出自修补技术以解决大语言模型微调中的知识使用差距问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 大语言模型 知识-使用差距 自修补技术 微调 泛化能力 推理任务 知识表示 激活位置

📋 核心要点

  1. 核心问题:现有方法在微调大语言模型时,虽然能够快速记忆新知识,但在实际推理任务中却无法有效利用这些知识,导致知识-使用差距。
  2. 方法要点:论文提出了一种自修补技术,通过监测知识在模型内部的渗透动态,识别并重新定位激活位置,以改善泛化性能。
  3. 实验或效果:通过实验验证,提出的策略能够恢复58%至75%的泛化失败的理想头室,显示出显著的性能提升。

📝 摘要(中文)

在微调大语言模型(LLMs)以注入新知识时,面临一个关键挑战:LLMs能够快速记忆新事实,但在下游推理任务中却无法有效使用这些知识。本文将这一现象形式化为“知识-使用差距”,并通过一种新颖的干预技术——自修补,监测知识在模型内部的空间渗透动态。自修补能够识别激活位置,通过重新定位表示显著改善失败的泛化案例。实验结果表明,记忆的表示可能存在于内部,但未能有效路由至计算有效的层。我们设计了一种简单的启发式策略,能够恢复58%至75%的泛化失败的理想头室。

🔬 方法详解

问题定义:本文旨在解决大语言模型微调过程中出现的知识-使用差距问题。现有方法虽然能够快速记忆新知识,但在推理任务中未能有效利用这些知识,导致准确性下降和时间延迟。

核心思路:论文的核心思路是通过自修补技术监测和调整模型内部的知识表示,以改善其在下游任务中的泛化能力。自修补技术能够识别出激活位置,并通过重新定位表示来提升模型的推理效果。

技术框架:整体架构包括微调阶段和自修补阶段。在微调阶段,模型被训练以记忆新知识;在自修补阶段,通过分析激活位置,调整知识的路由,以提高泛化性能。

关键创新:最重要的技术创新点在于自修补技术的提出,它能够有效识别并调整模型内部的知识表示路由,解决了传统方法无法有效利用记忆知识的问题。

关键设计:在技术细节上,论文设计了特定的参数设置和损失函数,以优化知识的激活和路由过程,确保模型能够在计算有效的层中使用记忆的知识。具体的网络结构和参数设置在实验部分进行了详细描述。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果表明,采用自修补技术后,模型在泛化失败的情况下能够恢复58%至75%的理想头室,相较于基线方法显示出显著的性能提升。这一发现为理解和改善大语言模型的知识使用提供了新的视角。

🎯 应用场景

该研究的潜在应用领域包括自然语言处理、智能问答系统和对话生成等。通过改善大语言模型的知识使用能力,可以显著提升这些系统在实际应用中的推理性能和用户体验,具有重要的实际价值和未来影响。

📄 摘要(原文)

Fine-tuning LLMs to inject new knowledge faces a critical challenge: LLMs can quickly memorize new facts, yet fail to use them for downstream reasoning tasks. We formalize this failure as the \textit{\textbf{Knowing--Using Gap}}, characterized by an accuracy gap and a temporal lag between memorization and generalization. To understand this phenomenon, we fine-tune LLMs with unseen knowledge and monitor the spatial permeation dynamics of the knowledge internally using a novel intervention technique called self-patching. Self-patching identifies activation locations where relocating representations substantially improves failed generalization cases. These results are consistent with a knowledge-circuit misalignment hypothesis: memorized representations can exist internally but may not be routed to computation-effective layers. To demonstrate the practicality of this diagnostic finding, we design a simple heuristic strategy which recovers 58--75\% of the oracle headroom in generalization failure. Experiments are done cross-domain for the robustness of this finding.