Rebalancing Token Importance in Language Models with TF-IDF Weighted Cross-Entropy Loss
作者: Zhijian Li, Stefan Larson, Kevin Leach
分类: cs.CL, cs.LG
发布日期: 2026-09-10
💡 一句话要点
提出TF-IDF加权交叉熵损失以解决语言模型记忆问题
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 语言模型 TF-IDF 交叉熵损失 记忆减轻 自然语言处理 模型训练 深度学习
📋 核心要点
- 现有语言模型训练中,均匀标记加权导致低信息标记主导学习,增加记忆倾向。
- 本文提出TF-IDF加权的交叉熵损失,强调语义信息丰富的标记,降低普遍标记权重。
- 实验结果显示,TF-IDF在LoRA微调下平均减少14%子字符串记忆长度,TinyLLaMA 1.1B下达到58%。
📝 摘要(中文)
大型语言模型通常在均匀的标记加权下进行训练,这使得频繁且低信息的标记主导学习,增加了记忆表面文本片段的倾向。为此,本文提出了一种信息加权的交叉熵损失,通过TF-IDF统计重新调整标记级别的贡献,强调语义信息丰富的标记,同时降低普遍标记的权重。在对五个解码器仅模型(参数从1.1B到13B)进行的实验中,发现记忆的子字符串长度一致减少,同时保持了困惑度和下游任务性能。在LoRA微调下,TF-IDF在所有五个模型中平均减少了14%的子字符串记忆长度;在TinyLLaMA 1.1B的全权重微调下,减少幅度达到58%。该方法与架构无关,可以在现有训练管道中以不到3%的计算开销集成,提供了一种轻量且原则性的方法来减轻记忆问题,而不干扰标准训练动态。
🔬 方法详解
问题定义:本文旨在解决大型语言模型在训练过程中由于均匀标记加权导致的低信息标记主导学习的问题。这种现象不仅增加了模型对表面文本的记忆倾向,还可能影响模型的泛化能力。
核心思路:论文提出了一种基于TF-IDF统计的加权交叉熵损失函数,通过重新调整标记的贡献,强调语义信息丰富的标记,从而减轻低信息标记的影响。这样的设计旨在提高模型对有意义信息的学习能力。
技术框架:整体方法包括三个主要模块:首先,计算每个标记的TF-IDF权重;其次,基于这些权重调整交叉熵损失;最后,将加权损失应用于模型训练中。该方法可以与现有的训练管道无缝集成。
关键创新:最重要的创新点在于引入TF-IDF加权机制,使得模型在训练时能够更关注语义信息丰富的标记,而不是频繁出现的低信息标记。这种方法与传统的均匀加权方法本质上不同,能够有效减轻记忆问题。
关键设计:在损失函数的设计中,TF-IDF权重被用来调整每个标记的贡献度,确保信息丰富的标记在训练中占据更大比重。此外,该方法的计算开销低于3%,使其在实际应用中具有较高的可行性。
🖼️ 关键图片
📊 实验亮点
实验结果表明,TF-IDF加权方法在LoRA微调下平均减少了14%的子字符串记忆长度,而在TinyLLaMA 1.1B的全权重微调中,减少幅度达到58%。这些结果显示了该方法在减轻记忆问题方面的显著效果,同时保持了模型的困惑度和下游任务性能。
🎯 应用场景
该研究的潜在应用领域包括自然语言处理、对话系统和文本生成等。通过减轻模型的记忆倾向,提升模型的泛化能力和理解深度,能够在实际应用中提高用户体验和系统性能。未来,该方法可能会推动更高效的语言模型训练策略的发展。
📄 摘要(原文)
Large language models are typically trained under uniform token weighting, which allows frequent and low-information tokens to dominate learning and can increase the tendency to memorize surface-level text spans. To address this, we present an information-weighted cross-entropy loss that rescales token-level contributions using TF-IDF statistics, emphasizing semantically informative tokens while down-weighting ubiquitous ones. Experiments on five decoder-only LLMs ranging from 1.1B to 13B parameters show consistent reductions in memorized substring length while preserving perplexity and downstream task performance. Under LoRA fine-tuning, TF-IDF reduces average substring memorization length by 14% across all five models. Under full-weight fine-tuning on TinyLLaMA 1.1B, the reduction reaches 58%. Our approach is architecture-agnostic and can be incorporated into existing training pipelines with less than 3% computational overhead, offering a lightweight and principled way to mitigate memorization without disrupting standard training dynamics.