PPL-Factory: Task-Aware and Budget-Aware Data Selection from Language Modeling to Reasoning

📄 arXiv: 2607.18199v1 📥 PDF

作者: Hang Zhang, Warren J. Gross

分类: cs.CL, cs.LG

发布日期: 2026-07-20

备注: 13 pages, 4 figures, 5 tables


💡 一句话要点

提出PPL-Factory以解决数据选择中的任务感知与预算感知问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 数据选择 语言模型 困惑度 任务感知 预算感知 微调 机器学习 自然语言处理

📋 核心要点

  1. 现有数据选择方法多依赖固定标准,难以适应不同下游任务的需求,导致效率低下。
  2. PPL-Factory通过结合任务感知的困惑度评分与预算感知的选择标准,提供了一种新的数据选择框架。
  3. 在GSM8K数据集上,PPL-Factory在使用10%数据时,准确率比全数据微调高出0.9,显示出显著的性能提升。

📝 摘要(中文)

并非所有训练样本对大型语言模型的微调都有同等贡献。选择有信息量的训练样本可以降低计算成本,同时保持下游性能。现有的数据选择方法多依赖于间接启发式,如数据质量、多样性或推理轨迹长度。然而,这些固定标准的有效性依赖于具体任务,且难以在多样的下游任务中推广。基于困惑度的数据选择提供了一种简单且模型感知的解决方案来估计样本难度,但现有方法通常对整个训练序列进行评分,忽略了语言建模和推理任务学习目标的差异。本文提出了PPL-Factory,一个简单且可解释的数据选择框架,结合了任务感知的困惑度评分和数据预算感知的选择标准。实验结果表明,PPL-Factory在仅使用1%的训练集时优于其他最先进的数据选择方法。

🔬 方法详解

问题定义:本文旨在解决现有数据选择方法在不同下游任务中适应性不足的问题,尤其是如何有效选择对模型微调贡献最大的训练样本。现有方法多依赖于固定的启发式标准,难以在多样化任务中保持有效性。

核心思路:PPL-Factory的核心思路是结合任务感知的困惑度评分与预算感知的选择标准,旨在通过更精确的样本选择来提高微调效率和效果。通过这种设计,模型能够更好地适应不同任务的需求,提升选择的有效性。

技术框架:PPL-Factory的整体架构包括两个主要模块:任务感知的困惑度评分模块和预算感知的选择标准模块。前者用于评估样本的难度,后者则根据可用的计算预算来选择样本。

关键创新:PPL-Factory的创新在于其将任务感知与预算感知结合起来,形成了一种新的数据选择策略。这与现有方法的本质区别在于,后者通常只关注单一标准,未能综合考虑任务特性和资源限制。

关键设计:在设计上,PPL-Factory采用了基于困惑度的评分机制,能够动态评估样本的学习难度。此外,选择标准的设置考虑了训练预算,使得在有限资源下仍能实现最佳性能。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

在GSM8K数据集上,PPL-Factory在仅使用1%的训练集时,表现优于其他最先进的数据选择方法。使用10%的数据时,PPL-Factory的准确率比全数据微调高出0.9,而在MATH数据集上则高出4.8,显示出显著的性能提升。

🎯 应用场景

PPL-Factory的研究成果在多个领域具有潜在应用价值,尤其是在需要高效训练的自然语言处理任务中。通过优化数据选择过程,该方法能够显著降低计算资源消耗,同时保持模型性能,适用于大规模语言模型的微调和其他机器学习任务。

📄 摘要(原文)

Not all training samples contribute equally to large language model fine-tuning. Selecting informative training samples can reduce the computational cost while preserving downstream performance. Many existing data selection methods rely on indirect heuristics, such as data quality, diversity or reasoning trace length. However, the effectiveness of these fixed criteria is task-dependent and difficult to generalize across diverse downstream tasks. Perplexity-based data selection provides a simple and model-aware solution to estimate the sample difficulty, but existing approaches typically score the entire training sequence and ignore the difference in learning objectives of language modeling and reasoning tasks. In this paper, we propose PPL-Factory, a simple and interpretable data selection framework that combines task-aware perplexity-based scores and data budget-aware selection criteria. Experiments on GSM8K demonstrate that PPL-Factory outperforms other state-of-the-art data selection methods using only $1\%$ of the training set. With $10\%$ of the data, PPL-Factory exceeds full-data fine-tuning accuracy by 0.9 on GSM8K and 4.8 on MATH. Overall, our results demonstrate that task-aware and budget-aware perplexity-based selection provides an effective and applicable approach for efficient fine-tuning.