UltraX: Refining Pre-Training Data at Scale with Adaptive Programmatic Editing
作者: Xinlong Zhao, Dongsheng Liu, Hengyu Zhao, Zixuan Fu, Zheng Wang, Jie Cai, Jie Zhou, Qiang Ma, Xuanhe Zhou, Xu Han, Yudong Wang, Zhiyuan Liu
分类: cs.CL, cs.AI
发布日期: 2026-07-09
💡 一句话要点
提出UltraX以解决大规模预训练数据编辑效率和质量问题
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 大规模数据处理 语言模型 数据精炼 程序监督 实例级编辑 文本生成 自然语言处理
📋 核心要点
- 现有方法在大规模数据处理时面临质量、效率和可靠性不足的问题,限制了大型语言模型的提升。
- UltraX通过引入插入操作,构建了一个函数调用精炼框架,实现了细粒度的实例级编辑,提升了数据质量。
- 实验结果显示,UltraX在所有语料库上平均性能最高,并在使用更少训练令牌的情况下超越基线,展现出更强的数据效率。
📝 摘要(中文)
随着可用训练数据接近物理极限,扩展法则带来的收益开始减小。因此,提升大型语言模型(LLMs)现在更依赖于高质量数据的利用。然而,在大规模语料库的背景下,现有的精炼方法在质量、效率和可靠性方面面临重大限制。为了解决这些挑战,本文提出了UltraX,一个针对大规模预训练数据的函数调用精炼框架,通过引入插入操作,完成了编辑功能空间的扩展,实现了细粒度实例级编辑。UltraX构建了一个可靠的程序监督生成管道,通过数据集自适应提示优化引导专家LLM生成高质量的精炼文本,并通过行对齐映射和动态上下文替换将原始-精炼文本对转换为结构化程序监督。实验表明,UltraX在所有语料库上实现了最高的平均性能,并且在训练令牌数量较少的情况下也能匹配或超越基线,展现出更强的数据效率和精炼可靠性。
🔬 方法详解
问题定义:本文旨在解决现有大规模预训练数据精炼方法在质量、效率和可靠性方面的不足。现有的基于规则的方法受限于固定启发式,难以处理实例级变异,而基于LLM的方法虽然提升了质量,但在大规模数据处理时效率和可靠性不足。
核心思路:UltraX的核心思路是通过引入插入操作,扩展编辑功能空间,实现细粒度的实例级编辑。该框架通过构建可靠的程序监督生成管道,提升数据的质量和稳定性。
技术框架:UltraX的整体架构包括数据集自适应提示优化、专家LLM生成高质量文本、行对齐映射和动态上下文替换等模块。该框架通过组合操作实现低置信度示例过滤和比例控制采样,确保训练分布的稳定性。
关键创新:UltraX的主要创新在于引入了插入操作,完成了编辑功能的扩展,与现有方法相比,能够实现更细粒度的编辑和更高的质量控制。
关键设计:在设计中,UltraX采用了滑动窗口预测、全局操作聚合和系统后处理等技术,以规范化和验证模型输出,提升大规模执行的稳定性和可靠性。
🖼️ 关键图片
📊 实验亮点
实验结果表明,UltraX在所有语料库上实现了最高的平均性能,并且在使用更少的训练令牌时,能够匹配或超越现有基线,展现出数据效率和精炼可靠性的显著提升。
🎯 应用场景
UltraX的研究成果在多个领域具有潜在应用价值,包括自然语言处理、文本生成和数据清洗等。通过提升大规模数据的质量和编辑效率,UltraX能够为语言模型的训练提供更高质量的输入数据,进而推动智能系统的性能提升。
📄 摘要(原文)
As available training data approaches its physical limit, gains from Scaling Laws have begun to diminish. Consequently, improving Large Language Models (LLMs) now depends less on data expansion and more on higher-quality data utilization. However, in the context of large-scale corpora, existing refinement methodologies face significant limitations in quality, efficiency, and reliability: Rule-based approaches are constrained by fixed heuristics and struggle with instance-level variations; LLM-based approaches improve quality but fail to meet the efficiency and reliability requirements of large-scale data processing. To address these challenges, we propose UltraX, a function-calling refinement framework for large-scale pre-training data that completes the editing function space by introducing insertion in addition to deletion and modification, enabling fine-grained instance-level editing. Specifically, UltraX builds a reliable program-supervision generation pipeline. In this pipeline, dataset-adaptive prompt optimization first guides an expert LLM to produce high-quality end-to-end refined texts, and Line Alignment Mapping and Dynamic Context Replacement then convert original-refined text pairs into structured program supervision. Meanwhile, UltraX improves supervision quality and stabilizes the training distribution with low-confidence example filtering and ratio-controlled sampling by operation combination. During inference and execution, it normalizes and validates model outputs through sliding-window prediction, global operation aggregation, and systematic post-processing, improving the stability and reliability of large-scale execution. Experiments show that UltraX achieves the highest average performance across all corpora and also matches or surpasses baselines with fewer training tokens, demonstrating stronger data efficiency and refinement reliability.