Cross-Tokenizer On-Policy Distillation via Byte-Prefix Marginalization

📄 arXiv: 2607.22334v1 📥 PDF

作者: Hao Wang, Kun Yuan, Wenlin Zhong, Minglei Zhang, Han Xiao, Ming Sun, Honggang Qi

分类: cs.LG, cs.AI, cs.CL

发布日期: 2026-07-24

备注: Project page: https://bpm-opd.github.io/


💡 一句话要点

提出字节前缀边际化方法以解决跨分词器蒸馏问题

🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture)

关键词: 字节前缀边际化 跨分词器蒸馏 在线蒸馏 语言模型 自然语言处理 模型整合

📋 核心要点

  1. 现有的跨分词器蒸馏方法在处理教师模型和学生模型之间的标记分配时存在信息丢失和不匹配的问题。
  2. 本文提出的字节前缀边际化(BPM)方法通过在共享字节空间中重新表达教师的标记分布,解决了跨分词器蒸馏中的信息丢失问题。
  3. 在多个数学和编程基准测试中,BPM方法在性能上超越了现有的跨分词器方法,平均提升了3.7-6.6个基准点。

📝 摘要(中文)

不同家族的开放权重语言模型展现出互补能力,促使通过在线蒸馏(OPD)将其整合为紧凑的学生模型。然而,现有的全词汇OPD通常假设共享分词器,而现有的跨分词器方法可能会丢失教师概率质量或将其分配给内容无关的学生标记。本文提出字节前缀边际化(BPM),在共享字节空间中重新表达教师的下一个标记分布。BPM将每个教师标记的概率分配给字节表示为教师标记字节前缀的最长学生标记,聚合映射到相同学生标记的质量,并将未匹配的质量放入显式残差类别。实验表明,BPM在多个基准测试中均优于现有跨分词器方法,显著提升了性能。

🔬 方法详解

问题定义:本文旨在解决现有跨分词器蒸馏方法在教师模型和学生模型之间的标记分配时可能导致的信息丢失和不匹配问题。现有方法通常假设共享分词器,导致无法有效利用教师模型的概率质量。

核心思路:提出字节前缀边际化(BPM)方法,通过在共享字节空间中重新表达教师的下一个标记分布,确保教师标记的概率能够有效地映射到学生标记上,从而保留更多的信息。

技术框架:BPM方法首先将教师标记的概率分配给字节表示为教师标记字节前缀的最长学生标记,然后聚合映射到相同学生标记的质量,最后将未匹配的质量放入显式的残差类别。

关键创新:BPM的核心创新在于其字节前缀映射机制,能够在不丢失信息的情况下实现教师和学生之间的有效对接。这一方法在处理教师标记跨越多个学生标记的情况时,仍能保持质量的保留。

关键设计:BPM方法的设计包括对教师标记的概率进行聚合,并在未匹配的情况下引入显式残差类别。此外,BPM在训练过程中使用了质量保留的链式因子化下界,以确保在大多数训练位置(超过99%)下的有效性。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果显示,BPM方法在Qwen3-32B、GLM-Z1-9B-0414和MiniMax-M2.7作为教师模型的情况下,均在六个数学和编程基准测试中超越了现有的跨分词器方法,平均提升了3.7-6.6个基准点,展现出显著的性能优势。

🎯 应用场景

该研究的潜在应用领域包括自然语言处理、机器翻译和编程语言理解等。通过有效整合不同模型的能力,BPM方法能够提升多种任务的性能,具有重要的实际价值和广泛的应用前景。

📄 摘要(原文)

Open-weight language models from different families exhibit complementary capabilities, motivating their consolidation into a compact student through on-policy distillation (OPD). However, full-vocabulary OPD typically assumes a shared tokenizer, while existing cross-tokenizer methods may discard teacher probability mass or assign it to student tokens with unrelated content. We introduce Byte-Prefix Marginalization (BPM), which re-expresses the teacher's next-token distribution over the student vocabulary in a shared byte space. Specifically, BPM assigns each teacher token's probability to the longest student token whose byte representation is a prefix of the teacher token's bytes, aggregates mass mapped to the same student token, and places otherwise unmatched mass in an explicit residual category. This produces a vocabulary-complete, byte-aligned, and mass-preserving target for dense OPD. The target exactly recovers the teacher-induced byte-prefix marginal when the relevant prefix does not span multiple teacher tokens (a condition satisfied at more than 99% of training positions) and uses a mass-preserving, chain-factorized lower bound otherwise. Across Qwen3-32B, GLM-Z1-9B-0414, and MiniMax-M2.7 as teachers, BPM consistently outperforms current cross-tokenizer methods on six mathematics and programming benchmarks, improving six-benchmark avg@8 by 3.7-6.6 points over the strongest baselines.