Structural Process Supervision for Latent Chain-of-Thought Reasoning

📄 arXiv: 2609.09928v1 📥 PDF

作者: Yiqi Li, Xu Chen, Chen Ju, Jiangchao Yao, Zhaoyang Li, Jinsong Lan, Xiaoyong Zhu, Bo Zheng, Yu Wang

分类: cs.AI

发布日期: 2026-09-09


💡 一句话要点

提出原型介导过程监督以解决潜在推理中的信息分布不均问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 潜在推理 过程监督 原型介导 信息分布 深度学习 自然语言处理 模型训练

📋 核心要点

  1. 现有潜在推理方法缺乏对嵌入的过程监督,导致信息分布不均和表示崩溃。
  2. 本文提出原型介导过程监督(PMPS),通过引入可学习的推理原型提供结构化监督。
  3. 实验表明,PMPS在GSM8K-Aug数据集上将输出令牌长度压缩至50%以下,并在准确率上超越现有方法。

📝 摘要(中文)

潜在推理方法通过用紧凑的连续空间嵌入替代冗长的显式思维链(CoT)标记,提升了令牌级效率和鲁棒性。然而,现有方法缺乏对这些潜在嵌入的直接过程监督,导致表示崩溃和信息分布不均。为此,本文提出了原型介导过程监督(PMPS),引入可学习的推理原型作为语义锚点,为潜在推理提供结构化的过程级监督。PMPS将潜在嵌入和显式CoT嵌入投影到共享原型空间,实现不等长表示之间的多对多软对齐。同时,本文引入了渐进序列对齐(PSA)模块进一步指导训练:位置先验最初鼓励顺序对齐结构,然后逐渐放宽以允许自适应匹配。实验结果表明,PMPS将输出令牌长度压缩至显式CoT的50%以下,并在不同模型系列中相比于领先基线SIM-CoT平均提高了2.08%的准确率。

🔬 方法详解

问题定义:本文旨在解决现有潜在推理方法中缺乏过程监督的问题,这导致了信息分布不均和表示崩溃,影响了推理的有效性和准确性。

核心思路:提出原型介导过程监督(PMPS),通过引入可学习的推理原型作为语义锚点,为潜在推理提供结构化的过程级监督,从而改善嵌入的表示质量和信息分布。

技术框架:PMPS的整体架构包括两个主要模块:首先是将潜在嵌入和显式CoT嵌入投影到共享原型空间,实现多对多的软对齐;其次是渐进序列对齐(PSA)模块,初期通过位置先验引导顺序对齐,随后逐步放宽以支持自适应匹配。

关键创新:PMPS的核心创新在于引入可学习的推理原型作为监督信号,与现有方法相比,PMPS通过结构化的过程监督显著提升了潜在推理的效果,避免了信息的崩溃和分布不均。

关键设计:在设计中,PMPS采用了多对多的软对齐机制,确保不同长度的嵌入能够有效对齐;同时,PSA模块的逐步放宽设计使得模型在训练过程中能够灵活适应不同的匹配需求。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果显示,PMPS在GSM8K-Aug数据集上将输出令牌长度压缩至显式CoT的50%以下,并在不同模型系列中相比于基线SIM-CoT平均提高了2.08%的准确率。在GPT-2模型上,PMPS甚至超越了CoT-SFT,展现出在更大模型和更具挑战性任务中的优越性能。

🎯 应用场景

该研究的潜在应用领域包括自然语言处理、智能问答系统和自动推理等。通过提升潜在推理的效率和准确性,PMPS可以为各种智能系统提供更强的推理能力,进而推动人工智能在复杂任务中的应用和发展。

📄 摘要(原文)

Latent reasoning approaches enhance token-level efficiency and robustness by replacing verbose, explicit chain-of-thought (CoT) tokens with compact continuous-space embeddings. However, existing methods lack direct process supervision over these latent embeddings, which often leads to representation collapse and uneven information distribution. To address this, we propose Prototype-Mediated Process Supervision (PMPS), which introduces learnable reasoning prototypes as semantic anchors to provide structural process-level supervision for latent reasoning. PMPS projects latent embeddings and explicit CoT embeddings into a shared prototype space, achieving many-to-many soft alignment between unequal-length representations through prototype assignment. Meanwhile, we introduce a Progressive Sequential Alignment (PSA) module to further guide training: positional priors initially encourage sequential alignment structure, then gradually relax to permit adaptive matching. Experimental results show that PMPS compresses output token length to under 50% of explicit CoT on GSM8K-Aug. Compared to leading baseline SIM-CoT, our method achieves average accuracy gains of 2.08% across different model families. On GPT-2, PMPS even surpasses CoT-SFT. On larger models and a more challenging task, PMPS consistently attains the highest accuracy among all latent reasoning methods with comparable output length.