Post-Training Shifts Confidence: A Three-Stage Analysis of How SFT, RL, and OPD Shape Pre-, Intra-, and Post-CoT Calibration
作者: Shuhao Li, Guodong Du, Anhao Zhao, Wanyu Lin, Tianyu Yuan, Xiaoyu Shen
分类: cs.CL
发布日期: 2026-07-15
🔗 代码/项目: GITHUB
💡 一句话要点
提出PosConf以优化推理模型的信心校准问题
🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture) 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 信心校准 推理模型 强化学习 监督微调 在线蒸馏 位置感知 数学推理 答案聚合
📋 核心要点
- 现有的后训练方法主要通过最终答案的准确性进行评估,忽视了推理过程中的信心变化。
- 提出了一个三阶段的校准框架,评估推理过程中的信心,并引入PosConf策略以优化信心的使用。
- 实验结果表明,PosConf在答案聚合上提升了6.1个百分点,并在早期停止中提高了4.3个百分点,显示出其有效性。
📝 摘要(中文)
大型语言模型通过监督微调、强化学习和在线蒸馏等后训练方法在推理能力上取得了显著进展,但这些方法通常仅通过最终答案的准确性进行评估。本文研究了这些方法如何在推理过程中重塑信心,提出了一个三阶段的校准框架,评估链式思维生成前、中、后的信心。通过对数学推理基准的对比实验,发现在线蒸馏在推理前提供了最有用的信心,监督微调在早期停止时提供了最强的在线信号,而强化学习则在答案聚合中产生了最可靠的信号。基于这些观察,提出了PosConf策略,显著提升了答案聚合和早期停止的效果。
🔬 方法详解
问题定义:本文旨在解决后训练方法在推理过程中信心校准不足的问题,现有方法往往只关注最终结果,忽视了推理过程中的信心变化。
核心思路:提出了一个三阶段的信心校准框架,分别评估推理前、推理中和推理后的信心,并基于位置依赖性提出PosConf策略,以优化信心的使用。
技术框架:框架包括三个主要阶段:推理前的困难估计、推理中的早期终止信号和推理后的答案聚合信号。每个阶段都有特定的信心评估方法。
关键创新:最重要的创新在于提出了位置感知的信心策略PosConf,该策略根据信心的可靠性选择相对位置区间,从而优化推理过程中的信心使用。
关键设计:在实验中,PosConf通过避免后期的逆校准区域,显著提高了答案聚合和早期停止的效果,具体表现为在答案聚合中提升了6.1个百分点。实验中还使用了不同的信心评估方法,以确保信心的可靠性。
🖼️ 关键图片
📊 实验亮点
实验结果显示,PosConf在答案聚合上提升了6.1个百分点,相较于多数投票方法表现更佳。同时,在早期停止中,PosConf避免了后期逆校准区域,提升了4.3个百分点,验证了其有效性。
🎯 应用场景
该研究的潜在应用领域包括自然语言处理中的推理任务、智能问答系统和对话系统等。通过优化信心校准,可以提升模型在复杂推理场景下的表现,具有重要的实际价值和未来影响。
📄 摘要(原文)
Large language models have made strong reasoning gains through supervised fine-tuning, reinforcement learning, and on-policy distillation, yet these post-training methods are usually evaluated only by final-answer accuracy. We study how they reshape confidence during reasoning. We introduce a three-stage calibration framework that evaluates confidence before, during, and after chain-of-thought generation, corresponding to difficulty estimation, early termination, and answer aggregation. Through a controlled comparison on mathematical reasoning benchmarks, we find that OPD provides the most useful pre-reasoning confidence, SFT gives the strongest online signal for early stopping, and RL produces the most reliable trace-level signal for aggregation. We further show that confidence reliability is position-dependent: RL confidence becomes informative after a path-commitment phase, while OPD confidence is useful early but can become inversely calibrated later. Based on this observation, we propose PosConf, a position-aware confidence strategy that uses confidence only from reliable relative-position intervals. PosConf improves RL answer aggregation by 6.1 points over majority voting and consistently improves OPD early stopping under tight token budgets, with gains up to 4.3 points by avoiding its later inverse-calibration region, showing that \emph{confidence in reasoning models should be used both stage-wise and position-awarely}. Our code is available at https://github.com/EIT-NLP/Post-Training-Calibration.