From Critic to Confidence: PPO for Language-Based Quantitative Prediction with Confidence Estimation

📄 arXiv: 2607.12687v1 📥 PDF

作者: Mehak Dhaliwal, Rasta Tadayon, Andong Hua, Haewon Jeong, Yao Qin

分类: cs.CL, cs.AI

发布日期: 2026-07-14


💡 一句话要点

提出CARE-PPO框架以解决语言预测中的信心估计问题

🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture) 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 语言模型 定量预测 信心估计 强化学习 PPO 医疗应用 金融应用 不确定性估计

📋 核心要点

  1. 现有大型语言模型在进行定量预测时,容易出现幻觉和过度自信的错误,导致预测结果不可靠。
  2. CARE-PPO框架通过将不确定性估计与PPO微调结合,采用信心对齐奖励,促进准确预测与信心信号的联合学习。
  3. 在医疗和金融领域的实验中,CARE-PPO在量化预测性能上显著优于传统方法,并在不同领域的真实场景中保持了良好的信心估计。

📝 摘要(中文)

大型语言模型(LLMs)能够从非结构化输入中进行语言基础的定量预测,但仍然容易出现幻觉和过度自信的错误,因此了解模型预测的可靠性至关重要。本文提出了CARE-PPO,一个强化学习框架,建立了不确定性估计的损失预测与演员-评论家PPO微调之间的联系,实现了准确数值估计和可靠信心信号的联合学习。CARE-PPO使用基于预测误差的信心对齐奖励,为演员提供密集的错误反馈,同时引导评论家学习与预测质量对齐的价值函数。在医疗和金融的两个真实任务中,CARE-PPO在量化预测性能上表现出色,并通过评论家生成显著更好的信心估计,优于基于logit和口头表达的基线。

🔬 方法详解

问题定义:本文旨在解决大型语言模型在定量预测中出现的幻觉和过度自信问题,现有方法在信心估计上存在不足,导致预测结果的可靠性难以评估。

核心思路:提出CARE-PPO框架,通过强化学习将不确定性估计与PPO微调结合,利用信心对齐奖励为模型提供反馈,促进准确预测与信心信号的共同优化。

技术框架:CARE-PPO框架主要包括两个模块:演员(Actor)和评论家(Critic)。演员负责生成预测,评论家则评估预测的质量并提供信心估计。通过反馈机制,演员和评论家实现联合学习。

关键创新:CARE-PPO的创新在于引入信心对齐奖励,使得评论家能够学习与预测质量对齐的价值函数,从而在推理阶段有效地作为信心估计器,显著提升了信心估计的准确性。

关键设计:在损失函数设计上,CARE-PPO采用基于预测误差的信心对齐奖励,确保演员在学习过程中能够获得密集的错误反馈。此外,模型在不同规模(4B和8B)上进行了训练,以验证其在真实任务中的有效性。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

在医疗和金融领域的实验中,CARE-PPO在量化预测性能上表现优异,显著优于传统的logit和口头表达基线,尤其是在真实的分布外场景中,信心估计的准确性得到了显著提升,展示了强化学习微调相较于监督学习的更好泛化能力。

🎯 应用场景

CARE-PPO框架在医疗和金融等领域具有广泛的应用潜力,能够帮助决策者在面对不确定性时做出更为可靠的判断。通过提高模型的信心估计能力,该研究为实际应用中的风险管理和资源配置提供了重要支持,未来可能推动更多领域的智能决策系统的发展。

📄 摘要(原文)

LLMs can perform language-based quantitative prediction from unstructured inputs, but remain susceptible to hallucinations and overconfident errors, making it critical to know not only what a model predicts, but when its predictions can be trusted. We introduce CARE-PPO, a reinforcement learning framework that establishes a connection between loss prediction for uncertainty estimation and actor-critic PPO fine-tuning, enabling joint learning of accurate numerical estimates and reliable confidence signals in language-based quantitative prediction. CARE-PPO uses a Confidence-Aligned Reward for Estimation, defined as a function of prediction error, to provide dense error-aware feedback to the actor while inducing the critic to learn a value function aligned with prediction quality. During inference, we repurpose the critic as a confidence estimator. Across two real-world tasks in healthcare and finance and two Qwen-3 model scales (4B and 8B), CARE-PPO achieves strong quantitative prediction performance, while producing significantly better-aligned confidence estimates through the critic than logit-based and verbalized baselines. These gains persist under realistic out-of-distribution settings across domains, spanning linguistic and domain shifts. Finally, CARE-PPO reduces task-specific overfitting on general instruction-following prompts, consistent with the broader generalization advantages of RL fine-tuning over supervised approaches.