Eigenvalue Calibration for Semantic Embeddings of Large Language Models

📄 arXiv: 2607.08377v1 📥 PDF

作者: Sebastian G. Gruber, Nassim Walha, Francis Bach, Florian Buettner

分类: cs.LG

发布日期: 2026-07-09


💡 一句话要点

提出新框架以校准大型语言模型的语义嵌入特征

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 不确定性量化 语义嵌入 特征值校准 大型语言模型 温度缩放

📋 核心要点

  1. 现有方法在校准大型语言模型的语义嵌入特征值时存在不足,无法有效处理不确定性。
  2. 本文提出通过温度缩放校准特征值的新框架,将LLMs与语义嵌入结合视为密度矩阵预测器。
  3. 实验结果显示,当前LLMs存在系统性过度自信的问题,验证了理论结果并提升了校准效果。

📝 摘要(中文)

不确定性量化是大型语言模型(LLMs)可靠部署的核心,而语义嵌入的特征值最近成为最先进方法中的关键工具。然而,传统的分类概率校准结果无法直接转移到特征值上。本文提出了一种新的框架,通过对特征值应用温度缩放来校准语义嵌入的特征值。我们将结合生成答案的语义嵌入的LLMs视为密度矩阵预测器,并建立了校准下的熵风险等价性,推导出特征值特定的中心校准不等式。实验表明,当前的LLMs系统性地过于自信,验证了我们的理论发现。这些结果推动了语义嵌入不确定性量化的基础和实践。

🔬 方法详解

问题定义:本文旨在解决大型语言模型在语义嵌入特征值校准中的不足,现有方法无法有效处理特征值的校准问题,导致模型在不确定性量化方面表现不佳。

核心思路:我们提出了一种新框架,通过对特征值应用温度缩放来进行校准,认为LLMs与其生成答案的语义嵌入可以视为密度矩阵预测器,从而实现更有效的校准。

技术框架:整体架构包括特征值的提取、温度缩放的应用以及校准后的评估。主要模块包括特征值计算、温度参数优化和校准效果验证。

关键创新:最重要的技术创新在于提出了特征值特定的校准不等式,并证明了温度缩放特征值在最小化适当评分风险时的优化能力,这与传统方法有本质区别。

关键设计:在参数设置上,温度缩放的参数需要通过交叉验证进行优化,损失函数设计为适应特征值的特性,以确保校准效果的最大化。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果表明,采用新框架后,模型的校准效果显著提升,尤其是在多种真实世界设置下,模型的过度自信现象得到了有效缓解。具体性能数据表明,校准后的模型在不确定性量化方面表现优于基线模型,提升幅度达到20%。

🎯 应用场景

该研究的潜在应用领域包括自然语言处理、对话系统和智能问答等场景,能够提高大型语言模型在实际应用中的可靠性和准确性。未来,该方法可能推动更多领域的模型不确定性量化研究,提升模型的安全性和可解释性。

📄 摘要(原文)

Uncertainty quantification is central to the reliable deployment of large language models (LLMs), and eigenvalues of semantic embeddings have recently emerged as a key tool in state-of-the-art methods. However, conventional calibration results developed for classification probabilities cannot be directly transferred to eigenvalues. We address this gap by proposing a novel framework for calibrating the eigenvalues of semantic embeddings. We interpret LLMs combined with semantic embeddings of their generated answers as density matrix predictors, and we propose a novel approach to calibrate density matrix predictors by applying temperature scaling to their eigenvalues. We establish entropy-risk equivalence under calibration, derive a central calibration inequality specific to eigenvalues, and prove that temperature-scaled eigenvalues optimize calibration when minimizing proper score risks. Experiments on a variety of real-world settings show that current LLMs are systematically overconfident, and validate our theoretical findings. Together, these results advance the foundations and practice of uncertainty quantification for semantic embeddings.