Code-MUE: Measuring Code LLMs' Uncertainty through Execution-based Semantic Interaction Graphs

📄 arXiv: 2607.12273 📥 PDF

作者: Xiaoning Ren, Yinxing Xue, Lei Ma, Yuheng Huang

分类: cs.SE, cs.AI, cs.CL

发布日期: 2026-07-20


💡 一句话要点

提出Code-MUE以解决代码LLMs不确定性评估问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 代码不确定性 大型语言模型 语义交互图 冯·诺依曼熵 风险检测 软件工程 黑盒评估

📋 核心要点

  1. 现有的不确定性估计方法在闭源模型和代码特性方面存在显著不足,无法有效评估代码LLMs的预测可靠性。
  2. 本文提出的Code-MUE框架通过执行的语义交互图来量化不确定性,基于运行时行为而非文本相似性进行评估。
  3. 实验证明,Code-MUE在功能正确性上与其他方法相比具有显著的负相关性,提升了风险检测和预测选择的能力。

📝 摘要(中文)

随着代码大型语言模型(LLMs)在现代软件工程中的重要性日益增强,其固有的随机性带来了显著的现实风险,哪怕是微小的错误也可能导致严重的功能、安全或安全后果。因此,可靠的自动化需要能够区分自信且有充分支持的预测与随机猜测。然而,现有的不确定性估计方法存在关键缺陷:白盒和灰盒技术往往无法应用于闭源模型,而标准的“黑盒”文本指标无法捕捉代码的独特脆弱性,语法变异并不总意味着语义差异。为了解决这一语法-语义差距,本文提出了Code-MUE,这是一种纯黑盒框架,通过基于执行的语义交互图来测量不确定性。与依赖表面文本相似性的先前方法不同,Code-MUE将不确定性基于可观察的运行时行为,计算解决空间的冯·诺依曼熵以量化全局语义多样性。大规模实证研究表明,Code-MUE与功能正确性之间存在强负相关(斯皮尔曼相关系数高达-0.98),显著优于词汇和嵌入基线,同时在实际工作流程中实现了稳健的风险检测和选择性预测。

🔬 方法详解

问题定义:本文旨在解决代码LLMs的不确定性评估问题,现有方法在闭源模型和代码特性方面存在显著不足,无法有效捕捉代码的语义脆弱性。

核心思路:Code-MUE的核心思路是通过执行的语义交互图来量化不确定性,基于可观察的运行时行为而非表面文本相似性,从而更准确地反映代码的语义多样性。

技术框架:Code-MUE的整体架构包括数据收集、执行语义交互图构建、冯·诺依曼熵计算和不确定性评估四个主要模块。首先收集代码执行数据,然后构建语义交互图,接着计算熵值,最后输出不确定性评估结果。

关键创新:最重要的技术创新点在于将不确定性评估基于运行时行为而非文本相似性,填补了语法与语义之间的差距,提供了一种新的评估方法。

关键设计:在设计中,Code-MUE采用了冯·诺依曼熵作为不确定性量化指标,确保了评估的准确性和可靠性,同时在模型训练过程中未使用任何闭源模型的内部信息。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果显示,Code-MUE与功能正确性之间存在强负相关,斯皮尔曼相关系数高达-0.98,显著优于传统的词汇和嵌入基线,提升了风险检测和选择性预测的能力。

🎯 应用场景

该研究的潜在应用领域包括软件开发、自动化测试和安全审计等。通过准确评估代码LLMs的不确定性,开发者可以更好地识别潜在风险,从而提高软件的安全性和可靠性,未来可能对软件工程实践产生深远影响。

📄 摘要(原文)

As Code Large Language Models (LLMs) become central to modern software engineering, their inherent stochasticity poses significant real-world risks, where even minor errors can lead to severe functional, security, or safety consequences. Reliable automation, therefore, demands the ability to distinguish between confident, well-supported predictions and stochastic guessing. However, existing uncertainty estimation methods face a critical gap: white and grey-box techniques are often inapplicable to closed-source models, while standard "black-box" text metrics fail to capture the unique fragility of code, where syntactic variation does not always imply semantic divergence. To bridge this syntax-semantics gap, we introduce Code-MUE, a purely black-box framework that measures uncertainty through execution-based Semantic Interaction Graphs. Different from prior approaches that rely on superficial textual similarity, Code-MUE grounds uncertainty in observable runtime behavior, calculating the Von Neumann entropy of the solution space to quantify global semantic diversity. A large-scale empirical study across eight state-of-the-art LLMs demonstrates that Code-MUE achieves a strong negative correlation with functional correctness (Spearman's correlation up to -0.98), significantly outperforming lexical and embedding-based baselines while enabling robust risk detection and selective prediction in practical workflows.