Code-MUE: Measuring Code LLMs' Uncertainty through Execution-based Semantic Interaction Graphs
作者: Xiaoning Ren, Yinxing Xue, Lei Ma, Yuheng Huang
分类: cs.SE, cs.AI, cs.CL
发布日期: 2026-07-14
备注: To appear at The ACM SIGSOFT International Symposium on Software Testing and Analysis (ISSTA) 2026
💡 一句话要点
提出Code-MUE以解决代码LLMs不确定性评估问题
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 代码不确定性 大型语言模型 语义交互图 风险检测 自动化测试 软件工程 机器学习
📋 核心要点
- 现有的不确定性估计方法无法有效处理闭源模型,且黑盒文本指标未能反映代码的语义脆弱性。
- 本文提出Code-MUE,通过执行基础的语义交互图来测量不确定性,基于可观察的运行时行为进行评估。
- 实验证明,Code-MUE与功能正确性之间的斯皮尔曼相关系数高达-0.98,显著优于现有基线,提升了风险检测能力。
📝 摘要(中文)
随着代码大型语言模型(LLMs)在现代软件工程中的核心地位,其固有的随机性带来了显著的现实风险,哪怕是微小的错误也可能导致严重的功能、安全或安全后果。因此,可靠的自动化需要能够区分自信且有充分支持的预测与随机猜测。然而,现有的不确定性估计方法存在关键缺陷:白盒和灰盒技术通常无法应用于闭源模型,而标准的“黑盒”文本指标未能捕捉代码的独特脆弱性。为此,本文提出了Code-MUE,一个纯黑盒框架,通过执行基础的语义交互图来测量不确定性。与依赖表面文本相似性的先前方法不同,Code-MUE将不确定性基于可观察的运行时行为,计算解决空间的冯·诺依曼熵以量化全局语义多样性。大规模实证研究表明,Code-MUE与功能正确性之间存在强负相关(斯皮尔曼相关系数高达-0.98),显著优于基于词汇和嵌入的基线,同时在实际工作流程中实现了稳健的风险检测和选择性预测。
🔬 方法详解
问题定义:本文旨在解决代码LLMs的不确定性评估问题,现有方法在处理闭源模型时存在局限性,且无法有效捕捉代码的语义脆弱性。
核心思路:Code-MUE的核心思路是通过执行基础的语义交互图来量化不确定性,基于可观察的运行时行为而非表面文本相似性,从而更准确地反映代码的语义多样性。
技术框架:该方法包括几个主要模块:首先,执行代码以获取运行时行为;其次,构建语义交互图以捕捉不同执行路径的关系;最后,计算冯·诺依曼熵以量化不确定性。
关键创新:Code-MUE的关键创新在于其完全依赖于运行时行为而非文本相似性,能够更有效地捕捉代码的语义特征,解决了现有方法的不足。
关键设计:在设计上,Code-MUE使用冯·诺依曼熵作为不确定性度量,确保了对解决空间的全面评估,同时在参数设置和损失函数上进行了优化,以提高模型的鲁棒性和准确性。
🖼️ 关键图片
📊 实验亮点
实验结果显示,Code-MUE与功能正确性之间的斯皮尔曼相关系数高达-0.98,表明其在不确定性评估方面的有效性。相较于传统的词汇和嵌入基线,Code-MUE在风险检测和选择性预测方面表现出显著提升,验证了其在实际工作流程中的应用价值。
🎯 应用场景
该研究的潜在应用领域包括软件开发中的自动化测试、代码审查和安全性分析等。通过准确评估代码LLMs的不确定性,开发者可以更有效地识别潜在风险,从而提高软件的可靠性和安全性。未来,该方法有望在更广泛的编程语言和开发环境中得到应用,推动智能编程工具的发展。
📄 摘要(原文)
As Code Large Language Models (LLMs) become central to modern software engineering, their inherent stochasticity poses significant real-world risks, where even minor errors can lead to severe functional, security, or safety consequences. Reliable automation, therefore, demands the ability to distinguish between confident, well-supported predictions and stochastic guessing. However, existing uncertainty estimation methods face a critical gap: white and grey-box techniques are often inapplicable to closed-source models, while standard "black-box" text metrics fail to capture the unique fragility of code, where syntactic variation does not always imply semantic divergence. To bridge this syntax-semantics gap, we introduce Code-MUE, a purely black-box framework that measures uncertainty through execution-based Semantic Interaction Graphs. Unlike prior approaches that rely on superficial textual similarity, Code-MUE grounds uncertainty in observable runtime behavior, calculating the Von Neumann entropy of the solution space to quantify global semantic diversity. A large-scale empirical study across eight state-of-the-art LLMs demonstrates that Code-MUE achieves a strong negative correlation with functional correctness (Spearman's correlation up to -0.98), significantly outperforming lexical and embedding-based baselines while enabling robust risk detection and selective prediction in practical workflows.