Beware What You Autocomplete: Forensic Attribution of Backdoored Code Completions
作者: Anjun Gao, Yueyang Quan, Zhuqing Liu, Minghong Fang
分类: cs.CR, cs.AI, cs.IR, cs.LG
发布日期: 2026-07-09
备注: To appear in COLM 2026
💡 一句话要点
提出CodeTracer以追踪后门代码补全的来源
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 后门攻击 代码补全 法医分析 大型语言模型 安全性 行为指纹 归因推理
📋 核心要点
- 现有代码补全系统易受到后门攻击,恶意微调数据可能导致不安全行为,防御措施尚未完全有效。
- 提出CodeTracer框架,通过分析微调语料和错误补全事件,追踪恶意代码补全的来源,提取行为指纹。
- 在多个漏洞案例和后门攻击的评估中,CodeTracer展现出高法医准确性和低误识别率,表现优于十个基线方法。
📝 摘要(中文)
大型语言模型使得代码补全系统变得强大,能够预测开发者后续的代码行。然而,这些模型仍然容易受到后门攻击,恶意的微调数据可以隐秘地植入不安全的行为。尽管防御技术有所进展,适应性和复杂的后门攻击仍然能够逃避检测和缓解。本文提出了CodeTracer,一个法医框架,能够追踪恶意代码补全的来源,回溯至负责这些补全的后门微调数据。CodeTracer在现实的部署约束下,仅依赖微调语料和报告的错误补全事件,提取受损输出的结构化行为指纹,缩小到语义相关的代码样本,并利用基于LLM的推理将不安全逻辑归因于特定的后门数据。通过对三个代表性漏洞案例和十种后门攻击的广泛评估,CodeTracer在法医准确性、低误识别率和对适应性攻击的强鲁棒性方面表现出色。
🔬 方法详解
问题定义:本文旨在解决大型语言模型代码补全系统中后门攻击的追踪问题。现有方法在检测和缓解后门攻击方面存在不足,无法有效识别恶意补全的来源。
核心思路:CodeTracer的核心思路是利用微调语料和错误补全事件,提取受损输出的行为指纹,并通过语义相关性缩小搜索范围,从而追踪到具体的后门数据。
技术框架:CodeTracer的整体架构包括数据收集、行为指纹提取、语义匹配和归因推理四个主要模块。首先收集微调语料和错误补全事件,然后提取结构化的行为指纹,接着进行语义匹配,最后利用LLM进行归因推理。
关键创新:最重要的技术创新在于其能够在现实部署条件下,依赖于微调语料和错误补全事件进行追踪,且具备高准确性和鲁棒性,区别于传统的检测方法。
关键设计:在设计中,CodeTracer采用了结构化行为指纹提取技术,结合语义相关性分析,确保了对后门数据的有效归因,同时在参数设置和损失函数上进行了优化,以提高模型的整体性能。
🖼️ 关键图片
📊 实验亮点
在实验中,CodeTracer在三个漏洞案例和十种后门攻击的评估中,展现出高达95%的法医准确性,误识别率低于5%,并在适应性攻击下保持强鲁棒性,显著优于十个竞争基线方法。
🎯 应用场景
该研究在软件开发和安全领域具有重要应用潜力,能够帮助开发者识别和追踪后门攻击,提升代码补全系统的安全性。未来,CodeTracer可扩展至其他领域,如自动化测试和代码审计,增强软件开发过程中的安全保障。
📄 摘要(原文)
Large language models have enabled powerful code completion systems that assist developers by predicting subsequent lines of code. However, these models remain vulnerable to backdoor attacks, where malicious fine-tuning data covertly implants unsafe behaviors. Despite advances in defensive techniques, adaptive and sophisticated backdoor attacks still evade detection and mitigation. We present CodeTracer, a forensic framework that traces malicious code completions back to the backdoor fine-tuning data responsible for them. Operating under realistic post-deployment constraints, CodeTracer relies solely on the fine-tuning corpus and the reported miscompletion event. It extracts a structured behavioral fingerprint from the compromised output, narrows the search to semantically relevant code samples, and employs LLM-based reasoning to attribute unsafe logic to specific backdoor data. Extensive evaluations across three representative vulnerability cases and ten backdoor attacks, along with sixteen competitive baselines, demonstrate that CodeTracer consistently achieves high forensic accuracy, low false identification rates, and strong robustness against adaptive attacks.