Hide and Seek in Embedding Space: Geometry-based Steganography and Detection in Large Language Models

📄 arXiv: 2601.22818 📥 PDF

作者: Charles Westphal, Keivan Navaie, Fernando E. Rosas

分类: cs.CR, cs.AI

发布日期: 2026-07-20


💡 一句话要点

提出低可恢复性隐写术以应对大语言模型中的隐写攻击

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 隐写术 大语言模型 信息安全 微调 可解释性

📋 核心要点

  1. 现有隐写术方法依赖于易于恢复的编码,导致隐写信息容易被检测和恢复。
  2. 论文提出低可恢复性隐写术,通过嵌入空间派生映射来降低隐写信息的可恢复性。
  3. 实验显示,使用新方法在多个模型上显著提高了秘密恢复率,同时降低了负载可恢复性。

📝 摘要(中文)

本研究探讨了微调的大语言模型(LLMs)如何通过隐写通道秘密编码提示信息。以往的研究表明这一威胁,但依赖于易于恢复的编码方式。我们通过分类器准确性形式化了负载可恢复性,并展示了之前的方案实现了100%的可恢复性。为此,我们引入了低可恢复性隐写术,利用嵌入空间派生的映射替代任意映射。实验结果显示,在Llama-8B和Ministral-8B模型上,精确秘密恢复率分别从17%提升至30%和24%提升至43%。同时,我们提出了一种基于机制可解释性的检测方法,表明恶意微调会留下可被解释性防御识别的内部特征。

🔬 方法详解

问题定义:本论文旨在解决现有隐写术在大语言模型中易于被检测和恢复的问题。以往方法的编码方式过于简单,导致隐写信息的可恢复性过高,给安全性带来隐患。

核心思路:论文提出了一种低可恢复性隐写术,利用嵌入空间的特征来进行信息编码。这种方法通过复杂的映射降低了隐写信息的可恢复性,从而提高了隐写的隐蔽性。

技术框架:整体流程包括数据预处理、嵌入空间映射生成、隐写信息编码和模型微调等阶段。首先,通过特定的提示生成嵌入空间映射,然后将秘密信息嵌入到模型输出中。

关键创新:最重要的创新在于引入了低可恢复性隐写术,利用嵌入空间特征进行编码,与传统方法相比,显著降低了隐写信息的可恢复性,同时提高了隐写的隐蔽性。

关键设计:在模型微调过程中,采用了特定的损失函数来优化隐写信息的嵌入效果,并通过线性探针对后层激活进行训练,以提高检测的准确性。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果显示,Llama-8B和Ministral-8B模型的秘密恢复率分别从17%提升至30%和24%提升至43%,而Llama-70B模型的恢复率从9%提升至19%。同时,检测准确性在微调模型中提高了33%,表明新方法在隐写和检测方面的有效性。

🎯 应用场景

该研究在信息安全、隐私保护和大语言模型的安全性评估等领域具有重要应用潜力。通过降低隐写信息的可恢复性,可以有效防止恶意攻击,保护用户隐私。未来,相关技术可应用于安全通信、数据保护等实际场景。

📄 摘要(原文)

Fine-tuned LLMs can covertly encode prompt secrets into outputs via steganographic channels. Prior work demonstrated this threat but relied on trivially recoverable encodings. We formalize payload recoverability via classifier accuracy and show previous schemes achieve 100\% recoverability. In response, we introduce low-recoverability steganography, replacing arbitrary mappings with embedding-space-derived ones. For Llama-8B (LoRA) and Ministral-8B (LoRA) trained on TrojanStego prompts, exact secret recovery rises from 17$\rightarrow$30\% (+78\%) and 24$\rightarrow$43\% (+80\%) respectively, while on Llama-70B (LoRA) trained on Wiki prompts, it climbs from 9$\rightarrow$19\% (+123\%), all while reducing payload recoverability. We then discuss detection. We argue that detecting fine-tuning-based steganographic attacks requires approaches beyond traditional steganalysis. Standard approaches measure distributional shift, which is an expected side-effect of fine-tuning. Instead, we propose a mechanistic interpretability approach: linear probes trained on later-layer activations detect the secret with up to 33\% higher accuracy in fine-tuned models compared to base models, even for low-recoverability schemes. This suggests that malicious fine-tuning leaves actionable internal signatures amenable to interpretability-based defenses.