CPInj: Uncovering Prompt Injection Risks in Textual Collaborative Prompt Optimization
作者: Xinting Liao, Behnoosh Zamanlooy, Masoumeh Shafieinejad, David B. Emerson, Ruinan Jin, Deval Pandya, Xiaoxiao Li
分类: cs.CR, cs.AI
发布日期: 2026-07-21
备注: Accepted by COLM 2026 and AI4GOOD workshop
💡 一句话要点
提出CPInj以揭示文本协作提示优化中的注入风险
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 提示注入 协作优化 大型语言模型 安全性评估 恶意指令
📋 核心要点
- 现有的文本协作提示优化方法存在恶意指令注入的风险,且现有防御措施效果不佳。
- 本文提出CPInj攻击,能够在聚合过程中注入恶意指令并降低模型性能,同时抵抗优化和检测。
- 通过在三种大型语言模型和五个推理任务上进行实验,验证了CPInj的有效性及其对TCPO的威胁。
📝 摘要(中文)
文本协作提示优化(TCPO)扩展了Textgrad,允许多个客户端在保持数据本地的情况下共同改进大型语言模型(LLMs)的提示。其依赖于自由形式的文本更新和聚合,导致了新的攻击面,即恶意指令可以被注入到本地提示中并通过服务器端的提示聚合传播。与传统的提示注入攻击不同,TCPO的攻击目标是其协作优化循环,这一过程更具挑战性。为此,本文提出了CPInj,一种协作提示注入攻击,能够污染聚合的全局提示,降低下游任务性能,并抵抗善意客户端的提示优化。实验表明,现有防御方法对CPInj无效,呼吁对TCPO进行更强有力的防御。
🔬 方法详解
问题定义:本文旨在解决文本协作提示优化(TCPO)中的恶意指令注入问题。现有方法未能有效防范此类攻击,导致聚合的全局提示可能被污染。
核心思路:CPInj攻击通过在协作优化循环中注入恶意指令,利用聚合过程的脆弱性,使得恶意内容能够存活并影响后续优化。
技术框架:该方法包括恶意指令的生成、注入、聚合及其对下游任务性能的影响评估。主要模块包括攻击生成模块、聚合模块及性能评估模块。
关键创新:CPInj的创新在于其针对TCPO的协作优化循环进行攻击,区别于传统的单一提示注入攻击,具有更高的隐蔽性和持久性。
关键设计:在攻击过程中,设计了特定的参数设置和损失函数,以确保恶意指令在聚合后仍能有效影响模型输出,同时对抗现有的检测机制。
🖼️ 关键图片
📊 实验亮点
实验结果显示,CPInj攻击能够显著降低下游任务的性能,且对现有防御方法具有较强的抵抗力。在多个实验中,攻击后模型性能下降幅度达到20%以上,揭示了TCPO的关键脆弱性。
🎯 应用场景
该研究的潜在应用领域包括大型语言模型的安全性评估和防护措施的设计,尤其是在需要多方协作的场景中。通过识别和缓解提示注入风险,可以提升模型在实际应用中的可靠性和安全性,具有重要的实际价值和未来影响。
📄 摘要(原文)
Textual Collaborative Prompt Optimization (TCPO) extends Textgrad (Yuksekgonul et al., 2025) to a decentralized setting by allowing multiple clients to jointly improve prompts for large language models (LLMs) while keeping their data locally. Its reliance on free-form textual updating and aggregation introduces a new and largely unexplored attack surface, i.e., malicious instructions can be injected into local prompts and propagated through server-side prompt aggregation. Unlike conventional prompt injection attacks, attacking TCPO targets the collaborative optimization loop in TCPO. This setting is more challenging because malicious instructions must survive aggregation, persist through subsequent benign prompt optimization, and evade server-side defenses. To expose this risk, we propose CPInj, a collaborative prompt injection attack that contaminates the aggregated global prompt with malicious instructions, degrades downstream task performance, resists purification by prompt optimization on benign clients, and evades advanced detection-based defenses on the server. We find that current defense methods are ineffective against CPInj. To mitigate this attack, we further propose a defense-oriented aggregation method, i.e., APAgg, which purifies malicious instructions and partially recovers TCPO utility. We conduct extensive experiments across three LLM families and five reasoning tasks in math, logic, and medicine. The results demonstrate that our proposed attack reveals a critical vulnerability in TCPO. Although we take a first step toward mitigation, the attack remains highly effective and far from fully resolved, calling for more robust defense for TCPO.