Uni-AdaVD: Universal Concept Erasure for Visual Generation via Orthogonal Value Decomposition
作者: Qifan Zhou, Yuan Wang, Yanbin Hao, Xiang Wang, Kuien Liu, Richang Hong, Meng Wang
分类: cs.CV
发布日期: 2026-07-16
🔗 代码/项目: GITHUB
💡 一句话要点
提出Uni-AdaVD以解决视觉生成中的概念消除问题
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 视觉生成 概念消除 多模态注意力 正交值分解 自适应消除
📋 核心要点
- 现有的概念消除方法往往依赖于特定的模型架构,难以有效去除不良概念而不影响其他内容。
- Uni-AdaVD提出了一种通用的概念消除框架,通过正交值分解和自适应消除偏移来实现目标语义的抑制。
- 在多种生成模型上进行的实验显示,Uni-AdaVD在概念消除的同时有效保留了非目标内容的生成先验。
📝 摘要(中文)
视觉生成模型不可避免地从未经整理的预训练数据中吸收不良概念,因此概念消除对于安全部署至关重要。然而,现有的消除方法往往特定于架构,难以在保留非目标内容和生成先验的同时去除目标概念。本文提出了Uni-AdaVD,这是一种通用的推理时概念消除框架。Uni-AdaVD将多模态注意力的值空间视为统一的干预空间,并引入编码器感知的目标表示构建,以定位异构文本编码器中的目标语义。它进一步结合正交值分解与自适应消除偏移,抑制目标语义方向而无需更新原始模型权重。在U-Net、DiT、自回归图像生成器以及文本到视频模型上的大量实验表明,Uni-AdaVD在单一和多重概念消除方面表现出色,同时保留非目标先验。这些结果表明,Uni-AdaVD为现代视觉生成模型提供了一种高效且适应性强的安全机制。
🔬 方法详解
问题定义:本文旨在解决视觉生成模型中不良概念的消除问题。现有方法通常特定于某一架构,难以在去除目标概念的同时保留非目标内容和生成先验。
核心思路:Uni-AdaVD通过将多模态注意力的值空间视为统一的干预空间,结合编码器感知的目标表示构建,来有效定位和消除目标语义。
技术框架:该框架包括多个主要模块:首先是目标表示的构建模块,接着是正交值分解模块,最后是自适应消除偏移模块。这些模块协同工作,实现了对目标概念的有效抑制。
关键创新:Uni-AdaVD的核心创新在于其通用性和适应性,能够在不更新原始模型权重的情况下,抑制目标语义方向,这是与现有方法的本质区别。
关键设计:在设计上,Uni-AdaVD采用了正交值分解技术,并通过自适应消除偏移来实现目标语义的抑制,确保了非目标内容的完整性。
🖼️ 关键图片
📊 实验亮点
实验结果表明,Uni-AdaVD在U-Net、DiT和自回归图像生成器等多种模型上实现了显著的性能提升,单一和多重概念消除的效果均优于现有基线方法,且在保留非目标先验方面表现出色,具体提升幅度未知。
🎯 应用场景
该研究的潜在应用领域包括图像生成、视频生成以及其他视觉生成任务,尤其是在需要确保生成内容安全性和合规性的场景中。Uni-AdaVD的通用性使其能够适应不同的生成模型,为实际应用提供了灵活的解决方案,未来可能在内容创作和自动化生成领域产生深远影响。
📄 摘要(原文)
Visual generative models inevitably absorb undesirable concepts from uncurated pretraining data, making concept erasure essential for safe deployment. Existing erasure methods, however, are often architecture-specific and struggle to remove target concepts while preserving non-target content and generative priors. We present Uni-AdaVD, a universal inference-time concept erasure framework for visual generation. Uni-AdaVD treats the value space of multimodal attention as a unified intervention space and introduces encoder-aware target representation construction to localize target semantics across heterogeneous text encoders. It further combines orthogonal value decomposition with an adaptive erasing shift to suppress target semantic directions without updating the original model weights. Extensive experiments on U-Net-, DiT-, and autoregressive image generators, as well as text-to-video models, demonstrate strong performance on single- and multi-concept erasure while preserving non-target priors. These results suggest that Uni-AdaVD provides an efficient and adaptable safety mechanism for modern visual generative models. Our code is available at https://github.com/QifanZhou/Uni-AdaVD.