Appearance Pointers -- Multimodal Region Control of Diffusion Transformers
作者: Rahul Sajnani, Yulia Gryaditskaya, Radomír Měch, Srinath Sridhar, Matheus Gadelha
分类: cs.CV, cs.AI, cs.GR
发布日期: 2026-07-21
备注: 38 Pages, Preprint with supplement
💡 一句话要点
提出外观指针以解决多模态区域控制问题
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 扩散变换器 外观指针 多模态控制 图像生成 区域控制 创意工具
📋 核心要点
- 现有的可控图像生成方法在区域控制上存在不足,难以满足创意专业人士的需求。
- 论文提出外观指针,通过对齐用户指定的掩码,指导扩散变换器在正确位置获取外观线索。
- 实验结果表明,该方法在多项指标上超越了现有的模态特定方法,展示了其有效性。
📝 摘要(中文)
可控图像生成对创意专业人士而言仍然具有挑战性,他们常常需要对材料、物体身份和空间排列进行精确的区域控制,而仅通过文本提示无法可靠实现。扩散变换器(DiTs)能够原生处理来自文本和图像的异构标记,但缺乏确定这些标记如何影响输出的机制。我们引入了外观指针,这是一种紧凑的标记,通过将文本或图像输入与用户指定的掩码对齐,指导DiTs在正确的空间位置获取正确的外观线索。外观指针由区域对应网络生成,并通过空间聚合机制进行优化,使模型能够处理多个区域描述而不显著增加标记负担。我们的方法首次引入了无模态依赖的接口,实现了DiT中的局部多模态控制,而无需从头开始重新训练基础模型。在多项指标上,我们的单一模型达到了或超过了特定模态的最先进方法的性能,提供了一条简单且可扩展的路径,以实现生成图像合成中的精确区域感知多模态指导。
🔬 方法详解
问题定义:本论文旨在解决可控图像生成中对区域控制的不足,现有方法无法提供精确的材料和对象身份控制,导致生成结果不符合用户需求。
核心思路:通过引入外观指针,论文设计了一种机制,使得扩散变换器能够根据用户指定的掩码,精确地获取和应用外观线索,从而实现更好的区域控制。
技术框架:整体架构包括区域对应网络和空间聚合机制。区域对应网络负责生成外观指针,而空间聚合机制则优化这些指针的使用,确保模型在处理多个区域描述时不会显著增加计算负担。
关键创新:外观指针的引入是本研究的核心创新,它提供了一种无模态依赖的接口,允许在不重新训练基础模型的情况下实现局部多模态控制,这与现有方法的设计理念有本质区别。
关键设计:在设计中,外观指针的生成和优化过程采用了特定的损失函数和网络结构,以确保指针的有效性和准确性,同时保持计算效率。
🖼️ 关键图片
📊 实验亮点
实验结果显示,提出的方法在多项性能指标上达到了或超过了模态特定的最先进方法,展示了其在生成图像合成中的有效性。具体而言,模型在区域控制的精确度和生成质量上均有显著提升,提供了一种新的解决方案。
🎯 应用场景
该研究的潜在应用领域包括艺术创作、广告设计和游戏开发等,能够为创意专业人士提供更高效的工具,帮助他们实现更精确的图像生成和区域控制。未来,该技术可能推动生成模型在多模态交互中的应用,提升用户体验和创作自由度。
📄 摘要(原文)
Controllable image generation remains challenging for creative professionals, who often require precise regional control over materials, object identities, and spatial arrangements that cannot be reliably achieved through text prompting alone. Diffusion Transformers (DiTs) can natively ingest heterogeneous tokens stemming from texts and images, but they lack mechanisms for determining where and how these tokens should influence the output. We introduce appearance pointers, compact tokens that guide DiTs toward the correct appearance cues at the correct spatial locations by aligning text or image inputs with user-specified masks. Appearance pointers are produced by a region correspondence network and refined through a spatial aggregation mechanism, enabling the model to handle multiple regional descriptions without significantly increasing token load. Our approach introduces the first modality-agnostic interface for localized multimodal control in a DiT without retraining the base model from scratch. Across a range of metrics, our single model reaches or surpasses the performance of modality-specific state of the art methods, offering a simple and extensible path toward precise, region-aware, multimodal guidance in generative image synthesis.