MTVDiff: Multimodal Conditional Latent Diffusion for Enhanced Thermal-to-Visible Face Translation
作者: Zhiyuan Xia, Haojie Li, Jingyu Lin, Yiguo Qiao, Cunjian Chen
分类: cs.CV
发布日期: 2026-07-22
备注: Accepted by ECCV 2026
💡 一句话要点
提出MTVDiff以解决热成像到可见光人脸转换中的挑战
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 热成像 可见光人脸转换 多模态潜在扩散 深度信息整合 语义一致性 人脸识别 图像生成 跨光谱转换
📋 核心要点
- 现有热成像到可见光人脸转换方法面临几何不连续性、语义属性不匹配和身份退化等挑战,影响了转换效果。
- 论文提出MTVDiff框架,通过整合深度和文本信息,利用双分支交叉注意力融合模块等技术,提升人脸转换质量。
- 实验结果显示,MTVDiff在MCXFace和SpeakingFaces数据集上显著优于现有方法,FID降低48.3%,Rank-1准确率提高8.9%。
📝 摘要(中文)
热成像到可见光的人脸转换面临几项基本挑战,包括几何不连续性、语义属性不匹配和身份退化。为此,我们提出了MTVDiff,这是一种新颖的多模态潜在扩散框架,能够协同整合深度和文本信息,以解决这些限制,同时保持身份特征。MTVDiff框架的三大核心技术贡献包括:1)双分支交叉注意力融合模块(DBCAF),用于多尺度热深度特征提取和融合;2)门控文本到视觉特征对齐机制,实现语义引导生成;3)空间特征变换(SFT),用于自适应多模态先验整合。在MCXFace和SpeakingFaces数据集上的广泛实验表明,我们的多模态方法在多个指标上显著优于现有的基于GAN和扩散的方法,图像质量和人脸验证性能均有显著提升,FID降低高达48.3%,Rank-1准确率提高高达8.9%。我们的工作为在不同光照条件下运行的人脸识别系统提供了稳健的解决方案,并通过有效的多模态整合推动了跨光谱人脸图像转换的最新进展。
🔬 方法详解
问题定义:论文旨在解决热成像到可见光人脸转换中的几何不连续性、语义属性不匹配和身份退化等问题,这些问题在现有的GAN和扩散方法中普遍存在,导致转换效果不理想。
核心思路:MTVDiff框架通过多模态潜在扩散方法,整合深度信息和文本信息,以增强生成过程中的语义一致性和身份保持能力。设计上,采用双分支交叉注意力机制来提取和融合多尺度特征,确保信息的全面性和准确性。
技术框架:MTVDiff的整体架构包括三个主要模块:1)双分支交叉注意力融合模块(DBCAF),用于特征提取和融合;2)门控文本到视觉特征对齐机制,确保生成过程中的语义引导;3)空间特征变换(SFT),实现自适应的多模态信息整合。
关键创新:最重要的技术创新在于DBCAF模块的设计,它能够有效处理多尺度特征的提取与融合,显著提升了生成图像的质量和一致性,相较于传统方法具有更强的适应性和灵活性。
关键设计:在网络结构上,采用了多层次的特征提取策略,并在损失函数中引入了语义一致性损失,以确保生成图像在视觉和语义上的一致性,同时优化了模型的训练过程。通过这些设计,MTVDiff在性能上实现了显著提升。
🖼️ 关键图片
📊 实验亮点
实验结果表明,MTVDiff在MCXFace和SpeakingFaces数据集上表现优异,相较于现有的GAN和扩散方法,FID指标降低了48.3%,Rank-1准确率提高了8.9%,显示出显著的性能提升,验证了其有效性。
🎯 应用场景
该研究的潜在应用领域包括人脸识别、监控系统和安全验证等,尤其是在不同光照条件下的场景中,MTVDiff能够有效提升人脸识别的准确性和鲁棒性。未来,随着技术的进一步发展,MTVDiff有望在更多跨光谱图像处理任务中发挥重要作用。
📄 摘要(原文)
Thermal-to-visible face translation presents fundamental challenges including geometric discontinuities, semantic attribute mismatches, and identity degradation. We propose MTVDiff, a novel multimodal latent diffusion framework that synergistically integrates depth and textual information to address these limitations while preserving identity characteristics. The MTVDiff framework presents three core technical contributions: (1) a Dual-Branch Cross-Attention Fusion (DBCAF) module for multi-scale thermal-depth feature extraction and fusion; (2) a Gated Text-to-Visual Feature Alignment mechanism for semantically-guided generation; and (3) Spatial Feature Transformations (SFT) for adaptive multimodal prior integration. Extensive experiments on the MCXFace and SpeakingFaces datasets demonstrate that our multimodal approach significantly outperforms existing GAN-based and diffusion-based approaches across multiple metrics, achieving substantial improvements in both image quality and face verification performance, with FID reductions of up to 48.3% and Rank-1 accuracy improvements of up to 8.9\%. Our work provides a robust solution for face recognition systems operating under varying illumination conditions and advances the state-of-the-art in cross-spectral facial image translation through effective multimodal integration.