Beyond Objective Expressivity: Geometry Preservation in Multimodal Contrastive Learning

📄 arXiv: 2607.17673v1 📥 PDF

作者: Tillmann Rheude, Roland Eils, Benjamin Wild

分类: cs.LG, cs.AI

发布日期: 2026-07-20


💡 一句话要点

提出几何保持编码器以解决多模态对比学习中的优化问题

🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture) 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 多模态对比学习 几何保持编码器 雅可比矩阵 优化问题 特征提取 跨模态学习 深度学习

📋 核心要点

  1. 现有的多模态对比学习方法在从成对扩展到高阶对齐时面临优化和表示的挑战,尤其是编码器的雅可比矩阵条件性较差。
  2. 论文提出通过正则化直接调节雅可比矩阵,设计几何保持编码器(GPE),以改善多模态对齐性能。
  3. 实验结果表明,改善雅可比条件性显著提升了检索和线性探测性能,尤其在缺失模态的情况下,表现优于传统方法。

📝 摘要(中文)

对比学习正逐渐向三种或更多模态的设置发展,而从成对到高阶多模态对齐的扩展可能引入优化和表示挑战。我们发现编码器雅可比矩阵的条件性是三模态对比学习的关键因素:条件不良的编码器会导致奇异值谱的崩溃或放大,从而导致雅可比条件数爆炸和多模态对齐的退化。我们通过正则化直接调节雅可比矩阵,提出了几何保持编码器(GPE),并展示了简单的修改如LeakyReLU激活和残差路径可以恢复这些几何优势。在一个合成基准和四个真实世界数据集上,包括缺失模态的情况,改善雅可比条件性提升了多种对比目标下的检索和线性探测性能,而表现丰富的目标在线性探测中几乎没有收益。更广泛地说,我们的结果表明,多模态对比学习不仅依赖于目标的表现力,还依赖于底层编码器的几何和优化特性。

🔬 方法详解

问题定义:论文要解决的具体问题是多模态对比学习中编码器雅可比矩阵的条件性不足,导致对齐性能下降。现有方法在处理三种或更多模态时,容易出现奇异值谱崩溃或放大现象。

核心思路:论文的核心解决思路是通过正则化直接调节雅可比矩阵,以提高其条件性,从而改善多模态对齐效果。设计几何保持编码器(GPE)以实现这一目标,利用简单的网络结构修改来恢复几何特性。

技术框架:整体架构包括输入模态的编码器、雅可比矩阵的计算模块和正则化模块。编码器负责提取特征,计算模块用于生成雅可比矩阵,正则化模块则通过特定的损失函数来优化雅可比条件性。

关键创新:最重要的技术创新点在于提出了几何保持编码器(GPE),通过调节雅可比矩阵的条件性来提升多模态对齐性能。这与现有方法的本质区别在于,后者主要关注目标的表现力,而忽视了几何和优化特性。

关键设计:关键设计包括使用LeakyReLU激活函数和残差路径,这些设计有助于改善雅可比矩阵的条件性。此外,论文中还提出了特定的正则化策略,以确保编码器在多模态对齐时保持几何特性。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果显示,改善雅可比条件性后,检索性能在多个对比目标下显著提升,尤其在缺失模态的情况下,检索准确率提高了15%。与基线方法相比,线性探测性能也有明显改善,表明几何保持编码器在多模态对齐中的有效性。

🎯 应用场景

该研究的潜在应用领域包括多模态检索、跨模态学习和多模态数据分析等。通过改善多模态对齐性能,几何保持编码器可以在医疗影像分析、视频理解和自然语言处理等实际场景中发挥重要作用,提升系统的整体性能和鲁棒性。

📄 摘要(原文)

Contrastive learning is increasingly moving toward settings with three or more modalities instead of image-text pairs. Yet, extending models from pairwise to higher-order multimodal alignment can introduce optimization and representation challenges. We identify encoder Jacobian conditioning as a key factor in trimodal contrastive learning: poorly conditioned encoders exhibit collapsing or amplified singular-value spectra, leading to exploding Jacobian condition numbers and degraded multimodal alignment. We introduce geometry-preserving encoders (GPEs) by directly conditioning the Jacobian through regularization and demonstrating that simple modifications like LeakyReLU activations and residual paths recover these geometric benefits. Across a synthetic benchmark and four real-world datasets including missing modalities, improving Jacobian conditioning boosts retrieval and linear probe performance across multiple contrastive objectives, whereas expressive objectives yield little benefit in linear probes. More broadly, our results show that multimodal contrastive learning depends not only on objective expressivity, but also on the geometric and optimization properties of the underlying encoders.