MCPO: Modality-Contrastive Preference Optimization for Multimodal Chain-of-Thought Compression

📄 arXiv: 2609.04947v1 📥 PDF

作者: Guangheng Yang, Zhenliang Ni, Zhenkai Wu, Han Shu, Juan Feng, Wenming Yang, Jie Hu

分类: cs.CV, cs.AI

发布日期: 2026-09-04


💡 一句话要点

提出MCPO以解决多模态推理链压缩问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 多模态推理 推理链压缩 对比学习 跨模态优化 计算效率 深度学习 机器学习

📋 核心要点

  1. 现有的推理链压缩方法依赖静态规则,缺乏细粒度的跨模态约束,导致视觉懒惰和幻觉推理问题。
  2. 提出了多模态对比偏好优化(MCPO),通过NCMI剪枝算法和非对称长度控制偏好损失来优化推理链的长度和一致性。
  3. 实验表明,MCPO能够将推理链长度减少最多69.5%,并实现3.34倍的推理速度提升,且保持准确性。

📝 摘要(中文)

近年来,多模态大规模推理模型在解决复杂任务方面展现出卓越能力,然而过长的推理链导致了显著的计算成本和KV缓存压力。现有的推理链压缩方法主要依赖静态规则或单一维度的偏好,缺乏细粒度的跨模态约束,容易引发视觉懒惰和幻觉推理。为了解决这些问题,本文提出了多模态对比偏好优化(MCPO),这是一种高样本效率的两阶段长度压缩方法,训练样本少于900个。在压缩阶段,采用了归一化跨模态互信息(NCMI)剪枝算法,自动识别并去除与视觉无关的推理步骤,显著减少冗余和幻觉内容。在对齐阶段,模型首先经过监督微调以实现领域自适应初始化,随后使用非对称多模态长度控制偏好损失进行优化。实验结果表明,该方法能够将推理链长度减少最多69.5%,并实现高达3.34倍的端到端推理加速,同时保持原有准确性。

🔬 方法详解

问题定义:本文旨在解决多模态推理链过长所带来的计算成本和KV缓存压力问题。现有方法往往依赖静态规则,缺乏跨模态的细粒度约束,导致推理链中冗余和幻觉内容的产生。

核心思路:MCPO通过引入归一化跨模态互信息(NCMI)剪枝算法和非对称长度控制偏好损失,旨在有效压缩推理链长度,同时保持推理的准确性和一致性。

技术框架:MCPO的整体架构分为两个主要阶段:压缩阶段和对齐阶段。在压缩阶段,使用NCMI算法识别并去除冗余推理步骤;在对齐阶段,进行监督微调和偏好损失优化。

关键创新:MCPO的主要创新在于引入了NCMI剪枝算法和非对称长度控制偏好损失,这些设计使得模型能够在不同上下文中有效调整推理链的长度,克服了现有方法的局限性。

关键设计:在压缩阶段,NCMI算法通过比较有图像和无图像上下文中的推理差异来进行剪枝;在对齐阶段,采用非线性赔率比公式来强化有图像上下文中的长度约束,同时在无图像上下文中保持模态一致性。具体的损失函数设计和网络结构细节在实验中进行了验证。

🖼️ 关键图片

fig_0
fig_1

📊 实验亮点

实验结果显示,MCPO能够将推理链长度减少最多69.5%,并实现高达3.34倍的端到端推理速度提升,且在保持原有准确性的同时,显著降低了计算成本。这些结果表明MCPO在多模态推理中的有效性和优越性。

🎯 应用场景

该研究的潜在应用领域包括多模态推理系统、智能助手和自动化决策支持等。通过有效压缩推理链,MCPO能够提高系统的响应速度和效率,降低计算资源消耗,具有重要的实际价值和未来影响。

📄 摘要(原文)

Recently, multimodal large-scale reasoning models have demonstrated remarkable capabilities in solving complex tasks through long Chains-of-Thought (M-CoT). However, excessively long reasoning trajectories incur substantial computational costs and significant KV-cache pressure. Existing CoT compression and alignment paradigms mainly rely on static rules or single-dimensional preferences, lacking fine-grained cross-modal constraints; as a result, they are prone to inducing visual laziness and hallucinatory reasoning. To address these issues, we propose Modality-Contrastive Preference Optimization (MCPO), a highly sample-efficient two-stage length-compression method that requires fewer than 900 training samples. In the compression stage, we introduce a step-level Normalized Cross-Modal Mutual Information (NCMI) pruning algorithm, which automatically identifies and removes visual-independent reasoning steps by comparing the reasoning discrepancies between with-image and no-image contexts. This significantly reduces redundancy and hallucinatory content in the reasoning chains. In the alignment stage, the model first undergoes supervised fine-tuning to achieve domain-adaptive initialization, followed by optimization using an asymmetric multimodal length-controlled preference loss. This objective adopts a highly nonlinear odds-ratio formulation that provides steep gradients in the with-image context to reinforce length constraints for preferred trajectories, while applying a scaled, flat-gradient linear difference in the no-image context to maintain modality consistency, thereby achieving stable cross-modal preference alignment. Extensive experiments on mainstream base models such as Qwen3-VL-Thinking show that our method can reduce CoT length by up to 69.5% and achieve up to 3.34x end-to-end inference speedup while preserving original accuracy.