PQFA: Parallel Quantum Feature Augmentation of Fused Representations for Multimodal Classification
作者: Mingzhu Wang, Yun Shang
分类: cs.LG, quant-ph
发布日期: 2026-07-15
💡 一句话要点
提出PQFA以增强多模态分类的后融合特征
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 多模态学习 量子计算 特征增强 鲁棒性 深度学习
📋 核心要点
- 现有多模态学习方法主要集中在表示的对齐与融合,后融合增强的研究相对匮乏,导致模型在处理缺失模态时的鲁棒性不足。
- 本文提出PQFA,通过并行量子电路对融合的多模态特征进行增强,利用量子计算的优势提升模型的表现。
- 实验结果表明,PQFA在多个数据集上均优于传统的融合方法,且在处理缺失模态时表现出更强的鲁棒性。
📝 摘要(中文)
大多数多模态学习方法专注于异构表示的对齐和融合,而后融合增强的研究相对较少。本文提出了并行量子特征增强(PQFA),这是一个混合量子-经典框架,利用多个浅层变分量子电路对融合的多模态特征进行处理。通过双向交叉注意力、注意力池化和自适应门控融合处理提取的文本和图像表示。融合特征随后被幅度编码到并行量子电路中,其测量结果与经典表示连接用于预测。实验表明,PQFA在MM-IMDb和N24News数据集上表现优于没有量子增强的融合基础模型和宽度匹配的多层感知机(MLP)增强基线,同时使用的增强参数约为2.2K,相较于MLP的24.0K显著减少。缺失模态实验进一步显示了在文本或视觉输入不完整时的增强鲁棒性,特别是在文本模态严重退化时效果显著。
🔬 方法详解
问题定义:本文旨在解决现有多模态学习方法在后融合特征增强方面的不足,特别是在处理缺失模态时的鲁棒性问题。现有方法往往忽视了融合后的特征增强,导致模型在实际应用中的表现不佳。
核心思路:PQFA的核心思路是利用并行量子电路对融合的多模态特征进行增强,结合量子计算的特性,提升模型的特征表达能力和预测性能。通过量子电路的幅度编码,模型能够更有效地处理复杂的特征交互。
技术框架:PQFA的整体架构包括多个主要模块:首先,使用冻结的RoBERTa和ViT编码器提取文本和图像表示;接着,通过双向交叉注意力和自适应门控融合进行特征融合;最后,将融合特征幅度编码到并行量子电路中,并与经典表示结合进行预测。
关键创新:PQFA的最重要创新在于将量子计算引入后融合特征增强中,显著提高了模型的参数效率和预测准确性。与传统的多层感知机(MLP)增强方法相比,PQFA在参数使用上更为高效,且在多模态数据处理上表现出更好的鲁棒性。
关键设计:在PQFA中,采用了约2.2K的增强参数,相较于传统MLP的24.0K大幅减少。此外,设计中还包括了特征空间分析和量子态诊断,以确保在不同噪声水平下的稳定预测性能。
🖼️ 关键图片
📊 实验亮点
PQFA在MM-IMDb和N24News数据集上的实验结果显示,模型在没有量子增强的基础融合方法上表现出显著提升,且在缺失模态实验中表现出更强的鲁棒性。具体而言,PQFA在处理严重退化的文本模态时,预测性能有明显改善,显示出量子增强的有效性。
🎯 应用场景
PQFA的研究成果在多模态学习领域具有广泛的应用潜力,尤其是在需要处理缺失数据的场景中,如医疗影像分析、社交媒体内容理解等。通过提升模型的鲁棒性和预测能力,PQFA有望推动相关领域的技术进步和实际应用。未来,随着量子计算技术的发展,PQFA的应用范围可能进一步扩展。
📄 摘要(原文)
Most multimodal learning methods improve how heterogeneous representations are aligned and fused, while post-fusion enhancement remains less explored. We propose Parallel Quantum Feature Augmentation (PQFA), a hybrid quantum-classical framework that applies multiple shallow variational quantum circuits to fused multimodal features. Text and image representations extracted by frozen RoBERTa and ViT encoders are processed through bidirectional cross-attention, attentive pooling, and adaptive gated fusion. The fused feature is then amplitude-encoded into parallel quantum circuits, whose measurement readouts are concatenated with the classical representation for prediction. We evaluate PQFA on MM-IMDb and N24News through controlled comparisons using the same encoders, fusion backbone, data splits, projection dimension, and augmentation output width. PQFA consistently outperforms both the fusion backbone without quantum augmentation and a width-matched MLP augmentation baseline, while using approximately 2.2K augmentation parameters compared with 24.0K for the MLP branch. Missing-modality experiments further show improved robustness when textual or visual inputs are incomplete, with particularly clear gains when the more informative textual modality is severely degraded. Controlled ablations and feature-space analyses indicate that the improvement cannot be reproduced by random feature mappings, increased classical width, or untrained quantum transformations. Quantum-state diagnostics additionally show stable predictive performance across the tested simulated noise levels and distinct branch-specific transformations of the encoded states. These results establish PQFA as an effective and parameter-efficient strategy for post-fusion augmentation in hybrid quantum-classical multimodal learning.