Dual-Correlation Hypergraph Network for Unaligned RGBT Video Object Detection and A Large-scale Benchmark
作者: Qishun Wang, Yapeng Li, Bin Luo, Zhengzheng Tu, Chenglong Li
分类: cs.CV
发布日期: 2026-07-09
💡 一句话要点
提出双关联超图网络以解决RGB-T视频目标检测中的对齐问题
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: RGBT视频目标检测 双关联超图网络 多模态特征对齐 时间空间关联 大规模数据集
📋 核心要点
- 现有RGBT视频目标检测方法在处理空间不对齐问题时效果欠佳,导致检测精度降低。
- 本文提出的双关联超图网络(DHNet)通过建模时间和空间关联,增强了多模态特征的互补信息。
- 在VT-VOD50和DVT-VOD1000数据集上的实验表明,DHNet在检测精度上超越了现有的最先进方法。
📝 摘要(中文)
RGB-热成像(RGBT)视频目标检测(VOD)因其在复杂条件下的优势而受到广泛关注。然而,RGBT图像对之间常存在空间不对齐的问题。为此,本文提出了一种双关联超图网络(DHNet),通过显式建模时间和空间两种关联来捕捉高维互补信息。我们设计了基于补丁的空间对齐模块(PSAM)以在局部区域级别对多模态特征进行顺序对齐,并引入双超图融合模块(DHFM)构建独立的时间和多模态超图,通过双关联学习增强目标的可辨识性。此外,我们构建了DVT-VOD1000数据集,包含1000个视频序列和103,464对RGBT图像,涵盖多种场景。实验结果表明,DHNet在检测精度上达到了最先进的水平。
🔬 方法详解
问题定义:本文旨在解决RGBT视频目标检测中由于空间不对齐导致的检测精度下降问题。现有方法在处理多模态特征时,往往无法有效对齐,从而影响目标检测的性能。
核心思路:论文提出的双关联超图网络(DHNet)通过显式建模时间和空间的双重关联,捕捉高维互补信息,从而提升目标的可辨识性。设计上,首先通过补丁对齐模块对多模态特征进行局部对齐,然后通过超图融合模块增强特征的表达能力。
技术框架:DHNet的整体架构包括两个主要模块:补丁对齐模块(PSAM)和双超图融合模块(DHFM)。PSAM负责在局部区域对多模态特征进行对齐,而DHFM则构建独立的时间和多模态超图,以实现双关联学习。
关键创新:最重要的创新在于引入了双关联学习机制,通过构建时间和空间的超图,显著提升了目标检测的准确性。这一方法与传统的单一模态处理方式有本质区别。
关键设计:在网络设计上,PSAM采用了补丁级别的特征对齐策略,确保了局部信息的准确性;而DHFM则通过构建超图来实现特征的深度融合,优化了损失函数以增强模型的学习能力。
🖼️ 关键图片
📊 实验亮点
在VT-VOD50和DVT-VOD1000数据集上的实验结果显示,DHNet在检测精度上达到了最先进的水平,具体性能提升幅度超过了现有基线方法,证明了双关联学习机制的有效性。
🎯 应用场景
该研究的潜在应用领域包括智能监控、自动驾驶、无人机监测等场景,能够在复杂环境下实现高效的目标检测。通过提升RGBT视频目标检测的精度,能够为安全监控和环境监测提供更可靠的技术支持,具有重要的实际价值和未来影响。
📄 摘要(原文)
RGB-Thermal (RGBT) Video Object Detection (VOD) has gained significant traction due to its ability to overcome the limitations of conventional RGB-based VOD under challenging conditions. However, spatial misalignment commonly exists between RGBT image pairs. To address this, we propose a Dual-Correlation Hypergraph Network (DHNet) that captures high-dimensional complementary information by explicitly modeling two types of correlations: temporal correlation across consecutive frames and spatial correlation from cross-modal features. Specifically, we first design a Patch-based Spatial Alignment Module (PSAM) to sequentially align the multimodal features at the local region level. Subsequently, we introduce a Dual Hypergraph Fusion Module (DHFM), which constructs separate temporal and multimodal hypergraphs to enhance object discriminability through dual-correlation learning. Furthermore, the field currently lacks a large-scale, scene-diverse benchmark dataset for comprehensive evaluation. To address this gap, we construct DVT-VOD1000, a large-scale RGBT VOD dataset containing 1,000 video sequences with 103,464 RGBT image pairs. The dataset covers diverse scenarios, including campuses, parks, transportation, rural areas, night scenes, rain, and snow. Comprehensive experiments on VT-VOD50 and our DVT-VOD1000 demonstrate that DHNet achieves state-of-the-art detection accuracy. The dataset and source code will be made publicly available on https://github.com/tzz-ahu/ to support academic research.