MonoSKD: General Distillation Framework for Monocular 3D Object Detection via Spearman Correlation Coefficient
作者: Sen Wang, Jin Zheng
分类: cs.CV, cs.AI
发布日期: 2023-10-17
备注: Accepted by ECAI 2023
🔗 代码/项目: GITHUB
💡 一句话要点
提出MonoSKD框架以解决单目3D目标检测中的知识蒸馏问题
🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture)
关键词: 单目3D检测 知识蒸馏 Spearman相关系数 跨模态学习 深度学习
📋 核心要点
- 单目3D目标检测面临从单幅图像中准确预测3D位置的挑战,现有方法在知识蒸馏方面存在复杂性。
- 提出MonoSKD框架,通过Spearman相关系数学习跨模态特征的相对相关性,采用宽松的Spearman损失以避免误导训练。
- 在KITTI 3D目标检测基准上进行广泛实验,MonoSKD实现了最先进的性能,且训练速度较快,资源消耗更低。
📝 摘要(中文)
单目3D目标检测是一个固有的病态问题,因为从单幅图像中预测准确的3D定位非常具有挑战性。现有的单目3D检测知识蒸馏方法通常将LiDAR投影到图像平面,并相应地训练教师网络。将基于LiDAR的模型知识转移到基于RGB的模型更为复杂,因此需要一种通用的蒸馏策略。为缓解跨模态问题,本文提出了MonoSKD,一个基于Spearman相关系数的单目3D检测知识蒸馏框架,以学习跨模态特征之间的相对相关性。考虑到这些特征之间的巨大差距,严格的特征对齐可能会误导训练,因此我们提出了更为宽松的Spearman损失。此外,通过选择合适的蒸馏位置和去除冗余模块,我们的方案节省了更多的GPU资源,并比现有方法训练得更快。大量实验验证了我们框架在KITTI 3D目标检测基准上的有效性。我们的算法在提交时达到了最先进的性能,且没有额外的推理计算成本。
🔬 方法详解
问题定义:本文旨在解决单目3D目标检测中的知识蒸馏问题,现有方法通常依赖于LiDAR数据进行训练,导致跨模态知识转移的复杂性和效率低下。
核心思路:提出MonoSKD框架,通过Spearman相关系数来学习不同模态特征之间的相对关系,避免了严格对齐带来的训练误导。
技术框架:MonoSKD框架包括特征提取、蒸馏损失计算和模型训练三个主要模块。特征提取模块从单目图像中提取特征,蒸馏损失模块计算基于Spearman相关系数的损失,最后进行模型训练。
关键创新:本研究的关键创新在于引入了宽松的Spearman损失函数,允许在特征对齐时保持一定的灵活性,从而提高了跨模态知识蒸馏的有效性。
关键设计:在参数设置上,选择了适当的蒸馏位置,并去除了冗余模块,以节省GPU资源并加快训练速度。损失函数的设计上,采用了Spearman相关系数作为主要度量,确保了特征之间的相对关系被有效学习。
🖼️ 关键图片
📊 实验亮点
在KITTI 3D目标检测基准上,MonoSKD框架实现了最先进的性能,具体表现为在多个评估指标上超越了现有方法,且在训练速度上显著提升,节省了GPU资源,展示了其优越性。
🎯 应用场景
MonoSKD框架在自动驾驶、机器人视觉和增强现实等领域具有广泛的应用潜力。通过提高单目3D目标检测的准确性和效率,该研究能够推动智能交通系统和自主导航技术的发展,具有重要的实际价值和未来影响。
📄 摘要(原文)
Monocular 3D object detection is an inherently ill-posed problem, as it is challenging to predict accurate 3D localization from a single image. Existing monocular 3D detection knowledge distillation methods usually project the LiDAR onto the image plane and train the teacher network accordingly. Transferring LiDAR-based model knowledge to RGB-based models is more complex, so a general distillation strategy is needed. To alleviate cross-modal prob-lem, we propose MonoSKD, a novel Knowledge Distillation framework for Monocular 3D detection based on Spearman correlation coefficient, to learn the relative correlation between cross-modal features. Considering the large gap between these features, strict alignment of features may mislead the training, so we propose a looser Spearman loss. Furthermore, by selecting appropriate distillation locations and removing redundant modules, our scheme saves more GPU resources and trains faster than existing methods. Extensive experiments are performed to verify the effectiveness of our framework on the challenging KITTI 3D object detection benchmark. Our method achieves state-of-the-art performance until submission with no additional inference computational cost. Our codes are available at https://github.com/Senwang98/MonoSKD