DPNeXt: A Lightweight Multi-Scale Feature Fusion Framework for Efficient ViT-Based Multi-Task Dense Prediction

📄 arXiv: 2607.16012 📥 PDF

作者: Jehun Kang, Jungha Wang, Youngjun Hwang, David Hyunchul Shim

分类: cs.CV, cs.AI, cs.RO

发布日期: 2026-07-20


💡 一句话要点

提出DPNeXt以解决多任务学习中的解码瓶颈问题

🎯 匹配领域: 支柱三:空间感知与语义 (Perception & Semantics) 支柱七:动作重定向 (Motion Retargeting) 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 多任务学习 特征融合 深度估计 语义分割 机器人感知 视觉基础模型 边界引导

📋 核心要点

  1. 现有的解码策略在多任务学习中存在瓶颈,影响了语义分割和深度估计的性能。
  2. DPNeXt通过双深度可分离反向瓶颈和多任务边界引导策略,优化了特征融合和任务模块化。
  3. 在Cityscapes和NYUv2数据集上,DPNeXt-B在语义分割和深度估计中均取得最佳结果,且参数量显著减少。

📝 摘要(中文)

多任务学习(MTL)在机器人感知系统中支持全面的3D空间场景理解,通过整合语义分割和深度估计。尽管视觉基础模型(VFM)越来越多地被用作强大的特征编码器,但现有的解码策略存在关键瓶颈。为此,我们提出DPNeXt,一个简化的多尺度特征融合解码器,作为标准密集预测变换器(DPT)的高效替代方案。DPNeXt利用双深度可分离反向瓶颈,通过以融合为中心的解码和独立任务模块化来提高冻结VFM的利用率。为了进一步减轻任务间的负面归纳迁移,我们引入了多任务边界引导(MTBG)策略。与以往添加融合模块或门控的边界感知方法不同,MTBG应用对称的边界聚焦监督,以鼓励几何一致性,而无需额外的标注或推理成本。实验结果表明,DPNeXt-S在Cityscapes数据集上超越了先前的最先进MTL模型,而DPNeXt-B进一步提升了整体性能,并在比较方法中取得最佳结果。

🔬 方法详解

问题定义:本论文旨在解决多任务学习中现有解码策略的瓶颈问题,特别是在语义分割和深度估计任务中的性能不足。现有方法在特征融合和任务间负面迁移方面存在挑战。

核心思路:DPNeXt通过引入双深度可分离反向瓶颈,优化了特征融合过程,并通过多任务边界引导策略减少任务间的负面影响,提升了模型的整体性能。

技术框架:DPNeXt的整体架构包括多尺度特征融合解码器,主要模块包括双深度可分离反向瓶颈和多任务边界引导模块,旨在提高VFM的利用率和任务间的几何一致性。

关键创新:最重要的技术创新在于引入了多任务边界引导策略,该策略通过对称的边界聚焦监督来增强几何一致性,而无需额外的标注或推理成本,这与传统方法形成鲜明对比。

关键设计:DPNeXt-S相比标准DPT减少了78.6%的可训练参数,并在资源受限的笔记本硬件上实现了最快的推理速度。关键设计还包括优化的损失函数和模块化的任务结构。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

DPNeXt-S在Cityscapes数据集上超越了先前的最先进MTL模型,DPNeXt-B在NYUv2上实现了最佳的语义分割和深度估计结果。与标准DPT相比,DPNeXt-S的可训练参数减少了78.6%,并在资源受限的硬件上实现了最快的推理速度,展示了其高效性和优越性。

🎯 应用场景

该研究在机器人感知、自动驾驶和增强现实等领域具有广泛的应用潜力。通过提升多任务学习的效率,DPNeXt能够在实时场景理解中提供更高的准确性和响应速度,推动智能系统的发展和应用。未来,该方法可能在更多复杂场景下实现更高效的多任务处理。

📄 摘要(原文)

Multi-Task Learning (MTL) in robotics perception systems supports comprehensive 3D spatial scene understanding by integrating semantic segmentation and depth estimation. While Vision Foundation Models (VFMs) are increasingly adopted as robust feature encoders, existing decoding strategies present a critical bottleneck. To address this, we propose DPNeXt, a streamlined multi-scale feature fusion decoder and efficient alternative to the standard Dense Prediction Transformer (DPT). DPNeXt uses dual depthwise separable inverted bottlenecks to improve frozen VFM utilization through fusion-centric decoding and independent task modularization. To further mitigate negative inductive transfer between tasks, we introduce the Multi-Task Boundary Guidance (MTBG) strategy. Unlike prior boundary-aware methods that add fusion modules or gating, MTBG applies symmetric boundary-focused supervision to encourage geometric consistency without extra annotation or inference cost. Experiments on Cityscapes show that DPNeXt-S outperforms prior state-of-the-art (SOTA) MTL models, while DPNeXt-B further improves the overall performance and achieves the best results among the compared methods. On NYUv2, DPNeXt-B also achieves the best semantic segmentation and depth estimation results among the compared methods while requiring substantially fewer trainable parameters than prior large-scale MTL models. Compared with the standard DPT, DPNeXt-S reduces trainable parameters by 78.6% and achieves the fastest inference speed among the compared models on resource-constrained laptop hardware. The source code, model checkpoints, and a demo video will be made available atthis https URL.