Unified Video Dense Prediction from Disjoint Data

📄 arXiv: 2607.21592v1 📥 PDF

作者: Yihong Sun, Seoung Wug Oh, Jiahui Huang, Bharath Hariharan, Joon-Young Lee

分类: cs.CV

发布日期: 2026-07-23

备注: ECCV 2026

🔗 代码/项目: PROJECT_PAGE


💡 一句话要点

提出UniD模型以解决视频场景理解中的数据碎片化问题

🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture) 支柱三:空间感知与语义 (Perception & Semantics)

关键词: 视频理解 场景理解 多任务学习 蒸馏训练 深度学习 数据融合 视觉模型

📋 核心要点

  1. 现有方法在处理场景理解时面临数据碎片化和注释不一致的问题,导致模型泛化能力不足。
  2. 论文提出的UniD模型通过轻量级任务投影器实现了从不相交数据集的联合预测,避免了伪标注的高计算成本。
  3. 实验结果表明,UniD在多个任务上表现优异,尤其在未见场景和任务组合中展现出强大的泛化能力。

📝 摘要(中文)

场景理解需要同时预测几何、外观和语义等信息。然而,现有的任务特定注释在不兼容的领域特定数据集中是碎片化的。当前的统一系统通过限制训练在完全共同注释的数据上,或通过承担伪标注的高计算成本来规避这一问题。为此,我们提出了UniD,一个统一的视频模型,能够从不相交的领域特定数据集中联合预测八种密集场景属性,包括深度、表面法线、语义分割、边界、人类部件、反射率、阴影和材料。我们提出了一种简单而有效的蒸馏步骤,其中每个任务的专家通过轻量级任务投影器监督统一的主干,消除了对注释重叠或伪标注的需求。我们的关键见解是,预训练的扩散模型的强视觉先验足以弥合由不相交训练源引入的领域差距,从而实现对训练期间未见场景任务组合的强健泛化。UniD在与每个任务专家和多任务基线的比较中表现出竞争力,并在分布外场景中展现出强大的泛化能力和增强的时间及跨任务一致性。

🔬 方法详解

问题定义:论文要解决的问题是如何在数据碎片化的情况下,实现对视频场景的统一理解。现有方法通常依赖于完全注释的数据集,或者需要高昂的计算成本进行伪标注,这限制了模型的泛化能力。

核心思路:论文的核心思路是通过引入轻量级任务投影器,使得每个任务的专家能够监督统一的主干网络,从而实现对不同领域数据的联合学习,消除对注释重叠的需求。

技术框架:整体架构包括一个统一的主干网络和多个任务投影器。主干网络负责提取特征,而任务投影器则将这些特征映射到各自的任务空间。通过这种方式,模型能够同时处理多个任务,提升学习效率。

关键创新:最重要的技术创新点在于利用预训练的扩散模型的强视觉先验,成功弥合了不同数据源之间的领域差距。这一方法与传统的依赖于伪标注或完全注释的数据集的方式有本质区别。

关键设计:在设计上,模型采用了轻量级的任务投影器,确保了计算效率。同时,损失函数的设计也考虑到了各任务之间的协同学习,增强了模型的整体性能。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果显示,UniD在多个任务上与每个任务的专家模型和多任务基线相比,表现出竞争力,尤其在未见场景中泛化能力显著提升,展现出更强的时间和跨任务一致性。

🎯 应用场景

该研究的潜在应用领域包括自动驾驶、机器人视觉、增强现实等场景理解任务。通过实现对不同数据源的有效整合,UniD模型能够在实际应用中提供更为准确和一致的场景理解,推动相关技术的发展与应用。

📄 摘要(原文)

Scene understanding requires simultaneous prediction about geometry, appearance, and semantics. However, existing task-specific annotations are fragmented across incompatible, domain-specific datasets. Current unified systems circumvent this by restricting training to fully co-annotated data, or by incurring the large computational cost of pseudo-labeling. To mitigate this, we introduce UniD, a unified video model that jointly predicts eight dense scene properties-depth, surface normals, semantic segmentation, boundaries, human parts, albedo, shading, and materials-all learned from disjoint, domain-specific datasets. We propose a simple yet effective distillation step in which per-task experts supervise a unified backbone through lightweight task projectors, eliminating the need for annotation overlap or pseudo-labeling. Our key insight is that the strong visual priors of a pretrained diffusion model are sufficient to bridge the domain gaps introduced by disjoint training sources, enabling robust generalization to scene-task combinations never seen during training. UniD achieves competitive performance against per-task specialists and multi-task baselines, with strong generalization to out-of-distribution scenarios and enhanced temporal and cross-task consistency. Code and video results are available at https://unid-video.github.io/.