Tabletop Transparent Scene Reconstruction via Epipolar-Guided Optical Flow with Monocular Depth Completion Prior

📄 arXiv: 2310.09956v1 📥 PDF

作者: Xiaotong Chen, Zheming Zhou, Zhuo Deng, Omid Ghasemalizadeh, Min Sun, Cheng-Hao Kuo, Arnie Sen

分类: cs.RO, cs.CV

发布日期: 2023-10-15

备注: IEEE-RAS Humanoids 2023 paper, 8 pages, 6 figures


💡 一句话要点

提出双阶段管道以解决透明物体重建问题

🎯 匹配领域: 支柱三:空间感知与语义 (Perception & Semantics)

关键词: 透明物体重建 RGB-D相机 深度补全 光流技术 机器人感知 3D重建 极线约束

📋 核心要点

  1. 现有方法在重建透明物体时面临RGB图像外观不一致和深度读数不准确的挑战。
  2. 本文提出的双阶段管道利用单目物体分割和深度补全网络,结合极线引导光流实现透明物体的3D重建。
  3. 实验结果显示,该方法在3D重建质量上显著优于传统基线,提升了机器人对透明物体的感知能力。

📝 摘要(中文)

使用经济实惠的RGB-D相机重建透明物体在机器人感知中一直是一个挑战,因为RGB域中的外观在不同视角下不一致,且单视图中的深度读数不准确。本文提出了一种针对移动平台的透明物体重建的双阶段管道。在第一阶段,利用现成的单目物体分割和深度补全网络预测透明物体的深度,提供单视图形状先验。随后,提出了基于极线约束的光流(EOF),将第一阶段的多个单视图形状先验融合为跨视图一致的3D重建。我们的关键创新在于EOF,它通过边界敏感采样和极线约束来准确建立透明物体在多个视图间的2D对应关系。定量评估表明,我们的管道在3D重建质量上显著优于基线方法,为更灵活的机器人感知和与透明物体的交互铺平了道路。

🔬 方法详解

问题定义:本文旨在解决使用RGB-D相机重建透明物体时,因外观不一致和深度读数不准确导致的重建困难。现有方法在处理透明物体时,往往无法提供可靠的深度信息,影响重建效果。

核心思路:论文提出的双阶段管道首先通过单目物体分割和深度补全网络获取透明物体的单视图形状先验,随后利用极线引导光流(EOF)将多个视图的形状先验融合为一致的3D重建。这种设计旨在提高透明物体的重建精度。

技术框架:整体流程分为两个主要阶段:第一阶段使用单目分割和深度补全网络预测透明物体的深度;第二阶段则通过EOF将多个视图的深度信息融合,生成跨视图一致的3D模型。

关键创新:EOF是本文的核心创新,它结合了边界敏感采样和极线约束,能够在多个视图间准确建立透明物体的2D对应关系。这一方法显著提高了重建的准确性和一致性。

关键设计:在技术细节上,EOF的设计考虑了边界信息的敏感性,采用了特定的损失函数来优化光流计算,确保在不同视角下的透明物体重建能够保持一致性和准确性。具体的网络结构和参数设置在实验部分进行了详细描述。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果表明,所提出的管道在3D重建质量上显著优于基线方法,具体提升幅度达到XX%(具体数据待补充),验证了EOF在处理透明物体重建中的有效性和优势。

🎯 应用场景

该研究的潜在应用领域包括机器人抓取、增强现实和虚拟现实等场景,能够帮助机器人更好地识别和交互透明物体,提升其在复杂环境中的操作能力。未来,该技术可能推动透明物体处理的广泛应用,改善人机交互体验。

📄 摘要(原文)

Reconstructing transparent objects using affordable RGB-D cameras is a persistent challenge in robotic perception due to inconsistent appearances across views in the RGB domain and inaccurate depth readings in each single-view. We introduce a two-stage pipeline for reconstructing transparent objects tailored for mobile platforms. In the first stage, off-the-shelf monocular object segmentation and depth completion networks are leveraged to predict the depth of transparent objects, furnishing single-view shape prior. Subsequently, we propose Epipolar-guided Optical Flow (EOF) to fuse several single-view shape priors from the first stage to a cross-view consistent 3D reconstruction given camera poses estimated from opaque part of the scene. Our key innovation lies in EOF which employs boundary-sensitive sampling and epipolar-line constraints into optical flow to accurately establish 2D correspondences across multiple views on transparent objects. Quantitative evaluations demonstrate that our pipeline significantly outperforms baseline methods in 3D reconstruction quality, paving the way for more adept robotic perception and interaction with transparent objects.