Breaking of brightness consistency in optical flow with a lightweight CNN network

📄 arXiv: 2310.15655v2 📥 PDF

作者: Yicheng Lin, Shuo Wang, Yunlong Jiang, Bin Han

分类: cs.CV

发布日期: 2023-10-24 (更新: 2024-05-27)

备注: 7 pages,7 figures

🔗 代码/项目: GITHUB


💡 一句话要点

提出轻量级CNN网络以解决光流中的亮度一致性问题

🎯 匹配领域: 支柱三:空间感知与语义 (Perception & Semantics)

关键词: 光流 卷积神经网络 高动态范围 无监督学习 特征提取 视觉惯性系统 动态光照 鲁棒性

📋 核心要点

  1. 现有稀疏光流方法在高动态范围环境中假设亮度一致性,导致性能下降。
  2. 提出了一种轻量级卷积神经网络,提取光照鲁棒的特征,并实现光流方法的改进。
  3. 在公共HDR数据集上,所提方法显著减少了93%的平移误差,验证了其有效性。

📝 摘要(中文)

稀疏光流在各种计算机视觉任务中被广泛应用,但在高动态范围(HDR)环境中,假设亮度一致性限制了其性能。本文提出了一种轻量级网络,用于提取对光照具有鲁棒性的卷积特征和强不变性的角点。通过将光流方法的典型亮度一致性修改为卷积特征一致性,提出了一种光照鲁棒的混合光流方法。该网络在商业CPU上以190 FPS的速度运行,仅使用四个卷积层同时提取特征图和得分图。由于浅层网络难以直接训练,设计了深层网络来计算可靠性图以辅助训练。采用端到端的无监督训练模式来训练两个网络。通过与原始光流在动态光照下的角点重复性和匹配性能进行比较,验证了所提方法的有效性。此外,通过在VINS-Mono中替换光流方法,构建了更准确的视觉惯性系统。在公共HDR数据集中,减少了93%的平移误差。代码已公开发布。

🔬 方法详解

问题定义:本文旨在解决现有稀疏光流方法在高动态范围环境中因假设亮度一致性而导致的性能不足问题。现有方法在动态光照条件下表现不佳,影响了光流的准确性和鲁棒性。

核心思路:论文提出通过轻量级卷积神经网络提取对光照变化鲁棒的卷积特征,并将光流方法的亮度一致性修改为卷积特征一致性,从而提高光流的性能。

技术框架:整体架构包括两个主要部分:一个浅层网络用于提取特征图和得分图,另一个深层网络用于计算可靠性图。两个网络采用端到端的无监督训练模式进行训练,确保特征提取的有效性。

关键创新:最重要的创新在于提出了光照鲁棒的混合光流方法,通过卷积特征一致性替代传统的亮度一致性,显著提升了在动态光照下的光流性能。

关键设计:网络结构采用四个卷积层,确保了轻量级和高效性。损失函数设计为无监督模式,允许在没有标注数据的情况下进行训练,增强了模型的泛化能力。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果表明,所提方法在公共HDR数据集上将平移误差减少了93%,相较于传统光流方法具有显著的性能提升。这一结果验证了光照鲁棒混合光流方法的有效性,尤其在动态光照条件下表现优异。

🎯 应用场景

该研究的潜在应用领域包括自动驾驶、机器人导航和增强现实等场景,尤其是在光照变化频繁的环境中。通过提高光流的鲁棒性,能够显著提升这些应用的准确性和可靠性,具有重要的实际价值和广泛的未来影响。

📄 摘要(原文)

Sparse optical flow is widely used in various computer vision tasks, however assuming brightness consistency limits its performance in High Dynamic Range (HDR) environments. In this work, a lightweight network is used to extract illumination robust convolutional features and corners with strong invariance. Modifying the typical brightness consistency of the optical flow method to the convolutional feature consistency yields the light-robust hybrid optical flow method. The proposed network runs at 190 FPS on a commercial CPU because it uses only four convolutional layers to extract feature maps and score maps simultaneously. Since the shallow network is difficult to train directly, a deep network is designed to compute the reliability map that helps it. An end-to-end unsupervised training mode is used for both networks. To validate the proposed method, we compare corner repeatability and matching performance with origin optical flow under dynamic illumination. In addition, a more accurate visual inertial system is constructed by replacing the optical flow method in VINS-Mono. In a public HDR dataset, it reduces translation errors by 93\%. The code is publicly available at https://github.com/linyicheng1/LET-NET.