Pix2HDR -- A pixel-wise acquisition and deep learning-based synthesis approach for high-speed HDR videos
作者: Caixin Wang, Jie Zhang, Matthew A. Wilson, Ralph Etienne-Cummings
分类: eess.IV, cs.CV
发布日期: 2023-10-24 (更新: 2024-04-25)
备注: 17 pages, 18 figures
💡 一句话要点
提出Pix2HDR以解决高速度HDR视频捕获问题
🎯 匹配领域: 支柱八:物理动画 (Physics-based Animation)
关键词: 高动态范围视频 深度学习 像素级采样 运动捕捉 图像传感器 视频合成 计算机视觉
📋 核心要点
- 现有方法在获取高动态范围视频时,往往需要多曝光帧,这导致运动不对齐和伪影问题。
- 本文提出通过单个像素在不同曝光和相位偏移下进行采样,结合深度学习进行HDR视频合成。
- 实验结果表明,本文方法在1000 FPS下实现了无别名HDR视频捕获,显著改善了动态场景下的表现。
📝 摘要(中文)
准确捕捉动态场景中的广泛运动和光强变化对于许多视觉应用至关重要。然而,由于相机的帧率限制,高速高动态范围(HDR)视频的获取面临挑战。现有方法通过多曝光帧来获取HDR视频,但由于帧间运动不对齐,可能导致合成算法出现伪影。本文提出了一种基于像素的采样方法,使用单个像素在不同曝光和相位偏移下进行采样,结合深度神经网络将像素输出转换为HDR视频,实现了1000 FPS的无别名HDR视频捕获,显著提升了在低光和明亮背景下快速运动的表现。
🔬 方法详解
问题定义:本文旨在解决高速高动态范围视频捕获中的运动不对齐和伪影问题。现有方法依赖多曝光帧,导致在快速运动场景中难以获得清晰的HDR视频。
核心思路:论文提出了一种基于像素的采样方法,通过对每个像素进行不同曝光和相位偏移的采样,避免了帧间运动不对齐的问题,并利用深度神经网络进行HDR视频合成。
技术框架:整体架构包括两个主要阶段:首先,使用单色可编程图像传感器进行像素级采样;其次,利用训练好的深度神经网络将采样结果转换为高质量的HDR视频。
关键创新:最重要的技术创新在于采用像素级采样而非传统的帧级采样,这使得在高速和高动态范围条件下能够有效捕获动态场景,显著减少了运动模糊和伪影。
关键设计:在网络结构上,采用了端到端学习的方式,设计了适应不同曝光和相位的损失函数,以优化HDR合成效果。
🖼️ 关键图片
📊 实验亮点
实验结果显示,本文方法在1000 FPS下实现了无别名HDR视频捕获,能够有效处理快速运动和低光条件下的场景,相较于传统方法,运动模糊和伪影显著减少,提升了视频质量。
🎯 应用场景
该研究具有广泛的应用潜力,特别是在需要高速度和高动态范围视频捕获的领域,如自动驾驶、运动分析和虚拟现实等。通过提升视觉系统在动态条件下的适应性和性能,未来可推动相关技术的进步和应用普及。
📄 摘要(原文)
Accurately capturing dynamic scenes with wide-ranging motion and light intensity is crucial for many vision applications. However, acquiring high-speed high dynamic range (HDR) video is challenging because the camera's frame rate restricts its dynamic range. Existing methods sacrifice speed to acquire multi-exposure frames. Yet, misaligned motion in these frames can still pose complications for HDR fusion algorithms, resulting in artifacts. Instead of frame-based exposures, we sample the videos using individual pixels at varying exposures and phase offsets. Implemented on a monochrome pixel-wise programmable image sensor, our sampling pattern simultaneously captures fast motion at a high dynamic range. We then transform pixel-wise outputs into an HDR video using end-to-end learned weights from deep neural networks, achieving high spatiotemporal resolution with minimized motion blurring. We demonstrate aliasing-free HDR video acquisition at 1000 FPS, resolving fast motion under low-light conditions and against bright backgrounds - both challenging conditions for conventional cameras. By combining the versatility of pixel-wise sampling patterns with the strength of deep neural networks at decoding complex scenes, our method greatly enhances the vision system's adaptability and performance in dynamic conditions.