RL-based Stateful Neural Adaptive Sampling and Denoising for Real-Time Path Tracing

📄 arXiv: 2310.03507v1 📥 PDF

作者: Antoine Scardigli, Lukas Cavigelli, Lorenz K. Müller

分类: cs.CV, cs.GR, cs.MM

发布日期: 2023-10-05

备注: Submitted to NeurIPS. https://openreview.net/forum?id=xNyR7DXUzJ


💡 一句话要点

提出基于RL的状态神经自适应采样与去噪以解决实时路径追踪问题

🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture) 支柱八:物理动画 (Physics-based Animation)

关键词: 蒙特卡洛路径追踪 强化学习 图像去噪 实时渲染 深度学习

📋 核心要点

  1. 现有的蒙特卡洛路径追踪方法在低采样情况下噪声水平高,限制了其在实时应用中的有效性。
  2. 本文提出了一个结合采样重要性网络、潜在空间编码器和去噪网络的框架,通过强化学习优化采样过程。
  3. 实验结果表明,该方法在多个数据集上显著提高了视觉质量,并将渲染时间减少了1.6倍,优于现有技术。

📝 摘要(中文)

蒙特卡洛路径追踪是一种强大的真实图像合成技术,但在低采样数量下会产生高噪声,限制了其在实时应用中的使用。为此,本文提出了一个框架,结合了采样重要性网络、潜在空间编码器网络和去噪网络的端到端训练。我们的方法利用强化学习优化采样重要性网络,从而避免显式的数值近似梯度。该方法不通过平均聚合每个像素的采样值,而是保留所有采样值并输入到潜在空间编码器中。编码器用学习到的表示替代了手工设计的时空启发式方法。最后,训练一个神经去噪器来精炼输出图像。我们的方案在多个具有挑战性的数据集上提高了视觉质量,并将相同质量下的渲染时间缩短了1.6倍,成为实时应用的有希望解决方案。

🔬 方法详解

问题定义:本文旨在解决蒙特卡洛路径追踪在低采样情况下产生的高噪声问题,这限制了其在实时图像合成中的应用。现有方法通常依赖于数值近似梯度,导致效率低下。

核心思路:我们提出的框架通过强化学习优化采样重要性网络,避免了传统方法中的显式梯度计算。该方法保留所有采样值,而不是简单平均,从而提高了信息利用率。

技术框架:整体架构包括三个主要模块:采样重要性网络、潜在空间编码器和去噪网络。采样网络负责生成样本,编码器将样本映射到潜在空间,去噪网络则对输出图像进行精炼。

关键创新:最重要的创新在于使用强化学习优化采样过程,并通过学习表示替代了传统的手工设计启发式方法。这种方法显著提高了图像质量和渲染效率。

关键设计:在网络结构上,采样网络和去噪网络均采用深度学习架构,损失函数设计为结合重建损失和感知损失,以确保生成图像的质量和真实感。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果显示,本文提出的方法在多个挑战性数据集上显著提高了视觉质量,并将相同质量下的渲染时间缩短了1.6倍,相较于现有的最先进技术具有明显的优势,展示了其在实时应用中的潜力。

🎯 应用场景

该研究的潜在应用领域包括实时图像合成、虚拟现实和游戏开发等。通过提升路径追踪的效率和质量,该方法能够在需要高质量图像的实时应用中发挥重要作用,推动相关技术的发展。

📄 摘要(原文)

Monte-Carlo path tracing is a powerful technique for realistic image synthesis but suffers from high levels of noise at low sample counts, limiting its use in real-time applications. To address this, we propose a framework with end-to-end training of a sampling importance network, a latent space encoder network, and a denoiser network. Our approach uses reinforcement learning to optimize the sampling importance network, thus avoiding explicit numerically approximated gradients. Our method does not aggregate the sampled values per pixel by averaging but keeps all sampled values which are then fed into the latent space encoder. The encoder replaces handcrafted spatiotemporal heuristics by learned representations in a latent space. Finally, a neural denoiser is trained to refine the output image. Our approach increases visual quality on several challenging datasets and reduces rendering times for equal quality by a factor of 1.6x compared to the previous state-of-the-art, making it a promising solution for real-time applications.