Scene Parameter Saliency via Differentiable Light Transport

📄 arXiv: 2607.21562v1 📥 PDF

作者: Linas Beresna, Eugene Fiume

分类: cs.CV, cs.GR

发布日期: 2026-07-23

备注: 13 pages, 5 figures


💡 一句话要点

提出可微光传输的场景参数显著性方法以提升模型可解释性

🎯 匹配领域: 支柱三:空间感知与语义 (Perception & Semantics)

关键词: 可微渲染 显著性图 光传输 模型可解释性 计算机图形学 参数优化 视觉效果

📋 核心要点

  1. 现有的神经显著性方法主要依赖于学习的权重传播,难以直接反映图像形成过程中的参数影响。
  2. 本文提出通过可微渲染器生成度量显著性图,直接从图像形成过程获取每个参数对特定指标的影响。
  3. 实验结果表明,不同指标下的显著性排名差异显著,强调了度量显著性图在场景理解中的重要性。

📝 摘要(中文)

基于梯度的显著性方法揭示了哪些输入特征对神经网络输出的影响,是模型可解释性的标准工具。本文观察到,可微渲染器在参数优化中产生了一种类似的显著性形式:通过对渲染图像评估的标量指标进行反向模式微分,可以获得每个参数的梯度,识别出哪些场景元素对该指标的影响最大。我们称这些梯度场为度量显著性图。与神经显著性不同,度量显著性通过图像形成过程本身传播,包括多次反射光传输,捕捉到手动检查时半透明的参数依赖性。我们为不同的目标计算了度量显著性图,结果显示同一场景在不同指标下的显著性排名差异显著。

🔬 方法详解

问题定义:本文旨在解决现有神经显著性方法在图像形成过程中的透明度不足的问题,现有方法难以直接揭示参数对输出的影响。

核心思路:通过可微渲染器的反向模式微分,直接计算每个场景参数对特定指标的影响,从而生成度量显著性图。此方法能够捕捉到光传输过程中的复杂依赖关系。

技术框架:整体流程包括:首先使用可微渲染器生成图像,然后对图像进行标量指标评估,最后通过反向微分计算每个参数的梯度,形成显著性图。主要模块包括图像生成、指标评估和梯度计算。

关键创新:最重要的创新在于将可微渲染器用于生成度量显著性图,区别于传统神经网络方法,强调了图像形成过程的直接影响。

关键设计:在参数设置上,选择了多种不同的指标进行评估,包括心理视觉眩光指数、场景平均亮度和神经感知评分,确保显著性图的多样性和适用性。损失函数设计上,关注于优化图像生成的质量和显著性图的准确性。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果显示,度量显著性图在不同指标下的显著性排名差异显著,某些参数在特定目标下的影响力远超其他参数,强调了该方法在场景理解中的有效性。与传统方法相比,显著性图提供了更深入的参数依赖性分析,提升了模型的可解释性。

🎯 应用场景

该研究的潜在应用领域包括计算机图形学、视觉效果制作和自动驾驶等领域。通过提供更清晰的参数影响分析,能够帮助设计师和工程师更好地理解和优化场景渲染过程,提高模型的可解释性和可靠性。未来,该方法可能在实时渲染和交互式应用中发挥重要作用。

📄 摘要(原文)

Gradient-based saliency methods reveal which input features most influence a neural network's output, and are a standard tool for model interpretability. We observe that differentiable renderers, which are conventionally used for parameter optimisation, produce an analogous form of saliency: given any scalar metric evaluated on a rendered image, a single reverse-mode differentiation pass yields per-parameter gradients that identify which scene elements most influence the metric. We call these gradient fields metric saliency maps. Unlike neural saliency, which propagates attribution through learned weights, metric saliency propagates through the image formation process itself, including multi-bounce light transport, capturing parameter dependencies that are semi-opaque to manual inspection. We compute metric saliency maps for qualitatively different objectives: psychovisual glare indices, mean scene luminance, and neural perceptual scores. The saliency rankings differ substantially across metrics for the same scene, with parameters that dominate one objective being negligible for another. The saliency map is specific to the metric, not an intrinsic property of the scene. Our results suggest that differentiable renderers produce derivative images that are as informative for scene understanding as the primal images they were designed to generate.