Does AI Understand Imaging? A Systematic Benchmark of Agentic AI for Computational Imaging Tasks
作者: Ethan Chung, Chuanjun Zheng, Jasper Tan, Jingxi Li, Haopeng Zhang, Huaijin Chen
分类: cs.AI
发布日期: 2026-07-08
备注: 14 pages, 11 figures. Preprint / work in progress. Paper Webpage: https://cirp-lab.github.io/imagingbench
💡 一句话要点
提出ImagingBench基准以评估代理AI在计算成像任务中的表现
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 计算成像 视觉语言模型 代理AI 基准测试 物理基础成像 多模态系统 逆重建 计算传感
📋 核心要点
- 现有的视觉语言模型在处理计算成像的物理和逆问题时表现不足,特别是在复杂的计算传感任务中。
- 本文提出ImagingBench基准,涵盖20个计算成像任务,评估不同代理AI在多种设置下的表现。
- 实验结果显示,代理模型在计算传感问题上普遍弱于专门方法,且规划者指导的增益有限,表明存在显著的性能差距。
📝 摘要(中文)
视觉语言模型(VLMs)和代理AI在语义视觉任务中表现出色,但它们是否能够处理计算成像背后的物理和逆问题仍不明确。本文提出了ImagingBench,这是一个涵盖20个计算成像任务的基准,分为五个类别:光线和波动光学、图像信号处理、逆重建、计算传感和校准。ImagingBench评估了三种互补设置:专家、规划者和前向系统模拟。通过对领先的图像中心多模态系统进行基准测试,发现代理模型在计算传感问题上表现不佳,尤其是在无透镜成像和全息成像等任务中。尽管模型生成的输出在视觉上令人信服,但其基于参考的保真度仍然较差,显示出语义视觉能力与物理基础成像性能之间的显著差距。
🔬 方法详解
问题定义:本文旨在解决代理AI在计算成像任务中表现不佳的问题,尤其是在处理物理和逆问题时的局限性。现有方法在复杂任务如无透镜成像和全息成像中效果不理想。
核心思路:论文提出ImagingBench基准,通过系统评估20个计算成像任务,比较代理AI与专门方法的性能,以揭示其在物理基础成像中的不足。
技术框架:ImagingBench包含五个任务类别,评估三种设置:专家(固定专家指导的逆重建)、规划者(规划者指导的逆重建)和前向(前向系统模拟)。每种设置旨在测试不同的代理AI在计算成像中的适应性。
关键创新:ImagingBench的创新在于提供了一个统一的测试平台,能够量化代理AI在计算成像中的表现差距,并追踪其进展。与现有方法相比,它更全面地评估了模型在物理基础成像中的能力。
关键设计:在实验中,使用了领先的图像中心多模态系统(如Gemini、GPT和Qwen),并与特定任务的非代理基线进行比较。参数设置和损失函数的选择旨在优化模型在不同任务中的表现。实验结果表明,尽管生成的输出在视觉上令人信服,但在参考保真度上仍存在显著不足。
🖼️ 关键图片
📊 实验亮点
实验结果显示,代理模型在计算传感任务中表现普遍弱于专门方法,尤其是在无透镜成像和全息成像等任务中。规划者指导的增益有限,且模型生成的输出在视觉上虽令人信服,但其基于参考的保真度仍然较差,显示出显著的性能差距。
🎯 应用场景
该研究的潜在应用领域包括医学成像、遥感、计算机视觉等领域,能够为相关技术的发展提供重要的基准和参考。通过提升代理AI在计算成像中的表现,未来可能推动更智能的成像系统的实现,改善图像质量和处理效率。
📄 摘要(原文)
Vision-language models (VLMs) and agentic AI have shown strong performance on semantic visual tasks, but it remains unclear whether they can handle the physics and inverse problems that underlie computational imaging. We present ImagingBench, a benchmark of 20 computational imaging tasks spanning five categories: ray and wave optics, image signal processing, inverse reconstruction, computational sensing, and calibration. ImagingBench evaluates three complementary settings: Expert, fixed expert-guided inverse reconstruction; Planner, planner-guided inverse reconstruction; and Forward, forward-system simulation for consistency checking. We benchmark leading proprietary and open-source image-centric multimodal systems, including Gemini, GPT, and Qwen, and compare them with representative task-specific non-agentic baselines. Across tasks, agentic models remain consistently weaker than specialized methods, especially on computational sensing problems such as lensless imaging, event-based reconstruction, time-of-flight imaging, and holography. Planner guidance provides only modest and inconsistent gains over the fixed-prompt Expert baseline. Although the models often generate visually plausible outputs, their reference-based fidelity remains poor, revealing a substantial gap between semantic visual competence and physically grounded imaging performance. ImagingBench provides a unified testbed for measuring this gap and tracking progress in agentic AI for computational imaging.