IQA-T1: Tool-based Visual Evidence Reasoning for Image Quality Assessment
作者: Jinjian Wu, Jiaqi Tang, Wei Wei, Yingying Yan, Jianmin Chen, Botong Geng, Lei Zhang, Qifeng Chen
分类: cs.CV, cs.AI, eess.IV
发布日期: 2026-07-14
备注: Accepted by ECCV 2026
🔗 代码/项目: GITHUB
💡 一句话要点
提出IQA-T1以解决开放世界图像质量评估问题
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 图像质量评估 多模态语言模型 视觉证据推理 工具生成 开放世界环境
📋 核心要点
- 现有的图像质量评估方法在开放世界环境中泛化能力不足,且缺乏可解释性。
- 本文提出的IQA-T1框架通过工具生成的视觉证据增强了多模态语言模型的推理能力。
- 在七个IQA基准上的实验结果显示,IQA-T1在性能上优于现有方法,并提供了更好的可解释性。
📝 摘要(中文)
开放世界环境中的图像质量评估(IQA)因其有限的泛化能力和可解释性而面临挑战。近期基于多模态大型语言模型(MLLM)的研究引入了文本推理进行质量预测,但其判断过于依赖语义偏见的内部表示,导致对低级感知退化的敏感性不足。为此,本文提出了IQA-T1,一个基于工具的视觉证据推理框架,通过显式的感知观察增强MLLM的推理能力。在推理过程中,模型自主调用专门的分析工具生成结构化的视觉证据,如噪声残差图、梯度统计和频谱,这些证据逐步融入推理过程。为支持这一范式,我们构建了Q-Tool数据集,包含11000个基于工具生成证据的多模态推理链。大量实验表明,IQA-T1在七个IQA基准上实现了最佳整体性能,并生成了可解释且基于证据的质量评估。
🔬 方法详解
问题定义:本文旨在解决开放世界环境中图像质量评估的泛化能力不足和可解释性差的问题。现有方法过于依赖语义偏见的内部表示,导致对低级感知退化的敏感性不足。
核心思路:IQA-T1通过引入工具生成的视觉证据来增强多模态语言模型的推理过程,使其能够更好地捕捉图像中的低级特征和退化信息。
技术框架:IQA-T1的整体架构包括多个模块,首先是工具调用模块,该模块在推理过程中自动调用分析工具生成视觉证据;其次是证据整合模块,将生成的视觉证据逐步融入推理过程;最后是质量评估模块,基于整合后的信息进行最终的质量预测。
关键创新:IQA-T1的主要创新在于其工具驱动的视觉证据推理机制,与传统方法相比,它能够更有效地处理低级感知退化问题,提升了模型的整体性能和可解释性。
关键设计:在设计上,IQA-T1使用了多种分析工具生成不同类型的视觉证据,并通过精心设计的损失函数来优化模型的推理能力,确保生成的质量评估结果既准确又具有可解释性。
🖼️ 关键图片
📊 实验亮点
在七个IQA基准测试中,IQA-T1表现出色,整体性能优于现有方法,具体提升幅度达到XX%(具体数据待补充),并且生成的质量评估结果具有良好的可解释性和证据支持。
🎯 应用场景
IQA-T1框架在图像质量评估领域具有广泛的应用潜力,尤其是在需要高精度和可解释性的图像处理任务中,如图像压缩、传输和增强等。未来,该方法可以扩展到其他视觉任务中,提升模型的泛化能力和解释能力。
📄 摘要(原文)
Image Quality Assessment (IQA) in open-world environments remains challenging due to limited generalization and interpretability. Recent approaches based on multimodal large language models (MLLMs) introduce textual reasoning for quality prediction, yet their judgments rely heavily on semantically biased internal representations, making them insensitive to low-level perceptual degradations. We propose IQA-T1, a tool-based visual evidence reasoning framework that augments MLLM reasoning with explicit perceptual observations. During inference, the model autonomously invokes specialized analysis tools to generate structured visual evidence, such as noise residual maps, gradient statistics, and frequency spectra, which are progressively integrated into the reasoning process. To support this paradigm, we construct Q-Tool, a dataset containing 11k multimodal reasoning chains grounded in tool-generated evidence. Extensive experiments on seven IQA benchmarks show that IQA-T1 achieves the best overall performance across datasets while producing interpretable and evidence-grounded quality assessments. Code and dataset are available at https://github.com/zibuyu-02/IQA-T1.