CoRe: A Comprehensive Framework for Cross-Image Comparative Reasoning in Vision-Language Models

📄 arXiv: 2607.12786v1 📥 PDF

作者: Lin Peng, Cong Wan, Zeyu Guo, SongLin Dong, Yihong Gong

分类: cs.CV

发布日期: 2026-07-14

备注: Accepted by ACMMM2026


💡 一句话要点

提出CoRe框架以解决跨图像比较推理问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 跨图像推理 视觉语言模型 细粒度比较 结构化奖励 多模态学习

📋 核心要点

  1. 现有视觉语言模型在跨图像比较推理中面临细粒度属性定位和全局一致性推理的挑战,导致预测准确性不足。
  2. CoRe框架通过构建大规模训练集和结构化奖励机制,旨在提升跨图像比较推理的准确性和一致性。
  3. 实验结果显示,CoRe在CoRe-Bench基准上显著超越现有模型,并在标准多模态基准上表现出色,提升幅度明显。

📝 摘要(中文)

跨图像比较推理对视觉语言模型(VLMs)仍然具有挑战性,尤其是在需要细粒度属性定位和全局一致推理时。本文提出了CoRe,一个统一的框架来解决这一问题。CoRe包括:CoRe-20K,一个基于三元组的大规模训练集,涵盖计数、深度、距离和空间关系;TriSR,一个结构化奖励框架,联合监督属性定位、判断对齐和三元组一致性;以及CoRe-Bench,首个专注于细粒度跨图像比较推理的基准。实验表明,CoRe在CoRe-Bench上显著优于现有VLMs,同时在标准多模态基准上保持竞争力,部分准确率比最强基线提高28.2个百分点。

🔬 方法详解

问题定义:本文旨在解决跨图像比较推理中的细粒度属性定位和全局一致性推理问题。现有方法在处理复杂视觉信息时,往往无法有效地进行准确的比较推理,导致预测结果不理想。

核心思路:CoRe框架通过整合大规模的三元组训练集和结构化奖励机制,旨在提升模型在跨图像比较推理中的表现。通过这种设计,模型能够更好地理解和比较不同图像之间的细微差别。

技术框架:CoRe框架主要包含三个模块:CoRe-20K训练集、TriSR结构化奖励框架和CoRe-Bench基准。CoRe-20K通过多专家协作从结构化视觉元数据中自动构建,TriSR则在GRPO优化下联合监督属性定位和判断对齐。

关键创新:CoRe的主要创新在于其大规模三元组训练集和结构化奖励机制的结合,这使得模型在细粒度比较推理上具有更高的准确性和一致性。与现有方法相比,CoRe在处理复杂视觉信息时表现出更强的能力。

关键设计:在设计上,CoRe使用了多种损失函数来优化属性定位和判断对齐,同时在网络结构上采用了适应性调整的策略,以确保模型在不同任务中的表现均衡。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

在CoRe-Bench基准上,CoRe框架的表现显著优于现有视觉语言模型,部分准确率比最强基线提高了28.2个百分点,显示出其在细粒度比较推理任务中的卓越能力。

🎯 应用场景

CoRe框架在图像理解、智能问答和多模态交互等领域具有广泛的应用潜力。通过提升跨图像比较推理的能力,CoRe能够为视觉语言模型在实际应用中提供更高的准确性和可靠性,推动智能系统的进一步发展。

📄 摘要(原文)

Cross-image comparative reasoning remains challenging for vision-language models (VLMs), especially when correct prediction requires fine-grained attribute grounding and globally consistent reasoning. We present CoRe, a unified framework for this problem. CoRe includes: (i) CoRe-20K, a large-scale triplet-based training set automatically constructed from structured visual metadata through a multi-expert collaborative pipeline, covering counting, depth, distance, and spatial relations; (ii) TriSR, a structured reward framework that jointly supervises attribute grounding, judgment alignment, and triplet consistency under GRPO optimization; and (iii) CoRe-Bench, the first benchmark dedicated to fine-grained cross-image comparative reasoning. Experiments show that CoRe substantially outperforms existing VLMs on CoRe-Bench while remaining competitive on standard multimodal benchmarks, achieving a 28.2-point gain in partial accuracy over the strongest baseline.