SigLIP-HD by Fine-to-Coarse Supervision
作者: Lihe Yang, Zhen Zhao, Hengshuang Zhao
分类: cs.CV
发布日期: 2026-07-10
备注: ICLR 2026. Code and model: https://github.com/LiheYoung/SigLIP-HD
💡 一句话要点
提出SigLIP-HD以解决低成本高质量视觉感知问题
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 视觉表示 多模态大语言模型 细到粗监督 特征对齐 OCR任务 计算机视觉 模型优化
📋 核心要点
- 现有方法在高分辨率图像处理上存在计算复杂性和设计挑战,未能充分利用标准分辨率下的模型感知能力。
- 论文提出的SigLIP-HD通过细到粗的监督设计,使中分辨率图像的粗特征模仿高分辨率图像的细粒度特征,从而降低成本。
- 实验结果表明,SigLIP-HD在相同推理预算下生成更优的视觉标记,尤其在OCR任务上显著优于基线模型。
📝 摘要(中文)
高质量视觉表示一直是计算机视觉领域的追求。在多模态大语言模型(MLLMs)中,使用高分辨率图像可以生成更细粒度的视觉标记,但这也带来了计算和设计上的复杂性。本文提出SigLIP-HD,通过简单的细到粗的监督设计,强制中分辨率图像的粗特征模仿其高分辨率版本的细粒度特征。该框架基于先进的SigLIP 2模型构建,最终模型在相同的推理预算下生成更好的视觉标记,并在广泛的MLLM基准上验证,尤其在OCR相关任务中表现出更强的结果。
🔬 方法详解
问题定义:本文旨在解决在低成本下实现高质量视觉感知的问题。现有方法在处理高分辨率图像时,面临计算复杂性和设计挑战,未能充分发挥标准分辨率下的模型感知能力。
核心思路:论文的核心思路是通过细到粗的监督设计,使中分辨率图像的粗特征能够模仿其高分辨率版本的细粒度特征。这种设计旨在降低计算成本,同时提升视觉表示的质量。
技术框架:整体架构基于SigLIP 2模型,主要包括中分辨率图像的特征提取、粗特征与细特征的对齐以及损失函数的设计。通过这些模块,模型能够在相同的推理预算下生成更优的视觉标记。
关键创新:最重要的技术创新点在于细到粗的监督设计方法,这与现有方法的本质区别在于不再依赖高分辨率图像的直接处理,而是通过特征对齐实现性能提升。
关键设计:在关键设计方面,论文采用了特定的损失函数来衡量粗特征与细特征之间的相似性,并对网络结构进行了优化,以确保在中分辨率下仍能有效捕捉细粒度信息。具体参数设置和网络结构细节在实验部分有详细描述。
🖼️ 关键图片
📊 实验亮点
实验结果显示,SigLIP-HD在多个MLLM基准上表现优异,尤其在OCR相关任务中,性能提升幅度超过了基线模型,具体提升幅度达到XX%(具体数据需根据实验结果填写)。
🎯 应用场景
该研究的潜在应用领域包括图像识别、自动驾驶、增强现实等需要高质量视觉感知的场景。通过降低计算成本,SigLIP-HD能够在资源受限的环境中实现高效的视觉处理,具有重要的实际价值和未来影响。
📄 摘要(原文)
High-quality visual representation is a long-standing pursuit in computer vision. In the context of multimodal LLMs (MLLMs), feeding higher-resolution images can produce more fine-grained visual tokens. However, it introduces additional computational and design complexity, due to multiple forward passes and post-processing of increased tokens. Before simply adopting a higher resolution, have we truly unlocked the model's full perception capability at a standard resolution? Therefore, we study an interesting problem: how to achieve fine visual perception under lower cost without larger images. We present SigLIP-HD in this work. The core is a highly simple fine-to-coarse supervision design. We enforce the coarse feature of a mid-resolution image to mimic the fine-grained feature of its high-resolution version. We build this framework on the advanced SigLIP 2 model. Our final model produces better visual tokens at exactly the same inference budget. It is validated on extensive MLLM benchmarks and consistently delivers stronger results than our baseline model, especially on OCR-related tasks.