VisCo: Leveraging Large Language Models as Intrinsic Encoders for Visual Token Compression

📄 arXiv: 2607.12756v1 📥 PDF

作者: Yupeng Zheng, Kai Zou, Bin Liu, Nenghai Yu

分类: cs.CV

发布日期: 2026-07-14


💡 一句话要点

提出VisCo以解决视觉标记压缩效率低的问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 视觉标记压缩 视觉语言模型 自编码器 信息编码 多模态学习

📋 核心要点

  1. 现有视觉标记压缩方法在高压缩比下性能显著下降,且重训练成本高,影响模型的先验知识。
  2. VisCo通过重用预训练的视觉语言模型作为内在压缩器,提出了一种训练高效的自压缩框架。
  3. 实验结果显示,VisCo在所有压缩比下均超越了现有方法,尤其在高压缩比下表现更为突出。

📝 摘要(中文)

视觉语言模型(VLMs)处理大量视觉标记,导致推理延迟和内存开销显著。这促使了视觉标记压缩的广泛研究。现有的无训练策略依赖启发式指标,在高压缩比下性能显著下降;而许多基于训练的方法引入外部压缩模块,迫使VLM骨干网络适应,导致重训练成本高且损害VLM的先验知识。有效的视觉标记压缩依赖于强大的信息编码能力,这一能力在预训练的VLM中已存在但未被充分利用。为此,本文提出了VisCo,一个训练高效的自压缩框架,利用预训练的VLM本身作为内在压缩器。VisCo是一个参数共享的自编码器,使用少量内存标记压缩视觉信息,并将层次信息从编码转移到解码。实验表明,VisCo在所有评估的压缩比下均超越了先前的方法,在更激进的压缩下获得更大的提升,并在极端单标记设置中保持稳定。此外,当与原始视觉标记结合时,学习到的内存标记甚至可以改善基础模型,表明VisCo捕获了超越压缩的互补表示。

🔬 方法详解

问题定义:本文旨在解决视觉语言模型在处理大量视觉标记时的推理延迟和内存开销问题。现有方法在高压缩比下性能下降明显,且重训练成本高,影响模型的先验知识。

核心思路:VisCo的核心思想是利用预训练的视觉语言模型本身作为内在压缩器,通过参数共享的自编码器结构实现视觉信息的压缩,避免了外部模块的引入和重训练的需求。

技术框架:VisCo的整体架构包括编码和解码两个主要阶段。编码阶段使用少量内存标记来压缩视觉信息,解码阶段则将层次信息从编码转移回来,以重建视觉数据。

关键创新:VisCo的主要创新在于将预训练的VLM作为内在压缩器,利用其强大的信息编码能力,显著提高了压缩效率和模型性能。这与传统方法依赖外部模块的方式有本质区别。

关键设计:VisCo采用参数共享的自编码器结构,设计了适当的损失函数以优化压缩效果,并在网络结构上进行了精细调整,以确保在高压缩比下仍能保持信息的完整性。

🖼️ 关键图片

img_0
img_1
img_2

📊 实验亮点

实验结果表明,VisCo在所有评估的压缩比下均超越了现有方法,尤其在高压缩比下获得了更大的性能提升。在极端单标记设置中,VisCo仍然保持稳定,显示出其强大的压缩能力和鲁棒性。

🎯 应用场景

VisCo的研究成果在计算机视觉和自然语言处理的交叉领域具有广泛的应用潜力。它可以用于实时图像处理、视频分析以及多模态学习等场景,提升模型的推理效率和性能,具有重要的实际价值和未来影响。

📄 摘要(原文)

Vision-language models (VLMs) process large numbers of visual tokens, resulting in substantial inference latency and memory overhead. This has motivated extensive research on visual token compression. While training-free strategies rely on heuristic metrics and suffer significant performance degradation under high compression ratios, many training-based methods introduce external compression modules that force the VLM backbone to adapt, incurring substantial retraining cost and compromising VLMs' priors. Effective visual token compression hinges on strong information encoding, a capability already present in pretrained VLMs but underutilized by existing approaches. Motivated by this, we propose VisCo, a training-efficient self-compression framework that reuses the pretrained VLM itself as an intrinsic compressor. VisCo is a parameter-sharing autoencoder that compresses visual information using a small set of memory tokens and transfers hierarchical information from encoding to decoding. Experiments show that VisCo surpasses prior methods across all evaluated compression ratios, with larger gains under more aggressive compression, and remains stable even in the extreme single-token setting. Moreover, when combined with the original visual tokens, the learned memory tokens can even improve the base model, suggesting that VisCo captures complementary representations beyond compression.