CLON: Cue-Calibrated Linguistic Object Onboarding for Zero-Shot 6D Pose Front-Ends

📄 arXiv: 2609.04784v1 📥 PDF

作者: Seojin Ji, Yoojin Kwon, Hyung-Sin Kim

分类: cs.CV

发布日期: 2026-09-04

备注: 8 pages, 5 figures


💡 一句话要点

提出CLON以解决零-shot 6D姿态估计中的前端问题

🎯 匹配领域: 支柱三:空间感知与语义 (Perception & Semantics)

关键词: 零-shot学习 6D姿态估计 物体识别 语义记忆 增强现实 机器人视觉 深度学习

📋 核心要点

  1. 现有的零-shot 6D姿态估计方法在前端处理上存在不足,无法有效区分真实物体和干扰项。
  2. CLON通过构建语言语义记忆和物体集提示权重,实现了无需特定训练的新物体提议生成。
  3. 在多个数据集上,CLON显著提升了检测和分割性能,验证了其有效性和实用性。

📝 摘要(中文)

零-shot 6D姿态估计管道越来越依赖强大的下游姿态求解器,但其性能常常受到前端的限制:物体提议必须保留部分可见的真实正样本,同时拒绝语义上合理的干扰项。我们提出了Cue-Calibrated Linguistic Object Onboarding (CLON),这是一种不需要针对新物体进行特定任务训练的前端。CLON利用已渲染的模板构建语言语义记忆,以生成自上而下的提议,并为校准提议评分计算物体集提示权重。在七个BOP-Classic-Core数据集上,CLON在检测AP上提高了8.1个百分点,在分割AP上提高了6.2个百分点,在下游6D姿态AR上提高了最多4.1个百分点,相较于CNOS和SAM-6D前端。

🔬 方法详解

问题定义:本论文旨在解决零-shot 6D姿态估计中前端提议生成的挑战,现有方法在处理部分可见物体和干扰项时表现不佳,导致性能下降。

核心思路:CLON的核心思想是通过构建语言语义记忆和物体集提示权重,来生成高召回率的物体提议,从而提高姿态估计的准确性。这样的设计使得系统能够在没有特定训练的情况下,灵活应对新物体。

技术框架:CLON的整体架构包括两个主要模块:首先是语言语义记忆的构建,用于生成自上而下的提议;其次是物体集提示权重的计算,用于在场景推理前固定提议评分。

关键创新:CLON的创新在于其无需针对新物体进行特定训练的能力,通过语言语义记忆和提示权重的结合,显著提升了提议生成的质量。与现有方法相比,CLON在处理部分可见物体时表现出更高的鲁棒性。

关键设计:在设计中,CLON使用了固定的提示权重,这些权重在场景推理前计算并保持不变,从而优化了在线评分过程。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

在七个BOP-Classic-Core数据集上,CLON在检测AP上提高了8.1个百分点,分割AP提高了6.2个百分点,6D姿态AR提高了最多4.1个百分点,显著优于CNOS和SAM-6D前端,验证了其有效性。

🎯 应用场景

CLON的研究成果在机器人视觉、增强现实和自动驾驶等领域具有广泛的应用潜力。通过提高零-shot 6D姿态估计的准确性,CLON能够帮助这些系统更好地识别和定位物体,从而提升其智能化水平和实用性。

📄 摘要(原文)

Zero-shot 6D pose estimation pipelines increasingly rely on strong downstream pose solvers, but their performance is often limited by the front-end: object proposals must preserve partially visible true positives while rejecting semantically plausible distractors. We introduce Cue-Calibrated Linguistic Object Onboarding (CLON), a front-end requiring no task-specific training for new objects. Given rendered templates of the onboarded object set, CLON constructs a linguistic semantic memory for top-down proposal generation and object-set cue weights for calibrated proposal scoring. The linguistic memory guides SAM 3 toward high-recall proposals for onboarded objects, while cue weights are computed once from the onboarded object set before scene inference and kept fixed during online scoring. On seven BOP-Classic-Core datasets, CLON improves detection AP by 8.1 percentage points (pp), segmentation AP by 6.2 pp, and downstream 6D pose AR by up to 4.1 pp over CNOS and SAM-6D front-ends.