GOLF: Global Observation with Local Focus for Calibration-Aware Stereo Interaction Field Estimation

📄 arXiv: 2609.08607v1 📥 PDF

作者: Minqiang Zou, Riqiang Jin, Zhi Lv, Dong Luo, Lianghai Tian, Zhenyu Zhao, Qi Xu, Tong Wu, Mochen Yu, Yao Tang

分类: cs.CV

发布日期: 2026-09-08

备注: First-Place Solution for the HANDS@ECCV 2026 SHOW3D Challenge


💡 一句话要点

提出GOLF以解决手部交互场景中的3D向量估计问题

🎯 匹配领域: 支柱六:视频提取与匹配 (Video Extraction)

关键词: 3D向量估计 手部交互 立体视觉 深度学习 模型集成

📋 核心要点

  1. 核心问题:现有方法在手部与物体交互场景中难以准确预测3D向量,尤其是在复杂背景下。
  2. 方法要点:GOLF结合全局上下文与局部证据,通过改进的DINOv3模型进行联合解码,提升了交互场估计的准确性。
  3. 实验或效果:主要模型在隐藏测试集上取得27.61的官方得分,集成模型进一步提升至27.47,获得挑战赛第一名。

📝 摘要(中文)

我们提出了GOLF,这是在2026年HANDS@ECCV的SHOW3D交互场估计挑战赛中的第一名解决方案。给定同步的自我中心立体视图,任务是预测21个手关节到操控物体最近点的3D向量。GOLF结合了密集的全局上下文、局部采样的手/物体证据和共同框架的Plücker光线几何。我们对DINOv3 ViT-H+/16进行了LoRA和可训练的LayerNorm参数的适配,然后联合解码两个交互场。我们的主要模型在隐藏测试集上达到了27.61的官方得分和27.96毫米的平均ADE。通过与一个直接微调的互补变体进行等权重集成,这些结果提高到27.47的官方得分和27.82毫米的平均ADE,确保了第一名。

🔬 方法详解

问题定义:本论文旨在解决在自我中心立体视图下,如何准确预测手部21个关节到操控物体最近点的3D向量的问题。现有方法在复杂场景中难以有效整合全局与局部信息,导致预测精度不足。

核心思路:GOLF的核心思路是通过结合密集的全局上下文与局部采样的手/物体证据,利用共同框架的Plücker光线几何,来提高交互场的估计精度。这种设计使得模型能够更好地理解手部与物体之间的关系。

技术框架:GOLF的整体架构包括数据输入、特征提取、全局上下文整合、局部证据采样和联合解码等主要模块。我们采用了改进的DINOv3 ViT-H+/16作为基础模型,并在此基础上进行LoRA和可训练的LayerNorm参数的适配。

关键创新:GOLF的主要创新在于将全局上下文与局部证据有效结合,并通过联合解码两个交互场来提升预测精度。这一方法与传统的单一视角或局部方法有本质区别,能够更全面地捕捉手部与物体的交互信息。

关键设计:在模型设计中,我们采用了LoRA技术来降低模型参数的复杂性,同时引入可训练的LayerNorm参数以增强模型的适应性。此外,损失函数的设计也经过精心调整,以确保模型在训练过程中能够有效收敛。

🖼️ 关键图片

fig_0
fig_1

📊 实验亮点

GOLF在隐藏测试集上取得了27.61的官方得分和27.96毫米的平均ADE,通过与直接微调的变体进行等权重集成,进一步提升至27.47的官方得分和27.82毫米的平均ADE,显示出显著的性能提升,确保了第一名的成绩。

🎯 应用场景

该研究的潜在应用领域包括虚拟现实、增强现实以及人机交互等场景,能够为手势识别和物体操控提供更精确的3D交互信息。未来,GOLF有望推动智能机器人和自动化系统在复杂环境中的应用,提升人机协作的效率和准确性。

📄 摘要(原文)

We present GOLF, the first-place solution to the SHOW3D Interaction Field Estimation Challenge at HANDS@ECCV 2026. Given synchronized egocentric stereo views, the task is to predict a 3D vector from each of 21 hand joints to the closest point on the manipulated object. GOLF combines dense global context, locally sampled hand/object evidence, and common-frame Plücker-ray geometry. We adapt DINOv3 ViT-H+/16 with LoRA and trainable LayerNorm parameters, then jointly decode both interaction fields. Our primary model achieves an official score of 27.61 and a mean ADE of 27.96 mm on the hidden test set. An equal-weight ensemble with a complementary directly fine-tuned variant improves these results to an official score of 27.47 and a mean ADE of 27.82 mm, securing first place.