InViG: Benchmarking Interactive Visual Grounding with 500K Human-Robot Interactions
作者: Hanbo Zhang, Jie Xu, Yuchen Mo, Tao Kong
分类: cs.RO, cs.CV
发布日期: 2023-10-18
备注: 8 pages, 9 figures, 3 tables, under review
💡 一句话要点
提出InViG数据集以解决人机交互中的语言歧义问题
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 人机交互 视觉定位 语言歧义 数据集 深度学习 机器人技术 开放式对话
📋 核心要点
- 现有的人机交互方法依赖于预定义的交互模板,无法有效应对真实场景中的语言歧义问题。
- 本文提出了InViG数据集,包含520K图像和开放式对话,旨在提升交互视觉定位的准确性和灵活性。
- 通过使用InViG数据集,研究团队实现了45.6%的成功率,显著提升了交互视觉歧义解决的效果。
📝 摘要(中文)
人类沟通中普遍存在歧义,现有的人机交互方法往往依赖于预定义的交互模板,导致在真实和开放场景中的表现不佳。为了解决这些问题,本文提出了一个大规模数据集InViG,用于处理语言歧义下的交互视觉定位。该数据集包含超过520K张图像,配有开放式目标导向的歧义对话,涵盖数百万个物体实例及相应的问答对。利用InViG数据集,本文进行了广泛的研究,并提出了一系列端到端的交互视觉歧义和定位的基线解决方案,在验证中达到了45.6%的成功率。InViG数据集是首个针对开放式交互视觉定位的大规模数据集,为关注歧义的人机交互提供了一个实用且具有挑战性的基准。
🔬 方法详解
问题定义:本文旨在解决人机交互中的语言歧义问题,现有方法因依赖固定模板而在开放场景中表现不佳,无法适应多变的用户需求。
核心思路:提出InViG数据集,通过开放式目标导向的对话来引导视觉定位,增强系统对语言歧义的理解和处理能力。
技术框架:整体架构包括数据集构建、对话生成、视觉定位模型训练和评估四个主要模块,形成一个闭环的交互系统。
关键创新:InViG数据集是首个大规模的开放式交互视觉定位数据集,提供了丰富的歧义对话样本,显著提升了人机交互的灵活性和准确性。
关键设计:在模型训练中,采用了多种损失函数以平衡视觉和语言信息的融合,网络结构设计上引入了注意力机制以提高对关键物体的关注度。
🖼️ 关键图片
📊 实验亮点
在验证阶段,利用InViG数据集,研究团队实现了45.6%的成功率,相较于传统方法有显著提升,展示了开放式交互视觉定位的有效性和潜力。
🎯 应用场景
该研究的潜在应用领域包括智能家居、服务机器人和增强现实等场景,能够提升人机交互的自然性和智能化水平。未来,InViG数据集可为相关领域的研究提供重要的基准和参考,推动更复杂的交互系统的开发。
📄 摘要(原文)
Ambiguity is ubiquitous in human communication. Previous approaches in Human-Robot Interaction (HRI) have often relied on predefined interaction templates, leading to reduced performance in realistic and open-ended scenarios. To address these issues, we present a large-scale dataset, \invig, for interactive visual grounding under language ambiguity. Our dataset comprises over 520K images accompanied by open-ended goal-oriented disambiguation dialogues, encompassing millions of object instances and corresponding question-answer pairs. Leveraging the \invig dataset, we conduct extensive studies and propose a set of baseline solutions for end-to-end interactive visual disambiguation and grounding, achieving a 45.6\% success rate during validation. To the best of our knowledge, the \invig dataset is the first large-scale dataset for resolving open-ended interactive visual grounding, presenting a practical yet highly challenging benchmark for ambiguity-aware HRI. Codes and datasets are available at: \href{https://openivg.github.io}{https://openivg.github.io}.