KineFuse: Kinematic-Aware Haptic Fusion for In-Hand Occluded-Object Pose Tracking
作者: Chanyoung Ahn, Jaesung Lee, Sungwoo Park, Donghyun Hwang
分类: cs.RO
发布日期: 2026-07-16
备注: 8 pages, 10 figures. Accepted for presentation at the 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2026)
🔗 代码/项目: PROJECT_PAGE
💡 一句话要点
提出KineFuse以解决手部操作中的物体姿态跟踪问题
🎯 匹配领域: 支柱一:机器人控制 (Robot Control)
关键词: 物体姿态跟踪 触觉信号 运动学感知 多模态融合 机器人操作 闭环控制 视觉与触觉 手部操作
📋 核心要点
- 现有方法在手部操作中面临物体遮挡问题,导致6D姿态跟踪的准确性下降。
- 本文提出了一种运动学感知的指级编码器,利用触觉信号补充视觉信息以提高跟踪精度。
- 实验结果显示,顺序跟踪能显著放大架构差异,且指级标记化方法在性能上优于其他融合方式。
📝 摘要(中文)
灵巧的手部操作需要持续的6D姿态跟踪,但手指在操作过程中不可避免地会遮挡物体。本文研究如何利用多指手上的稀疏触觉信号(包括本体感受、近端力/扭矩和二进制接触)来补充在遮挡情况下的预训练视觉姿态跟踪器。我们提出了一种运动学感知的指级编码器,并通过每帧精细化、顺序开环跟踪和闭环操作三个层次对其与四种替代设计进行了系统比较。实验结果表明,顺序跟踪能放大架构差异,结构化编码器能够学习任务特定的跨模态门控,且紧凑的指级标记化表现优于平面融合和关节级表示。我们验证了改进的跟踪在下游重定向任务中的成功率更高,并提供了定性实证演示。
🔬 方法详解
问题定义:本文旨在解决在手部操作中由于手指遮挡导致的物体姿态跟踪不准确的问题。现有方法在处理遮挡时往往依赖于视觉信息,导致跟踪精度下降。
核心思路:我们提出了一种运动学感知的指级编码器,通过结构化触觉信号来补充视觉信息,特别是在物体被遮挡的情况下。该设计允许模型在没有显式监督的情况下,学习如何有效地结合视觉和触觉信息。
技术框架:整体架构包括一个指级编码器,负责处理来自多指的触觉信号,并与预训练的视觉姿态跟踪器进行融合。该框架分为三个主要阶段:每帧精细化、顺序开环跟踪和闭环操作。
关键创新:最重要的创新点在于提出了结构化的指级编码器,能够学习任务特定的跨模态门控机制,使用视觉信息进行平移,而将旋转的注意力集中在触觉信号上。与现有方法相比,这种设计显著提高了跟踪精度。
关键设计:在模型设计中,我们采用了紧凑的指级标记化方法,使用4个标记来表示手指的触觉信息。此外,损失函数的设计也考虑了不同模态之间的平衡,确保视觉和触觉信息能够有效融合。
🖼️ 关键图片
📊 实验亮点
实验结果表明,顺序跟踪阶段的架构差异可放大至15倍,且紧凑的指级标记化方法在性能上优于平面融合和关节级表示,显著提升了跟踪精度和下游任务的成功率。
🎯 应用场景
该研究的潜在应用领域包括机器人抓取、虚拟现实和增强现实等场景,能够显著提升人机交互的自然性和准确性。通过提高物体姿态跟踪的精度,未来可以在复杂环境中实现更灵活的操作和控制,推动智能机器人技术的发展。
📄 摘要(原文)
Dexterous in-hand manipulation requires continuous 6D pose tracking, yet the manipulating fingers inevitably occlude the object from the camera. We study how to structure the sparse haptic signals already available on multi-fingered hands, including proprioception, proximal force/torque, and binary contact, to complement a pretrained visual pose tracker under occlusion. We propose a kinematic-aware finger-level encoder and systematically compare it against four alternative designs through three levels of evaluation: per-frame refinement, sequential open-loop tracking, and closed-loop manipulation. Our experiments reveal that (i) per-frame evaluation cannot distinguish encoder quality, while sequential tracking amplifies architectural differences by up to 15 times; (ii) the structured encoder learns task-specific cross-modal gating, using vision exclusively for translation and dedicating one attention head to haptics for rotation, without explicit supervision; and (iii) compact finger-level tokenization with 4 tokens outperforms both flat fusion and joint-level representations, which suppress vision through norm dominance. We validate that improved tracking yields higher success in a downstream reorientation task and provide qualitative real-world demonstrations. Our project page is available at https://cold-young.github.io/kine-fuse/.