BayesContact: Uncertain Pose Estimation via Visuo-Tactile Proposals and Simulation-based Inference
作者: Aditya Kamireddypalli, Matias Mattamala, Joao Moura, Russell Buchanan, Sethu Vijayakumar, Subramanian Ramamoorthy
分类: cs.RO
发布日期: 2026-07-20
💡 一句话要点
提出BayesContact以解决不确定姿态估计问题
🎯 匹配领域: 支柱一:机器人控制 (Robot Control) 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 姿态估计 视觉-触觉融合 仿真推理 机器人操作 多模态信念
📋 核心要点
- 现有方法在接触丰富的操作中,姿态估计的准确性往往不足,尤其是仅依赖深度传感器时。
- 本文提出BayesContact,通过维护粒子信念并融合深度与接触证据,利用仿真推理进行姿态估计。
- 实验结果表明,BayesContact在模拟几何和真实机器人实验中,姿态可观测性和插入成功率提高了30%。
📝 摘要(中文)
接触丰富的操作需要比仅依赖深度传感器提供的姿态估计更为准确。现有方法依赖视觉和接触信息,通常需要昂贵的离线训练过程,并且在新环境和几何形状下需要重新训练。本文提出BayesContact,一个基于仿真的推理框架,用于在插入操作中进行视觉-触觉姿态估计。BayesContact维护一个关于物体姿态的粒子信念,并将深度观测与基于力/扭矩的接触证据融合。我们采用基于仿真的前向模型来近似这些观测的似然性。对于每个姿态假设,渲染器预测深度测量,物理模拟器预测在受控探测动作下的接触结果;两者都与真实观测进行评分以更新信念。最终的多模态信念还支持基于信息增益的探测以实现主动消歧。在模拟几何和真实机器人实验中,BayesContact在姿态可观测性和插入成功率上比仅依赖视觉的推理提高了30%。
🔬 方法详解
问题定义:本文旨在解决在接触丰富的操作中,姿态估计准确性不足的问题。现有方法通常依赖深度传感器,导致在复杂环境中的表现不佳,且需要昂贵的离线训练。
核心思路:BayesContact的核心思路是通过维护粒子信念来融合深度观测与力/扭矩导出的接触证据,利用仿真模型来近似观测的似然性,从而提高姿态估计的准确性。
技术框架:BayesContact的整体架构包括粒子滤波器、深度渲染模块和物理模拟器。粒子滤波器维护对物体姿态的信念,深度渲染模块生成深度测量,物理模拟器预测接触结果,二者结合用于更新信念。
关键创新:最重要的技术创新在于将仿真推理与多模态信念融合相结合,使得在复杂环境中能够更准确地估计物体姿态,并支持基于信息增益的主动探测。
关键设计:在设计中,粒子滤波器的粒子数量和更新策略、损失函数的选择以及渲染和模拟的精度都是关键参数,这些设计确保了系统在不同环境下的鲁棒性和准确性。
🖼️ 关键图片
📊 实验亮点
实验结果显示,BayesContact在姿态可观测性和插入成功率上比传统的视觉推理方法提高了30%。这一显著提升表明,该方法在处理复杂接触任务时具有更强的有效性和可靠性。
🎯 应用场景
BayesContact的研究成果在机器人操作、自动化装配和人机交互等领域具有广泛的应用潜力。通过提高姿态估计的准确性,该方法可以显著提升机器人在复杂环境中的操作能力,进而推动智能制造和服务机器人技术的发展。
📄 摘要(原文)
Contact-rich manipulation requires pose estimates that are often more accurate than what depth-only sensing provides. Existing methods, relying on vision and contact, employ costly offline training procedures that need to be retrained for new environments and geometries. We propose BayesContact, a Simulation-Based Inference framework for visuo-tactile pose estimation in peg-in-hole insertion. BayesContact maintains a particle belief over object pose and fuses depth observations with force/torque-derived contact evidence. We employ simulation based forward models to approximate these observation likelihoods. For each pose hypothesis, a renderer predicts depth measurements and a physics simulator predicts contact outcomes under guarded probing actions; both are scored against real observations to update the belief. The resulting multimodal belief also enables information-gain-based probing for active disambiguation. Across simulated geometries and real-robot experiments, BayesContact improves pose observability and insertion success over vision-only inference by 30%