BayesContact: Uncertain Pose Estimation via Visuo-Tactile Proposals and Simulation-based Inference

📄 arXiv: 2607.16123 📥 PDF

作者: Aditya Kamireddypalli, Matias Mattamala, Joao Moura, Russell Buchanan, Sethu Vijayakumar, Subramanian Ramamoorthy

分类: cs.RO

发布日期: 2026-07-20


💡 一句话要点

提出BayesContact以解决不确定姿态估计问题

🎯 匹配领域: 支柱一:机器人控制 (Robot Control) 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 姿态估计 视觉-触觉融合 仿真推理 机器人操作 多模态信念

📋 核心要点

  1. 现有方法在接触丰富的操作中,姿态估计的准确性往往不足,尤其是仅依赖深度传感器时。
  2. 本文提出BayesContact,通过维护粒子信念并融合深度与接触证据,利用仿真推理进行姿态估计。
  3. 实验结果表明,BayesContact在模拟几何和真实机器人实验中,姿态可观测性和插入成功率提高了30%。

📝 摘要(中文)

接触丰富的操作需要比仅依赖深度传感器提供的姿态估计更为准确。现有方法依赖视觉和接触信息,通常需要昂贵的离线训练过程,并且在新环境和几何形状下需要重新训练。本文提出BayesContact,一个基于仿真的推理框架,用于在插入操作中进行视觉-触觉姿态估计。BayesContact维护一个关于物体姿态的粒子信念,并将深度观测与基于力/扭矩的接触证据融合。我们采用基于仿真的前向模型来近似这些观测的似然性。对于每个姿态假设,渲染器预测深度测量,物理模拟器预测在受控探测动作下的接触结果;两者都与真实观测进行评分以更新信念。最终的多模态信念还支持基于信息增益的探测以实现主动消歧。在模拟几何和真实机器人实验中,BayesContact在姿态可观测性和插入成功率上比仅依赖视觉的推理提高了30%。

🔬 方法详解

问题定义:本文旨在解决在接触丰富的操作中,姿态估计准确性不足的问题。现有方法通常依赖深度传感器,导致在复杂环境中的表现不佳,且需要昂贵的离线训练。

核心思路:BayesContact的核心思路是通过维护粒子信念来融合深度观测与力/扭矩导出的接触证据,利用仿真模型来近似观测的似然性,从而提高姿态估计的准确性。

技术框架:BayesContact的整体架构包括粒子滤波器、深度渲染模块和物理模拟器。粒子滤波器维护对物体姿态的信念,深度渲染模块生成深度测量,物理模拟器预测接触结果,二者结合用于更新信念。

关键创新:最重要的技术创新在于将仿真推理与多模态信念融合相结合,使得在复杂环境中能够更准确地估计物体姿态,并支持基于信息增益的主动探测。

关键设计:在设计中,粒子滤波器的粒子数量和更新策略、损失函数的选择以及渲染和模拟的精度都是关键参数,这些设计确保了系统在不同环境下的鲁棒性和准确性。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果显示,BayesContact在姿态可观测性和插入成功率上比传统的视觉推理方法提高了30%。这一显著提升表明,该方法在处理复杂接触任务时具有更强的有效性和可靠性。

🎯 应用场景

BayesContact的研究成果在机器人操作、自动化装配和人机交互等领域具有广泛的应用潜力。通过提高姿态估计的准确性,该方法可以显著提升机器人在复杂环境中的操作能力,进而推动智能制造和服务机器人技术的发展。

📄 摘要(原文)

Contact-rich manipulation requires pose estimates that are often more accurate than what depth-only sensing provides. Existing methods, relying on vision and contact, employ costly offline training procedures that need to be retrained for new environments and geometries. We propose BayesContact, a Simulation-Based Inference framework for visuo-tactile pose estimation in peg-in-hole insertion. BayesContact maintains a particle belief over object pose and fuses depth observations with force/torque-derived contact evidence. We employ simulation based forward models to approximate these observation likelihoods. For each pose hypothesis, a renderer predicts depth measurements and a physics simulator predicts contact outcomes under guarded probing actions; both are scored against real observations to update the belief. The resulting multimodal belief also enables information-gain-based probing for active disambiguation. Across simulated geometries and real-robot experiments, BayesContact improves pose observability and insertion success over vision-only inference by 30%