Deformable Object Manipulation under Partial Observability via Real-Time Full-Shape Estimation

📄 arXiv: 2609.10308v1 📥 PDF

作者: Kosar Behnia, Ville Kyrki, Gokhan Alcan

分类: cs.RO

发布日期: 2026-09-09

备注: 8 pages, 8 figures


💡 一句话要点

提出cRVAE以解决可变形物体在部分可观测下的操控问题

🎯 匹配领域: 支柱一:机器人控制 (Robot Control)

关键词: 可变形物体 条件递归变分自编码器 实时状态估计 机器人操控 障碍物感知

📋 核心要点

  1. 可变形物体的操控面临高维状态空间和部分可观测性等挑战,现有方法难以有效解决这些问题。
  2. 本文提出cRVAE,通过条件递归变分自编码器从部分观测中实时估计完整状态,提升操控效率。
  3. 在绳索和织物的仿真实验中,cRVAE的运行速度显著提高,且准确性与传统方法相当,展示了其实际应用潜力。

📝 摘要(中文)

可变形物体(DO)的操控因其高维状态空间、欠驱动动态和部分可观测性而面临挑战。本文提出了一种轻量级的条件递归变分自编码器(cRVAE),该模型在推理过程中仅通过部分角节点观测来估计完整的DO状态。该模型作为前向模型应用于回退视野最优控制框架中,以实现障碍物感知的协作DO操控。在对绳索和织物的仿真中,cRVAE能够仅通过可用的角节点测量来估计完整的DO状态,其准确性与参数识别的XPBD模型相匹配。推理过程中,该模型不使用物理参数作为输入,也不进行在线参数识别,且在绳索上每次前向传递速度约为350倍,织物上超过1500倍,保持在100毫秒的控制预算内,使得基于视野的规划成为可能。完整形状估计的实时性使得该模型能够在硬件上部署,且在Unitree Go2机器人上得到了验证。

🔬 方法详解

问题定义:本文旨在解决可变形物体在部分可观测性下的操控问题。现有方法在处理高维状态空间和欠驱动动态时,往往无法有效估计物体的完整状态,导致操控精度不足。

核心思路:论文提出的cRVAE模型通过条件递归变分自编码器,从部分角节点观测中实时估计完整的DO状态。这种设计使得模型在推理时不依赖于物理参数,降低了复杂性并提高了速度。

技术框架:cRVAE模型的整体架构包括数据输入模块、状态估计模块和控制决策模块。输入模块接收角节点观测,状态估计模块利用递归神经网络进行状态推断,控制决策模块则基于估计的状态进行操控策略的生成。

关键创新:cRVAE的最大创新在于其能够在不依赖物理参数的情况下,实时估计可变形物体的完整形状。这一特性使得模型在硬件上的部署成为可能,显著提升了操控效率。

关键设计:模型采用轻量级的网络结构,损失函数设计为结合重构误差和KL散度,确保状态估计的准确性和模型的泛化能力。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果表明,cRVAE在绳索和织物的仿真中,前向传递速度分别达到了约350倍和1500倍,显著优于传统XPBD模型。同时,cRVAE在状态估计的准确性上与XPBD模型相当,展示了其在实时操控中的有效性。

🎯 应用场景

该研究在可变形物体操控领域具有广泛的应用潜力,尤其是在机器人抓取、自动化生产线和人机协作等场景中。通过实时的状态估计,机器人能够更灵活地应对复杂环境中的障碍物,提高工作效率和安全性。未来,该技术有望推动智能机器人在动态环境中的应用,提升其自主决策能力。

📄 摘要(原文)

Manipulating deformable objects (DOs) is challenging due to their high-dimensional state space, underactuated dynamics, and partial observability. In this paper, we propose cRVAE, a lightweight conditional recurrent variational autoencoder that estimates the full DO state from only partial corner-node observations during inference. The resulting model is used as the forward model in a receding-horizon optimal control framework for obstacle-aware collaborative DO manipulation. In simulation on rope and fabric, cRVAE estimates the full DO state from the available corner-node measurements alone, matching the accuracy of a parameter-identified XPBD model. At inference it uses no physical parameters as model inputs and performs no online parameter identification. It also runs approximately 350 times faster on the rope and over 1500 times faster on the fabric per forward pass, keeping horizon-based planning within the 100 ms control budget where XPBD exceeds it already at short horizons. Full-shape estimation from corner sensing at in-loop speed is what makes the model deployable on hardware, which we demonstrate on a Unitree Go2 robot.