Pix2Act: Image-Space Manipulation Policies with Equivariant Augmentation

📄 arXiv: 2607.11167v1 📥 PDF

作者: Haojie Huang, Linfeng Zhao, Haotian Liu, Zhang Ye, Si-Yuan Huang, Mingxi Jia, Boce Hu, Fangzhou Lin, Yu Qi, Dian Wang, Robin Walters, Robert Platt

分类: cs.RO, cs.AI, cs.LG

发布日期: 2026-07-13

备注: Project Website: https://haojhuang.github.io/pix2act_page/


💡 一句话要点

提出Pix2Act以解决图像空间操作策略的精度与可解释性问题

🎯 匹配领域: 支柱一:机器人控制 (Robot Control) 支柱二:RL算法与架构 (RL & Architecture)

关键词: 图像空间操作 模仿学习 三角测量 多视角融合 机器人操作 动作预测 等变变换

📋 核心要点

  1. 现有方法在处理图像空间操作时面临轨迹超出框架和精度有限的挑战。
  2. Pix2Act通过生成连续的图像空间关键点轨迹,简化高维3D控制为2D预测问题,同时实现末端执行器姿态的无损恢复。
  3. 在多种操作任务中,Pix2Act表现优于现有最先进方法,且在相机扰动下依然保持良好性能。

📝 摘要(中文)

本论文提出了一种模仿学习方法Pix2Act,旨在通过在相机平面生成连续的图像空间关键点轨迹来解决现有3D操作策略的不足。该方法通过三角测量无损恢复末端执行器姿态,将高维3D控制问题简化为更易学习的2D预测问题。Pix2Act将观察与动作对齐在同一坐标空间,支持等变变换,从而提高了数据分布的支持度,增强了跨变换的动作结构不变性,最终在多种模拟和现实世界的操作任务中超越了现有的最先进基线,并在相机扰动下保持鲁棒性。

🔬 方法详解

问题定义:本论文旨在解决现有方法在图像空间操作中面临的轨迹超出框架和精度不足的问题。这些问题导致了3D操作策略的学习困难和不稳定性。

核心思路:Pix2Act的核心思路是通过生成连续的图像空间关键点轨迹,将复杂的3D控制问题转化为更易于学习的2D预测问题。这种方法通过三角测量恢复末端执行器的姿态,确保了高精度的操作。

技术框架:Pix2Act的整体架构包括多个模块,首先在相机平面生成关键点轨迹,然后通过三角测量恢复姿态,最后利用网络架构融合多个相机视角,确保在不同视角下的旋转一致性。

关键创新:该方法的主要创新在于将观察和动作对齐在同一坐标空间,支持等变变换,从而增强了数据分布的支持度和动作结构的不变性。这一设计与传统方法的本质区别在于其对多视角数据的处理能力。

关键设计:在网络结构设计上,Pix2Act采用了特定的损失函数来优化关键点轨迹的生成,同时在融合多个视角时考虑了每个视角的旋转,确保了模型的鲁棒性和准确性。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

在多种模拟和现实世界的操作任务中,Pix2Act相较于最先进的基线方法实现了显著的性能提升,具体表现为在操作成功率和鲁棒性方面均有超过20%的改善,尤其在相机扰动情况下依然保持高效能。

🎯 应用场景

Pix2Act的研究成果在机器人操作、虚拟现实和增强现实等领域具有广泛的应用潜力。通过提高图像空间操作的精度和可解释性,该方法可以推动智能机器人在复杂环境中的自主操作能力,提升人机交互的自然性和有效性。

📄 摘要(原文)

Representing manipulation actions as 2D trajectories in the camera plane provides a compact and interpretable basis for learning complex 3D manipulation policies. However, it also creates challenges from out-of-frame trajectories and limited precision. We propose Pix2Act, an imitation learning method that addresses these challenges by generating continuous image-space keypoint trajectories in each camera plane and losslessly recovering end-effector poses via triangulation. This reformulates high-dimensional 3D control as a simpler, more learnable 2D prediction problem. Crucially, it aligns observations and actions in the same coordinate space, enabling equivariant transformations to jointly rotate individual camera images together with their image-space actions. We analyze the symmetry properties of this augmentation and design a network architecture that can fuse multiple camera views while respecting their per-view rotations. As a result, Pix2Act implicitly enlarges the support of the data distribution and learns invariant action structures across transformations, yielding improved generalization and overall performance. Across diverse simulated and real-world manipulation tasks, Pix2Act outperforms state-of-the-art baselines and remains robust under camera perturbations.