Optimization of sim-to-real transfer in the humanoid robot NICO
作者: Juraj Gavura, Igor Farkaš
分类: cs.RO
发布日期: 2026-07-20
备注: 12 pages, 8 figures, accepted to International Conference on Artificial Neural Networks 2026, Neurorobotics workshop
💡 一句话要点
提出基于YOLO的物体检测优化NICO机器人抓取能力
🎯 匹配领域: 支柱一:机器人控制 (Robot Control)
关键词: 机器人抓取 视觉反馈 YOLO检测 立体视觉 非线性校准 物体定位 人形机器人 任务特定修正
📋 核心要点
- 现有方法在模拟与现实之间存在差距,导致机器人抓取时出现定位误差,影响抓取成功率。
- 本文提出了一种新的抓取管道,结合YOLO物体检测、立体视觉定位和任务特定修正,提高了抓取精度。
- 实验结果显示,非线性校准模型在校准区域内表现最佳,而视觉反馈模型在整个工作空间内的抓取成功率最高。
📝 摘要(中文)
机器人抓取需要视觉感知、物体定位、逆向运动学和手部控制之间的精确协调。然而,在物理机器人上执行模拟中规划的动作时,模拟与现实之间的差距可能导致小的定位误差,从而影响抓取成功率。本文在之前的低成本触觉校准方法基础上,扩展了从2D到桌面物体抓取的应用,增加了基于YOLO的物体和手部检测、基于立体视觉的定位以及任务特定的抓取执行修正。通过这些组件,形成了一种新的抓取管道,无需RGB-D相机、运动捕捉或外部跟踪系统。此外,本文还实现了一种视觉反馈模型,在抓取前将机器人手与检测到的物体对齐。实验结果表明,完全非线性校准模型在校准区域内表现最佳,而视觉反馈模型在整个桌面工作空间内的抓取成功率最高。
🔬 方法详解
问题定义:本文旨在解决机器人在执行模拟抓取动作时,由于模拟与现实之间的差距导致的定位误差问题。现有方法在抓取精度上存在不足,无法有效应对实际环境中的变化。
核心思路:论文提出了一种结合YOLO物体检测和立体视觉定位的校准抓取管道,通过视觉反馈模型提高抓取的成功率。这样的设计使得机器人能够在没有高成本设备的情况下,依然实现高效的抓取。
技术框架:整体架构包括三个主要模块:1) YOLO物体和手部检测;2) 基于立体视觉的物体定位;3) 任务特定的抓取执行修正。每个模块协同工作,形成一个完整的抓取系统。
关键创新:最重要的技术创新在于提出了一种无需RGB-D相机和外部跟踪系统的校准抓取方法,显著降低了抓取系统的成本和复杂性。
关键设计:在参数设置上,采用了低分辨率鱼眼相机进行立体视觉定位,损失函数设计上考虑了抓取成功率与定位精度的平衡,网络结构上则使用了YOLO进行物体检测,以提高实时性和准确性。
🖼️ 关键图片
📊 实验亮点
实验结果表明,完全非线性校准模型在校准区域内的抓取成功率达到了最高,而视觉反馈模型在整个桌面工作空间内的抓取成功率显著提高,展示了该方法的有效性和实用性。
🎯 应用场景
该研究的潜在应用领域包括服务机器人、工业自动化和家庭助理等场景。通过优化抓取能力,机器人能够更好地完成复杂的物体操作任务,提升人机协作的效率。未来,该技术有望在更广泛的机器人应用中得到推广,推动智能机器人技术的发展。
📄 摘要(原文)
Robotic grasping requires accurate coordination between visual perception, object localization, inverse kinematics, and hand control. However, when movements planned in simulation are executed on a physical robot, the sim-to-real gap can cause small positioning errors that prevent successful grasping. In our previous work, we introduced a low-cost haptic calibration method that improved 2D reaching accuracy of the humanoid robot NICO. In this paper, we extend this approach from reaching to tabletop object grasping by adding YOLO-based object and hand detection, stereo vision-based localization using the robot's built-in low-resolution fisheye cameras, and task-specific corrections for grasp execution. Together, these components form a novel calibration-based grasping pipeline that does not require RGB-D cameras, motion capture, or external tracking systems. We also implemented a visual feedback model that aligns the robot hand with the detected object before grasping. Our results show that the fully nonlinear calibration model achieved the best performance inside the calibrated area, while the visual feedback model achieved the highest overall grasping success across the full tabletop workspace.