Vision-Based Obstacle Separation for Strawberry Harvesting in Clusters Using Hierarchical Reinforcement Learning

📄 arXiv: 2607.13799v1 📥 PDF

作者: Teng Li, Hanfei Shi, Chunjiang Zhao, Ya Xiong

分类: cs.RO

发布日期: 2026-07-15

备注: Accepted to IROS 2026


💡 一句话要点

提出层次强化学习框架解决草莓采摘中的障碍物分离问题

🎯 匹配领域: 支柱一:机器人控制 (Robot Control) 支柱二:RL算法与架构 (RL & Architecture)

关键词: 层次强化学习 视觉引导决策 障碍物分离 草莓采摘 自动化农业 渐进自适应探索策略 机器人技术

📋 核心要点

  1. 现有的草莓采摘方法在聚集环境中面临障碍物遮挡问题,导致成熟果实的抓取不可靠。
  2. 本文提出的VGPA框架通过视觉引导决策和渐进自适应探索策略,分阶段解决障碍物分离和目标抓取问题。
  3. 实验结果表明,学习到的策略在仿真中成功率达到96.7%,在实际机器人上成功率为71.7%至88.3%,显示出显著的性能提升。

📝 摘要(中文)

在聚集的草莓环境中,选择性采摘面临挑战,因为成熟的果实常被周围未成熟的果实遮挡,导致直接抓取不可靠。为了解决这一问题,本文提出了一种层次强化学习框架VGPA,该框架集成了视觉引导决策机制和渐进自适应探索策略(PAES),用于视觉基础的障碍物分离和采摘。任务被分解为两个顺序阶段:障碍物分离和目标抓取。在高层次上,视觉引导机制改善了选项选择并加速了策略收敛;在低层次上,PAES提高了探索效率和连续控制学习的训练稳定性。仿真实验中,学习到的策略成功率达96.7%。此外,在自开发的并行机器人上进行的仿真到现实转移实验显示,该方法的成功率在71.7%到88.3%之间,优于直接采摘,同时仅需多1.22秒的平均采摘时间。这些结果验证了该方法在复杂聚集环境中进行机器人采摘的有效性、泛化能力和实际潜力。

🔬 方法详解

问题定义:本文旨在解决聚集草莓环境中成熟果实被未成熟果实遮挡的问题,现有方法在此场景下的抓取效果不佳,导致采摘效率低下。

核心思路:提出的VGPA框架通过层次强化学习,将任务分解为障碍物分离和目标抓取两个阶段,利用视觉信息引导决策,提升策略的选择和收敛速度。

技术框架:VGPA框架包括两个主要模块:高层次的视觉引导机制用于选项选择,低层次的渐进自适应探索策略(PAES)用于提高探索效率和训练稳定性。

关键创新:该方法的创新点在于将视觉引导决策与渐进自适应探索策略结合,显著改善了在复杂环境中的采摘表现,与传统方法相比,能够更有效地处理遮挡问题。

关键设计:在设计中,PAES通过动态调整探索策略,优化了训练过程中的参数设置,确保了在连续控制学习中的稳定性和效率。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果显示,学习到的策略在仿真环境中的成功率高达96.7%,而在实际机器人上成功率介于71.7%至88.3%之间,相较于直接采摘方法,表现出显著的性能提升,且仅增加1.22秒的采摘时间。

🎯 应用场景

该研究的潜在应用领域包括农业机器人、自动化采摘系统等,能够有效提升在复杂环境中进行果实采摘的效率和准确性。未来,该方法可能推动智能农业的发展,提高农业生产的自动化水平。

📄 摘要(原文)

Selective harvesting in clustered strawberry environments is challenging because ripe fruits are often occluded by surrounding unripe fruits, making direct grasping unreliable. To address this problem, this paper proposes a hierarchical reinforcement learning framework, termed VGPA, which integrates a vision-guided decision mechanism and a Progressive Adaptive Exploration Strategy (PAES) for vision-based obstacle separation and harvesting. The task was decomposed into two sequential stages: obstacle separation and target grasping. At the high level, the vision-guided mechanism improved option selection and accelerated policy convergence. At the low level, PAES improved exploration efficiency and training stability during continuous control learning. In simulation experiments, the learned policy achieved a success rate of 96.7%. In addition, sim-to-real transfer experiments on a self-developed parallel robot showed that the proposed method achieved success rates ranging from 71.7% to 88.3%, outperforming direct picking while requiring only 1.22~s more average harvesting time. These results verified the effectiveness, generalization ability, and practical potential of the proposed method for robotic harvesting in complex clustered environments.