Reinforcement Learning for the Full Strawberry Harvesting Process: Obstacle Separation, Detachment, and Placement

📄 arXiv: 2607.14708v1 📥 PDF

作者: Changyou Miao, Teng Li, Ya Xiong

分类: cs.RO

发布日期: 2026-07-16

备注: Accepted to IROS 2026


💡 一句话要点

提出基于强化学习的草莓采摘全流程解决方案

🎯 匹配领域: 支柱一:机器人控制 (Robot Control) 支柱二:RL算法与架构 (RL & Architecture)

关键词: 强化学习 机器人采摘 农业自动化 任务协调 交互感知

📋 核心要点

  1. 现有的草莓采摘方法在处理遮挡和植物结构变形时面临复杂的接触动态,导致效率低下。
  2. 本文提出了一种基于强化学习的策略框架,将采摘过程分为障碍物分离、果实脱离和放置三个阶段,利用启发式逻辑协调各阶段。
  3. 实验结果表明,该方法在仿真中成功率达到89.7%,在真实环境中为82.0%,且随着遮挡程度增加,执行时间也相应增长。

📝 摘要(中文)

草莓采摘面临严重的遮挡和可变形植物结构带来的复杂接触动态挑战。本文开发了一种基于策略的强化学习框架,结合启发式阶段协调,将障碍物分离、果实脱离和放置形式化为一个顺序决策任务。通过共享的交互感知策略生成各任务阶段的笛卡尔运动,同时轻量级启发式逻辑协调任务进展和夹持器事件。采用共享的结构化观察空间表示目标、障碍物、末端执行器和任务上下文信息。层次化架构将高层策略与低层笛卡尔阻抗控制结合,以实现顺应性交互。为支持零-shot的仿真到现实转移,采用了可行性优先的观察对齐和领域随机化。该策略在仿真中的成功率为89.7%,在真实世界实验中为82.0%。随着遮挡水平从1增加到5,平均执行时间从12.99秒增加到21.73秒,反映出更大的交互复杂性。这些结果展示了交互感知采摘行为有效转移到结构上不同的机器人平台。

🔬 方法详解

问题定义:本文旨在解决草莓采摘过程中由于遮挡和植物结构变形导致的复杂接触动态问题。现有方法在处理这些问题时效率较低,难以实现高效的自动化采摘。

核心思路:论文提出了一种基于策略的强化学习框架,将整个采摘过程视为一个顺序决策任务,通过共享的交互感知策略和启发式逻辑来协调各个阶段的执行。

技术框架:整体架构包括三个主要模块:障碍物分离、果实脱离和放置。每个模块通过共享的结构化观察空间进行信息交互,确保任务的顺利进行。同时,采用层次化架构将高层策略与低层笛卡尔阻抗控制结合,以实现顺应性交互。

关键创新:最重要的技术创新在于将强化学习与启发式逻辑相结合,形成了一种新的任务协调机制。这种机制使得机器人能够在复杂环境中有效地进行采摘,显著提高了成功率。

关键设计:在设计中,采用了共享的结构化观察空间来表示目标、障碍物和任务上下文信息。此外,为了支持零-shot的仿真到现实转移,采用了可行性优先的观察对齐和领域随机化技术,增强了模型的适应性。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果显示,所提出的强化学习策略在仿真环境中的成功率达到89.7%,在真实环境中为82.0%。随着遮挡程度的增加,平均执行时间从12.99秒增加到21.73秒,表明该方法在复杂环境中的有效性和适应性。

🎯 应用场景

该研究的潜在应用领域包括农业自动化和机器人采摘系统,能够有效提高草莓等易损水果的采摘效率和质量。未来,随着技术的进一步发展,该方法有望推广到其他类型的水果采摘和更广泛的农业机器人应用中,推动农业生产的智能化进程。

📄 摘要(原文)

Severe occlusions and deformable plant structures introduce complex contact dynamics that challenge robotic strawberry harvesting. A policy-driven reinforcement learning (RL) framework with heuristic phase coordination was developed, in which obstacle separation, fruit detachment, and placement were formulated as a sequential decision-making task. A shared interaction-aware policy generated Cartesian motions across all task phases, while lightweight heuristic logic coordinated task progression and gripper events. A shared structured observation space was used to represent target, obstacle, end-effector, and task-context information. A hierarchical architecture combined the high-level policy with low-level Cartesian impedance control for compliant interaction. To support zero-shot sim-to-real transfer, feasibility-first observation alignment and domain randomization were adopted. The policy achieved success rates of 89.7% in simulation and 82.0% in real-world experiments. As the occlusion level increased from 1 to 5, the average execution time increased from 12.99 s to 21.73 s, reflecting greater interaction complexity. These results demonstrated effective transfer of interaction-aware harvesting behaviors to a structurally different robotic platform.