Learning to build covering structures with continuous adjustments

📄 arXiv: 2609.08669v1 📥 PDF

作者: Gabriel Vallat, Maryam Kamgarpour, Stefana Parascho

分类: cs.RO, cs.LG

发布日期: 2026-09-08

备注: Accepted in IROS 2026


💡 一句话要点

提出一种强化学习方法以解决机器人建造中的灵活性问题

🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture)

关键词: 机器人建造 强化学习 图神经网络 自适应规划 混合动作空间 稳定性模拟 智能制造

📋 核心要点

  1. 现有机器人建造方法依赖于高精度的预定义计划,难以应对物理制造中的不确定性和变化。
  2. 本文提出了一种基于强化学习的自适应建造方法,能够在建造过程中动态生成施工序列,提升灵活性。
  3. 实验结果显示,HSAC算法在性能上显著优于HPPO,并在实际机器人系统中成功应用,验证了其有效性。

📝 摘要(中文)

机器人建造有潜力提高材料使用效率并创造复杂几何形状,但现有方法依赖于刚性、高精度的计划,无法适应物理制造中的公差、不准确性和意外变化。本文提出了一种强化学习方法,完全放弃预定义计划,能够在结构建造过程中自适应生成施工序列。该方法基于图结构状态表示和混合(参数化)动作空间,要求同时进行离散块选择和连续放置参数的调整。为了解决结构稳定性模拟的计算负担,本文开发了一种高效的探索策略,通过将单边边缘引入图神经网络,扩展了软演员-评论家(SAC)算法至这一混合设置。实验表明,所提出的HSAC算法在性能和样本效率上显著优于先前的混合PPO(HPPO)方法,并在物理双机器人设置中成功构建了一个跨度拱形结构,验证了模拟训练的策略能够有效转移到实际硬件上。

🔬 方法详解

问题定义:本文旨在解决现有机器人建造方法在面对物理制造中的不确定性和变化时的灵活性不足问题。现有方法通常依赖于固定的高精度计划,难以适应实际施工中的公差和意外情况。

核心思路:论文提出了一种强化学习方法,完全放弃预定义的施工计划,采用自适应生成施工序列的方式。通过图结构状态表示和混合动作空间,方法能够同时处理离散块选择和连续放置参数,提升了建造过程的灵活性和适应性。

技术框架:整体架构包括状态表示、动作选择和稳定性模拟三个主要模块。状态表示采用图结构,动作空间则结合了离散和连续的参数选择。为了提高计算效率,采用了高效的探索策略,结合图神经网络和软演员-评论家算法。

关键创新:最重要的技术创新在于将单边边缘引入图神经网络,优化了稳定性模拟的计算效率,并扩展了SAC算法以适应混合动作空间。这一设计使得算法在处理复杂建造任务时表现出更高的灵活性和效率。

关键设计:在参数设置上,算法能够处理多达10个离散动作而不导致性能下降。损失函数和网络结构经过精心设计,以确保在不同超参数选择下的鲁棒性和探索能力。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果表明,HSAC算法在性能上显著优于基线方法HPPO,展示了更高的渐近性能和良好的样本效率。具体而言,HSAC在处理复杂建造任务时,能够有效应对多达10个离散动作而不出现性能下降,验证了其在实际应用中的有效性。

🎯 应用场景

该研究的潜在应用领域包括建筑、基础设施建设和机器人协作等。通过提高机器人在建造过程中的灵活性和适应性,能够显著降低材料浪费,提升施工效率,推动智能制造的发展。未来,该方法有望在更复杂的建造任务中得到应用,进一步拓展机器人技术的边界。

📄 摘要(原文)

Robotic construction offers the potential to use materials more efficiently and create complex geometries, but current methods rely on rigid, high-precision plans that cannot accommodate the tolerances, inaccuracies, and unexpected changes inherent in physical fabrication. In this work, we introduce a reinforcement learning approach that forgoes predefined plans entirely, instead generating construction sequences adaptively as the structure is built. Our method operates on graph-structured state representations and a mixed (parameterized) action space, requiring both discrete block selection and continuous placement parameters. Because the stability simulation of a structure is computationally heavy, we develop an efficient exploration strategy by incorporating unilateral edges into graph neural networks, extending soft actor-critic (SAC) to this hybrid setting. We evaluate our algorithm, HSAC, against the prior method hybrid-PPO (HPPO), demonstrating significantly higher asymptotic performance and good sample efficiency. We also demonstrate HSAC's robustness to hyperparameter choices and its exploration capability, handling up to 10 discrete actions without performance degradation. Finally, we validate our approach on a physical two-robot setup, successfully building a spanning arch with 3D-printed blocks in closed-loop execution, confirming that policies trained in simulation transfer to real hardware.