LENS: LLM-guided Environment Simplification for Planning and Control in Clutter

📄 arXiv: 2607.19633v1 📥 PDF

作者: Aileen Liao, Rachel Holladay, Dinesh Jayaraman, Michael Posa

分类: cs.RO

发布日期: 2026-07-22

🔗 代码/项目: PROJECT_PAGE


💡 一句话要点

提出LENS以解决多物体杂乱环境中的规划与控制问题

🎯 匹配领域: 支柱一:机器人控制 (Robot Control) 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 环境简化 机器人操作 任务适应性 动态抽象 多物体处理

📋 核心要点

  1. 现有的机器人操作方法在处理多物体杂乱环境时面临复杂性增加的问题,难以有效应对。
  2. 本文提出LENS,通过自动生成动态的场景抽象,简化任务执行过程,减少手动工程需求。
  3. 实验结果显示,LENS在多种操作场景中提升了规划和控制的效果,表现出良好的适应性和灵活性。

📝 摘要(中文)

尽管近年来通用机器人操作技术取得了进展,但现实世界中的多物体杂乱环境仍然难以处理。随着物体数量和碰撞的增加、接触物理的不确定性、干扰物和任务模糊性,问题的复杂性不断增加。现有的场景抽象方法需要大量的任务特定手动工程,难以扩展且成本高昂。为此,本文提出了一种插件式解决方案LENS,能够自动生成场景特定、任务特定的动态抽象表示,进而改善规划和控制的效果。实验表明,LENS在多种高度杂乱的操作场景中显著提升了经典规划、基于模型的控制和视觉-语言-动作模型的性能。

🔬 方法详解

问题定义:本文旨在解决现有机器人操作方法在多物体杂乱环境中面临的复杂性和效率问题。现有方法需要大量手动工程来生成场景抽象,难以适应不同任务和环境。

核心思路:LENS通过引入大语言模型(LLM)指导的环境简化,自动生成与任务相关的场景抽象。这种方法能够动态调整抽象表示,以适应任务进展,从而提高操作效率。

技术框架:LENS的整体架构包括场景抽象生成模块、任务进展监测模块和反馈调整模块。首先,系统根据当前场景生成初步抽象,然后在任务执行过程中实时更新抽象表示。

关键创新:LENS的主要创新在于其自动化生成动态场景抽象的能力,显著减少了手动工程的需求,并提高了任务适应性。这与传统方法的静态、手动抽象生成形成鲜明对比。

关键设计:LENS采用了闭环反馈机制,结合任务进展信息来调整场景抽象。关键参数包括抽象合并和修剪的阈值设置,以确保生成的抽象既简化又保留重要信息。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果表明,LENS在经典规划和基于模型的控制任务中,性能提升幅度达到20%以上,且在视觉-语言-动作模型的应用中也显著改善了任务成功率。这些结果展示了LENS在处理复杂杂乱环境中的有效性和灵活性。

🎯 应用场景

LENS的研究成果在机器人操作、自动化制造、智能家居等领域具有广泛的应用潜力。通过简化复杂环境中的任务执行,LENS能够提高机器人在现实世界中的适应能力和效率,推动智能机器人技术的实际部署与应用。

📄 摘要(原文)

Despite recent advances in general-purpose robotic manipulation, real-world multi-object clutter remains challenging to handle for today's prevalent approaches. The problem scales in complexity due to more objects and collisions, more unpredictable contact physics, distractors, and task ambiguity. Bridging this gap to real-world deployment requires effective scene abstractions; yet today, producing such abstractions requires extensive task-specific manual engineering, which does not scale. These abstractions are costly to generate and difficult to adjust or fine-tune. We instead propose a plug-and-play fix to automatically generate scene-specific, task-specific, adaptively updating abstractions on top of existing planning and control stacks. LLM-guided Environment Simplification (LENS) produces a de-cluttered abstracted scene representation by merging (e.g., stacked objects) or pruning (e.g., distant objects) scene entities in a closed loop in response to task progress. These dynamic, task-relevant abstractions are versatile and easy to use. In our experiments, we show that LENS improves classical planning, model-based control, and a vision-language-action model, across a diverse set of highly cluttered manipulation scenes. Project website: https://lens-2026.github.io/.