Scale Up Strategically: Learning Compositional Generalization via Bias-Aware Evaluation and Data Collection for Robotic Manipulation

📄 arXiv: 2607.21582v1 📥 PDF

作者: Yu Qi, Zhang Ye, Xinyi Xu, Yuxuan Lu, Amitoj Sandhu, Boce Hu, Haojie Huang, Jonathan Tremblay, Lawson L. S. Wong

分类: cs.RO, cs.CV

发布日期: 2026-07-23


💡 一句话要点

提出偏差感知评估与数据收集策略以提升机器人操作的组合泛化能力

🎯 匹配领域: 支柱一:机器人控制 (Robot Control) 支柱二:RL算法与架构 (RL & Architecture)

关键词: 组合泛化 机器人操作 偏差感知 数据收集 策略优化 智能机器人 性能评估

📋 核心要点

  1. 现有的机器人策略往往依赖于显著的线索,而忽视了语言的基础,导致组合泛化能力不足。
  2. 本文提出了一种诊断框架,通过量化指令因素偏差,帮助识别和解决策略中的短路现象。
  3. 实验结果表明,偏差感知的数据收集策略在样本效率和泛化能力上均优于传统方法,且减少了所需演示数量。

📝 摘要(中文)

组合泛化对于机器人执行多样化指令至关重要。然而,预训练策略往往依赖显著线索而非语言基础。本文提出了一种诊断框架,能够将这种失败归因于个别指令因素,如颜色、动词、物体、大小和空间属性。该框架形式化了指令因素偏差,量化了细调策略对主导因素的过度依赖。通过两种指标:因素主导率(FDR)和因素主导层级(FDH),我们评估了六种基础策略的表现,发现颜色因素占主导地位,而动词和大小因素的基础较弱。此外,我们提出的偏差感知数据收集策略在仿真和真实机器人上均表现优于基线,且仅需一半的演示,显著提升了样本效率和泛化能力。

🔬 方法详解

问题定义:本文旨在解决机器人在执行多样化指令时的组合泛化能力不足的问题。现有方法常常依赖于显著线索,导致策略在面对新指令时表现不佳。

核心思路:论文的核心思路是通过引入偏差感知评估框架,识别和量化策略对不同指令因素的依赖程度,从而优化数据收集过程,提升策略的泛化能力。

技术框架:整体架构包括两个主要模块:1) 指令因素偏差评估,使用FDR和FDH指标量化策略对各因素的依赖;2) 偏差感知数据收集,基于评估结果重新分配数据收集预算,重点关注基础较弱的因素。

关键创新:最重要的技术创新在于提出了指令因素偏差的量化方法,能够明确识别策略在执行指令时的短路现象,并通过数据收集策略的优化实现更高的样本效率。

关键设计:在实验中,采用了FDR和FDH作为评估指标,设计了针对不同因素的动态数据收集策略,确保在有限的演示预算下,优先收集对策略改进最有帮助的数据。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果显示,采用偏差感知数据收集策略的机器人在执行任务时的样本效率提高了50%,并且在多个基准任务中超越了传统基线,展现出更强的泛化能力和适应性。

🎯 应用场景

该研究的潜在应用领域包括服务机器人、工业自动化和智能家居等场景。通过提升机器人对复杂指令的理解和执行能力,能够显著提高其在实际环境中的适应性和效率,推动智能机器人技术的进一步发展。

📄 摘要(原文)

Compositional generalization is essential for robot to follow diverse instructions. However, pretrained policies are known to take shortcuts, deferring to salient cues rather than grounding language. We introduce a diagnostic framework that localizes this failure to individual \textit{instruction factors}, \textit{e.g.,} reusable semantic components such as color, verb, object, size, and spatial attribute. Our framework formalizes instruction factor bias, the tendency of fine-tuned policies to over-rely on dominant factors as shortcuts, and quantifies it through two metrics: Factor Dominance Rate (FDR), capturing pairwise bias between factors, and Factor Dominance Hierarchy (FDH), aggregating these into a global ranking. Evaluation on six foundation policies reveals broadly consistent ordering, \textit{i.e.}, color $\geq$ object $\geq$ spatial $\geq$ verb $\geq$ size, with color dominant, and verb and size most under-grounded. We further show the diagnosis is actionable: a bias-aware data collection strategy that reallocates a fixed budget toward under-grounded factors outperforms baselines in simulation and on a real robot using half the demonstrations, thereby enabling more sample-efficient and generalizable policy learning.