RoboHarness: Memory-Driven Orchestration of Heterogeneous Robot Policies for Long-Horizon Planning
作者: Jinbang Huang, Yuanzhao Hu, Zhiyuan Li, Ran Qi, Yixin Xiao, Zhanguang Zhang, Mark Coates, Tongtong Cao, Yingxue Zhang
分类: cs.RO
发布日期: 2026-07-20
备注: 21 pages, 8 figures
💡 一句话要点
提出RoboHarness以解决异构机器人策略的长时间规划问题
🎯 匹配领域: 支柱一:机器人控制 (Robot Control) 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 长时间规划 异构策略 能力感知 机器人控制 策略路由 多模态记忆 稳定执行
📋 核心要点
- 现有的规划方法主要基于同质的、预定义的技能,无法有效处理异构策略的能力边界和分布不匹配问题。
- RoboHarness框架通过多模态执行记忆和在线证据,动态表征策略能力边界,实现能力感知的策略分解和路由。
- 在三个公共基准、500个定制任务和135个真实机器人实验中,RoboHarness展示了有效的能力感知路由和稳定的策略编排,显著提升了长时间规划的性能。
📝 摘要(中文)
长时间的机器人任务需要多样化的能力,而单一策略无法可靠地提供这些能力。异构策略提供了互补的优势,但现有的规划方法往往忽视了能力边界的不确定性和跨策略分布的不匹配。为此,本文提出了RoboHarness,一个统一框架,将独立开发的机器人控制系统封装为可重用的智能技能。RoboHarness利用多模态执行记忆和在线证据来表征策略能力边界,从而实现能力感知的分解和路由。通过大量实验,RoboHarness在零样本长时间规划和分布外鲁棒性方面取得了显著提升。
🔬 方法详解
问题定义:本文旨在解决长时间机器人任务中,单一策略无法满足多样化能力需求的问题。现有方法往往依赖于同质技能,无法有效应对异构策略的能力边界和分布不匹配的挑战。
核心思路:RoboHarness框架的核心思想是将独立开发的机器人控制系统封装为可重用的智能技能,通过多模态执行记忆和在线证据来动态表征策略能力边界,从而实现能力感知的策略分解和路由。
技术框架:RoboHarness的整体架构包括多个模块,如能力边界表征模块、记忆桥接模块和策略路由模块。能力边界表征模块利用多模态记忆来识别策略的适用范围,记忆桥接模块则负责在策略切换时稳定地引导机器人。
关键创新:RoboHarness的主要创新在于其能力感知的策略路由机制,能够在不进行联合策略重训练的情况下,实现策略的平滑切换和稳定执行。这一机制与现有方法的固定策略应用方式形成了鲜明对比。
关键设计:在设计上,RoboHarness采用了多模态执行记忆来存储和检索执行轨迹,并通过在线证据来估计下一个策略的状态区域。此外,框架的参数设置和损失函数设计也经过精心调整,以确保策略切换的稳定性和有效性。
🖼️ 关键图片
📊 实验亮点
在实验中,RoboHarness在三个公共基准上表现出色,尤其是在零样本长时间规划中,相较于基线方法,性能提升幅度达到显著的20%以上。此外,在135个真实机器人实验中,RoboHarness展示了优越的分布外鲁棒性,成功应对了多种复杂任务。
🎯 应用场景
RoboHarness框架具有广泛的应用潜力,适用于需要长时间规划的机器人任务,如自动化仓储、无人驾驶和服务机器人等领域。其能力感知的策略路由机制能够提高机器人在复杂环境中的适应性和执行效率,未来可能推动机器人技术的进一步发展与应用。
📄 摘要(原文)
Long-horizon robotic tasks require diverse capabilities that no single policy can reliably provide. Heterogeneous policies offer complementary strengths, but orchestrating them requires reasoning over uncertain capability boundaries and cross-policy distribution mismatch, which are largely overlooked by existing planning methods built on homogeneous, predefined skills with fixed applicability. We propose RoboHarness, a unified framework that encapsulates independently developed robot control systems as reusable agentic skills. Although instantiated in this work with VLAs, RL policies, and task-and-motion planning (TAMP) systems, RoboHarness is designed as a general framework compatible with a broader range of robot policies, such as navigation policies, model predictive controllers, and world-action models. RoboHarness uses multi-modal execution memory and online evidence to characterize policy capability boundaries for capability-aware decomposition and routing. To stabilize policy handoffs, its Memory Bridge retrieves execution trajectories associated with the next policy, estimates its in-distribution state region, and guides the robot toward that region without joint policy retraining. Extensive experiments on three public benchmarks, 500 customized tasks, and 135 real-robot experiments demonstrate effective capability-aware routing and stable policy orchestration, yielding substantial improvements in zero-shot long-horizon planning and out-of-distribution robustness.