Diagnosing Semantic Handoff Failures in Agent-Orchestrated Vision-Language-Action Skill Composition

📄 arXiv: 2607.06256v1 📥 PDF

作者: Ke Rui, Yushen Zuo, Jiawei Wang, Haoran Jia, Jinming Ma, Weitao Zhou, Minglei Li

分类: cs.RO

发布日期: 2026-07-07

期刊: RSS SemRob Workshop 2026


💡 一句话要点

提出一种方法以解决机器人技能组合中的语义交接失败问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 语义交接 技能组合 视觉-语言-动作 机器人执行 长时间任务 多视角验证 鲁棒性评估

📋 核心要点

  1. 现有方法在处理长时间任务时,技能之间的交接不够明确,导致后续技能无法可靠启动。
  2. 本文提出了一种代理协调的视觉-语言-动作执行框架,通过多视角验证来优化技能组合的执行。
  3. 实验表明,尽管在干净快照下技能成功率高,但在链式状态下的组合执行仍存在显著失败,揭示了技能库的不足。

📝 摘要(中文)

长时间的家庭任务要求机器人组合多种基于语言的技能,但连续技能之间的边界往往不明确。一个技能可能满足其后置条件,但可能导致机器人、物体或摄像头视角处于无法可靠启动下一个技能的状态。本文通过代理协调的视觉-语言-动作执行框架研究BEHAVIOR-1K中的语义交接问题。该框架调用基于$π_{0.5}$的技能检查点,分配每个技能的类型参数和步骤预算,并使用多视角视觉-语言模型验证来决定执行是否应继续、重试或重新规划。实验结果显示,尽管在干净快照下某些技能的成功率高达77-100%,但在链式状态下的组合执行仍然频繁停滞,揭示了单一技能成功与可靠的长时间任务完成之间的显著差距。

🔬 方法详解

问题定义:本文解决的问题是长时间家庭任务中,技能之间的语义交接失败,现有方法未能有效处理技能交接的复杂性,导致后续技能无法可靠启动。

核心思路:论文的核心思路是通过代理协调的执行框架,结合视觉、语言和动作模型,来优化技能的组合执行,确保在不同状态下的技能交接更加可靠。

技术框架:整体架构包括技能检查点的调用、参数分配、步骤预算设定,以及多视角视觉-语言模型的验证模块。该框架通过这些模块来决定执行的推进、重试或重新规划。

关键创新:最重要的技术创新在于将技能的独立能力与长时间组合的鲁棒性分开评估,提出了一种新的验证机制,能够有效识别和诊断技能交接中的潜在问题。

关键设计:在设计中,使用了$π_{0.5}$的技能检查点,设置了类型参数和步骤预算,并采用了多视角视觉-语言模型进行验证,确保了执行过程的灵活性和准确性。实验中还考虑了不同初始状态分布的影响。

🖼️ 关键图片

fig_0
img_1
img_2

📊 实验亮点

实验结果显示,在干净快照下,选定的导航、抓取、放置和开门技能的成功率达到77-100%。然而,在链式状态下的组合执行仍然频繁停滞,揭示了单一技能成功与长时间任务完成之间的显著差距,强调了未来技能库需要增强对复杂状态分布的鲁棒性。

🎯 应用场景

该研究的潜在应用领域包括家庭服务机器人、智能家居系统和人机交互等。通过提高机器人在复杂环境中的任务执行能力,能够显著提升用户体验和机器人自主性,未来可能推动智能机器人在日常生活中的广泛应用。

📄 摘要(原文)

Long-horizon household tasks require robots to compose many language-conditioned skills, yet the boundary between consecutive skills is rarely explicit. A skill may satisfy its own postcondition while leaving the robot, objects, or camera views in a state from which the next skill cannot reliably start. We study this semantic handoff problem in BEHAVIOR-1K through an agent-orchestrated vision-language-action execution harness. The harness invokes $π_{0.5}$-based skill checkpoints trained from cleaned BEHAVIOR-1K demonstrations, assigns each skill typed arguments and a step budget, and uses multi-view vision-language model verification to decide whether execution should advance, retry, or replan. To separate isolated skill competence from long-horizon compositional robustness, we evaluate the same checkpoints under two initial-state distributions: clean skill-boundary snapshots and chained terminal states produced by previous skills. Selected navigation, grasping, placement, and door-opening skills achieve 77--100% success from clean snapshots under human-reviewed verification, yet composed rollouts still frequently stall from chained states. Execution traces attribute these failures to next-skill readiness, target grounding, and low-level control execution, revealing a substantial gap between single-skill success and reliable long-horizon task completion. These findings turn near-zero end-to-end task success into actionable diagnostics, showing that future VLA skill libraries must learn robustness to the messy chained-state distribution that clean demonstrations systematically underrepresent.