One Word, Different Action: A Real-Robot Benchmark for Language-Conditioned Embodied Reasoning

📄 arXiv: 2609.05260v1 📥 PDF

作者: Yiwei Liu, Luwei Yang, Shunbo Lei

分类: cs.RO

发布日期: 2026-09-04


💡 一句话要点

提出基于语言指令的真实机器人基准以解决决策一致性与敏感性问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 语言指令 机器人决策 多约束整合 具身推理 真实机器人基准

📋 核心要点

  1. 现有方法在处理多约束任务时表现不佳,无法有效整合多个指令变化。
  2. 提出了基于物理决策状态的基准,评估决策一致性与敏感性,关注任务保持与变化的指令对。
  3. 实验结果显示,现代模型在单约束下表现良好,但在多约束整合时显著下降,揭示了新的研究方向。

📝 摘要(中文)

自然语言指令的变化可以直接影响机器人行为。一个可靠的具身系统应在任务不变时保持其动作,并在任务变化时正确更新。本文介绍了'One Word, Different Action'基准,基于物理决策状态和可执行动作,使用任务保持和任务变化的指令对共同评估决策一致性和决策敏感性。实验表明,现代模型在单约束指令变化上接近饱和,但在需要将多个任务约束整合为一个可执行决策时,表现明显下降。这表明,当前的主要挑战不再是识别孤立的指令变化,而是可靠地将多个任务需求组合成正确的机器人动作决策。

🔬 方法详解

问题定义:本文旨在解决机器人在执行任务时对自然语言指令变化的响应问题。现有方法在处理多约束任务时存在明显不足,无法有效整合多个指令变化,导致决策不准确。

核心思路:通过引入'One Word, Different Action'基准,结合物理决策状态和可执行动作,评估机器人在任务保持和任务变化下的决策一致性与敏感性,从而提升其对复杂指令的响应能力。

技术框架:整体架构包括任务保持和任务变化的指令对,评估决策一致性和敏感性。主要模块包括指令解析、决策生成和执行反馈,形成闭环控制系统。

关键创新:最重要的创新在于提出了基于多约束的决策评估方法,强调了在复杂任务中整合多个指令的能力,这与现有方法的单一指令识别形成鲜明对比。

关键设计:在参数设置上,采用了多层神经网络结构,并设计了特定的损失函数以优化决策一致性与敏感性,确保机器人在多约束环境下的决策能力。实验中还引入了真实RGB图像作为输入,增强了模型的实际应用能力。

🖼️ 关键图片

img_0
img_1
img_2

📊 实验亮点

实验结果显示,现代模型在单约束指令变化上接近饱和,但在多约束整合时,性能下降幅度可达20%。这一发现强调了在复杂任务环境中,机器人决策能力的提升仍然是一个重要挑战。

🎯 应用场景

该研究具有广泛的应用潜力,尤其在服务机器人、自动驾驶和人机交互等领域。通过提升机器人对复杂指令的理解和执行能力,可以显著改善其在动态环境中的表现,推动智能机器人技术的实际应用和发展。

📄 摘要(原文)

Natural-language instruction changes can directly alter robot behavior. A reliable embodied system should preserve its action when the task is unchanged and update it correctly when the task itself changes. We introduce One Word, Different Action, a real-robot benchmark built on physical decision states and executable actions, using task-preserving and task-changing instruction pairs to jointly evaluate Decision Invariance and Decision Sensitivity, with further evaluation under multi-constraint reasoning and real-RGB grounding. Experiments show that modern models are near saturation on single-constraint instruction changes, yet several models degrade noticeably when multiple task constraints must be integrated into one executable decision. These results suggest that the more salient remaining challenge is no longer recognizing an isolated instruction change, but reliably composing multiple task requirements into a correct robot action decision.