Whole-Body Semantic-to-Actuation Grounding of Elephant-Inspired Soft-Trunk Motion via Lightweight Flow Matching
作者: Tingcong Liu, Tongshun Chen, Siyi Ma, Yuhao Wang, Aye Phyu Phyu Aung, Ibrahim Alsarraj, J. Senthilnath, Bo An, Ke Wu
分类: cs.RO
发布日期: 2026-07-13
💡 一句话要点
提出全身语义到驱动的基础框架以解决人机交互中的运动表达问题
🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture) 支柱三:空间感知与语义 (Perception & Semantics) 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 人机交互 软体机器人 语义理解 运动生成 流匹配 Catmull-Rom样条 多模态融合
📋 核心要点
- 现有方法在将开放词汇响应映射到树干状操控器时面临挑战,尤其是末端执行器运动无法充分描述身体形状。
- 本文提出的框架通过轻量流匹配,将多模态语言模型的响应转化为可行的运动意图,解决了高维指令的可行性问题。
- 实验表明,该框架在提高响应正确性方面表现优异,且在用户满意度调查中显著提升了参与者的整体满意度。
📝 摘要(中文)
针对近距离人机交互中,树干状连续操控器在多样化全身表达中的应用挑战,本文提出了一种基于轻量流匹配的全身语义到驱动的基础框架。该框架将多模态大语言模型的响应转换为形态对齐的意图强度元组,并通过紧凑的Catmull-Rom样条控制参数化肌腱驱动轨迹,利用修正流生成器采样可行的全身运动。实验结果表明,该框架在保持运动多样性的同时,显著提高了基础响应的正确性,从25.0%提升至77.2%。
🔬 方法详解
问题定义:本文旨在解决在近距离人机交互中,如何将开放词汇的自然语言响应有效映射到树干状连续操控器的问题。现有方法的痛点在于,末端执行器的运动无法充分描述复杂的身体形状,而直接的全身指令又过于高维,难以实现可行的动作。
核心思路:论文提出的解决方案是构建一个全身语义到驱动的基础框架,通过轻量流匹配将多模态语言模型的响应转化为形态对齐的意图强度元组,从而实现对树干状操控器的有效控制。这样的设计使得机器人能够更好地理解和执行复杂的运动指令。
技术框架:整体架构包括三个主要模块:首先是将语言模型的响应转换为意图强度元组;其次是利用Catmull-Rom样条控制参数化肌腱驱动轨迹;最后,使用修正流生成器采样可行的全身运动。这一流程确保了生成的运动既符合语义要求,又具备可行性。
关键创新:最重要的技术创新点在于轻量流匹配的应用,它有效地将高维的全身指令简化为可操作的运动意图,并通过流生成器实现了高效的运动采样。这与现有的基于密集回归或去噪扩散的方法有本质区别。
关键设计:在参数设置上,使用了紧凑的Catmull-Rom样条来控制肌腱的驱动轨迹,损失函数设计上注重了运动的可行性与多样性。此外,网络结构方面采用了轻量级的流生成器,以提高推理速度和响应的实时性。
🖼️ 关键图片
📊 实验亮点
实验结果显示,提出的框架在基础响应的正确性上从25.0%提升至77.2%,相较于去噪扩散基线,正确性从71.9%提升至77.2%,推理时间从7.86毫秒减少至4.87毫秒,同时保持了运动的多样性。此外,100名参与者的实地研究表明,增加的软树干运动通道使整体满意度从46%提升至82%。
🎯 应用场景
该研究的潜在应用领域包括服务机器人、医疗辅助机器人以及教育机器人等,能够在需要与人类进行近距离互动的场景中,提供更加自然和丰富的运动表达。这将极大提升人机交互的体验和效率,未来可能推动智能机器人在更多领域的应用。
📄 摘要(原文)
For close-contact human-robot interaction (HRI), trunk-like continuum manipulators provide a physical channel for diverse whole-body expression, but grounding open-vocabulary responses into such robots is difficult: end-effector motion underspecifies body shape, whereas direct whole-body commands are high-dimensional and hard to keep feasible. We propose a whole-body semantic-to-actuation grounding framework for elephant-inspired soft-trunk HRI based on lightweight flow matching. The framework converts responses from a multimodal large language model into bounded, morphology-aligned intent-intensity tuples, parameterizes tendon-actuation trajectories with compact Catmull-Rom spline controls, and uses a rectified-flow generator to sample feasible whole-body trunk motions. Experiments show that the proposed framework improves held-out grounding correctness from 25.0% to 77.2% over a raw-response dense-regression baseline. Compared with a denoising-diffusion baseline, it improves correctness from 71.9% to 77.2% and reduces inference time from 7.86 ms to 4.87 ms while preserving motion diversity. A 100-participant physical HRI study further shows that adding the generated soft-trunk motion channel increases the positive overall-satisfaction rating from 46% to 82% over the audiovisual-only baseline.