An Intelligent-Cloud Edge Multimodal Interaction System for Robots

📄 arXiv: 2607.14675v1 📥 PDF

作者: Zihan Guo, Xiaoqi Li

分类: cs.RO, cs.AI

发布日期: 2026-07-16


💡 一句话要点

提出云边多模态交互系统以解决机器人在人机交互中的挑战

🎯 匹配领域: 支柱三:空间感知与语义 (Perception & Semantics) 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 多模态交互 手势识别 云计算 边缘计算 机器人技术 视觉语言模型 大语言模型 任务规划

📋 核心要点

  1. 现有方法在复杂环境中面临手势识别精度不足和任务规划能力有限的挑战,尤其是在资源受限的机器人系统中。
  2. 本文提出的云边多模态交互框架通过集成YOLO手势检测器与大语言模型和视觉语言模型,提升了人机交互的准确性和可靠性。
  3. 实验结果显示,YOLO-DC在手势检测精度和系统成功率上均显著优于传统方法,验证了该框架的有效性。

📝 摘要(中文)

在复杂环境中实现稳健的人机交互需要准确的手势感知、语义场景理解和可靠的任务规划,而这些往往受到有限的机载计算资源的限制。本文提出了一种云边多模态交互框架,集成了增强的基于YOLO的手势检测器和协调的大语言模型(LLM)与视觉语言模型(VLM)代理。所提出的检测器在网络中引入了卷积块注意力模块(CBAM),并将基线边界框回归目标替换为距离IoU(DIoU)损失。这些改进提高了在复杂背景下对小型或部分遮挡手势的特征区分和定位能力。云层负责手势检测、场景理解、多模态融合和行动规划,而TonyPi机器人则负责数据采集、通信、行动执行和反馈。实验结果表明,YOLO-DC在公共手势数据集和自定义数据集上的精度值分别为98.9%和95.0%,mAP@0.5值分别为90.7%和92.7%。系统级评估显示单一动作、复合动作和视觉依赖任务的成功率分别为95%、88%和82%。

🔬 方法详解

问题定义:本文旨在解决复杂环境中机器人与人类交互时的手势识别和任务规划问题,现有方法在这些方面存在精度不足和资源限制的痛点。

核心思路:提出的框架通过结合云计算和边缘计算,利用增强的YOLO手势检测器和多模态代理,提升了手势识别的准确性和任务执行的可靠性。

技术框架:整体架构分为云层和边缘层,云层负责手势检测、场景理解和行动规划,边缘层的TonyPi机器人负责数据采集、通信和执行反馈。

关键创新:引入卷积块注意力模块(CBAM)和距离IoU(DIoU)损失函数,显著提高了对小型和部分遮挡手势的检测能力,与传统YOLO方法相比具有本质区别。

关键设计:在网络结构中,CBAM增强了特征提取能力,DIoU损失函数优化了边界框回归,整体设计旨在提高复杂背景下的手势识别精度。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果表明,YOLO-DC在手势检测中的精度达到98.9%和95.0%,mAP@0.5值分别为90.7%和92.7%。系统级评估显示,单一动作、复合动作和视觉依赖任务的成功率分别为95%、88%和82%,验证了该框架的有效性和实用性。

🎯 应用场景

该研究的潜在应用领域包括服务机器人、智能家居、医疗辅助等场景,能够提升机器人在复杂环境中的人机交互能力,具有重要的实际价值和广泛的应用前景。未来,该框架可进一步扩展到更多的多模态交互任务中,推动智能机器人技术的发展。

📄 摘要(原文)

Robust human-robot interaction in complex environments requires accurate gesture perception, semantic scene understanding, and reliable task planning under limited onboard computing resources. This paper presents a cloud-edge multimodal interaction framework that integrates an enhanced YOLO-based gesture detector with coordinated large language model (LLM) and vision-language model (VLM) agents. The proposed detector, incorporates the Convolutional Block Attention Module (CBAM) into the neck and replaces the baseline bounding-box regression objective with Distance-IoU (DIoU) loss. These modifications improve feature discrimination and localization for small or partially occluded gestures in complex backgrounds. The cloud layer performs gesture detection, scene understanding, multimodal fusion, and action planning, whereas the TonyPi robot locally handles data acquisition, communication, action execution, and feedback. Experiments on a public gesture dataset and a custom dataset show that YOLO-DC achieves precision values of 98.9% and 95.0%, with mAP@0.5 values of 90.7% and 92.7%, respectively. System-level evaluation yields success rates of 95%, 88%, and 82% for single-action, composite-action, and vision-dependent tasks. A 30 participant evaluation yields an overall mean satisfaction score of 3.69 out of 5. These results demonstrate the feasibility of combining refined gesture detection with multimodal agents for resource-constrained robotic interaction.