Development of a Humanoid Robot Prototype for Multimodal Human-Robot Interaction

📄 arXiv: 2609.05361v1 📥 PDF

作者: Thang Tran Viet, Thanh Nguyen Canh, Huy Uong Gia, Phuc Dinh Van, Son Tran Duc, Ngoc Minh Do, Xiem HoangVan

分类: cs.RO

发布日期: 2026-09-04

备注: 6 pages, 6 figures. Published in the 2025 RIVF International Conference on Computing and Communication Technologies (RIVF 2025)

DOI: 10.1109/RIVF68649.2025.11364526


💡 一句话要点

提出一种类人机器人原型以促进多模态人机交互

🎯 匹配领域: 支柱一:机器人控制 (Robot Control) 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 类人机器人 人机交互 多模态融合 人工智能 手势识别 语音识别 物体检测

📋 核心要点

  1. 现有的人机交互方法在灵活性和智能性方面存在不足,难以适应复杂的真实环境。
  2. 本文提出了一种类人机器人原型,集成多种AI模块以实现更自然的人机交互,具有12个自由度的双臂和表情显示功能。
  3. 实验结果显示该系统在任务执行中的准确率超过90%,手势识别和语音识别的准确率分别达到96%和92%,验证了其有效性。

📝 摘要(中文)

人机交互(HRI)使人类与机器人在真实环境中进行直观和智能的协作。本文介绍了一种类人机器人原型,旨在作为开发和集成人工智能(AI)模块的灵活测试平台。该系统具有12个自由度的双臂机制和一个带有表达性LCD屏幕的2个自由度头部,用于表达面部情感。所有硬件组件由定制的控制板控制,实时AI处理由机载Jetson模块支持。系统集成了三个AI模块:(1)使用MediaPipe Pose和LSTM分类器的手势识别,(2)使用YOLO和3D定位的物体检测,以及(3)通过语音识别和基于大型语言模型(LLM)的语义解析进行的语音命令处理。通过定位精度实验验证了该平台,结果显示平均操作误差约为1.83厘米。实验结果表明,任务准确率超过90%,手势识别达到96%,语音识别达到92%。结果确认了所提出系统作为人机交互研究和原型开发的可重复和可访问的类人平台的有效性。

🔬 方法详解

问题定义:本研究旨在解决现有类人机器人在多模态人机交互中的灵活性不足和智能性不足的问题。现有方法往往无法有效处理复杂的交互场景,限制了人机协作的潜力。

核心思路:论文提出的核心思路是设计一个集成多种AI模块的类人机器人原型,以实现更自然和直观的人机交互。通过灵活的硬件设计和实时AI处理,提升机器人在真实环境中的适应能力。

技术框架:整体架构包括硬件部分和软件部分。硬件部分由双臂机制、头部显示屏和定制控制板组成,软件部分则集成了手势识别、物体检测和语音命令处理三个AI模块。

关键创新:最重要的技术创新在于将多模态AI模块有效集成到类人机器人中,使其能够同时处理视觉和听觉信息,从而提升人机交互的自然性和智能性。这与现有方法的单一模态处理形成鲜明对比。

关键设计:在设计中,使用了MediaPipe Pose和LSTM分类器进行手势识别,YOLO进行物体检测,语音识别结合大型语言模型进行语义解析。控制系统采用定制的控制板,确保实时处理和高效执行。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果显示,该系统在定位精度方面的平均操作误差为1.83厘米,任务准确率超过90%。具体而言,手势识别的准确率达到96%,语音识别的准确率达到92%,验证了系统的高效性和可靠性。

🎯 应用场景

该研究的类人机器人原型具有广泛的应用潜力,特别是在教育、医疗和服务行业中,可以用于辅助教学、患者护理和客户服务等场景。其灵活的多模态交互能力将推动人机协作的进一步发展,提升工作效率和用户体验。

📄 摘要(原文)

Human-robot interaction (HRI) enables intuitive and intelligent collaboration between humans and robots in real-world environments. This paper introduces a humanoid robot prototype designed as a flexible testbed for developing and integrating artificial intelligence (AI) modules in HRI tasks. The system features a 12 degree-of-freedom (DOFs) dual-arm mechanism and a 2 DOFs head with an expressive LCD screen to express facial emotions. All hardware components are controlled by a custom-designed controller board with real-time AI processing supported by an onboard Jetson module. The system incorporates three AI modules: (1) gesture recognition using MediaPipe Pose and an LSTM classifier, (2) object detection with YOLO and 3D localization, and (3) voice-command processing through speech recognition and large language model(LLM)-based semantic parsing. The platform is validated through experiments on positioning accuracy, with results showing average manipulation errors of approximately 1.83 cm. To demonstrate its versatility, experimental results show over 90% task accuracy, with gesture recognition reaching 96%, speech recognition reaching 92%. The results confirm the effectiveness of the proposed system as a reproducible and accessible humanoid platform for research and prototyping in HRI.