A Confidence-Aware Multimodal Fusion Framework for Industrial Human-Robot Collaboration
作者: Xinyu Liu, Qiqi Dong, Boya Jia, Yi Zhang, Binbin Lian
分类: cs.RO, cs.HC
发布日期: 2026-09-09
💡 一句话要点
提出信心感知多模态融合框架以提升工业人机协作中的意图预测
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 多模态融合 人机协作 意图预测 动态融合机制 信心感知 双向LSTM 工业自动化
📋 核心要点
- 现有的人机协作意图预测方法在多模态融合时缺乏对模态可靠性的动态评估,导致预测准确性下降。
- 本文提出的信心感知多模态融合框架通过动态调整模态融合权重,增强了对模态可靠性的适应性。
- 实验结果显示,所提方法在意图识别准确率上达到91.86%,并在复杂环境中表现出良好的稳定性和适应性。
📝 摘要(中文)
本文提出了一种信心感知多模态融合框架(CAMF),旨在实现工业人机协作中的可靠人类意图预测。该框架融合了四种异构模态,包括物体的六维姿态、注视、骨骼运动和基于IMU的手部运动。它将信心趋势驱动的动态融合机制嵌入双向长短期记忆网络(BiLSTM),以根据实时模态可靠性自适应平衡双向时间特征。此外,采用信心引导的平衡学习策略和信心冻结机制,动态调整网络梯度,抑制低质量模态的噪声,减轻跨模态学习偏差。基于UR3协作机器人构建的物理平台进行了实验验证。比较结果表明,所提方法的意图识别准确率达到91.86%,在整体性能和稳定性上优于现有多模态融合方法,并在低光照和部分遮挡干扰下保持满意的准确性。
🔬 方法详解
问题定义:本文旨在解决工业人机协作中意图预测的可靠性问题,现有方法在多模态融合时未能有效考虑模态的实时可靠性,导致预测效果不佳。
核心思路:提出信心感知多模态融合框架(CAMF),通过动态融合机制和信心引导的学习策略,提升模态融合的适应性和准确性。
技术框架:框架主要包括四个模态输入(物体六维姿态、注视、骨骼运动和IMU手部运动),通过BiLSTM进行特征提取,并结合信心趋势动态调整模态权重。
关键创新:引入信心趋势驱动的动态融合机制和信心冻结机制,显著提升了低质量模态的噪声抑制能力,解决了跨模态学习偏差问题。
关键设计:采用双向长短期记忆网络(BiLSTM)作为基础网络结构,设计了信心引导的平衡学习策略,动态调整网络梯度,确保高质量模态的影响力最大化。
🖼️ 关键图片
📊 实验亮点
实验结果显示,所提信心感知多模态融合框架在意图识别准确率上达到91.86%,显著优于现有方法,并在低光照和部分遮挡条件下保持稳定表现,展现出良好的环境适应性。
🎯 应用场景
该研究的潜在应用领域包括工业自动化、智能制造和人机协作系统。通过提高人机协作中的意图预测准确性,能够有效提升生产效率和安全性,未来可能在更多复杂环境中得到广泛应用。
📄 摘要(原文)
A confidence-aware multimodal fusion framework (CAMF) is proposed to realize reliable human intention prediction for industrial human-robot collaboration. This framework fuses four heterogeneous modalities including object 6D pose, gaze, skeletal motion and IMU-based hand motion. It embeds a confidence-trend-driven dynamic fusion mechanism into BiLSTM to adaptively balance bidirectional temporal features according to real-time modality reliability. A confidence-guided balanced learning strategy combined with a confidence freezing mechanism is further adopted to adjust network gradients dynamically, suppress noise from low-quality modalities and mitigate cross-modal learning bias. A physical platform based on the UR3 collaborative robot is built for experimental validation. Comparative results show that the proposed method reaches an intention recognition accuracy of 91.86% and outperforms existing multimodal fusion approaches in overall performance and stability. It also maintains satisfactory accuracy under low light and partial occlusion interference. In practical assembly tasks, the framework enables proactive and stable human-robot cooperation with strong environmental adaptability.