Breaking the 15% Barrier: A Real-World Data-Driven System for Proactive Social Robot Triggered by User Nonverbal Cues
作者: Yuga Yano, Yuki Okafuji, Ryo Miyoshi, Sanae Yamashita, Yoshiki Ohira
分类: cs.RO
发布日期: 2026-07-13
备注: 8 pages, accepted as a conference paper for IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS2026)
💡 一句话要点
提出基于非语言行为的社交机器人主动响应系统以提升用户互动体验
🎯 匹配领域: 支柱一:机器人控制 (Robot Control)
关键词: 非语言行为 社交机器人 主动响应 多模态识别 用户体验 对话生成 实时系统
📋 核心要点
- 现有的服务机器人多依赖于语音识别系统,忽视了用户的非语言行为对互动的影响。
- 本研究提出了一种实时识别用户非语言提示的系统,并基于这些提示生成对话内容。
- 实验结果显示,机器人在实际应用中有15.3%的发言是由用户的非语言行为触发,显著提升了互动效果。
📝 摘要(中文)
本论文研究了零售店服务机器人如何通过用户的非语言行为(如靠近、挥手、指向等)主动触发对话。研究表明,在为期6天的实际部署中,15.3%的机器人发言是由用户的非语言行为而非语言输入引发的,揭示了音频对话系统的局限性。基于对客户行为的分析,定义了一组服务相关的非语言提示,并开发了实时多用户多标签识别器。提出的对话框架基于识别的非语言提示生成语言模型的发言,支持机器人在没有手工规则的情况下主动响应用户行为。
🔬 方法详解
问题定义:本论文旨在解决现有服务机器人主要依赖语音输入的问题,忽视了用户非语言行为的影响,导致互动体验不足。
核心思路:通过分析用户的非语言行为,定义服务相关的非语言提示,并开发实时识别系统,以此触发机器人的对话生成。
技术框架:整体架构包括视频输入的多用户多标签识别模块,基于识别结果的对话生成模块,以及可选的视觉-语言模型,用于处理用户展示的物品。
关键创新:本研究的创新在于将非语言行为作为对话触发机制,突破了传统音频对话系统的限制,实现了更自然的用户互动。
关键设计:系统采用实时视频分析技术,识别用户的非语言提示,并通过条件生成的方式与语言模型结合,确保机器人能够及时响应用户行为。识别算法和对话生成模型的设计均经过优化,以提高响应速度和准确性。
🖼️ 关键图片
📊 实验亮点
实验结果表明,在为期6天的实际部署中,机器人有15.3%的发言是由用户的非语言行为触发,显示出该系统在提升用户互动中的有效性。与传统音频对话系统相比,该方法显著提高了机器人响应的灵活性和自然性。
🎯 应用场景
该研究的潜在应用场景包括零售、服务行业及人机交互领域。通过提升机器人对用户非语言行为的理解能力,可以显著改善客户体验,增加用户满意度,并推动服务机器人在实际场景中的广泛应用。
📄 摘要(原文)
Service robots in retail stores increasingly rely on cascaded speech pipelines (STT-LLM-TTS), yet many customer-robot interactions are initiated or guided by nonverbal behaviors such as approaching, waving, pointing, or showing items. This paper studies such cues in a real-world store deployment with a teleoperated humanoid robot and shows that a non-negligible portion of robot turns are triggered by nonverbal behaviors rather than spoken input, revealing a limitation of audio-only dialogue systems. In a 6-day in-the-wild deployment, 15.3\% of robot utterances were initiated by users' nonverbal behaviors rather than spoken input. Based on an analysis of observed customer behaviors, we define a set of frequent, service-relevant nonverbal cues and develop a real-time multi-person, multi-label recognizer that runs online from video. We then propose a dialogue framework that conditions LLM-based utterance generation on recognized nonverbal cue tokens, and optionally leverages a vision-language model when items are shown, enabling proactive robot responses without hand-crafted rules. We evaluate the approach offline on nonverbal-triggered turns and demonstrate an online prototype that reacts to users' nonverbal cues in real time.