SOPD-SocialNav: Selective On-Policy Distillation for Vision-Language Social Navigation

📄 arXiv: 2607.19850v1 📥 PDF

作者: Xinyu Zhang, Zishuo Wang, Ling Xiao

分类: cs.RO

发布日期: 2026-07-22

备注: This paper has been accepted to 2026 WRC Symposium on Advanced Robotics and Automation (WRC SARA)


💡 一句话要点

提出SOPD-SocialNav以解决轻量化社交导航模型的知识转移问题

🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture)

关键词: 视觉-语言模型 社交导航 知识蒸馏 轻量化模型 人机交互 机器人技术

📋 核心要点

  1. 现有的视觉-语言模型在社交导航中表现出色,但在资源受限的机器人平台上难以有效部署。
  2. 本文提出的SOPD方法通过选择性在线蒸馏,将社交导航知识从大型教师模型转移到轻量级学生模型,提升社交推理能力。
  3. 实验结果显示,SOPD在动作预测、感知一致性和推理一致性方面均优于传统方法,且在实际机器人部署中表现出更好的社交适应性。

📝 摘要(中文)

视觉-语言模型在社交机器人导航中展现出强大的潜力,能够利用丰富的语义理解复杂环境和人类行为。然而,大规模的视觉-语言模型在资源受限的机器人平台上难以部署,而轻量化的模型往往缺乏足够的社交推理能力。为了解决这一问题,本文提出了SOPD-SocialNav,一种选择性在线蒸馏方法,通过从大型教师模型向轻量级学生模型转移社交导航知识。SOPD引入了一种基于熵的标记选择机制,利用教师模型的不确定性来识别社交信息丰富的决策标记,同时抑制来自低熵标记的梯度。实验表明,SOPD在多个基准测试中均优于传统的监督微调和蒸馏方法,能够生成更为社交适应的导航行为。

🔬 方法详解

问题定义:本文解决的是如何在资源受限的机器人平台上有效部署社交导航模型的问题。现有的大规模视觉-语言模型难以直接应用,而轻量级模型又缺乏足够的社交推理能力。

核心思路:论文的核心思路是通过选择性在线蒸馏方法,将大型教师模型的社交导航知识转移到轻量级学生模型中。通过熵值选择机制,识别出对社交决策有重要影响的标记,从而提升学生模型的社交推理能力。

技术框架:整体架构包括教师模型和学生模型的协同训练,教师模型通过熵值机制选择重要标记,学生模型则通过温度控制的Jensen-Shannon散度目标与教师模型进行对齐。主要模块包括标记选择、知识蒸馏和模型训练。

关键创新:最重要的技术创新在于引入了基于熵的标记选择机制,能够有效识别出对社交决策有重要影响的标记,并抑制低熵标记的影响,从而提升学生模型的社交推理能力。

关键设计:在损失函数设计上,采用了温度控制的Jensen-Shannon散度作为对齐目标,确保学生模型在重要标记上的学习效果。同时,熵值选择机制的实现也需要合理的参数设置,以确保模型训练的稳定性和有效性。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果表明,SOPD在SNEI和MUSON基准测试中均优于监督微调和传统蒸馏方法,尤其在动作预测和推理一致性方面,提升幅度达到15%以上。此外,在Scout Mini机器人上的实际部署显示,蒸馏后的模型在社交场景中表现出更为适宜的导航行为。

🎯 应用场景

该研究的潜在应用领域包括社交机器人、智能家居和人机交互等场景。通过提升轻量级视觉-语言模型的社交推理能力,能够使机器人在复杂环境中更好地理解和响应人类行为,从而提高用户体验和交互质量。未来,该方法有望推动更多智能设备的社交智能化发展。

📄 摘要(原文)

Vision-language models have shown strong potential for social robot navigation by leveraging rich semantic understanding of complex environments and human behaviors. However, large scale VLMs are difficult to deploy on resource-constrained robotic platforms, while lightweight VLMs often lack sufficient social reasoning capability. To address this problem, we propose SOPD-SocialNav, a selective on-policy distillation (SOPD) method that transfers social navigation knowledge from a large teacher VLM to a lightweight student VLM. SOPD introduces an entropy-based token selection mechanism that uses teacher uncertainty to identify socially informative decision tokens, while suppressing gradients from low-entropy tokens corresponding to trivial navigation states. A temperature-controlled Jensen-Shannon divergence objective is then used to align the student and teacher distributions on the selected tokens. Experiments on the SNEI and MUSON benchmarks demonstrate that SOPD consistently outperforms supervised fine-tuning, off-policy distillation, and standard on-policy distillation baselines in action prediction, perception consistency, and reasoning consistency. Real-world deployment on a Scout Mini robot further shows that the distilled model can generate more socially appropriate navigation behaviors in conversational and queuing scenarios. These results suggest that SOPD is an effective strategy for building lightweight yet socially aware VLM-based navigation systems.