PGN: Design and Implementation of a Vision-Language Navigation System Based on Pangu Multimodal Foundation Model
作者: Li Xian, Mingxi Li, Yizheng Wang, Yiming Shen, Qi Chen, Zhuoling Xiao
分类: cs.AI
发布日期: 2026-07-20
备注: 6 pages, 5 figures
💡 一句话要点
提出PGN以解决视觉语言导航中的多模态对齐问题
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 视觉语言导航 多模态对齐 动作预测 专家轨迹 深度学习
📋 核心要点
- 现有的视觉语言导航方法在多模态对齐和稳定训练方面存在挑战,限制了其在复杂环境中的应用。
- PGN通过将视觉编码器与语言主干对齐,并利用专家轨迹进行适应,提出了一种新的离线动作预测框架。
- 在实验中,PGN在500个专家轨迹上实现了62.29%的NAM和100.00%的NER,展示了其在动作预测上的有效性。
📝 摘要(中文)
视觉语言导航(VLN)要求具身智能体解读自然语言指令并根据时间顺序的视觉观察预测动作。将多模态大语言模型适应于VLN需要视觉与语言的对齐、紧凑的时间输入、动作空间的基础以及在目标硬件上的稳定训练。本文介绍了PGN(Pangu Navigator),一个基于OpenPangu-7B构建的离线VLN动作预测系统。训练分为两个阶段,首先通过训练Q-Former和两层MLP投影器,将冻结的EVA-ViT-G/14视觉编码器与冻结的语言主干对齐。其次,PGN利用五个观察窗口、依赖于周期的时间采样和推理后再行动的输出格式,将对齐模型适应于专家导航轨迹。该实现结合了混合精度计算、选择性FP32计算和DeepSpeed ZeRO-2,在八个Ascend 910B NPU上进行训练。在500个保留的专家轨迹上进行的教师强制、开放循环评估中,V9报告了62.29%的标准化动作匹配率(NAM)和100.00%的非空率(NER)。
🔬 方法详解
问题定义:本文旨在解决视觉语言导航中多模态对齐和稳定训练的问题。现有方法在处理复杂的视觉和语言输入时,往往难以实现有效的对齐和准确的动作预测。
核心思路:PGN的核心思路是通过分阶段训练,将视觉编码器与语言主干进行对齐,并利用专家导航轨迹进行模型适应,从而提高动作预测的准确性和稳定性。
技术框架:PGN的整体架构分为两个主要阶段:第一阶段是对齐阶段,使用Q-Former和MLP投影器对视觉和语言模型进行对齐;第二阶段是适应阶段,利用专家轨迹进行模型的进一步训练和优化。
关键创新:PGN的关键创新在于其采用了五个观察窗口和推理后再行动的输出格式,这种设计使得模型能够更好地处理时间序列输入,并提高了动作预测的准确性。
关键设计:在训练过程中,PGN结合了混合精度计算和DeepSpeed ZeRO-2技术,以提高训练效率。同时,冻结的视觉路径和更新的结构标记嵌入及LoRA适配器的设计也为模型的稳定性提供了保障。
🖼️ 关键图片
📊 实验亮点
PGN在500个保留的专家轨迹上实现了62.29%的标准化动作匹配率(NAM)和100.00%的非空率(NER),显示出其在离线动作预测中的卓越性能。这些结果表明PGN在专家动作对齐方面的有效性,为后续的闭环导航研究奠定了基础。
🎯 应用场景
PGN的研究成果在智能机器人、自动驾驶和人机交互等领域具有广泛的应用潜力。通过提高视觉语言导航的准确性,PGN能够支持更复杂的任务执行和环境理解,推动智能体在真实世界中的应用。未来,PGN的技术也可能在增强现实和虚拟现实等新兴领域发挥重要作用。
📄 摘要(原文)
Vision-Language Navigation (VLN) requires an embodied agent to interpret a natural-language instruction and predict actions from temporally ordered visual observations. Adapting a multimodal large language model to VLN requires visual-language alignment, compact temporal inputs, action-space grounding, and stable training on the target hardware. This technical report presents PGN (Pangu Navigator), an offline VLN action-prediction system built on OpenPangu-7B. Training proceeds in two stages. First, PGMM aligns a frozen EVA-ViT-G/14 vision encoder with the frozen language backbone by training a Q-Former and a two-layer MLP projector. Second, PGN adapts the aligned model to expert navigation trajectories using five-observation windows, epoch-dependent temporal sampling, and a reasoning-then-action output format; this stage freezes the aligned visual pathway and updates three structural-token embeddings and LoRA adapters. The implementation combines mixed-precision computation, selective FP32 computation, and DeepSpeed ZeRO-2 on eight Ascend 910B NPUs. Under teacher-forced, open-loop evaluation on 500 held-out expert trajectories, V9 reports a 62.29% Normalized Action Match (NAM) and a 100.00% Non-empty Rate (NER). These metrics quantify offline expert-action alignment rather than closed-loop navigation success; evaluating error accumulation, path efficiency, and goal completion remains future work.