CAP: Continuously Adaptive Perception-Blind Humanoid Locomotion via Learned Denoising
作者: Hongjin Chen, Zijun Xu, Shihao Ma, Yi Zhao, Xilai Liu, Ke Ma, Wei Zhang, Chunyang Xie, Pengfei Li, Jieru Zhao, Wenchao Ding
分类: cs.RO
发布日期: 2026-09-10
备注: Accepted at the Conference on Robot Learning (CoRL), 2026
💡 一句话要点
提出CAP以解决复杂地形下人形机器人感知盲区问题
🎯 匹配领域: 支柱一:机器人控制 (Robot Control) 支柱二:RL算法与架构 (RL & Architecture)
关键词: 人形机器人 深度学习 去噪技术 感知与盲控 复杂地形 鲁棒性 变分编码器
📋 核心要点
- 现有方法在复杂地形下依赖于深度感知,但深度信息常常受到噪声和干扰,导致行走策略的可靠性下降。
- 本文提出CAP,通过训练的感知世界模型编码器和主动的本体状态变分编码器,恢复损坏的深度信息,实现更鲁棒的行走策略。
- 实验结果表明,CAP在深度信息有效时与现有感知基线相当,且在感知质量下降时表现更为平滑,适应性更强。
📝 摘要(中文)
人形机器人在复杂地形中行走需要前瞻性的外部感知来预测障碍物,但这种信号在实际应用中往往不可靠,存在部分失效和间歇性失效的问题。现有的感知策略通常假设深度观测是干净且在分布内的,而最近尝试将感知与盲控统一的研究则通常在不同子策略之间切换,未能充分利用部分损坏深度中的可恢复信息。为此,本文提出了CAP,一个单阶段的人形机器人行走策略,通过训练的感知世界模型编码器作为学习去噪器,从损坏输入中重建干净的深度,同时结合主动的本体状态变分编码器,提供无深度信息的身体状态。通过深度噪声课程与策略面对的潜在特征丢弃的耦合训练,CAP在整个感知质量谱上暴露策略于失败。在仿真中,CAP在深度信息有效时与感知基线相匹配或有所提升,并在感知恶化时比二元切换基线更平滑地降级。
🔬 方法详解
问题定义:本文旨在解决人形机器人在复杂地形中行走时,由于深度感知信号的不可靠性导致的行走策略失效问题。现有方法通常假设深度观测是干净的,未能有效处理部分损坏的深度信息。
核心思路:CAP的核心思路是通过一个训练的感知世界模型编码器作为去噪器,重建受损的深度信息,同时结合本体状态变分编码器提供身体状态信息,从而实现感知与盲控的有效结合。
技术框架:CAP的整体架构包括两个主要模块:感知世界模型编码器和本体状态变分编码器。前者负责从损坏的深度输入中恢复干净的深度信息,后者则提供无深度信息的身体状态。训练过程中采用深度噪声课程和特征丢弃策略,以增强模型的鲁棒性。
关键创新:CAP的创新点在于将感知与盲控策略整合为一个单一的策略,通过学习去噪来恢复部分损坏的深度信息,而不是简单地在不同策略间切换。这种方法能够更好地利用部分可恢复的信息。
关键设计:在训练过程中,采用了深度噪声课程来逐步增加输入的噪声水平,同时在策略面对的潜在特征上实施特征丢弃,以增强模型对不同感知质量的适应能力。
🖼️ 关键图片
📊 实验亮点
实验结果显示,CAP在深度信息有效时与现有感知基线相当,且在感知质量下降时表现更为平滑,优于传统的二元切换基线。这表明CAP在处理感知盲区时具有更强的适应性和鲁棒性。
🎯 应用场景
该研究的潜在应用领域包括服务机器人、救援机器人和自动驾驶等场景,尤其是在复杂和动态环境中。CAP的鲁棒性使其能够在真实世界中更可靠地执行任务,具有重要的实际价值和未来影响。
📄 摘要(原文)
Humanoid locomotion across complex terrain demands forward-looking exteroception to anticipate obstacles, yet this signal is unreliable in real-world deployment, failing partially and intermittently. Existing perceptive policies often assume that depth observations remain clean and in-distribution, while recent attempts to unify perceptive and blind control typically route or switch between separate sub-policies, leaving recoverable information in partially corrupted depth unexploited. We instead propose CAP, a single-stage humanoid locomotion policy that recovers this signal with a perceptive world-model encoder trained as a learned denoiser to reconstruct clean depth from a corrupted input, together with a co-active proprioceptive variational encoder that supplies depth-free body-state information. A coupled training recipe pairs a depth-noise curriculum on the world-model input with world-model feature dropout on the policy-facing latent, exposing the policy to failures across the entire perception-quality spectrum. In simulation, CAP matches or improves upon perceptive baselines when depth remains informative, and degrades more smoothly than a binary-switching baseline as perception worsens. On the Unitree G1, controlled trials and indoor-outdoor deployments demonstrate perception-robust locomotion under intermittent occlusion, real-sensor corruption, and outdoor depth artifacts.