DeCAL: Towards Physically-Grounded Dexterous Vision-Language-Action Models via Contact-Aware Latent Co-Imagination
作者: Yankai Fu, Ning Chen, Junkai Zhao, Heng Zhang, Guocai Yao, Pengwei Wang, Zhongyuan Wang, Shanghang Zhang
分类: cs.RO, cs.AI
发布日期: 2026-09-08
🔗 代码/项目: PROJECT_PAGE
💡 一句话要点
提出DeCAL以解决复杂接触动态下的灵巧视觉语言动作问题
🎯 匹配领域: 支柱一:机器人控制 (Robot Control) 支柱四:生成式动作 (Generative Motion) 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 灵巧操作 视觉-语言-动作 多模态融合 触觉信息 机器人技术
📋 核心要点
- 现有的视觉-语言-动作模型在处理复杂的接触动态和视觉遮挡时面临显著挑战,难以实现灵巧操作。
- DeCAL模型通过混合变换器架构,结合自适应视觉-触觉融合和潜在共想象,有效整合视觉与触觉信息,提升操作能力。
- 实验结果显示,DeCAL在多项任务中取得了71%的平均成功率和83.4%的进展成功率,表现出色且具备良好的泛化能力。
📝 摘要(中文)
灵巧操作涉及与物理世界的接触丰富且细致的交互,这对现有的视觉-语言-动作(VLA)模型提出了重大挑战,主要由于严重的视觉遮挡和复杂的接触动态。尽管近期研究已将触觉传感器纳入机器人操作中,但大多数方法仍依赖于同质的多模态融合,缺乏自适应的触觉整合和物理动态的显式建模。本文提出了DeCAL,一个基于物理的灵巧视觉-语言-动作模型,统一了理解、想象和动作生成,以应对接触丰富的灵巧操作。DeCAL基于混合变换器(MoT)架构,利用专门的专家模型来处理不同能力,同时促进信息的高效流动。为了有效利用触觉信息,我们引入了自适应视觉-触觉融合,通过接触感知的门控策略动态调节触觉交互。此外,我们提出了视觉-触觉潜在共想象,联合建模视觉和触觉动态,为策略提供隐含的物理世界知识。实验结果表明,DeCAL在所有任务中均表现出色,平均成功率达到71%,进展成功率为83.4%,并在未见场景中展现出强大的泛化能力。
🔬 方法详解
问题定义:本文旨在解决灵巧操作中由于复杂接触动态和视觉遮挡导致的现有视觉-语言-动作模型的不足,尤其是在触觉信息整合方面的挑战。
核心思路:DeCAL通过引入混合变换器架构和自适应视觉-触觉融合,旨在动态调节触觉交互并联合建模视觉与触觉动态,从而提升灵巧操作的能力。
技术框架:DeCAL的整体架构包括多个专家模型,每个模型专注于特定的能力,同时通过高效的信息流动机制实现协同工作。主要模块包括视觉处理、触觉信息融合和动作生成。
关键创新:最重要的创新在于自适应视觉-触觉融合和视觉-触觉潜在共想象,这使得模型能够动态调整触觉交互并隐式建模物理世界的知识,显著提升了灵巧操作的效果。
关键设计:在设计中,采用了接触感知的门控策略来调节触觉信息的整合,确保在不同操作场景下的灵活性和适应性,同时优化了网络结构以提高信息处理的效率。
🖼️ 关键图片
📊 实验亮点
DeCAL在所有实验任务中均表现出色,平均成功率达到71%,进展成功率为83.4%。与现有基线相比,DeCAL展现了显著的性能提升,尤其在未见场景中的泛化能力方面表现突出。
🎯 应用场景
DeCAL模型在机器人操作、自动化制造和人机交互等领域具有广泛的应用潜力。通过提升机器人在复杂环境中的灵巧操作能力,该研究可以推动智能机器人在实际场景中的应用,改善人机协作效率,并为未来的智能系统设计提供新的思路。
📄 摘要(原文)
Dexterous manipulation involves contact-rich and fine-grained interactions with the physical world, posing significant challenges for existing vision-language-action (VLA) models due to severe visual occlusions and complex contact dynamics. While recent works have incorporated tactile sensing into robotic manipulation, most approaches still rely on homogeneous multimodal fusion, lacking adaptive tactile integration and explicit modeling of physical dynamics. In this work, we present DeCAL, a physically-grounded dexterous vision-language-action model that unifies understanding, imagination and action generation for contact-rich dexterous manipulation. Built upon a Mixture-of-Transformers (MoT) architecture, DeCAL leverages specialized experts for each capability while enabling efficient information flow among them. To effectively leverage tactile information, we introduce Adaptive Visuo-Tactile Fusion that dynamically regulates tactile interactions via a contact-aware gating strategy. Furthermore, we propose Visuo-Tactile Latent Co-Imagination to jointly model visual and tactile dynamics, equipping the policy with implicit physical world knowledge. Experimental results show that DeCAL consistently achieves state-of-the-art performance across all tasks, attaining a 71% average success rate and an 83.4% progress success rate, while also demonstrating strong generalization to unseen scenarios. The website is available at https://aureleopku.github.io/DeCAL.