TouchWorld: A Predictive and Reactive Tactile Foundation Model for Dexterous Manipulation
作者: Jianyi Zhou, Feiyang Hong, Yunhao Li, Yicheng Zhao, Yongjue Cen, Zirui Liu, Jiakang Huang, Zirui Chen, Ruiyang Zhang, Weizhuo Zhu, Xuhua Song, Shuo Yang
分类: cs.RO
发布日期: 2026-07-08
💡 一句话要点
提出TouchWorld以解决灵巧操作中的触觉反馈问题
🎯 匹配领域: 支柱一:机器人控制 (Robot Control) 支柱二:RL算法与架构 (RL & Architecture) 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 灵巧操作 触觉反馈 机器人技术 多模态学习 预测模型 分层策略 在线修正 人机交互
📋 核心要点
- 现有方法将触觉视为低频观察流,无法有效处理灵巧操作中的快速反馈和局部适应问题。
- TouchWorld通过分层策略,将视觉-语言规划与触觉反馈相结合,提升了灵巧操作的预测与反应能力。
- 在六个灵巧操作任务中,TouchWorld的成功率显著高于基线,展示了其在复杂环境中的有效性。
📝 摘要(中文)
灵巧操作在日常环境中需要预测和反应:机器人必须预测接触如何演变,同时快速纠正因滑动、错位、不稳定抓取或力不匹配造成的局部错误。虽然视觉和语言提供了语义和几何指导,但它们无法可靠地揭示隐藏的接触状态,如力、滑动和接触稳定性。TouchWorld是一个预测和反应的触觉基础模型,采用分层策略,将视觉-语言子任务规划、触觉世界模型预测、视触觉目标条件的动作生成和高频触觉残差修正分开。实验结果表明,TouchWorld在六个长时间和接触丰富的灵巧操作任务中,干净环境下成功率为65.0%,在人为干扰下为53.7%,分别比最强基线提高15.7和18.5个百分点。
🔬 方法详解
问题定义:本论文旨在解决灵巧操作中触觉反馈不足的问题。现有方法将触觉视为低频观察流,导致在快速反馈和局部适应方面存在明显不足。
核心思路:TouchWorld的核心思路是通过分层策略将视觉-语言子任务规划与触觉反馈相结合,使机器人能够在操作过程中更好地预测和反应。
技术框架:TouchWorld的整体架构包括高层规划层、视触觉目标条件策略和触觉条件修正策略。高层规划层负责生成可执行的子任务和预测触觉子目标,视触觉目标条件策略生成名义动作块,而触觉条件修正策略则利用最近的触觉和本体反馈进行在线残差修正。
关键创新:TouchWorld的最大创新在于将触觉作为预测接触参考和快速反馈信号,保留了视觉-语言-动作策略的语义泛化,同时提升了局部接触适应能力。这一设计与现有方法的单一循环处理方式形成鲜明对比。
关键设计:在设计中,TouchWorld采用了分层策略,确保各个模块之间的高效协作。此外,触觉反馈的高频处理和残差修正机制是其核心技术细节,确保了在复杂操作中的实时适应能力。
🖼️ 关键图片
📊 实验亮点
在六个长时间和接触丰富的灵巧操作任务中,TouchWorld在干净环境下的成功率达65.0%,在人为干扰下为53.7%,分别比最强基线提高15.7和18.5个百分点,显示出其在复杂操作中的显著优势。
🎯 应用场景
TouchWorld的研究成果在机器人灵巧操作、自动化装配、服务机器人等领域具有广泛的应用潜力。通过提升机器人在复杂环境中的触觉反馈能力,该模型能够显著改善机器人在动态和不确定环境中的操作表现,推动智能机器人技术的发展。
📄 摘要(原文)
Dexterous manipulation in everyday environments requires both anticipation and reaction: a robot must predict how contact should evolve while rapidly correcting local errors caused by slip, misalignment, unstable grasping, or force mismatch. Vision and language provide semantic and geometric guidance, but they cannot reliably reveal hidden contact states such as force, slip, and contact stability. Although tactile sensing exposes these physical cues, most existing policies treat touch as a low-frequency observation stream within a monolithic action model, coupling slow task reasoning, action generation, and fast contact feedback in a single loop. We introduce TouchWorld, a predictive-and-reactive tactile foundation model for dexterous manipulation. TouchWorld uses a hierarchical policy that separates vision-language subtask planning, tactile world-model prediction, visuo-tactile goal-conditioned action generation, and high-frequency tactile residual refinement. A High-Level Planning Layer produces executable subtasks and predicts tactile subgoals; a Visuo-Tactile Goal-Conditioned Policy generates nominal action chunks; and a Tactile-Conditioned Refinement Policy performs online residual correction using recent tactile and proprioceptive feedback. By using touch as both a predictive contact reference and a fast feedback signal, TouchWorld preserves the semantic generalization of vision-language-action policies while improving local contact adaptation. Across six long-horizon and contact-rich dexterous manipulation tasks, TouchWorld achieves 65.0% success in the clean setting and 53.7% success under human perturbations, outperforming the strongest baseline by 15.7 and 18.5 percentage points, respectively.