Differentiable Clone-Structured Causal Graphs for End-to-End Cognitive Map Learning from Image Sequences

📄 arXiv: 2607.12382v1 📥 PDF

作者: Arash Nikzad, Sasan Sarbishegi, Ali Dasmeh, Muhammad Asif, Parsa Gharavi, Erik Husom, Sagar Sen, Andrew B. Lehr, Olivier Penacchio, Ana Clemente, Tristan M. Stöber

分类: cs.LG, q-bio.NC

发布日期: 2026-07-14


💡 一句话要点

提出可微分克隆结构因果图以解决认知地图学习问题

🎯 匹配领域: 支柱四:生成式动作 (Generative Motion)

关键词: 认知地图 深度学习 可微分模型 图像序列 机器人导航 变分自编码器 因果图

📋 核心要点

  1. 现有的克隆结构因果图(CSCG)方法依赖于预定义的离散字母表,限制了其与神经网络的结合,无法实现端到端的处理。
  2. 本文提出了一种新的可微分模块gradCSCG,结合了向量量化变分自编码器(VQ-VAE),实现了从原始图像序列中学习结构化地图。
  3. 实验表明,新的端到端管道在四个高度别名的环境中成功恢复了底层邻接图,具有高边缘精度和召回率。

📝 摘要(中文)

本文探讨了如何从连续的原始感官输入和自身运动中构建结构化的世界地图,尤其是在自然变化导致精确感官模式罕见重复的情况下。克隆结构因果图算法(CSCG)作为一种规范的海马体模型,展示了如何从别名观察中学习可解释的地图。然而,CSCG需要预定义的离散字母表,其期望最大化的公式也难以与现有神经网络模块结合,阻碍了对原始图像序列的端到端处理。为此,本文将CSCG重新构造为一个完全可微分的模块gradCSCG,并将其与学习的向量量化变分自编码器(VQ-VAE)感知前端相结合。通过软发射前向传递,使得地图学习目标能够反馈到感知中,同时一系列损失平衡机制在联合训练过程中减轻模块崩溃。实验结果表明,梯度训练在原始符号网格世界中重现了CSCG的结果,并在MNIST图像序列上保持了鲁棒性。

🔬 方法详解

问题定义:本文旨在解决如何从连续的感官输入和运动中构建结构化地图的问题。现有的CSCG方法需要预定义的离散字母表,且其期望最大化公式难以与神经网络结合,限制了端到端处理能力。

核心思路:论文通过将CSCG重新构造为一个完全可微分的模块gradCSCG,消除了与神经网络结合的障碍,并与VQ-VAE感知前端相结合,使得地图学习目标能够反馈到感知模块。

技术框架:整体架构包括gradCSCG模块和VQ-VAE前端。gradCSCG负责从别名观察中学习地图,而VQ-VAE则用于处理原始图像输入。通过软发射机制,确保了信息在模块间的有效流动。

关键创新:最重要的创新在于将CSCG转化为可微分形式,使其能够与深度学习架构无缝结合。这一设计使得地图学习与感知之间的反馈成为可能,提升了整体性能。

关键设计:在损失函数设计上,采用了一系列损失平衡机制,以防止在联合训练过程中模块崩溃。此外,VQ-VAE的结构设计也经过优化,以提高对输入图像的处理能力。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果显示,新的端到端管道在四个高度别名的环境中成功恢复了底层邻接图,边缘精度和召回率均表现出色,证明了gradCSCG在处理复杂视觉输入时的有效性。

🎯 应用场景

该研究的潜在应用领域包括机器人导航、自动驾驶和增强现实等场景,能够帮助智能体在复杂环境中构建和更新其认知地图。通过实现端到端的学习,未来可能推动更高效的感知与决策系统的发展。

📄 摘要(原文)

How can an agent build a structured map of its world from nothing but an ongoing sequence of raw sensory input and its own movements, especially when natural variation means exact sensory patterns rarely repeat? The Clone-Structured Causal Graph algorithm (CSCG), a normative hippocampus model, shows how an interpretable map can be learned from aliased observations. However, CSCG requires a predefined discrete alphabet, and its expectation-maximization formulation is not easily combined with existing neural network modules, preventing the end-to-end processing of raw image sequences. We remove this barrier by reformulating CSCG as a single, fully differentiable module, gradCSCG, and coupling it to a learned vector-quantized variational autoencoder (VQ-VAE) perceptual front-end. A soft emission forward pass allows the map-learning objective to flow back into perception, while a set of loss-balancing mechanisms mitigates module collapse during joint training. We demonstrate, first, that gradient training reproduces CSCG's results on original symbolic grid worlds by recovering room topology from heavily aliased observations. Second, we show that map recovery remains robust on MNIST image sequences, where each visit to a location yields a newly sampled image of its assigned digit. Across four heavily aliased environments, the end-to-end pipeline successfully uncovers the underlying adjacency graph with high edge precision and recall, directly from visual input. This work provides a proof of principle that CSCG can serve as a composable building block in a deep learning architecture.