DAGR: State-Conditioned Goal Representations via Difference-Aware Goal Cross-Attention
作者: Xing Lei, Wenyan Yang, Xuetao Zhang, Donglin Wang
分类: cs.LG, stat.ML
发布日期: 2026-07-15
💡 一句话要点
提出DAGR以解决目标编码的状态依赖问题
🎯 匹配领域: 支柱一:机器人控制 (Robot Control) 支柱二:RL算法与架构 (RL & Architecture)
关键词: 目标编码 强化学习 门控交叉注意力 状态依赖 多尺度机制
📋 核心要点
- 现有的目标编码方法未考虑当前状态,导致无法有效标识目标中需要行动的部分。
- DAGR通过多尺度门控交叉注意力将静态目标嵌入转化为状态条件嵌入,提升了目标编码的有效性。
- 在OGBench上,DAGR在导航任务中表现优异,消融实验显示性能提升主要归因于门控残差设计。
📝 摘要(中文)
目标条件强化学习依赖于目标的编码方式。现有的对比、度量、时间距离和信息论编码器虽然各有不同的目标,但都存在一个共同点,即它们不考虑当前状态。这种状态独立的嵌入无法标识出目标中仍需行动的部分。为此,本文提出DAGR,通过多尺度门控交叉注意力将任何后融合编码器的静态嵌入精炼为状态条件嵌入。近似恒等的门控残差保留了基础表示,而差异感知目标交叉注意力则利用每个标记的状态-目标差异图来偏置注意力得分。在OGBench上,DAGR在导航任务中表现出色。消融实验表明,性能提升源于门控残差,而非命名方法的差异偏置。对于操作和拼图任务,DAGR的表现与基础模型相当或略低。DAGR是一种结构化的精炼,而非普遍的改进。
🔬 方法详解
问题定义:本文旨在解决目标条件强化学习中目标编码的状态独立性问题。现有方法无法有效标识目标中仍需行动的部分,导致策略需要反向推断这些信息。
核心思路:DAGR的核心思路是通过多尺度门控交叉注意力机制,将静态的目标嵌入转化为状态条件的嵌入。这种设计使得目标编码能够动态适应当前状态,从而提高决策的准确性。
技术框架:DAGR的整体架构包括两个主要模块:首先是门控残差模块,用于保留基础表示;其次是差异感知目标交叉注意力模块,通过状态-目标差异图来调整注意力得分。这两个模块协同工作,提升了目标编码的效果。
关键创新:DAGR的主要创新在于引入了差异感知目标交叉注意力机制,使得目标编码能够考虑当前状态的影响。这与传统的状态独立编码方法形成了鲜明对比,显著提升了目标条件强化学习的性能。
关键设计:在设计中,门控残差的设置近似恒等映射,确保基础表示的保留。同时,差异感知机制通过每个标记的状态-目标差异图来动态调整注意力得分,增强了模型的灵活性和适应性。实验中使用的损失函数和网络结构经过精心设计,以确保模型的有效训练。
🖼️ 关键图片
📊 实验亮点
在OGBench上,DAGR在导航任务中显著提升了性能,消融实验表明,性能的提升主要归因于门控残差设计,而非差异偏置。尽管在操作和拼图任务中表现与基础模型相当或略低,但DAGR的结构化精炼为未来的研究提供了新的思路。
🎯 应用场景
DAGR的研究成果在导航、操作和拼图等任务中具有广泛的应用潜力。通过提高目标编码的状态适应性,DAGR能够在复杂环境中实现更高效的决策,推动智能体在动态场景中的表现。未来,该方法有望应用于机器人导航、自动驾驶等领域,提升智能系统的自主决策能力。
📄 摘要(原文)
Goal-conditioned reinforcement learning hinges on how the goal is encoded. Contrastive, metric, temporal-distance, and information-theoretic encoders differ in objective. They still share one trait. None of them sees the current state. Such a state-independent embedding cannot mark which part of the goal still needs action. The policy must then recover that cue by inverting both encoders. We propose DAGR. It refines the static embedding of any late-fusion encoder into a state-conditioned one through multi-scale gated cross-attention. A near-identity gated residual preserves the base representation. Difference-aware Goal Cross-Attention then biases the attention scores using a per-token state-goal discrepancy map. On OGBench, DAGR improves navigation. Our ablations trace the gain to the gated residual, not to the difference bias that names the method. On manipulation and puzzle tasks it matches or falls below the base. DAGR is a structured refinement, not a universal improvement.