Factorized Spectral Representations for Reinforcement Learning

📄 arXiv: 2607.13498v1 📥 PDF

作者: Junyi Wu, Dan Li

分类: cs.LG

发布日期: 2026-07-15


💡 一句话要点

提出FaStR以提升强化学习中的世界模型学习效率

🎯 匹配领域: 支柱一:机器人控制 (Robot Control) 支柱二:RL算法与架构 (RL & Architecture)

关键词: 谱表示 强化学习 样本效率 三模态张量 CP分解 动态环境 自监督学习

📋 核心要点

  1. 现有的谱表示方法在处理高维状态和动作空间时,样本效率较低,难以适应复杂的动态环境。
  2. 本文提出FaStR,通过三模态张量的CP分解,生成独立的状态、动作和下一个状态编码器,从而提高表示学习的效率。
  3. 实验结果表明,FaStR在高维运动任务中表现出显著的性能提升,尤其在动态结构与分解形式一致的情况下,状态编码器能够有效迁移。

📝 摘要(中文)

从交互数据中学习紧凑的世界模型是样本高效深度强化学习的核心。谱表示方法通过将转移核视为矩阵,利用自监督对比目标学习低秩分解,已成为连续控制领域的主流方法。本文进一步提出了FaStR,利用三模态张量的CP分解,生成独立的状态、动作和下一个状态编码器,形成单一的谱表示。该分解形式缩小了假设类,减少了表示学习所需的样本量,尤其在高维运动任务中表现出显著的性能提升。

🔬 方法详解

问题定义:本文旨在解决现有谱表示方法在高维状态和动作空间中的样本效率低下问题,尤其是在复杂动态环境下的适应性不足。

核心思路:论文提出FaStR,通过将转移核视为三模态张量,利用CP分解生成独立的状态、动作和下一个状态编码器,从而形成一个更紧凑的谱表示。这样的设计能够有效减少表示学习所需的样本量。

技术框架:FaStR的整体架构包括三个主要模块:状态编码器、动作编码器和下一个状态编码器。通过噪声对比目标进行训练,确保每个编码器能够独立学习其特征。

关键创新:FaStR的主要创新在于引入了三模态张量的CP分解,这与传统的矩阵视角不同,能够更好地捕捉状态、动作和下一个状态之间的关系,从而提高了表示学习的效率。

关键设计:在损失函数设计上,FaStR采用噪声对比学习方法,以增强编码器的鲁棒性。网络结构上,状态和动作编码器的设计允许在不同的任务中进行有效的迁移学习,特别是在执行器变化时,状态编码器能够保持不变。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果显示,FaStR在高维运动任务中相较于基线方法提升了样本效率,尤其在动态结构与分解形式一致的情况下,状态编码器能够有效迁移,表现出更优的学习性能。

🎯 应用场景

该研究的潜在应用领域包括机器人控制、自动驾驶和游戏AI等需要高效学习动态环境的场景。通过提高样本效率,FaStR能够加速模型训练过程,降低对大量标注数据的依赖,具有重要的实际价值和未来影响。

📄 摘要(原文)

Learning a compact model of the world from interaction data is central to sample-efficient deep reinforcement learning. Spectral representation methods have become the leading paradigm for representation learning in continuous control by taking a matrix view of the transition kernel, with state-action pairs on one side and next states on the other, and learning a low-rank factorization through self-supervised contrastive objectives. We take this view one step further. The transition kernel is naturally a three-mode tensor over states, actions, and next states, and a CP decomposition gives one feature map per mode. We propose FaStR, which fits this decomposition with a noise contrastive objective, producing separate state, action, and next-state encoders that together form a single spectral representation. The factored form yields a smaller hypothesis class, and the sample size needed for representation learning shrinks by a factor that scales with the smaller of the state and action dimensions. Empirically, FaStR delivers its largest gains on high-dimensional locomotion tasks whose dynamics align with the factored structure, and the learned state encoder transfers intact across actuator shift while only the action encoder is retrained.