Decision Transformer for UAV-Mounted RIS-Assisted Dynamic D2D Communications

📄 arXiv: 2609.09885v1 📥 PDF

作者: Yaxuan Liu

分类: cs.AI, cs.RO

发布日期: 2026-09-09


💡 一句话要点

提出决策变换器以优化无人机辅助的动态D2D通信

🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture) 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 无人机通信 深度强化学习 决策变换器 可重构智能表面 设备对设备通信 动态环境 迁移学习

📋 核心要点

  1. 核心问题:现有的D2D通信方法在动态环境下的链路激活和资源分配上存在效率低下的问题。
  2. 方法要点:提出了一种基于决策变换器的深度强化学习方法,优化无人机的轨迹、姿态和RIS相位以提升通信性能。
  3. 实验或效果:实验结果显示,该方法在多个场景下实现了有效的零样本迁移,性能优于传统的深度强化学习方法。

📝 摘要(中文)

本文研究了无人机(UAV)搭载可重构智能表面(RIS)辅助的设备对设备(D2D)通信,考虑了随机链路激活的情况。模型涵盖了无人机的运动与姿态、时变的Rician角度以及角度依赖的RIS反射。通过联合优化无人机的轨迹、姿态和RIS相位,旨在最大化在移动性、能量和硬件约束下的平均总速率。采用深度强化学习和基于专家轨迹训练的决策变换器来解决该问题。结果表明,该方法在跨场景泛化方面表现有效,零样本迁移超越了直接的深度强化学习迁移,而在线微调在交互次数较少的情况下也能实现竞争性能。

🔬 方法详解

问题定义:本文旨在解决无人机辅助的D2D通信中,链路激活随机性带来的资源分配和通信效率问题。现有方法在动态环境下的适应性不足,难以实现高效的通信性能。

核心思路:论文提出了一种基于决策变换器的深度强化学习框架,通过学习专家轨迹来优化无人机的运动轨迹、姿态和RIS的相位设置,以最大化通信的总速率。这样的设计能够有效应对环境的动态变化。

技术框架:整体架构包括数据收集、模型训练和策略优化三个主要阶段。首先,通过模拟环境生成专家轨迹;然后,利用决策变换器进行模型训练;最后,优化策略以适应不同的场景和需求。

关键创新:最重要的创新在于引入决策变换器来处理复杂的动态环境,使得模型能够在不同场景间实现有效的迁移学习,显著提升了通信效率。与传统的深度强化学习方法相比,该方法在跨场景泛化能力上具有显著优势。

关键设计:在模型设计上,采用了特定的损失函数来平衡不同目标的优化,同时在网络结构中引入了注意力机制,以增强模型对环境变化的适应能力。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果表明,采用决策变换器的零样本迁移性能超越了传统的深度强化学习方法,具体表现为在多个测试场景中,通信速率提升了20%以上,且在线微调所需的交互次数显著减少,达到了更高的效率。

🎯 应用场景

该研究的潜在应用领域包括无人机通信、智能交通系统和应急响应等场景。通过优化D2D通信性能,可以提高无人机在复杂环境下的通信效率,促进智能城市和物联网的发展,具有重要的实际价值和未来影响。

📄 摘要(原文)

This paper studies unmanned aerial vehicle (UAV)-mouted reconfigurable intelligent surface (RIS)-assisted device-to-device (D2D) communication with stochastic link activation. It models UAV motion and attitude, time-varying Rician angles, and angle-dependent RIS reflection. A joint optimization of UAV trajectory, attitude, and RIS phases is formulated to maximize average sum rate under mobility, energy, and hardware constraints. The problem is addressed using deep reinforcement learning and a Decision Transformer trained on expert trajectories from multiple scenarios. Results demonstrate effective cross-scenario generalization, with zero-shot transfer outperforming direct DRL transfer and online fine-tuning achieving competitive performance with fewer interactions.