Deep Reinforcement Learning for Optimization of STAR-RIS Phase and Energy Splitting Coefficients in OTFS-NOMA Framework

📄 arXiv: 2609.04536v1 📥 PDF

作者: Rais. J. Gachaba, Manobendu Sarker, Anirban Bhowal

分类: cs.IT, eess.SY

发布日期: 2026-09-03

备注: Accepted in IEEE ANTS 2026


💡 一句话要点

提出深度强化学习优化STAR-RIS相位与能量分配系数以解决OTFS-NOMA问题

🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture)

关键词: 深度强化学习 可重构智能表面 非正交多址接入 正交时间频率空间 通信优化 信道状态信息 总速率最大化 移动通信

📋 核心要点

  1. 现有方法在延迟-多普勒移动性下,经典交替优化在每个相干间隔的重新配置中变得不切实际,导致性能下降。
  2. 本文提出将STAR-RIS相位和能量分配设计为约束的非凸总速率最大化问题,并采用深度强化学习进行优化。
  3. 仿真结果显示,所提方法在用户速度变化范围内总速率降幅仅约10%,并在多种基线中表现出显著的性能提升。

📝 摘要(中文)

本文考虑了一种下行通信框架,该框架结合了同时传输和反射的可重构智能表面(STAR-RIS)、正交时间频率空间(OTFS)和非正交多址接入(NOMA)技术。由于延迟-多普勒移动性使得经典的交替优化在每个相干间隔的重新配置中变得不切实际,本文将STAR-RIS的相位移和能量分配设计形式化为一个约束的非凸总速率最大化问题。为了解决每个间隔的重新优化负担,采用了一种深度强化学习(DRL)方法,通过单次前向传递将观察到的信道实现映射到STAR-RIS配置。具体提出了一种最大熵DRL代理Beta-Space Soft Actor-Critic(SAC-BSE)。仿真结果表明,在每个STAR-RIS分支上有两个NOMA复用用户的情况下,快速收敛,且在128倍用户速度范围内总速率降幅限制在约10%,并在发射功率和STAR-RIS元素数量增加时,相较于OTFS、NOMA、STAR-RIS、固定分配和模式切换基线均获得了一致的增益。

🔬 方法详解

问题定义:本文要解决的问题是如何在延迟-多普勒移动性影响下优化STAR-RIS的相位和能量分配,以实现高效的下行通信。现有的经典交替优化方法在每个相干间隔的重新配置中面临性能下降的挑战。

核心思路:论文的核心思路是将STAR-RIS的相位移和能量分配设计为一个约束的非凸总速率最大化问题,并通过深度强化学习(DRL)方法来实现优化,避免了传统方法的重新优化负担。

技术框架:整体架构包括信道状态信息的获取、STAR-RIS配置的映射和深度强化学习代理的训练。通过单次前向传递,DRL代理能够快速适应不同的信道条件。

关键创新:最重要的技术创新点在于提出了Beta-Space Soft Actor-Critic(SAC-BSE)作为最大熵DRL代理,能够高效地处理复杂的非凸优化问题,与传统方法相比具有更好的收敛性和适应性。

关键设计:在设计中,采用了特定的损失函数来优化总速率,并设置了适当的网络结构以支持快速学习和适应。关键参数包括学习率、折扣因子等,这些都经过实验验证以确保最佳性能。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果表明,所提出的DRL方法在用户速度变化范围内,总速率降幅仅约10%。与OTFS、NOMA、STAR-RIS、固定分配和模式切换基线相比,随着发射功率和STAR-RIS元素数量的增加,均获得了一致的性能提升,显示出该方法的有效性。

🎯 应用场景

该研究的潜在应用领域包括下一代无线通信系统、智能交通系统和物联网等。通过优化STAR-RIS的相位和能量分配,可以显著提升系统的通信效率和用户体验,具有重要的实际价值和未来影响。

📄 摘要(原文)

This paper considers a downlink communication framework comprising a simultaneously transmitting and reflecting reconfigurable intelligent surface (STAR-RIS)-aided by orthogonal time frequency space (OTFS) and non-orthogonal multiple access (NOMA) technologies. Further, delay-Doppler mobility in such frameworks renders classical alternating optimization impractical for per-coherence interval reconfiguration. To mitigate such issues, the STAR-RIS phase-shift and energy-splitting design is formulated as a constrained, non-convex sum-rate maximization problem with closed-form maximum ratio transmission beamforming and fixed NOMA power allocation. To circumvent the per-interval re-optimization burden, a deep reinforcement learning (DRL) approach is adopted that maps observed channel realizations to STAR-RIS configurations through a single forward pass. Specifically, Beta-Space Soft Actor-Critic (SAC-BSE), a maximum entropy DRL agent, is proposed. Simulation results, with two NOMA-multiplexed users on each STAR-RIS branch, confirm rapid convergence, limit the sum-rate degradation to roughly 10\% across a 128-fold user-speed range, and yield consistent gains over OTFS-only, NOMA-only, STAR-RIS-only, fixed-split, and mode-switching baselines as transmit power and the number of STAR-RIS elements increase.