| 1 |
Guided Data Augmentation for Offline Reinforcement Learning and Imitation Learning |
提出引导数据增强方法以解决离线强化学习中的数据不足问题 |
reinforcement learning offline RL offline reinforcement learning |
|
|
| 2 |
FP8-LM: Training FP8 Large Language Models |
提出FP8混合精度框架以提升大语言模型训练效率 |
reinforcement learning AMP large language model |
✅ |
|
| 3 |
Causal disentanglement of multimodal data |
提出causalPIMA以解决多模态数据因果表示学习问题 |
representation learning multimodal |
|
|
| 4 |
Multi Time Scale World Models |
提出多时间尺度世界模型以解决复杂不确定性预测问题 |
world model world models |
✅ |
|
| 5 |
Bridging Distributionally Robust Learning and Offline RL: An Approach to Mitigate Distribution Shift and Partial Data Coverage |
提出一种结合分布鲁棒学习与离线强化学习的方法以应对数据分布偏移问题 |
reinforcement learning DRL offline RL |
|
|
| 6 |
Understanding and Mitigating Hyperbolic Dimensional Collapse in Graph Contrastive Learning |
提出新框架以解决图对比学习中的超曲面维度崩溃问题 |
representation learning contrastive learning |
|
|
| 7 |
Train Once, Get a Family: State-Adaptive Balances for Offline-to-Online Reinforcement Learning |
提出FamO2O框架以解决离线到在线强化学习中的分布偏移问题 |
reinforcement learning |
✅ |
|
| 8 |
State-Action Similarity-Based Representations for Off-Policy Evaluation |
提出基于状态-动作相似性的表示以提升离线策略评估效率 |
reinforcement learning representation learning |
✅ |
|
| 9 |
Learning to Search Feasible and Infeasible Regions of Routing Problems with Flexible Neural k-Opt |
提出NeuOpt以解决灵活的路由问题 |
reinforcement learning reward shaping |
✅ |
|