| 1 |
Self-Confirming Transformer for Belief-Conditioned Adaptation in Offline Multi-Agent Reinforcement Learning |
提出自确认变换器以解决离线多智能体强化学习中的适应问题 |
reinforcement learning offline RL offline reinforcement learning |
|
|
| 2 |
Beyond Uniform Sampling: Offline Reinforcement Learning with Imbalanced Datasets |
提出一种新采样策略以解决离线强化学习中的不平衡数据问题 |
reinforcement learning policy learning offline RL |
✅ |
|
| 3 |
Amortizing intractable inference in large language models |
提出基于变分推断的LLM采样方法以解决后验分布不可处理问题 |
reinforcement learning large language model chain-of-thought |
|
|
| 4 |
Confronting Reward Model Overoptimization with Constrained RLHF |
提出约束强化学习以解决复合奖励模型过度优化问题 |
reinforcement learning RLHF large language model |
|
|
| 5 |
Adjustable Robust Reinforcement Learning for Online 3D Bin Packing |
提出可调鲁棒强化学习框架以解决在线3D装箱问题 |
reinforcement learning deep reinforcement learning DRL |
|
|
| 6 |
Improving Reinforcement Learning Efficiency with Auxiliary Tasks in Non-Visual Environments: A Comparison |
提出辅助任务以提高非视觉环境中的强化学习效率 |
reinforcement learning representation learning |
|
|
| 7 |
Understanding, Predicting and Better Resolving Q-Value Divergence in Offline-RL |
提出自激励特征度量以解决离线强化学习中的Q值发散问题 |
offline RL |
|
|
| 8 |
T-Rep: Representation Learning for Time Series using Time-Embeddings |
提出T-Rep以解决多变量时间序列表示学习问题 |
representation learning |
|
|
| 9 |
Reinforcement Learning with Fast and Forgetful Memory |
提出快速遗忘记忆以解决强化学习中的记忆问题 |
reinforcement learning |
✅ |
|
| 10 |
Perfect Alignment May be Poisonous to Graph Contrastive Learning |
提出针对图对比学习的增强策略以提升下游任务性能 |
contrastive learning |
✅ |
|
| 11 |
Amortized Network Intervention to Steer the Excitatory Point Processes |
提出ANI框架以优化动态图中的事件流管理 |
reinforcement learning policy learning |
|
|