| 11 |
Small batch deep reinforcement learning |
提出小批量深度强化学习以提升性能 |
reinforcement learning deep reinforcement learning |
|
|
| 12 |
Beyond One-Preference-Fits-All Alignment: Multi-Objective Direct Preference Optimization |
提出多目标直接偏好优化以解决单一模型适应性不足问题 |
reinforcement learning RLHF DPO |
✅ |
|
| 13 |
How the level sampling process impacts zero-shot generalisation in deep reinforcement learning |
提出自监督环境设计以提升深度强化学习的零-shot泛化能力 |
reinforcement learning deep reinforcement learning |
|
|
| 14 |
PyDCM: Custom Data Center Models with Reinforcement Learning for Sustainability |
提出PyDCM以优化数据中心的可持续性问题 |
reinforcement learning deep reinforcement learning |
|
|
| 15 |
Certifiably Robust Graph Contrastive Learning |
提出可证明鲁棒的图对比学习框架以应对对抗攻击 |
representation learning contrastive learning |
✅ |
|
| 16 |
Safe Exploration in Reinforcement Learning: A Generalized Formulation and Algorithms |
提出一种广义安全探索算法以解决强化学习中的安全问题 |
reinforcement learning |
|
|
| 17 |
Constraint-Conditioned Policy Optimization for Versatile Safe Reinforcement Learning |
提出条件约束策略优化以解决多样化安全强化学习问题 |
reinforcement learning |
|
|
| 18 |
LESSON: Learning to Integrate Exploration Strategies for Reinforcement Learning via an Option Framework |
提出统一框架以整合强化学习中的探索策略 |
reinforcement learning |
|
|