| 1 |
Conditionally Combining Robot Skills using Large Language Models |
提出Language-World与PCBC方法以提升机器人技能组合能力 |
reinforcement learning deep reinforcement learning large language model |
✅ |
|
| 2 |
Privately Aligning Language Models with Reinforcement Learning |
提出隐私保护的强化学习对齐方法以提升语言模型性能 |
reinforcement learning RLHF large language model |
|
|
| 3 |
Towards Control-Centric Representations in Reinforcement Learning from Images |
提出ReBis以解决图像强化学习中的控制中心表示问题 |
reinforcement learning latent dynamics spatiotemporal |
|
|
| 4 |
Zephyr: Direct Distillation of LM Alignment |
提出Zephyr以解决语言模型对用户意图的对齐问题 |
RLHF direct preference optimization distillation |
✅ |
|
| 5 |
MultiPrompter: Cooperative Prompt Optimization with Multi-Agent Reinforcement Learning |
提出MultiPrompter以解决提示优化中的协作问题 |
reinforcement learning foundation model |
|
|
| 6 |
Model-enhanced Contrastive Reinforcement Learning for Sequential Recommendation |
提出模型增强对比强化学习以解决推荐系统中的数据稀疏问题 |
reinforcement learning offline RL contrastive learning |
|
|
| 7 |
Pitfall of Optimism: Distributional Reinforcement Learning by Randomizing Risk Criterion |
提出随机化风险标准的分布式强化学习算法以解决偏见探索问题 |
reinforcement learning |
|
|
| 8 |
Hyperparameter Optimization for Multi-Objective Reinforcement Learning |
提出超参数优化方法以解决多目标强化学习挑战 |
reinforcement learning |
|
|
| 9 |
Transfer of Reinforcement Learning-Based Controllers from Model- to Hardware-in-the-Loop |
结合迁移学习与硬件仿真加速强化学习控制器开发 |
reinforcement learning |
|
|
| 10 |
RedCoast: A Lightweight Tool to Automate Distributed Training of LLMs on Any GPU/TPUs |
提出RedCoast以自动化大语言模型的分布式训练 |
reinforcement learning large language model |
|
|
| 11 |
Modality-Agnostic Self-Supervised Learning with Meta-Learned Masked Auto-Encoder |
提出MetaMAE以实现模态无关的自监督学习 |
MAE contrastive learning |
✅ |
|