| 1 |
Unleashing the Power of Pre-trained Language Models for Offline Reinforcement Learning |
提出LaMo框架以解决离线强化学习中的数据稀缺问题 |
reinforcement learning offline RL offline reinforcement learning |
|
|
| 2 |
Closed Drafting as a Case Study for First-Principle Interpretability, Memory, and Generalizability in Deep Reinforcement Learning |
提出基于第一原理的深度强化学习可解释性研究方法 |
reinforcement learning deep reinforcement learning DRL |
|
|
| 3 |
The Alignment Ceiling: Objective Mismatch in Reinforcement Learning from Human Feedback |
提出解决人类反馈强化学习中的目标不匹配问题 |
reinforcement learning RLHF large language model |
|
|
| 4 |
Sample-Efficient and Safe Deep Reinforcement Learning via Reset Deep Ensemble Agents |
提出重置深度集成代理以解决深度强化学习中的样本效率和安全性问题 |
reinforcement learning deep reinforcement learning |
|
|
| 5 |
A Tractable Inference Perspective of Offline RL |
提出Trifle以解决离线强化学习中的可处理性问题 |
reinforcement learning offline RL offline reinforcement learning |
|
|
| 6 |
Offline RL with Observation Histories: Analyzing and Improving Sample Complexity |
提出观察历史的离线强化学习方法以改善样本复杂度 |
reinforcement learning offline RL offline reinforcement learning |
|
|
| 7 |
Autonomous Robotic Reinforcement Learning with Asynchronous Human Feedback |
提出一种基于人类反馈的自主机器人强化学习方法 |
reinforcement learning policy learning |
✅ |
|
| 8 |
Dropout Strategy in Reinforcement Learning: Limiting the Surrogate Objective Variance in Policy Optimization Methods |
提出Dropout策略以解决强化学习中的目标方差问题 |
reinforcement learning PPO |
|
|
| 9 |
Towards Instance-Optimality in Online PAC Reinforcement Learning |
提出实例依赖的下界以优化在线PAC强化学习 |
reinforcement learning |
|
|
| 10 |
LoRA Fine-tuning Efficiently Undoes Safety Training in Llama 2-Chat 70B |
提出LoRA微调方法以有效解除Llama 2-Chat的安全训练 |
reinforcement learning large language model |
|
|
| 11 |
Amoeba: Circumventing ML-supported Network Censorship via Adversarial Reinforcement Learning |
提出Amoeba以解决机器学习支持的网络审查问题 |
reinforcement learning |
|
|
| 12 |
Network Contention-Aware Cluster Scheduling with Reinforcement Learning |
提出基于强化学习的网络争用感知集群调度方法 |
reinforcement learning |
|
|
| 13 |
Generative Learning of Continuous Data by Tensor Networks |
提出连续数据生成模型以解决现有方法局限性 |
world model world models |
|
|
| 14 |
Contrastive Difference Predictive Coding |
提出时间差对比预测编码以提高强化学习效率 |
reinforcement learning representation learning |
|
|