| 1 |
ReMax: A Simple, Effective, and Efficient Reinforcement Learning Method for Aligning Large Language Models |
提出ReMax以解决PPO在大语言模型对齐中的不足 |
reinforcement learning PPO RLHF |
|
|
| 2 |
Leveraging Knowledge Distillation for Efficient Deep Reinforcement Learning in Resource-Constrained Environments |
结合知识蒸馏提升深度强化学习在资源受限环境中的效率 |
reinforcement learning deep reinforcement learning DRL |
|
|
| 3 |
DavIR: Data Selection via Implicit Reward for Large Language Models |
提出DavIR以解决大语言模型的数据选择问题 |
DPO direct preference optimization large language model |
|
|
| 4 |
Leveraging Topological Maps in Deep Reinforcement Learning for Multi-Object Navigation |
利用拓扑地图提升深度强化学习在多目标导航中的表现 |
reinforcement learning deep reinforcement learning |
|
|
| 5 |
Proper Laplacian Representation Learning |
提出拉普拉斯表示学习以解决强化学习中的状态表示问题 |
reinforcement learning representation learning reward shaping |
|
|
| 6 |
Uncertainty-aware transfer across tasks using hybrid model-based successor feature reinforcement learning |
提出混合模型基础的后继特征强化学习以解决不确定性知识转移问题 |
reinforcement learning |
|
|
| 7 |
Robust Multi-Agent Reinforcement Learning via Adversarial Regularization: Theoretical Foundation and Stable Algorithms |
提出ERNIE框架以解决多智能体强化学习的鲁棒性问题 |
reinforcement learning |
✅ |
|
| 8 |
A Comprehensive Study of Privacy Risks in Curriculum Learning |
提出隐私风险评估方法以解决课程学习中的数据泄露问题 |
curriculum learning |
|
|
| 9 |
Sample Complexity of Preference-Based Nonparametric Off-Policy Evaluation with Deep Networks |
提出一种样本复杂度理论以解决基于偏好的非参数离线策略评估问题 |
reinforcement learning RLHF |
|
|
| 10 |
Self-Pro: A Self-Prompt and Tuning Framework for Graph Neural Networks |
提出Self-Prompt框架以解决图神经网络的负迁移问题 |
representation learning contrastive learning |
✅ |
|
| 11 |
Mimicking the Maestro: Exploring the Efficacy of a Virtual AI Teacher in Fine Motor Skill Acquisition |
提出虚拟AI教师以提升精细运动技能的学习效果 |
reinforcement learning imitation learning |
|
|