| 1 |
LLaMA Rider: Spurring Large Language Models to Explore the Open World |
提出LLaMA Rider以提升大语言模型在开放世界中的探索能力 |
reinforcement learning large language model |
|
|
| 2 |
Distance-rank Aware Sequential Reward Learning for Inverse Reinforcement Learning with Sub-optimal Demonstrations |
提出距离排名感知序列奖励学习以解决逆强化学习中的奖励模糊问题 |
reinforcement learning inverse reinforcement learning contrastive learning |
|
|
| 3 |
Offline Reinforcement Learning for Optimizing Production Bidding Policies |
提出离线强化学习优化生产竞标策略以应对广告市场挑战 |
reinforcement learning offline reinforcement learning |
|
|
| 4 |
Optimal Scheduling of Electric Vehicle Charging with Deep Reinforcement Learning considering End Users Flexibility |
提出深度强化学习优化电动车充电调度以提升用户灵活性 |
reinforcement learning deep reinforcement learning |
|
|
| 5 |
Does Graph Distillation See Like Vision Dataset Counterpart? |
提出结构广播图数据蒸馏方法以提升图表示学习性能 |
representation learning distillation |
✅ |
|
| 6 |
Graph Distillation with Eigenbasis Matching |
提出图蒸馏方法以解决图神经网络训练效率问题 |
distillation |
✅ |
|
| 7 |
Goodhart's Law in Reinforcement Learning |
提出早停方法以解决强化学习中的Goodhart定律问题 |
reinforcement learning |
|
|
| 8 |
Automatic Music Playlist Generation via Simulation-based Reinforcement Learning |
提出基于模拟强化学习的音乐播放列表自动生成方法 |
reinforcement learning |
|
|
| 9 |
Semi-Supervised End-To-End Contrastive Learning For Time Series Classification |
提出SLOTS以解决时间序列分类中的半监督学习问题 |
contrastive learning |
|
|
| 10 |
Progressively Efficient Learning |
提出通信高效的互动学习框架以提升AI学习能力 |
reinforcement learning imitation learning |
|
|