| 1 |
Deep reinforcement learning for machine scheduling: Methodology, the state-of-the-art, and future directions |
综述深度强化学习在机器调度中的应用与挑战 |
reinforcement learning deep reinforcement learning DRL |
|
|
| 2 |
Deep Reinforcement Learning Algorithms for Hybrid V2X Communication: A Benchmarking Study |
提出深度强化学习算法以解决V2X通信中的垂直切换问题 |
reinforcement learning deep reinforcement learning DRL |
|
|
| 3 |
Reward Model Ensembles Help Mitigate Overoptimization |
提出集成奖励模型以解决过度优化问题 |
reinforcement learning PPO RLHF |
|
|
| 4 |
Neural architecture impact on identifying temporally extended Reinforcement Learning tasks |
提出基于注意力机制的架构以解决强化学习任务的可解释性问题 |
reinforcement learning deep reinforcement learning |
|
|
| 5 |
Co-modeling the Sequential and Graphical Routes for Peptide Representation Learning |
提出RepCon以融合肽的序列与图形表示学习 |
representation learning contrastive learning |
|
|
| 6 |
Discovering General Reinforcement Learning Algorithms with Adversarial Environment Design |
提出GROOVE以解决深度强化学习算法的泛化问题 |
reinforcement learning deep reinforcement learning |
|
|
| 7 |
Leveraging Model-based Trees as Interpretable Surrogate Models for Model Distillation |
提出基于模型树的可解释替代模型以优化模型蒸馏 |
distillation |
|
|
| 8 |
Decision ConvFormer: Local Filtering in MetaFormer is Sufficient for Decision Making |
提出Decision ConvFormer以解决决策Transformer局部依赖捕捉不足问题 |
reinforcement learning offline reinforcement learning decision transformer |
|
|
| 9 |
Multi-Domain Causal Representation Learning via Weak Distributional Invariances |
提出多域因果表示学习方法以解决数据简化假设问题 |
representation learning |
|
|
| 10 |
Multi-Agent Reinforcement Learning for Power Grid Topology Optimization |
提出层次化多智能体强化学习框架以优化电网拓扑 |
reinforcement learning |
|
|
| 11 |
Online Estimation and Inference for Robust Policy Evaluation in Reinforcement Learning |
提出在线鲁棒策略评估方法以解决强化学习中的统计推断问题 |
reinforcement learning |
|
|
| 12 |
Improving Knowledge Distillation with Teacher's Explanation |
提出知识解释蒸馏框架以提升模型性能 |
distillation |
|
|
| 13 |
Heterogeneous Federated Learning Using Knowledge Codistillation |
提出异构联邦学习方法以解决模型架构不一致问题 |
distillation |
|
|
| 14 |
Never Train from Scratch: Fair Comparison of Long-Sequence Models Requires Data-Driven Priors |
提出数据驱动的预训练方法以公平比较长序列模型 |
SSM state space model |
|
|
| 15 |
Learning to Reach Goals via Diffusion |
提出基于扩散模型的目标导向强化学习方法Merlin |
reinforcement learning offline RL |
|
|