| 1 |
Multi-step Proximal Policy Improvement in Offline Reinforcement Learning |
提出多步近端策略改进以解决离线强化学习中的策略更新问题 |
reinforcement learning TD3 offline reinforcement learning |
|
|
| 2 |
Gradients Know What Outcomes Don't: Unlocking Reinforcement Learning for LLM Reasoning with Gradient-Aligned Rewards |
提出梯度对齐奖励以解决强化学习在大语言模型推理中的局限性 |
reinforcement learning large language model chain-of-thought |
✅ |
|
| 3 |
DE-Venus: A Data-Efficient RLVR Framework for Large Language Models |
提出DE-Venus框架以解决RLVR中的数据效率问题 |
reinforcement learning large language model |
|
|
| 4 |
Out-of-Distribution Generalisation with Sequence Models in Offline Multi-Agent Reinforcement Learning |
提出多任务序列模型以解决离线多智能体强化学习中的零-shot任务泛化问题 |
reinforcement learning zero-shot transfer |
|
|
| 5 |
Risk and Anomaly Identification for Distribution Network Optimal Operation Based on Reinforcement Learning and Uncertainty Quantification |
提出基于强化学习和不确定性量化的配电网络风险与异常识别方法 |
reinforcement learning deep reinforcement learning DRL |
|
|
| 6 |
Subspace Inference Enables Efficient Active Reward Learning from Preferences |
提出PreferenceEKF以解决人类偏好学习中的不确定性问题 |
reinforcement learning offline reinforcement learning preference learning |
✅ |
|
| 7 |
TraveL: Transformer-based Multi-view Path Distributional Representation Learning |
提出TraveL框架以解决路径表示学习中的旅行者行为多样性问题 |
representation learning MAE |
|
|
| 8 |
Unlocking Lossless Speedups in LLMs via Discrete Diffusion |
提出扩散增强LLM以解决自回归生成速度慢的问题 |
distillation large language model |
✅ |
|
| 9 |
A Peer-Relative Representation Learning Framework for Energy Inefficiency Identification in Mobile Network Sites |
提出一种同行相对表示学习框架以识别移动网络站点的能效问题 |
representation learning |
|
|
| 10 |
Beyond Straightness: Non-Crossing Flow Matching via Quantile AlignTree Coupling |
提出量化对齐树流匹配以解决流匹配中的路径交叉问题 |
flow matching |
|
|
| 11 |
EF1-Constrained Nash Social Welfare with Identical Additive Valuations: Complexity, Guarantees, and Experiments |
提出PriorityNet以解决EF1约束下的Nash社会福利问题 |
reinforcement learning deep reinforcement learning |
|
|