| 1 |
Entropy Pacing Policy Optimization for Multi-Task Agentic Reinforcement Learning |
提出熵节奏策略优化以解决多任务强化学习中的探索-利用不匹配问题 |
reinforcement learning generalist agent large language model |
|
|
| 2 |
Guidance Breaks the Fitted Operator: A Terminal-Fitted Repair for Classifier-Free Guidance |
提出终端拟合修复方法以解决分类器无关引导的过饱和问题 |
flow matching classifier-free guidance |
|
|
| 3 |
Selective Timestep Weighting and Advantage-Based Replay for Sample-Efficient Diffusion RLHF |
提出选择性时间步加权和基于优势的重放以提高扩散RLHF的样本效率 |
reinforcement learning PPO RLHF |
|
|
| 4 |
Single-Rollout Asynchronous Optimization for Agentic Reinforcement Learning |
提出单次回合异步优化以解决强化学习稳定性问题 |
reinforcement learning large language model |
|
|
| 5 |
UP: Unbounded Positive Asymmetric Optimization for Breaking the Exploration-Stability Dilemma |
提出无界正向非对称优化以解决探索与稳定性困境 |
reinforcement learning large language model multimodal |
|
|
| 6 |
TimEE: End-to-end Time Series Classification via In-Context Learning |
提出TimEE以解决时间序列分类中的训练效率问题 |
representation learning foundation model |
✅ |
|
| 7 |
FMMVCC: Fuzzy Mamba-based Multi-View Contrastive Clustering for Univariate Time Series |
提出FMMVCC以解决时间序列聚类中的长程依赖问题 |
Mamba |
|
|
| 8 |
Gimitest: A Comprehensive Tool for Testing Reinforcement Learning Policies |
提出Gimitest以解决强化学习策略测试的可靠性问题 |
reinforcement learning |
|
|
| 9 |
Mathematical methods of reinforcement learning |
系统化数学方法以推动强化学习算法设计与分析 |
reinforcement learning |
|
|
| 10 |
Weight-Space Physics: Interpretable Hypernetworks for Lattice Quantum Field Theories |
提出JEPAWG以解决量子场论中的可解释性问题 |
Joint-Embedding Predictive Architecture joint-embedding predictive architecture |
|
|