| 1 |
Can a student Large Language Model perform as well as it's teacher? |
提出知识蒸馏以优化学生模型在资源受限环境中的表现 |
distillation large language model |
|
|
| 2 |
Reinforcement Learning from Automatic Feedback for High-Quality Unit Test Generation |
提出基于静态质量指标的强化学习方法以提升单元测试生成质量 |
reinforcement learning PPO large language model |
|
|
| 3 |
A Deep Reinforcement Learning Approach for Interactive Search with Sentence-level Feedback |
提出DQrank以解决交互搜索中的句子级反馈问题 |
reinforcement learning deep reinforcement learning |
|
|
| 4 |
Language Models Represent Space and Time |
提出语言模型空间与时间表示的研究以揭示其真实世界的理解能力 |
world model world models spatiotemporal |
|
|
| 5 |
OOD Aware Supervised Contrastive Learning |
提出OOD感知的监督对比学习以解决OOD检测问题 |
representation learning contrastive learning |
|
|
| 6 |
Learning Optimal Advantage from Preferences and Mistaking it for Reward |
提出基于遗憾的偏好模型以优化奖励学习 |
reinforcement learning RLHF large language model |
|
|
| 7 |
Blending Imitation and Reinforcement Learning for Robust Policy Improvement |
提出RPI算法以解决强化学习样本复杂度问题 |
reinforcement learning imitation learning |
|
|
| 8 |
Distributionally Safe Reinforcement Learning under Model Uncertainty: A Single-Level Approach by Differentiable Convex Programming |
提出一种可处理模型不确定性的单层安全强化学习方法 |
reinforcement learning |
|
|
| 9 |
SNIP: Bridging Mathematical Symbolic and Numeric Realms with Unified Pre-training |
提出SNIP模型以解决符号与数值领域的整合问题 |
contrastive learning multimodal |
✅ |
|
| 10 |
Conditional Instrumental Variable Regression with Representation Learning for Causal Inference |
提出条件工具变量回归以解决因果推断中的混杂问题 |
representation learning |
|
|
| 11 |
On Representation Complexity of Model-based and Model-free Reinforcement Learning |
研究强化学习的电路复杂性以提升样本效率 |
reinforcement learning |
|
|
| 12 |
PCGPT: Procedural Content Generation via Transformers |
提出PCGPT框架以解决程序内容生成中的重复性问题 |
reinforcement learning offline reinforcement learning |
|
|