cs.CL(2026-07-15)
📊 共 9 篇论文 | 🔗 2 篇有代码
🎯 兴趣领域导航
支柱二:RL算法与架构 (RL & Architecture) (4 🔗2)
支柱九:具身大模型 (Embodied Foundation Models) (4)
支柱七:动作重定向 (Motion Retargeting) (1)
🔬 支柱二:RL算法与架构 (RL & Architecture) (4 篇)
| # | 题目 | 一句话要点 | 标签 | 🔗 | ⭐ |
|---|---|---|---|---|---|
| 1 | GFlowRL: Scaling Distribution-Matching RL to Large Language Models | 提出GFlowRL以解决大规模语言模型的分布匹配强化学习问题 | reinforcement learning large language model | ✅ | |
| 2 | SPyCE: Skill-Policy Co-evolution for Multimodal Agents | 提出SPyCE框架以解决多模态智能体的技能与策略共演化问题 | reinforcement learning multimodal | ||
| 3 | Post-Training Shifts Confidence: A Three-Stage Analysis of How SFT, RL, and OPD Shape Pre-, Intra-, and Post-CoT Calibration | 提出PosConf以优化推理模型的信心校准问题 | reinforcement learning distillation large language model | ✅ | |
| 4 | Demystifying On-Policy Distillation: Roles, Pathologies, and Regulations | 提出轻量信号调节以解决OPD中的探索路径问题 | teacher-student distillation |
🔬 支柱九:具身大模型 (Embodied Foundation Models) (4 篇)
| # | 题目 | 一句话要点 | 标签 | 🔗 | ⭐ |
|---|---|---|---|---|---|
| 5 | Analogical Deep Research: Retrieving and Integrating Historical Analogies for Foresight Analysis | 提出类比深度研究框架以提升历史类比分析能力 | large language model | ||
| 6 | Memory as a Controlled Process: Learned Adaptive Memory Management for LLM Agents | 提出MemCon框架以优化大语言模型的记忆管理 | large language model | ||
| 7 | High-Order Question Generation in a Multilingual Educational Context | 提出多语言高阶问题生成方法以提升批判性思维能力 | large language model | ||
| 8 | When Rubrics Change: Cross-Rubric Generalization for Critical Thinking Essay Scoring | 提出跨评分标准泛化方法以提升自动化作文评分效果 | large language model |
🔬 支柱七:动作重定向 (Motion Retargeting) (1 篇)
| # | 题目 | 一句话要点 | 标签 | 🔗 | ⭐ |
|---|---|---|---|---|---|
| 9 | Evaluation Ability Does Not Imply Optimization Utility: LLM-as-a-Judge Signals in Closed-Loop Table Recognition | 研究表明LLM评估能力不等于优化效用 | structure preservation |