T1: Terminal Agent Reinforcement Learning for Long-Horizon Tasks

📄 arXiv: 2609.11042v1 📥 PDF

作者: Junyao Yang, Yucheng Shi, Zhongzhi Li, Ruhan Wang, Zongxia Li, Haitao Mi, Leowei Liang

分类: cs.LG, cs.AI

发布日期: 2026-09-10

备注: 37 pages, 18 figures


💡 一句话要点

提出T1模型以解决长时间任务中的终端任务问题

🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture)

关键词: 长时间任务 强化学习 混合专家模型 终端任务 能力转移 自动化编程 科学发现

📋 核心要点

  1. 现有方法在处理长时间任务时,往往面临效率低下和能力转移不足的问题。
  2. 论文提出的T1模型通过混合专家架构和强化学习,优化了终端任务的执行效率和准确性。
  3. 实验表明,T1模型在多个基准测试中显著提升了解决率,展示了其优越的性能。

📝 摘要(中文)

随着智能体的使用逐渐向长时间任务(如编码和科学发现)转变,终端任务显得尤为重要。本文介绍了T1,一个由122B参数组成的混合专家模型,采用强化学习在云沙箱中操作真实的shell,支持每个任务超过300次的工具调用。我们提供了一套全面的训练方案,包括通过密集过程奖励来稳定演员-评论家训练,利用TITO构建实现稳定优化,并采用完全脱离分布的训练语料,确保模型能力的真实转移。实验结果显示,T1在Terminal-Bench 2.1上将初始基线模型的解决率从43.8%提升至64.0%,在长时间终端基准上达到27.9%,超越了GPT-5.4和GLM-5.1。

🔬 方法详解

问题定义:本文旨在解决长时间任务中的终端任务执行效率低和能力转移不足的问题。现有方法在面对复杂的任务时,往往无法有效利用资源,导致性能下降。

核心思路:T1模型通过混合专家架构和强化学习,结合稳定的训练策略,旨在提升智能体在长时间任务中的表现。通过优化奖励机制和训练流程,确保模型能够有效学习并执行复杂任务。

技术框架:T1的整体架构包括三个主要模块:首先是演员-评论家训练框架,通过密集过程奖励来稳定训练;其次是TITO构建,确保在每个回合边界进行漂移修复;最后是回放路由重放,记录每个专家的选择以优化训练过程。

关键创新:T1的核心创新在于其混合专家模型和TITO构建,显著降低了训练与推理之间的对数概率差异,从而提高了模型的稳定性和性能。这与现有方法相比,提供了更高效的学习机制。

关键设计:在训练过程中,采用了激进的预热策略以稳定训练,损失函数设计为基于通过验证器的绝对数量进行评分,同时确保训练语料完全脱离分布,以避免基准过拟合。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

在Terminal-Bench 2.1上,T1模型将初始基线的解决率从43.8%提升至64.0%,在长时间终端基准上达到27.9%,超越了GPT-5.4和GLM-5.1,展示了显著的性能提升,证明了其在长时间任务中的有效性。

🎯 应用场景

T1模型的潜在应用领域包括自动化编程、科学研究辅助工具以及复杂决策支持系统。其高效的任务执行能力和准确性使其在需要长时间推理和复杂操作的场景中具有重要的实际价值,未来可能推动相关领域的技术进步。

📄 摘要(原文)

Agent usage is shifting toward long-horizon tasks such as coding and scientific discovery, among which terminal tasks are especially important. We introduce T1, a Mixture-of-Experts model of 122B total trained with reinforcement learning, operating a real shell in a cloud sandbox for up to 300+ tool-call turns per task, rewarded by executing each task's own verifier. We provide a comprehensive recipe: First, an aggressively warm-started to stabilize actor-critic training, with a dense process reward scoring trajectories by the absolute number of passing verifiers. Second, stable optimization through TITO construction, training on the exact sampled token identifiers with drift repair at turn boundaries, and rollout routing replay, recording the sampler's per-token expert choices at every MoE layer and replaying them during training. Third, fully out-of-distribution training corpus: isolated seeds and synthesized tasks disjoint from Terminal-Bench 2.1 ensures gains reflect genuine capability transfer over benchmark overfitting. Together, TITO and R3 cut the training-to-inference log-probability difference from 0.021 to 0.013, with exactly aligned zero token drift in the loss region. On Terminal-Bench 2.1, our post-train pipeline raises initial base model from 43.8% to T1 with 64.0% resolved. On Long-Horizon Terminal Bench, T1 reaches 27.9% and surpasses GPT-5.4 and GLM-5.1.