Recursive Harness Self-Improvement

📄 arXiv: 2607.15524 📥 PDF

作者: Hyunin Lee, Jinglue Xu, Jeffrey Seely, Donghyun Lee, Matei Zaharia, Yujin Tang

分类: cs.LG, cs.AI

发布日期: 2026-07-20


💡 一句话要点

提出递归式工具自我改进以优化模型训练质量

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 递归式自我改进 工具优化 模型训练 低推理努力 任务特定学习

📋 核心要点

  1. 现有方法在持续更新提供者构建的工具时,面临高成本和劳动密集的问题。
  2. 本文提出递归式工具自我改进(RHI),通过成对反馈迭代优化用户构建的工具,提升执行轨迹质量。
  3. 在30个合成机器学习任务中,RHI迭代显著提升低推理努力代理的性能,推理成本降低了60%。

📝 摘要(中文)

在模型与工具的共同演化下,工具不仅是推理时的支架,更是生成数据的组件,其执行轨迹能够影响未来的基础模型。这激励了工具内学习的研究:优化工具以提升代理的即时性能及未来模型训练的轨迹质量。然而,持续更新构建的支架成本高且劳动密集。因此,本文探讨了以任务特定方式优化用户构建的工具,以提高执行轨迹质量,同时保持计算轻量和仅需少量更新迭代。为此,我们提出了递归式工具自我改进(RHI),通过对自身修订历史的成对反馈迭代精炼工具。实验表明,经过少量RHI迭代,低推理努力代理的性能上限显著提高,超越高推理努力设置,同时推理成本降低了60%。这些提升主要源于更有效的任务特定上下文管理,而非更长的推理轨迹。最后,我们将这种行为形式化为信息论假设,建议RHI作为模型与工具共同演化中的持续学习实用算法。

🔬 方法详解

问题定义:本文旨在解决持续更新提供者构建的工具所带来的高成本和劳动密集问题。现有方法在优化工具时缺乏有效性和灵活性,难以适应特定任务的需求。

核心思路:递归式工具自我改进(RHI)通过将工具视为代理循环的提示级规范,利用成对反馈迭代精炼工具。这种设计旨在提高执行轨迹的质量,同时保持计算的轻量性。

技术框架:RHI的整体架构包括工具的初始构建、反馈收集、迭代优化和性能评估四个主要模块。每个模块相互连接,形成闭环反馈机制,以不断提升工具的性能。

关键创新:RHI的核心创新在于通过自身修订历史的成对反馈实现工具的自我改进。这种方法与传统的工具更新方式不同,能够在较少的迭代中实现显著的性能提升。

关键设计:在RHI中,关键参数设置包括反馈的频率和迭代次数,损失函数设计为优化执行轨迹的质量,网络结构则采用轻量级的模型以降低计算成本。

📊 实验亮点

实验结果显示,经过少量RHI迭代,低推理努力代理的性能上限显著提高,超越了高推理努力设置,推理成本降低了多达60%。这些结果表明RHI在提升任务特定上下文管理方面的有效性。

🎯 应用场景

该研究的潜在应用领域包括金融、机器人和制药等多个行业。通过优化工具的执行轨迹,RHI能够提升模型的训练效率和性能,具有广泛的实际价值和未来影响,尤其在需要快速迭代和高效学习的场景中尤为重要。

📄 摘要(原文)

Under model--harness co-evolution, harnesses are not merely inference-time scaffolds but data-generating components whose execution traces can shape future foundation models. This motivates harness-in-the-loop learning: optimizing harnesses for both immediate agent performance and the quality of traces used for future model training. However, continually updating provider-built scaffolds is costly and labor-intensive. We therefore investigate whether optimizing user-constructed harnesses in a task-specific manner can improve execution-trace quality while remaining computationally lightweight and requiring only a few update iterations. To this end, we introduce Recursive Harness Self-Improvement (RHI), which represents the harness as a prompt-level specification of the agent loop and iteratively refines it using pairwise feedback over its own revision history. Across 30 synthetic machine-learning research tasks spanning quantitative finance, robotics, and pharmacy, a few RHI iterations suffice to substantially raise the performance ceiling of low-reasoning-effort agents, exceeding the corresponding maximum-reasoning-effort setting while reducing inference cost by up to 60%. We show that these gains arise primarily from improved task-specific context management through more effective inter-agent information flow rather than longer reasoning traces. Finally, we formalize this behavior as an information-theoretic hypothesis for RHI's implicit optimization objective, suggesting RHI as a practical algorithm for continual learning within the paradigm of model--harness co-evolution.