PhoenixRepair: Rethinking Repair Strategy Exploration in Software Agents
作者: Tianyue Jiang, Yanlin Wang, Xin He, Daya Guo, Jiachi Chen, Ming Wen, Ensheng Shi, Xilin Liu, Yuchi Ma, Guanbin Li
分类: cs.AI
发布日期: 2026-07-21
备注: 14 pages, 5 figures
🔗 代码/项目: GITHUB
💡 一句话要点
提出PhoenixRepair以解决软件代理修复策略探索不足问题
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 软件修复 多代理框架 修复策略探索 自动化问题解决 故障定位
📋 核心要点
- 现有的代理方法在修复策略探索上存在明显不足,尤其是在编辑位置和修复尝试的探索上。
- PhoenixRepair通过多位置采样和迭代反思与优化,系统性地扩展了修复策略的搜索空间。
- 在实验中,PhoenixRepair在多个基准测试中表现优异,显著提高了解决率和故障定位准确性。
📝 摘要(中文)
尽管大型语言模型在自动化问题解决方面取得了显著进展,但现有基于代理的方法在修复策略探索上存在根本性局限。这种局限主要体现在两个方面:一是对多个潜在编辑位置的探索有限,二是在每个位置的修复尝试探索也不足。为了解决这些挑战,本文提出了PhoenixRepair,一个多代理框架,系统性地探索多个候选编辑位置,并对补丁生成进行迭代反思和优化,从而扩展修复策略的搜索空间。实验结果表明,PhoenixRepair在DeepSeek-V3.1上相较于SWE-agent实现了7.8%的相对提升,并在MiniMax-M2.5下达到了76.0%的最高解决率,同时在故障定位准确性上也优于现有方法。
🔬 方法详解
问题定义:本文旨在解决现有软件代理在修复策略探索中的不足,特别是对多个编辑位置和修复尝试的探索不充分,导致修复效果不佳。
核心思路:PhoenixRepair的核心思路是通过多代理框架,系统性地探索多个候选编辑位置,并在每个位置进行迭代反思和优化,以生成更优的修复补丁。这样的设计旨在扩大修复策略的搜索空间,从而提高修复成功率。
技术框架:该框架包括多个主要模块:首先是多位置采样,接着是基于图的定位信息增强,最后是通过历史尝试的提炼见解进行最终生成。每个阶段都旨在逐步改进补丁的质量。
关键创新:PhoenixRepair的最大创新在于其多代理框架和迭代反思机制,这与现有方法的单一位置探索和缺乏反馈循环形成鲜明对比,从而显著提升了修复效果。
关键设计:在设计上,PhoenixRepair采用了多位置采样策略,并结合图结构信息来处理复杂任务,同时在补丁生成过程中引入了历史尝试的反馈,以优化最终的修复结果。具体的参数设置和损失函数设计在实验部分进行了详细描述。
🖼️ 关键图片
📊 实验亮点
在实验中,PhoenixRepair在DeepSeek-V3.1上相较于SWE-agent实现了7.8%的相对提升,并在MiniMax-M2.5下达到了76.0%的最高解决率。此外,该方法在故障定位准确性上也优于现有的其他方法,展示了其在实际应用中的有效性。
🎯 应用场景
PhoenixRepair的研究成果在软件开发和维护领域具有广泛的应用潜力,尤其是在自动化缺陷修复和代码质量提升方面。通过提高修复策略的探索能力,该方法可以有效减少软件开发中的人工干预,提高开发效率和软件可靠性。未来,该框架还可以扩展到其他领域,如自动化测试和智能代码审查等。
📄 摘要(原文)
While Large Language Models have greatly advanced automated issue resolution, existing agent-based methods exhibit a fundamental limitation in their insufficient exploration of repair strategies. This insufficiency manifests in two key aspects. First, the exploration of multiple potential edit locations is limited. Second, the exploration of repair attempts at each location is also insufficient. To address these challenges, we present PhoenixRepair, a multi-agent framework that systematically explores multiple candidate edit locations and performs iterative reflection and refinement on patch generation, thereby expanding the search space of repair strategies. Our framework begins with multi-location sampling, optionally augmented with graph-based localization information for difficult tasks, followed by iterative reflection and refinement to generate better patches, culminating in final-round generation guided by distilled insights from all historical attempts. Experiments on SWE-bench-Verified demonstrate that PhoenixRepair achieves the largest relative improvement of 7.8\% over SWE-agent under DeepSeek-V3.1, and attains the highest resolved rate of 76.0\% Pass@1 under MiniMax-M2.5. Meanwhile, it achieves higher fault localization accuracy than existing approaches. Our code is available at https://github.com/DeepSoftwareAnalytics/PhoenixRepair.