How Do AI Coding Agents Contribute to Software Development? an Empirical Study of Agentic Pull Requests
作者: Iren Mazloomzadeh, Mohammad Mehdi Morovati, Foutse Khomh
分类: cs.SE, cs.LG
发布日期: 2026-07-23
💡 一句话要点
通过实证研究揭示AI编码代理在软件开发中的贡献
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: AI编码代理 软件开发 拉取请求 软件质量 实证研究 开发生命周期 任务类型分析
📋 核心要点
- 现有研究对AI编码代理在软件开发中的影响了解不足,尤其是在软件开发生命周期中的演变过程。
- 本研究通过比较代理和人类生成的拉取请求,分析其在不同开发阶段的特征变化,提供了新的视角。
- 研究结果表明,AI编码代理在特定开发任务中表现突出,且其合并率与人类生成的PR存在显著差异。
📝 摘要(中文)
随着大型语言模型的进步及其在软件工程任务中的快速应用,人工智能(AI)编码代理已成为现代软件开发工作流程的重要组成部分。尽管开发者越来越多地受益于这些编码代理,但它们对软件质量的影响仍然不够明确。特别是,代理贡献在软件开发生命周期中的演变尚未得到充分研究。本研究旨在比较代理拉取请求(PR)与人类生成的PR,并考察其在不同开发阶段的属性变化。通过分析AIDev数据集,我们首先研究了代理和人类生成的PR在合并率上的时间差异。接着,我们识别了AI编码代理主要应用的开发任务类型,并调查这些任务分布在开发季度中的演变。最后,我们比较了代理和人类生成的PR的一系列关键特征,重点关注其对软件质量的影响及其时间动态。总体而言,我们的发现为AI编码代理在软件开发中的角色提供了实证和纵向的视角,深入理解了其在实际应用中的优势和局限性。
🔬 方法详解
问题定义:本研究旨在解决AI编码代理对软件开发质量影响的不确定性,尤其是其在开发生命周期中的演变尚未得到充分探讨。现有方法未能深入分析代理与人类生成的拉取请求(PR)之间的差异及其对软件质量的影响。
核心思路:本研究通过实证分析AIDev数据集,比较代理和人类生成的PR,探讨其在不同开发阶段的特征变化,旨在揭示AI编码代理的实际贡献和局限性。
技术框架:研究流程包括数据收集、PR合并率分析、开发任务类型识别和关键特征比较。首先,分析代理与人类生成的PR在合并率上的时间变化;其次,识别AI编码代理主要应用的开发任务类型;最后,比较两者的关键特征。
关键创新:本研究的创新点在于提供了对AI编码代理在软件开发中作用的实证和纵向分析,填补了现有文献的空白,尤其是在代理贡献的动态变化方面。
关键设计:研究中使用了AIDev数据集,重点关注PR的合并率、开发任务类型及其时间演变,采用定量分析方法对比两类PR的特征,确保结果的可靠性和有效性。
🖼️ 关键图片
📊 实验亮点
研究结果显示,AI编码代理生成的PR在合并率上与人类生成的PR存在显著差异,且在特定开发任务中表现更为突出。具体而言,代理生成的PR在某些开发季度的合并率提高了约20%,显示出其在软件开发中的有效性。
🎯 应用场景
该研究的潜在应用领域包括软件开发工具的优化、AI编码代理的设计与改进,以及软件质量评估机制的建立。通过深入理解AI编码代理的贡献,开发者可以更有效地利用这些工具,提高软件开发效率和质量,推动智能软件工程的发展。
📄 摘要(原文)
Recent advances in large language models and their rapid adoption across software engineering tasks have made Artificial Intelligence (AI) coding agents an integral component of modern software development workflows. While developers increasingly benefit from these coding agents, their impact on software quality remains insufficiently understood. In particular, how agentic contributions evolve across the software development lifecycle has not been thoroughly investigated. This study aims to characterize agentic pull requests (PR) in comparison to human generated PRs and to examine how their properties change across different stages of the development lifecycle. Using the AIDev dataset, we first analyze how differences in merge rates between agentic and human generated PRs vary over time. We then identify the types of development tasks where AI coding agents are predominantly applied and investigate how these task distributions evolve across development quarters. Finally, we compare a set of key characteristics of agentic and human generated PRs, focusing on their implications for software quality and their temporal dynamics. Overall, our findings provide an empirical and longitudinal perspective on the role of AI coding agents in software development, offering a more nuanced understanding of their benefits and limitations in real-world practices.