BackendForge: Benchmarking Agentic End-to-End Code Generation with Backend Services

📄 arXiv: 2607.11042v1 📥 PDF

作者: Yuzhe Guo, Mengzhou Wu, Yuan Cao, Jialei Wei, Dezhi Ran, Wei Yang, Tao Xie

分类: cs.SE, cs.AI

发布日期: 2026-07-13


💡 一句话要点

提出BackendForge以评估智能代码生成的可部署性与正确性

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 大型语言模型 代码生成 后端服务 自动化测试 OpenAPI 软件工程 智能编码

📋 核心要点

  1. 当前大型语言模型在生成可部署后端服务时面临行为正确性和完整性不足的挑战。
  2. BackendForge通过引入测试代理和代码代理的协同演化机制,提供了一种新的评估方法来生成后端服务。
  3. 实验结果显示,尽管GPT-5.5在基础预言下表现良好,但在最终预言下的成功率显著下降,揭示了LLMs的局限性。

📝 摘要(中文)

大型语言模型(LLMs)在智能编码环境中的应用日益增加,能够检查文件、执行命令、运行测试、观察失败并迭代修正代码。本文提出BackendForge,一个基于真实开源应用的56个合同定义后端生成任务的基准,旨在评估LLMs生成的端到端软件工件的可部署性和行为正确性。通过可见的规范和OpenAPI合同,LLMs需生成一个Docker化服务,并通过HTTP测试进行评估。BackendForge使用测试代理和代码代理共同演化测试预言和参考服务,提出基于规范的后端测试并修复参考实现。尽管表现最佳的模型GPT-5.5在基础预言下成功率为55.4%,但在最终预言下仅为28.6%,表明当前LLMs在实现完整后端服务方面仍存在挑战。

🔬 方法详解

问题定义:本文旨在解决大型语言模型在生成可部署和行为正确的后端服务时的评估问题。现有方法未能充分验证生成代码的完整性和正确性,尤其是在复杂的后端服务场景中。

核心思路:BackendForge通过设计一套基于真实应用的后端生成任务,结合OpenAPI合同和HTTP测试,提供了一种系统化的评估框架,确保生成的服务符合预期的行为规范。

技术框架:整体架构包括任务定义、生成模型、测试代理和代码代理四个主要模块。生成模型负责根据规范生成后端服务,测试代理设计测试用例,代码代理则负责修复生成的服务以满足测试要求。

关键创新:最重要的创新在于引入了测试代理与代码代理的协同演化机制,使得测试和代码生成过程相互促进,从而提高了生成服务的质量和正确性。

关键设计:在参数设置上,BackendForge定义了56个具体的后端生成任务,并通过OpenAPI合同确保生成服务的行为符合预期。损失函数和评估标准则基于HTTP测试结果,确保评估的客观性和准确性。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果显示,GPT-5.5在基础预言下的成功率为55.4%,但在最终预言下仅为28.6%。这一显著差距表明,尽管当前LLMs能够实现许多局部API行为,但在生成完整后端服务方面仍面临重大挑战。

🎯 应用场景

BackendForge的研究成果在软件开发、自动化测试和智能编程助手等领域具有广泛的应用潜力。通过提供一个标准化的评估框架,开发者可以更有效地利用大型语言模型生成高质量的后端服务,从而提升软件开发的效率和可靠性。未来,该研究可能推动智能编码工具的进一步发展,促进软件工程的自动化进程。

📄 摘要(原文)

Large language models (LLMs) are increasingly used in agentic coding settings, where they can inspect files, execute commands, run tests, observe failures, and iteratively revise code. This shift raises a central evaluation question: can an agentic LLM generate an end-to-end software artifact that is both deployable and behaviorally correct under execution? Backend services provide a controlled but realistic substrate for this evaluation. Their APIs expose application-level executable semantics, and deployed behavior can be checked deterministically against an OpenAPI contract through black-box HTTP interactions. We introduce BackendForge, a benchmark of 56 contract-defined backend generation tasks rewritten from real open-source applications. Given a visible specification and an OpenAPI contract, an LLM must generate a Dockerized service that is built, deployed, and evaluated only through HTTP tests. To strengthen evaluation without introducing hidden requirements, BackendForge uses a test agent and a code agent to co-evolve the test oracle and reference service, where the test agent proposes specification-grounded backend tests and the code agent repairs the reference implementation. Although the best-performing model, GPT-5.5, succeeds on 55.4\% of tasks under the base oracle, it succeeds on only 28.6\% under the final oracle. This gap suggests that current LLMs can implement many local API behaviors, but still struggle to produce complete backend services.