$Φ$-Bench: Can Large Language Models Engineer the Infrastructure That Powers Them?

📄 arXiv: 2609.10226v1 📥 PDF

作者: Leilei Ding, Shumin Wang, Yuting Huang, Fanqi Wan, Yinmin Zhang, Qi Han, Yiming Xu, Feiyuan Zhang, Xiaomeng Chu, Guoliang You, Wuyang Zhang, Daxin Jiang, Yanyong Zhang

分类: cs.CL

发布日期: 2026-09-09


💡 一句话要点

提出$Φ$-Bench以评估大语言模型在基础设施工程中的能力

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 大语言模型 基础设施工程 优化问题 系统评估 长时间任务

📋 核心要点

  1. 现有基准主要关注孤立的内核和预定义的操作,无法评估LLMs在开放式基础设施工程中的能力。
  2. 本文提出$Φ$-Bench,旨在系统评估LLMs在基础设施工程堆栈中的表现,涵盖多种复杂任务。
  3. 实验结果显示,当前LLMs在工程复杂基础设施方面存在能力和局限性,为未来的优化提供了重要见解。

📝 摘要(中文)

大语言模型(LLMs)在推理和代码生成方面展现出显著能力,提出了它们可能协助开发和优化自身基础设施的前景。然而,现有基准主要集中于孤立的内核、预定义的操作符或预设的优化目标,无法评估LLMs在开放式、长时间跨度的基础设施工程中的能力。为填补这一空白,本文提出了$Φ$-Bench,这是一个系统评估LLMs在基础设施工程堆栈上的基准。$Φ$-Bench基于前沿研究中的优化问题,并结合真实世界的代码库,涵盖了基础设施堆栈的广泛任务,复杂度从局部内核级函数补全到长时间实现和端到端系统优化。对前沿LLMs的广泛实验揭示了它们在工程复杂LLM基础设施方面的能力和局限性,为未来AI基础设施的自主优化提供了洞见。

🔬 方法详解

问题定义:本文旨在解决现有基准无法有效评估大语言模型在基础设施工程中的能力这一具体问题。现有方法主要集中于孤立的内核和预定义的操作,缺乏对开放式和长时间跨度任务的评估。

核心思路:论文的核心思路是构建$Φ$-Bench基准,通过涵盖多样化的任务和复杂度,系统评估LLMs在基础设施工程中的表现。这种设计使得评估不仅限于简单的功能补全,而是扩展到全面的系统优化。

技术框架:$Φ$-Bench的整体架构包括多个模块,首先是任务定义模块,接着是基于真实代码库的优化问题生成模块,最后是评估模块,综合考虑了不同复杂度的任务。

关键创新:最重要的技术创新点在于$Φ$-Bench的设计,它不仅关注局部内核功能,还涵盖了长时间实现和端到端系统优化,与现有方法的本质区别在于其开放性和多样性。

关键设计:在设计中,$Φ$-Bench采用了多种任务复杂度设置,结合真实世界的代码库,确保评估的真实性和有效性。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果表明,当前前沿LLMs在复杂基础设施工程中的表现存在显著局限性,尤其是在长时间跨度的任务中。通过$Φ$-Bench的评估,研究者能够清晰地识别出LLMs的强项与短板,为未来的研究方向提供了重要的参考。

🎯 应用场景

$Φ$-Bench的研究成果具有广泛的应用潜力,能够为大语言模型的基础设施优化提供系统化的评估工具。这一基准不仅可以用于学术研究,还可以在工业界中帮助开发更高效的AI系统,推动自主优化技术的发展。

📄 摘要(原文)

Large language models (LLMs) have demonstrated remarkable capabilities in reasoning and code generation, raising the prospect that they could assist in developing and optimizing the very infrastructure that powers them. However, existing benchmarks mainly focus on isolated kernels, predefined operators, or pre-specified optimization targets, and therefore fail to evaluate the ability of LLMs to perform open-ended, long-horizon LLM infrastructure engineering. To address this gap, we present $Φ$-Bench, a benchmark for systematically evaluating LLMs on engineering the LLM infrastructure stack. Derived from optimization problems studied in frontier research and grounded in real-world code repositories, $Φ$-Bench provides broad coverage of the LLM infrastructure stack and spans tasks of varying complexity, ranging from localized kernel-level function completion to long-horizon implementation and end-to-end system optimization. Extensive experiments on frontier LLMs reveal their current capabilities and limitations in engineering complex LLM infrastructure, offering insights into the challenges that remain on the path toward autonomous optimization of future AI infrastructure.