ERPBench: Evaluating LLM Agents for Enterprise Decision-Making Across Competitive Market Ecologies
作者: Xinran Zhang, Pengrui Lu, Lyumanshan Ye, Pengfei Liu
分类: cs.AI
发布日期: 2026-09-04
🔗 代码/项目: GITHUB
💡 一句话要点
提出ERPBench以评估企业决策中的LLM代理在竞争市场中的表现
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 大型语言模型 企业决策 市场生态 决策支持 执行基准 竞争分析
📋 核心要点
- 现有方法缺乏对LLM代理在不同竞争市场生态中决策能力的全面评估,导致决策结论的转移性未被充分验证。
- 论文提出了ERPBench,一个针对企业决策代理的基准,设计了六轮ERP模拟以测试不同市场生态中的决策表现。
- 实验结果显示,在Solo生态中,DeepSeek模型表现最佳,而在Arena生态中,Gemini模型领先,且两者在任务层面的胜者仅重合21个问题。
📝 摘要(中文)
大型语言模型(LLM)代理在企业工作流程中越来越受到关注,但现有评估很少测试商业决策结论在竞争市场生态中的转移能力。我们引入了ERPBench,这是一个针对企业决策代理的执行工具基准,包含六轮企业资源规划(ERP)模拟,涉及定价、生产、采购、库存、财务和共享市场竞争。ERPBench在两个匹配的竞争市场生态中评估相同的100个固定问题:Solo和Arena。研究表明,在不同生态中,表现最佳的模型有所不同,且在Arena中,Gemini的底层排名率从22%降至0%。ERPBench支持企业代理在不同市场生态中的排名转移评估,并提供聚合执行干预分析。
🔬 方法详解
问题定义:本研究旨在解决现有评估方法未能有效测试LLM代理在不同竞争市场生态中决策能力的问题。现有方法往往局限于单一生态,缺乏对决策结论转移性的考量。
核心思路:论文的核心思路是通过设计一个执行工具基准(ERPBench),在两个不同的市场生态中评估LLM代理的决策表现,从而验证其在不同环境下的适应性和有效性。
技术框架:ERPBench的整体架构包括六轮ERP模拟,涵盖定价、生产、采购、库存、财务等多个模块。评估分为Solo和Arena两个生态,分别与固定规则对手和多个LLM代理竞争。
关键创新:最重要的技术创新在于引入了两个匹配的市场生态进行对比评估,能够有效识别不同生态中表现最佳的模型,并分析其决策转移能力。
关键设计:在实验中,设置了100个固定问题,并在两个生态中进行评估,使用了聚合执行干预分析来支持结果的解释。模型的表现通过平均估值和排名进行量化,确保评估的客观性和准确性。
🖼️ 关键图片
📊 实验亮点
实验结果显示,在Solo生态中,DeepSeek模型的平均估值为252.29M,排名1.67,而在Arena生态中,Gemini模型的平均估值为263.95M,排名1.76。两种生态中仅有21个问题的任务层面胜者重合,显示出不同市场环境对模型表现的显著影响。
🎯 应用场景
该研究的潜在应用领域包括企业决策支持系统、市场分析工具和智能代理开发。通过验证LLM代理在不同市场生态中的表现,企业可以更好地选择和部署适合其特定环境的决策支持工具,从而提升决策效率和市场竞争力。
📄 摘要(原文)
Large language model (LLM) agents are increasingly proposed for enterprise workflows, yet existing evaluations rarely test whether business-decision conclusions transfer across competitive market ecologies. We introduce ERPBench, an execution-instrumented benchmark for enterprise decision agents in a six-round Enterprise Resource Planning (ERP) simulation with coupled pricing, production, procurement, inventory, finance, and shared-market competition. ERPBench evaluates the same 100 fixed problems in two matched competitive market ecologies: Solo, where each evaluated LLM agent competes against fixed rule-based opponents, and Arena, where six evaluated LLM agents compete in a shared market. Across six model families, this yields 1,200 model-level trajectories spanning 7,200 decision rounds. Under the observed service configuration, the leading model differs between ecologies: DeepSeek leads in Solo (252.29M mean valuation; mean rank 1.67), whereas Gemini leads in Arena (263.95M; 1.76). The two ecologies identify the same task-level winner on only 21 of 100 problems, and Gemini's bottom-rank rate falls from 22 % to 0 % in Arena. ERPBench supports paired evaluation of whether enterprise-agent rankings transfer across competitive market ecologies, supplemented by aggregate execution-intervention analysis. Code and benchmark resources are available in our https://github.com/GAIR-NLP/erp-bench.