WuYu-EnvLE-Bench: A Benchmark for Evaluating Large Language Models in Environmental Law Enforcement
作者: Ziliang Yang, Yi Zhang, Kaijun Lin, Jiachao Ke, Haihong Xu, Zongguo Wen
分类: cs.AI
发布日期: 2026-07-20
备注: 98 pages, 45 figures,
💡 一句话要点
提出WuYu-EnvLE-Bench以评估环境执法中的大型语言模型
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 环境执法 大型语言模型 基准评估 证据推理 智能执法
📋 核心要点
- 现有大型语言模型在环境执法中的应用面临生成可追溯决策能力不足的挑战。
- 论文提出WuYu-EnvLE-Bench基准,涵盖真实案例和专家评审,评估LLMs在环境执法中的表现。
- 实验结果显示,LLMs在规则约束任务上表现良好,但在证据链和程序判断方面存在显著不足。
📝 摘要(中文)
大型语言模型(LLMs)在环境执法中的应用日益受到关注,但其生成可追溯执法决策的能力尚不明确。我们引入了WuYu-EnvLE-Bench,这是一个基于真实执法案例、监管标准和专家评审构建的基准。该基准包含2521个实例、14个任务和12个污染介质子领域,覆盖了预执法、执法和后执法工作流程。通过绝对环境执法评分(AES)和智能执法指数(IEI),我们评估了开源和闭源LLMs在能力、响应质量和资源效率方面的表现。结果表明,LLMs在规则约束任务上表现良好,但在证据链构建、矛盾检测、多源整合和程序判断方面仍不可靠。模型规模的扩大也显示出收益递减:中型模型在结构化任务上接近领先模型,而大型模型在证据推理瓶颈上并未可靠突破。WuYu-EnvLE-Bench强调了基于证据、规则意识和任务适应的执法推理的必要性。
🔬 方法详解
问题定义:论文要解决的问题是大型语言模型在环境执法中生成可追溯决策的能力不足,现有方法在证据链构建和程序判断等方面存在明显短板。
核心思路:论文的核心思路是构建WuYu-EnvLE-Bench基准,通过真实案例和专家评审来评估LLMs的能力,确保评估的全面性和准确性。
技术框架:整体架构包括数据收集、任务设计、模型评估和结果分析四个主要模块。数据收集阶段从真实执法案例中提取信息,任务设计阶段则涵盖多种环境执法相关任务。
关键创新:最重要的技术创新点在于引入了绝对环境执法评分(AES)和智能执法指数(IEI),为评估LLMs提供了新的标准和视角,与现有方法相比,强调了证据和规则的结合。
关键设计:在设计中,论文设置了多种任务类型,采用了不同的评估指标,并对模型的响应质量和资源效率进行了详细分析,确保评估结果的可靠性和有效性。
🖼️ 关键图片
📊 实验亮点
实验结果显示,LLMs在规则约束任务上的表现良好,绝对环境执法评分(AES)和智能执法指数(IEI)为评估提供了新的视角。然而,在证据链构建和程序判断方面,LLMs的表现仍显不足,尤其是大型模型未能有效突破推理瓶颈。
🎯 应用场景
该研究的潜在应用领域包括环境执法、政策制定和法律咨询等。通过评估大型语言模型在环境执法中的表现,可以为相关决策提供数据支持,提升执法效率和准确性,具有重要的实际价值和未来影响。
📄 摘要(原文)
Large language models (LLMs) are increasingly considered for environmental enforcement, but their ability to produce traceable enforcement decisions remains unclear. We introduce WuYu-EnvLE-Bench, a benchmark built from real enforcement cases, regulatory standards, and expert review. It contains 2,521 benchmark instances, 14 tasks, and 12 pollution-medium subdomains across pre-enforcement, in-enforcement, and post-enforcement workflows. Using Absolute Environmental Enforcement Score (AES) and Intelligent Enforcement Index (IEI), we evaluate open-source and closed-source LLMs across capability, response quality, and resource efficiency. Results show that LLMs perform well on rule-bounded tasks but remain unreliable in evidence-chain construction, contradiction detection, multi-source integration, and procedural judgment. Model scaling also shows diminishing returns: medium-sized models approach leading models in structured tasks, while larger models do not reliably overcome evidence-reasoning bottlenecks. WuYu-EnvLE-Bench highlights the need for evidence-grounded, rule-aware, and task-adaptive enforcement reasoning.