Human Grounded Evaluation of Large Language Models for Optical Network Automation

📄 arXiv: 2607.18068v1 📥 PDF

作者: Kiarash Rezaei, Omran Ayoub, Paolo Monti, Carlos Natalino

分类: cs.NI, cs.AI

发布日期: 2026-07-20


💡 一句话要点

提出HuGLEN以解决光网络自动化中的LLM评估问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 大型语言模型 光网络自动化 可解释人工智能 质量效率评分 模型评估 自动化运维

📋 核心要点

  1. 现有方法在评估不同LLM的输出质量和推理成本时缺乏可扩展性和一致性,导致选择困难。
  2. HuGLEN通过结合LLM作为评判者和专家评分,提供了一种可重复的评估流程,优化了LLM的选择。
  3. 实验结果显示,12B参数的中型LLM在质量效率评分上表现最佳,显著提升了解释质量与效率的平衡。

📝 摘要(中文)

大型语言模型(LLMs)在网络自动化中的应用日益增加,但不同LLM家族的输出质量和推理成本差异显著。本文提出了HuGLEN,一个逐步评估管道,利用LLM作为评判者和少量专家评分,实现候选LLM的可扩展和可重复比较,并通过质量效率评分(QES)对其进行排名。我们展示了HuGLEN在将可解释人工智能(XAI)模型的光网络传输质量(QoT)估计任务输出转化为操作员友好解释中的应用。结果表明,中型LLM(12B参数)获得了最高的QES,表明其在解释质量和效率之间的最佳权衡。总体而言,HuGLEN降低了人工标注负担,同时支持面向操作员的自动化任务的一致模型选择。

🔬 方法详解

问题定义:本文旨在解决在光网络自动化中评估大型语言模型(LLM)输出质量和推理成本的困难。现有方法缺乏可扩展性和一致性,导致操作员在选择合适的LLM时面临挑战。

核心思路:HuGLEN的核心思想是利用LLM作为评判者,结合少量专家评分,构建一个逐步评估管道,以实现候选LLM的可扩展和可重复比较。通过引入质量效率评分(QES),可以有效地对不同模型进行排名。

技术框架:HuGLEN的整体架构包括数据收集、模型输出生成、专家评分和LLM评判四个主要模块。首先收集光网络相关数据,然后生成模型输出,接着由专家进行评分,最后通过LLM进行评判和排名。

关键创新:HuGLEN的主要创新在于将LLM作为评判者的设计,使得评估过程更加自动化和高效。这一方法与传统的人工评分方法相比,显著降低了人工标注的负担,并提高了评估的一致性。

关键设计:在HuGLEN中,设置了适当的评分标准和损失函数,以确保LLM的评判结果与专家评分尽可能一致。此外,选择了中型LLM(12B参数)作为评判者,以实现最佳的质量效率评分。该设计确保了在解释质量和效率之间的最佳平衡。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果表明,使用HuGLEN评估的中型LLM(12B参数)在质量效率评分(QES)上达到了最高值,显示出在解释质量与效率之间的最佳权衡。这一结果显著优于其他候选模型,表明HuGLEN在模型选择中的有效性。

🎯 应用场景

该研究的潜在应用领域包括光网络管理、自动化运维和智能网络优化等。通过提供高效的LLM评估工具,HuGLEN能够帮助网络运营商更好地选择和应用适合的模型,从而提升网络服务质量和运营效率。未来,HuGLEN的框架也可以扩展到其他领域的模型评估中,具有广泛的实际价值。

📄 摘要(原文)

Large language models (LLMs) are increasingly adopted for network automation, yet their output quality and inference cost can vary substantially across LLM families. We present HuGLEN, a stepwise evaluation pipeline that uses an LLM-as-a-judge together with a small set of expert ratings to enable scalable and reproducible comparison of candidate LLMs, and to rank them using a quality efficiency score (QES). We demonstrate HuGLEN for translating outputs from an explainable artificial intelligence (XAI) model for the optical network quality of transmission (QoT) estimation task into operator-friendly explanations. Our results show that a medium-sized LLM (12B parameters) achieves the highest QES, indicating the best trade-off between explanation quality and efficiency. Overall, HuGLEN reduces the human-labeling burden while supporting consistent model selection for operator-facing automation tasks.