Latency-Response Theory Model: Evaluating Large Language Models via Response Accuracy and Chain-of-Thought Length

📄 arXiv: 2512.07019 📥 PDF

作者: Zhiyu Xu, Jia Liu, Yixin Wang, Yuqi Gu

分类: stat.ME, cs.AI, stat.AP, stat.ML

发布日期: 2026-07-20


💡 一句话要点

提出LaRT模型以提升大语言模型评估的准确性与效率

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 大语言模型 评估方法 潜在反应理论 思维链长度 机器学习 自然语言处理 参数估计

📋 核心要点

  1. 现有的评估方法主要关注响应准确性,忽视了思维链长度这一重要指标,导致评估结果不够全面。
  2. LaRT模型通过引入潜在能力与潜在速度的相关性,联合考虑响应准确性和思维链长度,从而提升评估的全面性和准确性。
  3. 实验结果表明,LaRT在预测能力、项目效率、排名有效性等多个指标上均优于传统的IRT模型,提供了更为准确的LLM排名。

📝 摘要(中文)

随着大语言模型(LLMs)的广泛应用,迫切需要有效的评估方法来指导下游应用和未来改进。本文提出的潜在反应理论(LaRT)模型,通过引入潜在能力与潜在速度之间的相关参数,联合建模响应准确性和思维链长度(CoT),为LLMs的评估提供了新的视角。我们推导出高效的随机近似期望最大化算法用于参数估计,并通过理论分析和仿真实验验证了LaRT在估计准确性和置信区间方面的优势。实证结果显示,LaRT在多个关键评估指标上优于传统的IRT模型。

🔬 方法详解

问题定义:本文旨在解决现有大语言模型评估方法中对思维链长度的忽视,导致评估结果不够全面和准确的问题。现有的IRT模型主要关注响应准确性,未能充分利用思维链长度这一重要信息。

核心思路:LaRT模型通过引入潜在能力与潜在速度之间的相关参数,联合建模响应准确性和思维链长度,从而提升评估的全面性和准确性。这样的设计使得模型能够更好地反映LLMs的推理能力。

技术框架:LaRT模型的整体架构包括潜在能力和潜在速度的参数估计模块,以及基于随机近似的期望最大化算法。模型首先通过收集LLMs的响应数据进行训练,然后利用推导的算法进行参数估计。

关键创新:LaRT模型的主要创新在于引入了潜在能力与潜在速度之间的相关性参数,使得模型能够同时考虑响应准确性和思维链长度。这一创新与传统的IRT模型形成了本质区别,提升了评估的准确性。

关键设计:在参数设置上,LaRT模型采用了高效的随机近似期望最大化算法,确保了参数估计的统计有效性。此外,模型在损失函数设计上也进行了优化,以更好地适应联合建模的需求。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果显示,LaRT模型在多个关键评估指标上均优于传统的IRT模型,具体表现为在预测能力、项目效率和排名有效性等方面的显著提升。LaRT模型在LLM排名中展现出更高的准确性,提供了更短的置信区间,验证了其在实际应用中的有效性。

🎯 应用场景

该研究的潜在应用领域包括自然语言处理、教育评估和智能问答系统等。通过提供更为准确的评估方法,LaRT模型能够帮助开发者优化大语言模型的性能,进而提升实际应用中的用户体验和系统效率。未来,LaRT模型可能在多种智能系统中得到广泛应用,推动相关领域的进一步发展。

📄 摘要(原文)

The proliferation of Large Language Models (LLMs) necessitates valid evaluation methods to provide guidance for both downstream applications and actionable future improvements. The Item Response Theory (IRT) model with Computerized Adaptive Testing has recently emerged as a promising framework for evaluating LLMs via their response accuracy. Beyond simple response accuracy, LLMs' chain of thought (CoT) lengths serve as a vital indicator of their reasoning ability. To leverage the CoT length information to assist LLM evaluation, we propose the \textbf{La}tency-\textbf{R}esponse \textbf{T}heory (LaRT) model, which jointly models both the response accuracy and CoT length by introducing a key correlation parameter between the latent ability and the latent speed. We derive an efficient stochastic approximation Expectation-Maximization algorithm for parameter estimation. We establish rigorous identifiability results for the latent ability and latent speed parameters to ensure the statistical validity of their estimation. Through both theoretical asymptotic analyses and simulation studies, we demonstrate LaRT's advantages over IRT in terms of superior estimation accuracy and shorter confidence intervals for latent trait estimation. To evaluate LaRT in real data, we collect responses from diverse LLMs on popular benchmark datasets. We find that LaRT yields different LLM rankings than IRT and outperforms IRT across multiple key evaluation metrics including predictive power, item efficiency, ranking validity, and LLM evaluation efficiency. Code and data are available atthis https URL