Do Reasoning Representations Help Humans Evaluate LLM Outputs?

📄 arXiv: 2609.09038v1 📥 PDF

作者: Jaewoo Lim, Sungbok Shin, Sanghyun Hong

分类: cs.LG, cs.HC

发布日期: 2026-09-08

备注: 19 pages. EMNLP 2026 (Findings)


💡 一句话要点

研究推理表示以改善人类对大型语言模型输出的评估

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 推理表示 大型语言模型 人类评估 信任校准 可解释性 错误检测 结构理解

📋 核心要点

  1. 现有推理表示通常以模型为中心进行评估,缺乏对人类评估能力的直接支持。
  2. 本研究将推理表示视为人类接口,通过控制实验研究不同推理格式的有效性。
  3. 实验结果表明,参与者偏好复杂的表示形式,但简单的链式思维更有助于信任和可解释性。

📝 摘要(中文)

推理表示越来越多地被用作大型语言模型输出的解释。然而,它们通常以模型中心的标准进行评估,如答案准确性和可信度,这使得人们不清楚它们是否帮助评估模型响应。本研究将推理表示视为面向人类的接口,而非模型推理能力的代理。我们通过一个基于网络的框架,对六种推理格式进行控制实验,涵盖不同复杂度的任务,收集结构理解、错误检测和定位、信任校准的细致判断。研究显示,参与者偏好基于规划和分解的表示,但更简单的思维链追踪更好地支持验证、信任和可解释性。偏好的表示也引入了校准风险,导致对正确追踪的误报增多,尽管信任度高但验证意愿低。

🔬 方法详解

问题定义:本研究旨在解决推理表示在帮助人类评估大型语言模型输出方面的有效性问题。现有方法主要集中在模型的准确性和可信度,缺乏对人类用户的关注。

核心思路:本研究通过控制实验,探讨六种不同推理格式在不同复杂度任务中的表现,旨在评估这些表示如何影响人类的理解和信任。

技术框架:研究采用基于网络的框架,随机化任务领域、问题实例和表示顺序,收集参与者对结构理解、错误检测和信任校准的细致判断。

关键创新:本研究的创新在于将推理表示视为人类评估的工具,而非仅仅是模型推理能力的代理,揭示了人类偏好与评估支持之间的差异。

关键设计:实验设计中,采用了多种推理格式,包括规划和分解方法,并对参与者的反馈进行了细致分析,以评估不同表示对信任和可解释性的影响。

🖼️ 关键图片

fig_0
fig_1

📊 实验亮点

实验结果显示,参与者对基于规划和分解的推理表示偏好明显,但简单的链式思维在验证和信任方面表现更佳。尽管偏好的表示形式提高了参与者的信任度,但也导致了对正确输出的误报增加,验证意愿显著降低。

🎯 应用场景

该研究的潜在应用场景包括教育、人工智能助手和决策支持系统等领域。通过改善人类对模型输出的理解和信任,可以提升这些系统的用户体验和实用性,促进更广泛的应用。未来,研究结果可能推动推理表示的标准化和优化,从而更好地服务于人类用户。

📄 摘要(原文)

Reasoning representations are increasingly used as explanations for large language model outputs. Yet they are typically evaluated with model-centric criteria, such as answer accuracy and faithfulness, leaving it unclear whether they help people evaluate model responses. In this work, we study reasoning representations as human-facing interfaces rather than proxies for model reasoning ability. We conduct a controlled human study of six reasoning formats across tasks of varying complexity, supported by a web-based framework that randomizes task domains, problem instances, and representation order. The study collects fine-grained judgments of structural understanding, error detection and localization, and trust calibration. Our study shows a mismatch between perceived preference and support for human evaluation. Participants prefer planning- and decomposition-based representations, but simpler chain-of-thought traces better support verification, trust, and interpretability. Preferred representations also introduce calibration risks, with more false alarms on correct traces and high trust despite low willingness to verify.