FANToM: A Benchmark for Stress-testing Machine Theory of Mind in Interactions

📄 arXiv: 2310.15421v3 📥 PDF

作者: Hyunwoo Kim, Melanie Sclar, Xuhui Zhou, Ronan Le Bras, Gunhee Kim, Yejin Choi, Maarten Sap

分类: cs.CL, cs.AI

发布日期: 2023-10-24 (更新: 2023-10-31)

备注: EMNLP 2023. Code and dataset can be found here: https://hyunw.kim/fantom


💡 一句话要点

提出FANToM基准以测试机器的心智理论能力

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 心智理论 对话系统 大型语言模型 推理能力 信息不对称 基准测试 自然语言处理

📋 核心要点

  1. 现有的心智理论评估方法主要依赖被动叙事,缺乏互动性,无法真实反映模型的推理能力。
  2. FANToM基准通过设计多种问题,要求模型在信息不对称的对话中进行推理,从而有效测试其心智理论能力。
  3. 实验结果显示,当前最先进的LLMs在FANToM基准上的表现显著低于人类,揭示了其在心智理论推理方面的不足。

📝 摘要(中文)

心智理论(ToM)评估目前主要集中在使用被动叙事来测试模型,这种方法缺乏互动性。我们引入FANToM,一个旨在通过问答在信息不对称的对话环境中压力测试ToM的新基准。该基准基于心理学的重要理论要求和评估大型语言模型(LLMs)时所需的实证考虑。我们设计了多种类型的问题,要求相同的推理能力,以识别LLMs中虚幻或错误的ToM能力。结果表明,FANToM对当前最先进的LLMs具有挑战性,即使在链式推理或微调的情况下,其表现仍显著低于人类。

🔬 方法详解

问题定义:论文旨在解决现有心智理论评估方法的不足,特别是缺乏互动性的问题。现有方法无法有效测试模型在动态对话中的推理能力。

核心思路:FANToM基准通过设计多种类型的问题,要求模型在信息不对称的对话中进行推理,从而揭示其心智理论能力的真实水平。

技术框架:整体架构包括问题设计、模型评估和结果分析三个主要模块。问题设计阶段涉及多种推理类型的构建,模型评估阶段则通过对比人类和模型的回答进行性能分析。

关键创新:FANToM的最大创新在于其设计的互动性问题,这些问题能够有效识别模型的虚假心智理论能力,与传统的被动叙事评估方法形成鲜明对比。

关键设计:在问题设计中,采用了多种推理类型,确保每个问题都要求相同的推理能力。此外,评估过程中使用了链式推理和微调技术,以测试模型在不同条件下的表现。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果表明,当前最先进的LLMs在FANToM基准上的表现显著低于人类,尤其是在链式推理和微调的情况下,模型的推理能力仍然存在明显不足。这一发现强调了心智理论能力在对话系统中的重要性。

🎯 应用场景

该研究的潜在应用领域包括自然语言处理、对话系统和人机交互等。通过更准确地评估模型的心智理论能力,FANToM可以帮助开发更智能的对话系统,提升人机交互的自然性和有效性。未来,该基准可能成为评估大型语言模型的重要标准,推动相关技术的发展。

📄 摘要(原文)

Theory of mind (ToM) evaluations currently focus on testing models using passive narratives that inherently lack interactivity. We introduce FANToM, a new benchmark designed to stress-test ToM within information-asymmetric conversational contexts via question answering. Our benchmark draws upon important theoretical requisites from psychology and necessary empirical considerations when evaluating large language models (LLMs). In particular, we formulate multiple types of questions that demand the same underlying reasoning to identify illusory or false sense of ToM capabilities in LLMs. We show that FANToM is challenging for state-of-the-art LLMs, which perform significantly worse than humans even with chain-of-thought reasoning or fine-tuning.