Beyond Sally-Anne: Evaluating Theory of Mind in LLMs using Epistemic Schelling Points

📄 arXiv: 2607.11363v1 📥 PDF

作者: Roberta Rocca, Sami Boukortt, Geoff Keeling, Winnie Street

分类: cs.CL, cs.AI

发布日期: 2026-07-13


💡 一句话要点

提出EAST任务以评估LLMs的心智理论能力

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 心智理论 大型语言模型 社交推理 知识透明度 对话生成 评估方法

📋 核心要点

  1. 现有的心智理论评估方法如Sally-Anne任务,因模型预训练的影响而容易被操控,无法有效测试其在自然环境中的能力。
  2. 本文提出了EAST任务,通过双人对话游戏的形式,要求模型在不同知识透明度下独立达成语义协调,评估其ToM能力。
  3. 实验结果显示,只有少数前沿模型能够成功应对任务的知识需求,揭示了社会推理能力的显著差距,尤其是在知识追踪方面。

📝 摘要(中文)

在大型语言模型(LLMs)中,基于文本的心智理论(ToM)评估常常涉及类似于Sally-Anne任务的认知测试,这些测试因模型在预训练中接触过相关任务而容易被操控,且未能有效测试模型在自然环境中的功能性ToM能力。为了解决这些问题,本文引入了Epistemic Asymmetry Schelling Task(EAST),这是一种旨在基准化稳健且可推广的ToM能力的双人对话游戏。通过要求LLM-LLM对在不同的知识透明状态下独立收敛于语义Schelling点,我们评估模型是否能够稳健地应用ToM以实现协调。结果显示,功能性社会推理存在显著能力差距,只有前沿模型能够成功应对任务的不同知识需求。推理轨迹分析表明,协调失败主要由知识追踪错误引起,例如将私人知识与共同知识混淆。尽管在传统静态基准上表现良好,本研究表明稳健的社会推理和知识追踪仍然是关键瓶颈,为未来LLM的评估和发展提供了具体目标。

🔬 方法详解

问题定义:本文旨在解决现有心智理论评估方法的不足,尤其是它们在自然环境中的适用性和有效性。现有方法容易被操控,无法真实反映模型的功能性ToM能力。

核心思路:论文提出EAST任务,设计为双人对话游戏,要求模型在不同的知识透明状态下独立达成语义Schelling点,以此评估其稳健的ToM能力。这样的设计旨在模拟更复杂的社交推理场景。

技术框架:EAST任务的整体架构包括两个主要模块:模型对话生成和知识透明度管理。模型通过对话生成进行推理,同时在不同的知识透明度条件下进行协调。

关键创新:最重要的技术创新在于引入了知识透明度的变化,使得模型在面对不同的知识状态时能够进行有效的社交推理。这一设计与传统静态评估方法形成鲜明对比。

关键设计:在EAST任务中,模型的对话生成使用了特定的损失函数,以优化其在不同知识状态下的协调能力。关键参数设置包括对话轮数和知识透明度的具体值,这些都对模型的表现产生了重要影响。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果表明,只有前沿的语言模型能够成功应对EAST任务的知识透明度变化,显示出在功能性社会推理方面存在显著的能力差距。模型在传统静态基准上表现良好,但在动态社交推理中却面临挑战,强调了知识追踪的重要性。

🎯 应用场景

该研究的潜在应用领域包括社交机器人、智能助手和教育技术等,能够帮助这些系统更好地理解和预测人类行为,从而提升人机交互的自然性和有效性。未来,该方法也可能为其他领域的智能系统提供评估和改进的框架。

📄 摘要(原文)

Text-based evaluations of Theory of Mind (ToM) in Large Language Models (LLMs) often involve cognitive tests akin to the Sally-Anne task that can be gamed due to exposure to relevantly similar tasks in pre-training and do not obviously test models' functional ToM abilities in ways that generalize to naturalistic settings. To address these issues, we introduce the Epistemic Asymmetry Schelling Task (EAST), a two-player dialogue game designed to benchmark robust and generalizable ToM abilities. By requiring LLM-LLM dyads to independently converge on semantic Schelling points under varying states of epistemic transparency, we evaluate whether models can robustly apply ToM to achieve coordination. Our results reveal a significant capability gap in functional social reasoning, with only frontier models successfully navigating the varying epistemic demands of the tasks. Analysis of reasoning traces shows that coordination failures are primarily driven by epistemic tracking errors, such as conflating private knowledge with mutual knowledge. Despite high performance on traditional static benchmarks, our study shows that robust social reasoning and epistemic tracking remain a critical bottleneck, providing concrete targets for future LLM evaluation and development.