Reality Monitoring in Large Language Models: Self-Knowledge That Transforms with Conversation Memory
作者: Saurabh Ranjan, Konstantina Sokratous, Brian Odegaard
分类: cs.AI, cs.CL, cs.CY, q-bio.NC
发布日期: 2026-07-27
💡 一句话要点
提出对话记忆结构优化以提升大语言模型的现实监控能力
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 对话系统 大语言模型 现实监控 源归属 记忆结构 多轮对话 人工智能
📋 核心要点
- 核心问题:现有对话AI无法有效区分自身生成内容与用户输入,导致错误信息被视为事实,影响对话质量。
- 方法要点:通过优化对话记忆结构,研究如何提升大语言模型的现实监控能力,确保其能准确识别信息来源。
- 实验或效果:实验结果显示,在不同记忆需求下,模型的源归属能力存在显著差异,揭示了内部与外部判断的复杂关系。
📝 摘要(中文)
一款无法区分自身输出与用户发言的对话AI会将自身错误视为用户提供的事实。人类的这一能力称为现实监控,其失败与幻觉、妄想和虚构有关,但大语言模型(LLMs)是否具备此能力尚未得到验证。通过两项实验和六种LLMs,我们发现源归属依赖于对话记忆的结构:在最低记忆需求下,自生成内容的准确性达到顶峰,但在情节延迟后则转为脆弱的外部项优势。反馈揭示了两种失败:在某些模型中,内部和外部判断互换;在其他模型中,准确性提高而信心与正确性脱钩,这种分离在现有基准中不可见。跨模型的这一模式表明,活跃的参数计数而非总计数是关键。这表明,随着AI系统承担自主的多轮角色,评估其知识的来源同样重要。
🔬 方法详解
问题定义:论文要解决的问题是大语言模型在对话中无法有效区分自身生成内容与用户输入,导致错误信息被误认为用户提供的事实。现有方法未能充分考虑对话记忆的结构对源归属的影响。
核心思路:论文提出通过优化对话记忆的结构来提升大语言模型的现实监控能力。具体而言,研究了在不同记忆需求下模型的源归属能力,旨在揭示模型在对话中如何处理自我生成与外部信息的关系。
技术框架:整体架构包括两个主要实验,分别测试六种不同的大语言模型。实验设计关注对话记忆的结构,评估在不同情境下模型的源归属能力。主要模块包括信息生成、记忆管理和源判断。
关键创新:最重要的技术创新点在于揭示了对话记忆结构对源归属能力的影响,特别是在情节延迟情况下,模型的表现出现了从自生成内容的优势转向外部项的脆弱优势。这一发现与现有方法的本质区别在于关注了记忆结构的动态变化。
关键设计:在实验中,设置了不同的记忆需求和反馈机制,以观察模型在源判断中的表现。关键参数包括记忆容量、反馈频率和模型的内部结构设计,这些都对模型的判断能力产生了显著影响。
🖼️ 关键图片
📊 实验亮点
实验结果表明,在最低记忆需求下,自生成内容的准确性达到顶峰,而在情节延迟后,模型的外部项优势显著增强。某些模型内部与外部判断互换,而其他模型则显示出准确性提高但信心与正确性脱钩的现象。这些发现揭示了模型在源归属判断中的复杂性,超越了现有基准的评估。
🎯 应用场景
该研究的潜在应用领域包括对话系统、虚拟助手和自动客服等场景。通过提升大语言模型的现实监控能力,可以显著提高对话的准确性和用户体验,减少误导性信息的传播。未来,这一研究可能推动更智能的AI系统在多轮对话中的应用,增强其自主性和可靠性。
📄 摘要(原文)
A conversational AI that cannot tell its own output from what a user said will treat its own mistakes as user-provided facts. In humans, this capacity is called reality monitoring, and its failures are linked to hallucinations, delusions, and confabulation, yet whether LLMs possess it remains untested. Here we show, across two experiments and six LLMs, that source attribution depends on how conversational memory is structured: ceiling accuracy for self-generated content under minimal memory demands reverses to a fragile external-item advantage once episodic delay removes that shortcut. Feedback exposes two failures: in some models, internal and external judgments swap; in others, accuracy improves while confidence decouples from correctness, dissociations invisible to existing benchmarks. Across models, this pattern implicates active, not aggregate, parameter count. This suggests that as AI systems take on autonomous, multi-turn roles, evaluating what they know is not enough: tracking where that knowledge came from may matter equally.