Reading Books is Great, But Not if You Are Driving! Visually Grounded Reasoning about Defeasible Commonsense Norms
作者: Seungju Han, Junhyeok Kim, Jack Hessel, Liwei Jiang, Jiwan Chung, Yejin Son, Yejin Choi, Youngjae Yu
分类: cs.LG, cs.AI
发布日期: 2023-10-16 (更新: 2023-11-11)
备注: Published as a conference paper at EMNLP 2023 (long)
💡 一句话要点
提出NORMLENS以解决视觉基础的常识推理问题
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 视觉推理 常识规范 多模态学习 社会常识 模型对齐
📋 核心要点
- 核心问题:现有模型在视觉基础的常识推理中,无法有效对齐人类的判断和解释,表现出明显的不足。
- 方法要点:本文提出的NORMLENS基准,通过多模态数据和人类解释,帮助模型更好地理解和推理常识规范。
- 实验或效果:实验结果显示,现有模型的判断与人类标注不一致,且通过新方法对齐后,模型表现有所提升。
📝 摘要(中文)
常识规范在不同上下文中是可推翻的:阅读书籍通常是好的,但在驾驶时则不然。虽然上下文可以用语言明确描述,但在具身场景中,上下文通常是通过视觉提供的。这种关于可推翻常识规范的视觉基础推理对人类来说相对简单,但对机器则构成挑战,因为它需要视觉理解和常识推理。为此,本文构建了一个新的多模态基准NORMLENS,包含10K人类判断及自由形式解释,涵盖2K多模态情境,旨在探讨模型与人类判断的对齐程度及模型解释其判断的能力。研究发现,现有模型的判断与人类标注不够一致,并提出了一种通过从大型语言模型中提炼社会常识知识来更好地对齐模型与人类的新方法。
🔬 方法详解
问题定义:本文旨在解决机器在视觉基础的常识推理中,如何有效理解和应用可推翻的常识规范的问题。现有方法在处理多模态情境时,常常无法准确反映人类的判断和解释,导致模型性能不足。
核心思路:论文提出通过构建NORMLENS基准,结合人类的判断和解释,来训练模型更好地理解上下文和常识规范。通过从大型语言模型中提炼社会常识知识,增强模型的推理能力。
技术框架:整体架构包括数据收集、模型训练和评估三个主要阶段。首先,收集包含人类判断和解释的多模态数据;其次,利用这些数据训练模型;最后,通过与人类标注进行对比,评估模型的表现。
关键创新:最重要的技术创新在于提出了NORMLENS基准和从大型语言模型中提炼社会常识知识的方法,这与现有方法的主要区别在于更好地结合了视觉信息和人类的常识推理。
关键设计:在模型训练中,采用了特定的损失函数来优化模型的判断与人类标注的一致性,同时设计了多层次的网络结构,以增强模型对多模态信息的处理能力。具体参数设置和网络结构细节在论文中有详细说明。
🖼️ 关键图片
📊 实验亮点
实验结果表明,现有最先进模型的判断与人类标注的对齐度较低,且在引入新方法后,模型的判断准确性有所提升,具体提升幅度和性能数据在论文中有详细列出,显示出该方法的有效性。
🎯 应用场景
该研究的潜在应用领域包括自动驾驶、智能助手和人机交互等场景。在这些领域,机器需要理解复杂的上下文信息并做出合理的判断,从而提升用户体验和安全性。未来,该研究可能推动更智能的系统开发,使其能够更好地理解和适应人类的常识行为。
📄 摘要(原文)
Commonsense norms are defeasible by context: reading books is usually great, but not when driving a car. While contexts can be explicitly described in language, in embodied scenarios, contexts are often provided visually. This type of visually grounded reasoning about defeasible commonsense norms is generally easy for humans, but (as we show) poses a challenge for machines, as it necessitates both visual understanding and reasoning about commonsense norms. We construct a new multimodal benchmark for studying visual-grounded commonsense norms: NORMLENS. NORMLENS consists of 10K human judgments accompanied by free-form explanations covering 2K multimodal situations, and serves as a probe to address two questions: (1) to what extent can models align with average human judgment? and (2) how well can models explain their predicted judgments? We find that state-of-the-art model judgments and explanations are not well-aligned with human annotation. Additionally, we present a new approach to better align models with humans by distilling social commonsense knowledge from large language models. The data and code are released at https://seungjuhan.me/normlens.