From Symbolic Perception to Logical Deduction: A Framework for Guiding Language Models in Geometric Reasoning
作者: Weichen Dai, Rafael Medeiros Cabral, Ziyi Shou, Yan Cao, Xin Shen, Dongcai Lu, Yi Zhou
分类: cs.AI, cs.CL
发布日期: 2026-09-09
💡 一句话要点
提出一种框架以指导语言模型进行几何推理
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 几何推理 语言模型 符号推理 多模态模型 可解释性 教育技术 自动化推理
📋 核心要点
- 核心问题:现有的多模态模型在处理几何推理时计算复杂且缺乏透明性,导致推理结果难以解释。
- 方法要点:提出的框架结合几何视觉解析器与符号求解器,能够将图示转换为符号形式并进行形式推导。
- 实验或效果:实验结果显示,该方法在复杂几何问题上与Gemini 2.5 Pro的性能相当,且提供更清晰的解决方案。
📝 摘要(中文)
平面几何在人工智能领域仍然是一个重大挑战,要求视觉感知与数学推理的结合。尽管大型多模态模型(LMMs)能够自然处理视听语言输入,但它们通常计算密集且不透明。我们展示了一个纯语言模型(LLM)在配备专门模块后,能够在复杂几何问题上与最先进的LMMs相媲美。我们的框架整合了几何视觉解析器,将图示转换为符号形式,以及符号求解器进行形式推导,从而减轻幻觉现象并促进可解释推理。为了进行严格评估,我们策划了2025年中国中考的挑战性问题基准,确保数据的新颖性并测试更深层次的推理能力。实验表明,我们的方法在性能上可与Gemini 2.5 Pro相媲美,同时提供更清晰的人类化解决方案。
🔬 方法详解
问题定义:本论文旨在解决平面几何推理中的视觉感知与数学推理的结合问题。现有的多模态模型在处理此类问题时,往往计算复杂且结果不透明,导致推理过程难以理解。
核心思路:论文提出的框架通过将几何视觉解析器与符号求解器结合,能够有效地将图示信息转换为符号形式,并进行形式化推导,从而提高推理的可解释性和准确性。
技术框架:整体架构包括两个主要模块:几何视觉解析器负责将输入的图示转换为符号表示,符号求解器则对这些符号进行逻辑推导。该框架的设计旨在简化推理过程并减少幻觉现象。
关键创新:本研究的主要创新在于通过引入符号求解器,使得纯语言模型在几何推理任务中能够达到与大型多模态模型相媲美的性能,同时提升了推理的透明度和可解释性。
关键设计:在模型设计中,关键参数设置包括解析器与求解器的交互机制,以及损失函数的选择,以确保推导过程的准确性和有效性。
🖼️ 关键图片
📊 实验亮点
实验结果表明,所提出的方法在复杂几何问题上的表现与Gemini 2.5 Pro相当,且在推理的清晰度上具有显著优势,提供了更具人类化的解决方案。
🎯 应用场景
该研究的潜在应用领域包括教育、自动化推理系统及智能辅导工具。通过提高几何推理的准确性和可解释性,该框架能够帮助学生更好地理解几何概念,并为未来的智能教育系统奠定基础。
📄 摘要(原文)
Plane geometry remains a significant challenge in AI, requiring the integration of visual perception and mathematical reasoning. While Large Multimodal Models (LMMs) naturally handle visuo-linguistic inputs, they are often computationally intensive and opaque. We demonstrate that a pure Large Language Model (LLM), when equipped with specialized modules, can rival state-of-the-art LMMs on complex geometry problems. Our framework integrates a Geometric Vision Parser, which translates diagrams into symbolic form, with a Symbolic Solver that performs formal deductions, thereby mitigating hallucinations and promoting interpretable reasoning. To enable rigorous evaluation, we curate a benchmark of challenging problems from the 2025 Chinese Zhongkao examinations, ensuring data novelty and testing deeper deductive skills. Experiments demonstrate that our approach achieves performance comparable to Gemini 2.5 Pro while delivering clearer, human-like solutions.