Learning Mechanistic Reasoning for Chemical Reactions with Large Language Models

📄 arXiv: 2607.12771v1 📥 PDF

作者: Xingyu Dang, Haocheng Tang, Junmei Wang, Yanjun Li

分类: cs.LG, cs.CE, cs.CL, q-bio.BM

发布日期: 2026-07-14


💡 一句话要点

提出大规模推理数据集以提升化学反应机制学习

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 化学反应机制 大型语言模型 推理数据集 FukuyamaBench 模型微调 层次推理 化学智能

📋 核心要点

  1. 现有化学LLMs主要关注粗粒度反应名称,导致物理不一致和幻觉,缺乏对反应机制的深入理解。
  2. 本文提出了一个新颖的大规模反应机制推理数据集,并建立了FukuyamaBench基准,以评估模型的层次机制推理能力。
  3. 经过微调的Qwen3-30B-A3B在FukuyamaBench Set~A上达到了8.3%的精确路径匹配,显著优于现有模型。

📝 摘要(中文)

反应机制是解释化学转化的逐步反应序列。学习机制逻辑对于增强大型语言模型(LLMs)的化学智能至关重要。然而,现有的化学LLMs主要关注粗粒度的反应名称,导致物理不一致和幻觉。相对而言,专门的小规模生成模型在机制推断上通常面临泛化能力受限的问题。为了解决这些问题,本文构建了一个新颖的大规模反应机制推理数据集,并建立了FukuyamaBench基准,以严格评估模型在层次机制推理上的表现。经过微调的Qwen3-30B-A3B在FukuyamaBench Set~A上达到了8.3%的精确路径匹配,超越了专门的FlowER模型(5.1%),证明机制感知训练显著提升了语言模型的化学推理能力。

🔬 方法详解

问题定义:本文旨在解决现有化学LLMs在反应机制推理中的不足,特别是粗粒度反应名称导致的物理不一致和幻觉问题。现有的小规模生成模型在泛化能力上也存在限制。

核心思路:通过构建一个大规模的反应机制推理数据集,结合层次化的推理框架,增强模型对化学反应机制的理解和推理能力。

技术框架:整体架构包括数据集构建、模型微调和性能评估三个主要模块。数据集提供了丰富的反应机制信息,模型微调则针对机制推理进行优化,最后通过FukuyamaBench进行严格评估。

关键创新:最重要的技术创新在于构建了一个大规模的反应机制推理数据集,并设计了FukuyamaBench基准,能够有效评估模型在层次机制推理上的能力,这与现有方法的粗粒度处理形成鲜明对比。

关键设计:在模型微调过程中,采用了特定的损失函数和网络结构,以确保模型能够有效学习反应机制的层次逻辑,具体参数设置和网络结构细节在论文中有详细描述。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

在FukuyamaBench Set~A上,微调后的Qwen3-30B-A3B模型达到了8.3%的精确路径匹配,显著高于专门的FlowER模型(5.1%),展示了机制感知训练对化学推理的显著提升。

🎯 应用场景

该研究的潜在应用领域包括化学合成、药物发现和材料科学等。通过提升语言模型在化学反应机制推理方面的能力,可以更好地支持化学研究和工业应用,推动智能化化学的进步。

📄 摘要(原文)

Reaction mechanisms consist of the step-by-step sequences of elementary reactions that explain chemical transformations. Learning the mechanism logic is therefore essential for enhancing the fundamental chemical intelligence of large language models (LLMs). The stepwise deduction of reaction mechanism aligns naturally with the reasoning paradigms of reasoning LLMs. However, current chemical LLMs primarily emphasize coarse-grained name reactions for product prediction and retrosynthesis, often leading to physical inconsistencies and hallucinations. In contrast, specialized small-scale generative models for mechanism inference typically suffer from restricted generalization capacity across diverse chemical spaces. To overcome these limitations, we built a novel, large-scale reasoning dataset of reaction mechanisms. Furthermore, we established the FukuyamaBench, a difficult benchmark derived from Fukuyama's Advanced Organic Reaction Mechanism book, to rigorously evaluate model performance on hierarchical mechanism reasoning. Our fine-tuned Qwen3-30B-A3B achieves 8.3% exact pathway match on FukuyamaBench Set~A, surpassing the specialized FlowER model (5.1%), demonstrating that mechanism-aware training substantially enhances chemical reasoning in language models.