Chemical Chain-of-Thought Functions as a Hallucination-Prone Molecular Scratchpad

📄 arXiv: 2607.20935v1 📥 PDF

作者: Jiatong Li, Yuxuan Ren, Weida Wang, Xiaoyong Wei, Yatao Bian

分类: cs.CE, cs.CL

发布日期: 2026-07-23

备注: 16 pages, 6 figures


💡 一句话要点

提出化学链式思维函数以解决分子推理中的幻觉问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 化学推理 链式思维 幻觉现象 分子草稿 模型评估

📋 核心要点

  1. 现有的化学推理模型在生成答案时常常伴随虚构的结构声明,导致推理的可靠性受到质疑。
  2. 论文提出了化学链式思维(CoT)作为一种分子草稿,强调其在推理过程中的潜在功能和局限性。
  3. 实验结果显示,扰动模型的结构草图会显著影响生成质量,表明草图在推理中具有重要作用。

📝 摘要(中文)

化学推理语言模型期望通过可靠的链式思维(CoT)推导分子答案。然而,在四个推理模型家族和十二个化学任务中,幻觉现象普遍存在,且与答案的正确性大致脱钩:正确答案常常与缺乏相关分子的虚构结构声明共存。归因分析表明,模型特定形式中存在共享的草稿功能:Chem-R和ether-0依赖于碎片化的SMILES草图,而ChemDFM-R则强调骨架、位置和命名线索。值得注意的是,扰动Chem-R的SMILES草图会降低生成质量,表明结构草图即使在语言结构声明大多无效时也能起到因果负担的作用。这些结果表明,化学CoT既不是可靠的解释,也不仅仅是事后合理化,而是一个容易产生幻觉的分子草稿。这一发现提醒我们不要将CoT视为可靠推理的直接证据,并激励在过程层面进行监督,而不仅仅是答案评估。

🔬 方法详解

问题定义:本论文旨在解决化学推理模型在生成答案时出现的幻觉现象,现有方法在推理过程中常常伴随虚构的结构声明,影响了推理的可靠性和有效性。

核心思路:论文提出化学链式思维(CoT)作为一种分子草稿,强调其在推理过程中的重要性,并探讨其在不同模型中的表现差异。通过分析不同模型的草图功能,揭示了其在推理中的潜在作用。

技术框架:整体架构包括多个模块,首先是输入分子结构的解析,然后是生成链式思维的过程,最后是输出答案的生成。模型如Chem-R和ChemDFM-R在草图生成和推理过程中采用不同的策略,分别依赖于碎片化的SMILES草图和结构线索。

关键创新:最重要的技术创新在于揭示了化学CoT不仅是推理的工具,更是一个容易产生幻觉的分子草稿。与现有方法相比,强调了草图在推理中的因果作用。

关键设计:在模型设计中,采用了不同的损失函数和网络结构来优化草图生成过程,特别是Chem-R模型中,草图的扰动会直接影响生成质量,显示出草图在推理中的重要性。通过对比实验,验证了不同模型在草图生成上的表现差异。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果表明,扰动Chem-R模型的SMILES草图会显著降低生成质量,验证了草图在推理过程中的重要性。与基线模型相比,提出的方法在多个化学任务中展现出更好的推理能力,强调了过程监督的重要性。

🎯 应用场景

该研究的潜在应用领域包括化学信息学、药物发现和材料科学等。通过改进化学推理模型的可靠性,可以更好地支持分子设计和分析,提升科学研究的效率和准确性。未来,该研究可能推动更高级的化学推理工具的发展,促进跨学科的合作与创新。

📄 摘要(原文)

Chemical reasoning language models are expected to derive molecular answers through faithful chain-of-thought (CoT). However, across four reasoning model families and twelve chemistry tasks, hallucination is widespread and largely decoupled from answer correctness: correct answers often coexist with fabricated structural claims absent from the relevant molecules. Yet this does not make the reasoning trace computationally irrelevant. Attribution analyses suggest a shared scratchpad function expressed in model-specific forms: Chem-R and ether-0 rely on fragmented SMILES drafts, whereas ChemDFM-R emphasizes scaffold, positional, and naming cues. Notably, perturbing Chem-R's SMILES sketches degrades generation, showing that structural drafts can be causally load-bearing even when verbal structural claims are largely inert. Together, these results show that chemical CoT is neither a faithful explanation nor merely a post-hoc rationalization, but a hallucination-prone molecular scratchpad. This finding cautions against treating CoT as direct evidence of faithful reasoning and motivates process-level supervision beyond answer-only evaluation.