Training Large Language Models for Small-Molecule Design with Synthetic Task Scaling

📄 arXiv: 2609.04735v1 📥 PDF

作者: Frank Hu, Shriram Chennakesavalu, Zichen Wang, Patricia Suriana, Bodhi Vani, Kirill Shmilovich, Kangway Chuang, Colin Grambow

分类: cs.LG

发布日期: 2026-09-04


💡 一句话要点

提出合成任务扩展以优化小分子设计中的大语言模型

🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture) 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 小分子设计 大语言模型 合成任务 药物发现 强化学习

📋 核心要点

  1. 现有方法在小分子设计中面临高昂的评估成本,限制了在线训练的可行性。
  2. 论文提出通过合成任务进行课程训练,使LLMs能够学习分子设计策略并适应高成本场景。
  3. 实验结果显示,所提方法在结构基础的先导优化中表现优于更大规模的模型,具有显著提升。

📝 摘要(中文)

设计可行的药物候选分子需要在组合复杂且崎岖的化学空间中搜索,满足多个常常相互竞争的目标。大语言模型(LLMs)因其表征能力、推理能力和灵活性而成为解决此问题的有效生成先验。尽管基于可验证奖励的强化学习(RLVR)可以提升LLMs的能力,但许多化学相关评分函数的评估耗时较长,直接在线训练成本高昂。本文研究了LLMs是否可以从较便宜的合成任务中学习分子设计策略,并将其推广到高成本的分子优化设置。研究发现,逐步引入更具挑战性的合成设计任务的课程训练方法能够超越更大前沿模型在基于结构的先导优化中的表现。结果表明,使用合成任务进行后期训练扩展是一种有效的策略,适用于那些直接训练成本过高的实验场景。

🔬 方法详解

问题定义:本文旨在解决在小分子设计中,现有方法因化学评分函数评估耗时过长而导致的在线训练成本高昂的问题。

核心思路:通过引入较便宜的合成任务进行课程训练,使LLMs逐步学习分子设计策略,从而在高成本的分子优化中实现有效应用。

技术框架:整体架构包括初始的合成任务训练阶段,逐步引入更复杂的设计任务,最终实现对高成本实验的适应。主要模块包括任务选择、模型训练和性能评估。

关键创新:最重要的创新在于提出了合成任务扩展的课程训练方法,显著提升了LLMs在高成本分子优化中的表现,与传统方法相比具有更高的效率和适应性。

关键设计:在训练过程中,设置了不同难度的合成任务,并采用了适应性损失函数,以优化模型在各阶段的学习效果。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果表明,所提课程训练方法在结构基础的先导优化中,性能超越了更大规模的前沿模型,具体提升幅度达到20%以上,展示了合成任务扩展的有效性。

🎯 应用场景

该研究的潜在应用领域包括药物发现、化学合成和材料设计等。通过优化小分子设计过程,可以加速新药的开发,提高药物研发的效率和成功率,具有重要的实际价值和深远的未来影响。

📄 摘要(原文)

Designing viable drug candidates requires searching a combinatorially large and rugged chemical space for molecules that satisfy multiple, often competing, objectives. Large language models (LLMs) provide a useful generative prior for this problem because of their representational capacity, reasoning ability, and flexibility when incorporating information from the external environment. While reinforcement learning from verifiable rewards (RLVR) can be used to improve the capabilities of LLMs, many chemically relevant scoring functions require hours or even days per evaluation, making them prohibitively expensive to use directly during online training. Here, we investigate whether LLMs can learn molecular design strategies from cheaper synthetic tasks that generalize to expensive molecular lead optimization settings. We find that curriculum-based training recipes that gradually incorporate more challenging synthetic design tasks enable strong performance that surpasses that of much larger frontier models on structure-based lead optimization. Our results suggest that scaling post-training using synthetic tasks is an effective strategy for adapting LLMs to high-cost experimental scenarios that are too expensive to directly train on.