DrugCLIP: Contrastive Protein-Molecule Representation Learning for Virtual Screening

📄 arXiv: 2310.06367v1 📥 PDF

作者: Bowen Gao, Bo Qiang, Haichuan Tan, Minsi Ren, Yinjun Jia, Minsi Lu, Jingjing Liu, Weiying Ma, Yanyan Lan

分类: cs.LG

发布日期: 2023-10-10


💡 一句话要点

提出DrugCLIP以解决虚拟筛选中的高计算成本问题

🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture)

关键词: 虚拟筛选 对比学习 蛋白质-分子表示 药物发现 生物信息学 数据增强

📋 核心要点

  1. 现有的虚拟筛选方法如传统对接耗时长且只能使用有限的搜索库,限制了其应用。
  2. 本文提出DrugCLIP,通过对比学习将虚拟筛选视为密集检索任务,能够处理大量成对数据。
  3. 实验结果显示,DrugCLIP在多个虚拟筛选基准上显著优于传统方法,尤其在零样本设置下表现突出。

📝 摘要(中文)

虚拟筛选是从大量化合物数据库中识别潜在药物与特定蛋白质结合口袋的关键步骤。传统的对接方法耗时较长,且在实际应用中只能使用有限的搜索库。尽管最近的监督学习方法在结合亲和力预测方面表现出色,但由于对有限的可靠结合亲和力标签数据的强依赖,尚未超越对接方法。本文提出了一种新颖的对比学习框架DrugCLIP,通过将虚拟筛选重新定义为密集检索任务,利用对比学习对来自大量成对数据的结合蛋白质口袋和分子的表示进行对齐,而无需显式的结合亲和力评分。我们还引入了一种受生物知识启发的数据增强策略,以学习更好的蛋白质-分子表示。大量实验表明,DrugCLIP在多样的虚拟筛选基准上显著优于传统对接和监督学习方法,尤其在零样本设置下计算时间大幅减少。

🔬 方法详解

问题定义:本文旨在解决传统虚拟筛选方法在计算时间和搜索库限制方面的不足。现有的对接方法耗时较长,且依赖于有限的高质量数据,导致在实际应用中的局限性。

核心思路:论文提出的DrugCLIP框架通过对比学习将虚拟筛选重新定义为密集检索任务,能够有效对齐蛋白质口袋与分子的表示,从而减少对显式结合亲和力评分的依赖。

技术框架:DrugCLIP的整体架构包括数据预处理、对比学习模块和生物知识驱动的数据增强策略。数据预处理阶段将大量成对数据进行整理,随后通过对比学习模块进行表示对齐,最后利用数据增强策略提升模型的泛化能力。

关键创新:DrugCLIP的主要创新在于将虚拟筛选任务转化为密集检索问题,并通过对比学习实现蛋白质与分子的有效表示对齐。这一方法与传统的依赖于评分函数的监督学习方法本质上不同,能够更好地利用无标签数据。

关键设计:在模型设计中,DrugCLIP采用了特定的损失函数以优化对比学习过程,并结合生物知识进行数据增强,提升了模型在不同虚拟筛选任务中的表现。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果表明,DrugCLIP在多个虚拟筛选基准上显著优于传统对接方法和监督学习方法,尤其在零样本设置下,计算时间减少了显著比例,提升幅度达到XX%(具体数据未知)。

🎯 应用场景

DrugCLIP的研究成果在药物发现领域具有广泛的应用潜力,尤其是在虚拟筛选阶段。通过提高筛选效率和准确性,该方法能够加速新药的研发过程,降低研发成本。此外,DrugCLIP的框架也可扩展至其他生物信息学任务,如蛋白质-配体相互作用预测等。

📄 摘要(原文)

Virtual screening, which identifies potential drugs from vast compound databases to bind with a particular protein pocket, is a critical step in AI-assisted drug discovery. Traditional docking methods are highly time-consuming, and can only work with a restricted search library in real-life applications. Recent supervised learning approaches using scoring functions for binding-affinity prediction, although promising, have not yet surpassed docking methods due to their strong dependency on limited data with reliable binding-affinity labels. In this paper, we propose a novel contrastive learning framework, DrugCLIP, by reformulating virtual screening as a dense retrieval task and employing contrastive learning to align representations of binding protein pockets and molecules from a large quantity of pairwise data without explicit binding-affinity scores. We also introduce a biological-knowledge inspired data augmentation strategy to learn better protein-molecule representations. Extensive experiments show that DrugCLIP significantly outperforms traditional docking and supervised learning methods on diverse virtual screening benchmarks with highly reduced computation time, especially in zero-shot setting.