Canopy: A Heterograph Foundation Model for Metabolic Engineering
作者: Jake Bowden, Laurence Legon, Satnam Surae
分类: cs.LG
发布日期: 2026-07-07
备注: Accepted at ICML GenBio Workshop 2026 https://openreview.net/forum?id=H8bvgKoT7j
💡 一句话要点
提出Canopy以解决代谢工程中微生物菌株设计问题
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 代谢工程 异构图模型 知识图谱 图神经网络 多模态学习 自监督学习 生物数据整合
📋 核心要点
- 现有的代谢工程计算方法无法有效利用实验数据,导致微生物菌株设计的效率低下。
- Canopy通过构建一个包含多种生物数据的异构知识图谱,利用图神经网络进行特征学习,解决了现有方法的不足。
- 在发酵浓度预测任务中,Canopy的嵌入表现出R²=0.41,显著优于传统表格方法的R²=0.24。
📝 摘要(中文)
设计能够以商业可行的浓度生产高价值化学品的微生物菌株仍然是代谢工程中的一个核心挑战。现有的计算方法要么依赖于无法从实验数据学习的化学计量约束模型,要么应用于手工特征的表格机器学习,忽视了生物知识的关系结构。我们提出了Canopy,一个异构图基础模型,将十个公共和专有数据源整合为一个统一的知识图谱,涵盖了基因、蛋白质、代谢物、反应、途径、菌株和发酵实验等多达6.9百万个节点。节点特征通过领域特定的基础模型进行编码,形成单一图中的多模态表示。在发酵浓度预测的下游任务中,Canopy的嵌入表现优于表格基线和同质GNN变体。
🔬 方法详解
问题定义:本论文旨在解决代谢工程中微生物菌株设计的挑战,现有方法无法有效整合实验数据和生物知识,导致模型性能不足。
核心思路:提出Canopy,一个异构图基础模型,通过构建知识图谱整合多种生物数据,利用图神经网络学习节点特征,提升预测性能。
技术框架:Canopy的整体架构包括数据整合、节点特征编码、预训练Heterogeneous Graph Transformer(HGT)和下游任务的预测模块。节点特征通过ESM-2、MoLFormer和PubMedBERT等模型进行编码。
关键创新:Canopy的核心创新在于构建了一个包含6.9M节点的异构知识图谱,并通过多模态特征学习和自监督预训练方法显著提升了模型的表达能力。
关键设计:在模型设计中,使用了SignNet位置编码、Jumping Knowledge聚合和虚拟节点,结合四个自监督目标(链接预测、节点掩蔽建模、距离预测和对比实验聚类),并通过学习的同方差不确定性加权进行平衡。
🖼️ 关键图片
📊 实验亮点
Canopy在发酵浓度预测任务中,使用冻结的嵌入达到了R²=0.41,显著优于表格基线的最佳R²=0.24,并且在同质GNN变体中也表现出更好的性能,展示了其在代谢工程中的有效性。
🎯 应用场景
该研究的潜在应用领域包括生物工程、制药和合成生物学等,能够帮助研究人员更高效地设计和优化微生物菌株,以生产高价值化学品,推动相关产业的发展。未来,Canopy可能会扩展到其他生物数据整合和分析任务中。
📄 摘要(原文)
Designing microbial strains that produce high-value chemicals at commercially viable titers remains a central challenge in metabolic engineering. Existing computational approaches either rely on stoichiometric constraint-based models that cannot learn from experimental data, or apply tabular machine learning to hand-crafted features that discard the relational structure of biological knowledge. We present Canopy, a heterogeneous graph foundation model that integrates ten public and proprietary data sources into a unified knowledge graph (KG) of 6.9M nodes across 13 types and 34 edge types, covering genes, proteins, metabolites, reactions, pathways, strains, and fermentation experiments. Node features are encoded through domain-specific foundation models (ESM-2 for protein sequences, MoLFormer for chemical SMILES, and PubMedBERT for biomedical text), yielding a multi-modal representation within a single graph. We pretrain a Heterogeneous Graph Transformer (HGT) augmented with SignNet positional encodings, Jumping Knowledge aggregation, and virtual nodes using four self-supervised objectives (link prediction, masked node modelling, distance prediction, and contrastive experiment clustering), balanced via learned homoscedastic uncertainty weighting. On the downstream task of fermentation titer prediction, frozen Canopy embeddings achieve $R^{2} = 0.41$ with a lightweight probe, outperforming tabular baselines (best $R^{2} = 0.24$) and homogeneous GNN variants.