Nature Biomedical Engineering IF=26.8 | LyMOI:深度学习 + 大语言模型解锁组学机制解析新范式
引言
组学技术虽能全景式描绘细胞分子图谱,但其海量数据的解读长期面临一个核心瓶颈:传统方法多依赖统计显著性,难以深入揭示背后的生物学机制和因果关系。这导致从数据到机理的转化效率低下,大量潜在调控因子和通路关联被埋没。
近日,发表于《Nature Biomedical Engineering》的一项研究带来了突破。华中科技大学等团队开发了一个名为LyMOI的深度学习与大语言模型混合工作流。它不仅能从1.3TB多组学数据中高精度预测关键调控分子,更能借助大模型的“思维链”进行机理推理,成功发现了自噬过程的新调控因子,并指导了癌症联合治疗新策略的发现。
基本信息
• 文章标题:A deep learning and large language hybrid workflow for omics interpretation
• 期刊:Nature Biomedical Engineering
• 影响因子:26.8
• 发表时间:2025年10月24日
• 研究单位:华中科技大学(生命科学与技术学院、同济医学院附属同济医院)、北京理工大学、四川大学、澳门大学等
• 数据集:整合了来自人类、小鼠、大鼠和酵母四种真核生物在34种自噬调控条件下的转录组、蛋白质组和磷酸化蛋白质组数据,总计约1.3 TB。此外,构建了一个包含562个真核生物物种、1,093,931个蛋白质之间187,985,327个相互作用或同源关系的大型知识图谱。
• Github地址:https://github.com/BioCUCKOO/LyMOI
• 论文地址:https://doi.org/10.1038/s41551-025-01576-5
研究内容与方法
LyMOI框架:大语言模型与图学习结合的多组学解释方法
1. Prompt工程:降低LLM幻觉的双提示策略
- 零样本提示(Zero-shot Prompting)
- 设计逻辑:先查询基因/蛋白的基础功能,再评估其参与目标生物学过程的置信度(0-9分),通过功能前置查询减少LLM幻觉
- 模板示例:
"Can you tell me the function of the protein {protein_full_name} of {species}? Does the protein {protein_name} involve in {biological_process}? Please use 0-9 to indicate possibilities." - 核心代码片段:
def zero_shot_prompt(protein_name, species, biological_process): prompt = f"Can you tell me the function of the protein {protein_name} of {species}? Does the protein {protein_name} involve in {biological_process}? Please use 0-9 to indicate possibilities." response = openai.ChatCompletion.create( model="gpt-3.5-turbo", messages=[{"role": "user", "content": prompt}] ) return response.choices[0].message['content']
- 思维链提示(Chain-of-Thought, CoT Prompting)
- 设计逻辑:先获取分子功能信息,再引导LLM输出人类可理解的推理链条,推导分子间调控关系
- 模板示例:
"Can you tell me the function of {geneA} and {geneB}? Both are involved in {biological_process}. Do these two genes have any known interactions or relationships with each other? Based on your all available biological knowledge, could you help me reason about the regulatory relationship between {geneA} and {geneB}? Please tell me the chain of thought for reasoning the regulatory relationship between these two genes?" - 核心代码片段:
def cot_prompt(geneA, geneB, biological_process): prompt = f"Can you tell me the function of {geneA} and {geneB}? Both are involved in {biological_process}. Do these two genes have any known interactions or relationships with each other? Based on your all available biological knowledge, could you help me reason about the regulatory relationship between {geneA} and {geneB}? Please tell me the chain of thought for reasoning the regulatory relationship between these two genes?" response = openai.ChatCompletion.create( model="gpt-3.5-turbo", messages=[{"role": "user", "content": prompt}] ) return response.choices[0].message['content']

2. 多组学与PPI特征编码:结构化分子特征构建
- 多组学特征归一化
- 处理逻辑:对转录组(FPKM)、蛋白组(表达强度)、磷酸化组(位点强度求和)数据进行z-score归一化,多时间点样本取均值作为最终表达值
- 特征向量定义:
Vmrna=Normalized FPKM[FPKMcondition1,FPKMcondition2,...]V_{mrna} = \text{Normalized FPKM}[FPKM_{condition1}, FPKM_{condition2}, ...]Vmrna=Normalized FPKM[FPKMcondition1,FPKMcondition2,...]
Vprotein=Normalized Intensity[Intensitycondition1,Intensitycondition2,...]V_{protein} = \text{Normalized Intensity}[Intensity_{condition1}, Intensity_{condition2}, ...]Vprotein=Normalized Intensity[Intensitycondition1,Intensitycondition2,...]
Vphoprotein=Normalized Intensity[Intensitycondition1,Intensitycondition2,...]V_{phoprotein} = \text{Normalized Intensity}[Intensity_{condition1}, Intensity_{condition2}, ...]Vphoprotein=Normalized Intensity[Intensitycondition1,Intensitycondition2,...] - 跨物种特征收敛:通过同源基因映射,将小鼠、大鼠、酵母的特征对齐到人类同源基因,缺失值补0
- 核心代码片段:
def normalize_omics_data(omics_df): if 'FPKM' in omics_df.columns: omics_df['normalized_FPKM'] = (omics_df['FPKM'] - omics_df['FPKM'].mean()) / omics_df['FPKM'].std() if 'Intensity' in omics_df.columns: omics_df['normalized_Intensity'] = (omics_df['Intensity'] - omics_df['Intensity'].mean()) / omics_df['Intensity'].std() return omics_df
- PPI特征编码
- 处理逻辑:统计每个基因在THANATOS数据库1810个自噬调控基因中的近邻数量,通过Sigmoid函数转换为0-1区间的特征值
- 公式:
VPPI=Sigmoid(Number[Genebenchmark])V_{PPI} = \text{Sigmoid}(\text{Number}[Gene_{benchmark}])VPPI=Sigmoid(Number[Genebenchmark]),其中Sigmoid(x)=11+e−x\text{Sigmoid}(x) = \frac{1}{1+e^{-x}}Sigmoid(x)=1+e−x1 - 核心代码片段:
def sigmoid(x): return 1 / (1 + np.exp(-x)) def encode_ppi_feature(gene_neighbor_count): return sigmoid(gene_neighbor_count)
- 最终特征融合:拼接多组学特征与PPI特征,得到每个分子的输入特征向量Vfeature=Molecule[Vomics,VPPI]V_{feature} = \text{Molecule}[V_{omics}, V_{PPI}]Vfeature=Molecule[Vomics,VPPI]
3. LyMOI核心架构:跨物种图学习与分层模型训练
【LyMOI整体架构示意图】
-
3.1 跨物种图构建与GCN预训练
- 图构建流程
- 收集562个真核生物的完整蛋白质组,通过双向最佳命中(RBH)方法鉴定物种间同源基因
- 整合7个公共PPI数据库的2,813,799条PPI关系,构建包含1,093,931个节点(蛋白)和187,985,327条边(同源关系/PPIs)的跨物种知识图
- 核心代码片段:
def build_cross_species_graph(ortholog_pairs, ppi_data): G = nx.Graph() all_proteins = set([p for pair in ortholog_pairs for p in pair] + list(ppi_data['protein1']) + list(ppi_data['protein2'])) G.add_nodes_from(all_proteins) # 添加同源关系边 for p1, p2 in ortholog_pairs: G.add_edge(p1, p2, type='ortholog') # 添加PPI关系边 for _, row in ppi_data.iterrows(): G.add_edge(row['protein1'], row['protein2'], type='ppi') return G - GCN预训练
- 模型结构:5层图卷积网络(GCNConv),输入层维度50,隐藏层100,输出层2
- 训练逻辑:以整合12个数据库的6502个细胞死亡/自噬调控基因为正样本,其余基因为负样本,预训练图模型学习节点嵌入
- 核心代码片段:
def pretrain_gcn(G, node_features, labels): data = from_networkx(G) data.x = torch.tensor(node_features, dtype=torch.float) data.y = torch.tensor(labels, dtype=torch.long) model = GCN(data.num_node_features, 100, 2) optimizer = torch.optim.Adam(model.parameters(), lr=0.01) criterion = torch.nn.CrossEntropyLoss() for epoch in range(100): model.train() optimizer.zero_grad() out = model(data.x, data.edge_index) loss = criterion(out[data.train_mask], data.y[data.train_mask]) loss.backward() optimizer.step() return model
- 图构建流程
-
3.2 教师模型构建与训练
- 子图提取:从跨物种图中提取人、小鼠、大鼠、酵母的子图,包含34,905个节点和1,774,552条边
- 特征嵌入:将多组学与PPI特征嵌入子图节点,通过消息传递更新节点特征
- 模型结构:5层前馈神经网络(1输入层+3隐藏层+1输出层),继承预训练GCN的初始化参数
- 训练数据:以THANATOS数据库的1810个自噬调控基因为主正样本,LLM解释的302个基因为副正样本
- 核心代码片段:
def train_teacher_model(subgraph, node_features, primary_labels, secondary_labels): data = from_networkx(subgraph) data.x = torch.tensor(node_features, dtype=torch.float) combined_labels = torch.tensor([1 if p or s else 0 for p, s in zip(primary_labels, secondary_labels)], dtype=torch.float) model = nn.Sequential( nn.Linear(data.num_node_features, 256), nn.ReLU(), nn.Linear(256, 128), nn.ReLU(), nn.Linear(128, 64), nn.ReLU(), nn.Linear(64, 1), nn.Sigmoid() ) # 继承预训练GCN参数 pretrained_weights = torch.load('pretrained_gcn.pth') model[0].weight.data = pretrained_weights['conv1.weight'][:256, :] optimizer = torch.optim.Adam(model.parameters(), lr=0.001) criterion = nn.BCELoss() for epoch in range(50): model.train() optimizer.zero_grad() out = model(data.x) loss = criterion(out.squeeze(), combined_labels) loss.backward() optimizer.step() return model
-
3.3 学生模型训练:条件特异性调控因子预测
- 分层训练逻辑:继承教师模型的初始化参数,针对34种自噬诱导条件分别训练独立的学生模型
- 训练数据:以该条件下文献 curated的功能基因为正样本,同时加入教师模型的1810个自噬调控基因作为通用正样本
- 模型优化:通过4折交叉验证选择最优参数,输出层通过Sigmoid函数计算基因参与目标过程的概率,以特异性95%为阈值筛选候选分子
- 核心代码片段:
def train_student_model(teacher_model, condition_node_features, condition_labels, teacher_labels): student_model = copy.deepcopy(teacher_model) combined_labels = torch.tensor([1 if c or t else 0 for c, t in zip(condition_labels, teacher_labels)], dtype=torch.float) optimizer = torch.optim.Adam(student_model.parameters(), lr=0.0005) criterion = nn.BCELoss() for epoch in range(30): student_model.train() optimizer.zero_grad() out = student_model(condition_node_features) loss = criterion(out.squeeze(), combined_labels) loss.backward() optimizer.step() return student_model
-
3.4 图推理(GI):分子间潜在关联预测
- 推理逻辑:从学生模型最后一层隐藏层提取100维节点嵌入,通过余弦相似度计算分子间的潜在调控/关联关系
- 公式:
Similarity=cos(θ)=VA×VB∣VA∣×∣VB∣\text{Similarity} = \cos(\theta) = \frac{V_A \times V_B}{|V_A| \times |V_B|}Similarity=cos(θ)=∣VA∣×∣VB∣VA×VB - 筛选逻辑:取余弦相似度排名前10%的分子对作为LLM推理的候选集合
- 核心代码片段:
def calculate_cosine_similarity(embedding_A, embedding_B): dot_product = np.dot(embedding_A, embedding_B) norm_A = np.linalg.norm(embedding_A) norm_B = np.linalg.norm(embedding_B) return dot_product / (norm_A * norm_B) if norm_A !=0 and norm_B !=0 else 0
-
3.5 LLM推理:分子调控关系的自然语言解释
- 推理逻辑:对GI筛选的候选分子对,使用思维链提示让LLM生成调控关系的推理链条
- 结果分类:将LLM输出分为正调控、负调控、调控、功能关联四类,通过文献检索验证结果的支持率
- 核心代码片段:
def llm_reason_regulation(geneA, geneB, biological_process): prompt = f"Can you tell me the function of {geneA} and {geneB}? Both are involved in {biological_process}. Do these two genes have any known interactions or relationships with each other? Based on your all available biological knowledge, could you help me reason about the regulatory relationship between {geneA} and {geneB}? Please tell me the chain of thought for reasoning the regulatory relationship between these two genes?" response = openai.ChatCompletion.create( model="gpt-3.5-turbo", messages=[{"role": "user", "content": prompt}] ) return parse_llm_response(response.choices[0].message['content'])
实验结果分析
LyMOI框架在自噬调控基因预测中的性能评估
以下图表展示了LyMOI框架在预测自噬调控基因方面的性能。通过比较不同模型架构和训练策略下的AUC值,评估了LyMOI相对于传统机器学习方法的优势。
图b-d:LyMOI框架性能评估。b, 使用或不使用预训练及GPT-3.5生成知识时的AUC值对比。c, 教师模型与逻辑回归(LR)、随机森林(RF)、高斯朴素贝叶斯(GNB)和支持向量机(SVM)的AUC值比较。d, 教师模型预测结果的主成分分析(PCA)图。
- 集成GPT-3.5知识提升模型性能:在教师模型训练中,结合GPT-3.5生成的合成数据集,将AUC值从0.81提升至0.83(图b)。这表明大语言模型提供的先验知识能有效增强图学习模型的预测能力。
- 图卷积网络(GCN)优于传统算法:LyMOI采用的GCN架构在教师模型中取得了最高的AUC值(0.83),显著优于LR、RF、GNB和SVM等传统机器学习方法(图c)。
- 分层架构捕捉条件特异性:在特定条件(如氮饥饿、葡萄糖饥饿、双硫仑处理)下,结合了教师模型通用知识和学生模型条件特异性微调的LyMOI框架,其AUC值(0.92-0.94)远高于仅使用教师模型或学生模型,也优于其他对比算法(图e-g)。这验证了分层架构能有效学习自噬调控的通用模式与条件特异性特征。
LyMOI成功鉴定酵母葡萄糖饥饿诱导的自噬新调控因子
该部分通过实验验证了LyMOI在酵母葡萄糖饥饿条件下预测的新自噬调控因子Gin4和Elm1。

图a-h:酵母葡萄糖饥饿诱导自噬中新调控因子的鉴定。a, LyMOI预测基因与转录组、蛋白质组、磷酸化蛋白质组差异表达基因中已知自噬基因的百分比对比。f, 免疫印迹检测野生型(WT)、elm1Δ和gin4Δ菌株在葡萄糖饥饿不同时间点GFP-Atg8的切割情况。g, 荧光显微镜观察并量化WT、elm1Δ和gin4Δ菌株的自噬表型。h, WT、gin4Δ和elm1Δ菌株在葡萄糖饥饿0和4小时后的ALP(碱性磷酸酶)活性。
- LyMOI显著提高组学数据挖掘的生物学相关性:在葡萄糖饥饿条件下,转录组、蛋白质组和磷酸化蛋白质组的差异表达基因中,已知自噬基因的比例仅为0.7%-4.0%。而LyMOI预测的候选分子中,已知自噬基因的比例高达31.8%,显著提升了发现的生物学意义(图a)。
- GIN4和ELM1缺失抑制自噬活性:免疫印迹结果显示,敲除GIN4或ELM1显著减少了GFP-Atg8的切割(图f)。荧光成像表明,突变体酵母细胞液泡中保留的GFP分子数量显著低于野生型(图g)。
- 功能缺失导致自噬流下降:gin4Δ和elm1Δ菌株的ALP活性低于野生型菌株(图h)。这些结果共同证实,Gin4和Elm1是葡萄糖饥饿诱导自噬的关键正调控因子。
LyMOI揭示CTSL和FAM98A在双硫仑诱导的自噬及癌症生存中的关键作用
该部分将LyMOI应用于哺乳动物系统,鉴定出人类癌蛋白CTSL和FAM98A是双硫仑(DSF)诱导自噬的关键调控因子,并阐明了其促进癌细胞生存的机制。
图a-g:CTSL和FAM98A在DSF介导的自噬激活中的关键作用。a, LyMOI预测基因与转录组、蛋白质组差异表达基因中已知自噬基因的百分比对比。c, d, 免疫印迹及定量分析显示沉默CTSL(c)或FAM98A(d)对LC3-II和SQSTM1蛋白表达的影响。e, 共聚焦显微镜观察沉默CTSL和FAM98A的HeLa细胞在DSF处理后的GFP-LC3斑点。f, g, 使用mCherry-GFP-LC3串联荧光探针评估自噬体(黄色)和自溶酶体(红色)的形成。
- LyMOI精准预测DSF条件下的自噬调控因子:在DSF处理下,转录组和蛋白质组的差异表达基因中,已知自噬基因仅占5.0%,而LyMOI预测的分子中该比例高达45.5%,凸显了其预测的精准性(图a)。
- CTSL和FAM98A是DSF诱导自噬所必需的:沉默CTSL或FAM98A显著降低了LC3-II蛋白水平,增加了SQSTM1/p62的积累(图c, d),并减少了GFP-LC3斑点的数量(图e),表明自噬激活和自噬流被抑制。mCherry-GFP-LC3实验进一步证实,敲低这两个基因减少了自噬体和自溶酶体的形成(图f, g)。
- CTSL和FAM98A通过自噬途径促进癌细胞生存:功能实验表明,沉默CTSL或FAM98A能抑制HeLa细胞的增殖和迁移。在自噬核心基因ATG5或ATG7敲除的细胞中,沉默CTSL或FAM98A则不再影响细胞增殖,证明其促癌作用依赖于自噬途径。
优势与局限
优势
• 多模态融合能力强:LyMOI结合图卷积网络(GCN)与大型语言模型(GPT-3.5),能够同时处理多组学数据与生物知识文本,实现从数据挖掘到机制解释的端到端分析。
• 生物相关性显著提升:相比传统差异表达分析,LyMOI在自噬等场景中预测的分子相关性提高近7倍,大幅增强了组学数据挖掘的生物学意义。
• 支持机制推理与实验验证:通过链式思维(CoT)提示,模型能生成类生物学家的机制解释,并成功指导实验验证,如发现CTSL和FAM98A在双硫仑诱导自噬中的关键作用,进而提出癌症联合治疗新策略。
局限
• 依赖合成数据质量:尽管采用提示工程减少幻觉,但GPT-3.5生成的合成数据仍可能存在错误或过时信息,影响模型在新机制推理中的可靠性。
• 模型计算复杂度高:整合大规模知识图谱与多组学数据需要大量计算资源,且图神经网络的训练与微调过程较为耗时,限制了其广泛部署。
• 单细胞组学应用尚不成熟:虽然框架支持单细胞数据解读,但其在复杂细胞类型与微环境中的机制推理能力仍需进一步优化与验证。
参考文献
- ChatGPT: Optimizing Language Models for Dialogue OpenAI, 2022:该论文介绍了GPT-3.5/ChatGPT模型,是本研究进行生物知识推理与合成数据集生成的核心大语言模型工具。研究者通过精心设计的提示工程策略,有效引导模型生成高质量的分子关联解释与合成数据,为后续图模型训练提供了关键的先验知识。
- Kipf, T. N. & Welling, M. Semi-Supervised Classification with Graph Convolutional Networks ICLR, 2017:本文提出了图卷积网络(GCNs)模型,是本研究构建大型图模型(LGM)并进行节点特征学习与预测的核心深度学习架构。LyMOI框架利用GCNs整合进化保守的蛋白质相互作用网络与多组学数据,以预测特定条件下的分子调控因子。
- Wei, J. et al. Chain-of-Thought Prompting Elicits Reasoning in Large Language Models NeurIPS, 2022:该论文提出了思维链(CoT)提示技术,用于提升大语言模型的复杂推理能力。本研究借鉴该方法,利用GPT-3.5生成机器思维链,以类似生物学家的常识性方式,对预测出的关键分子在自噬等生物过程中的作用机制进行解释。
- Deng, W. et al. THANATOS: an integrative data resource of proteins and post-translational modifications in the regulation of autophagy Autophagy, 2018:该研究构建了THANATOS数据库,系统收集了已报道的自噬调控基因。本研究将该数据库作为关键的基准数据集,用于评估GPT-3.5生成知识的性能,并作为图模型预训练和微调的正样本来源之一。
- Skrott, Z. et al. Alcohol-abuse drug disulfiram targets cancer via p97 segregase adaptor NPL4 Nature, 2017:该论文揭示了双硫仑(DSF)的抗肿瘤机制。本研究利用LyMOI框架对DSF处理下的多组学数据进行解读,预测并实验验证了CTSL和FAM98A是DSF诱导自噬的关键调控因子,并进一步提出了DSF与CTSL抑制剂Z-FY-CHO的联合抗癌治疗策略。
更多推荐




所有评论(0)