Flexynesis多组学深度学习生信分析
关键词:多组学整合;深度学习;生信分析;Flexynesis;标志物发现
一、文章简要介绍
这篇Nature Communications文章来自德国柏林马普分子医学中心BIMSB生物信息学平台,2025年发表,DOI:10.1038/s41467-025-63688-5。做的是精准肿瘤里的老难题:怎么把基因组、转录组、甲基化、拷贝数这些不同层次的组学数据揉在一起,训练出一个能预测药效、分型、生存期的模型。
文章拿80篇已发表的多组学整合工作做了摸底:29篇没给代码,45篇给的是脚本和笔记本,几乎都不能直接装来用。于是他们干脆做了一个打包好的工具,取名Flexynesis,基于PyTorch Lightning开发,PyPI、Bioconda、Galaxy都能装。
图1 Flexynesis数据整合与分析工作流总览
图1是整体工作流:多组学表格输入后自动清洗、特征选择,用贝叶斯优化搜超参数,训练多种神经网络,最后用Integrated Gradients算特征重要性,输出每个任务的关键标志物。
二、Flexynesis工具与分析方法
先说架构。工具内置五种网络:全连接网络DirectPred、带MMD损失的变分自编码器supervised_vae、跨模态编码器CrossModalPred、三元组对比网络MultiTripletNetwork、图神经网络GNN(接STRING蛋白互作网络,支持GraphConv、GCNConv、SAGEConv三种卷积)。数据融合支持早融合和中间融合两种。
再说流程。数据进来先做质控:缺失值插补、低方差特征剔除。特征选择用拉普拉斯评分,每个组学模态单独筛,再剔冗余。超参数用scikit-optimize做贝叶斯序列优化,搜编码维度、学习率、隐藏层大小。评估指标按任务区分:回归看皮尔逊相关和R方,分类看AUC和F1,生存看一致性指数。
图2 单任务建模:回归、分类、生存三类任务的示例
图2是三类单任务演示。回归:用CCLE细胞系基因表达和拷贝数预测两种靶向药的响应,在GDSC数据上独立验证,预测和实测相关约0.6;分类:预测微卫星不稳定状态,只用表达和甲基化就拿到AUC 0.981;生存:LGG和GBM胶质瘤合并队列训练Cox比例风险头,高风险和低风险组明显分开。
三、关键结果与发现
第一个结果:多任务能同时学。在1865例转移性乳腺癌METABRIC队列上,同时预测亚型和化疗状态,嵌入空间把两个临床变量都分开了,比单独训练效果好。胶质瘤上用年龄、组织学诊断、生存三个头同时训,嵌入里能看出年龄越大风险越高、且多是胶质母细胞瘤;三个任务筛出的标志物重叠在IDH1、ATRX、PIK3CA、EGFR这些已知基因上。
图3 METABRIC数据单任务与多任务建模的嵌入对比
图3是METABRIC嵌入的对比:上面两个图是单任务模型,只能分开一个变量;下面是多任务模型,亚型和化疗状态两个变量同时分开。
图4 无监督VAE聚类:TCGA 21种癌型自动分群
图4是无监督玩法:不加任何标签,用VAE-MMD把TCGA的21种癌、1600个样本压缩成嵌入,k-means自动分群,得到的聚类和真实癌型高度吻合,调整互信息0.78。
第二个结果:跨模态翻译。用DepMap数据做基因必需性预测:每个基因用三组特征表示,细胞系表达谱、ProtTrans蛋白语言模型的序列嵌入、DescribePROT蛋白功能特征。输入基因表达去重建CRISPR敲除必需性分数,1064个细胞系的预测相关度明显提升,蛋白语言模型嵌入贡献最大,光加DescribePROT没有额外收益。
图5 跨模态预测:DepMap基因必需性与蛋白语言模型嵌入
图5左上是跨模态架构示意,右边小提琴图对比三种输入组合的预测相关度,加了蛋白序列嵌入那组明显上移。
第三个结果:微调救活跨分布预测。用TCGA肿瘤组织训练的模型直接去预测CCLE细胞系癌型,F1只有0.16,几乎瞎猜;拿50个细胞系样本微调后,深度学习模型F1拉到0.8,传统方法没法微调只能干瞪眼。数据分布接近时微调收益不大,分布偏移大时是质变。
图6 模型微调对跨数据分布预测的提升
图6上面是分布接近的场景(CCLE到GDSC),微调没什么差别;下面是分布偏移的场景(肿瘤组织到细胞系),微调后分数直接翻五倍。
第四个结果:标志物能对上临床库。预测八种已知靶点药物的响应,每个药取前十特征,八种里有六种找到了CIViC数据库收录的已知标志物,比如厄洛替尼的EGFR、紫杉醇的ERBB2。另外所有表现最好的模型都包含RNA表达层,单用突变信息效果最差,这和业内经验一致。
图7 八种药物的响应标志物发现与CIViC库验证
图7上半是每种药最优模型的皮尔逊相关,下半是按数据层着色的top10标志物,标着Known Target的柱子就是CIViC验证过的已知靶点。
作者也说了,这套工具没有发明新算法,价值在于把数据清洗、特征选择、超参搜索、训练评估、标志物发现串成一条标准化流水线,让不熟悉深度学习的临床研究者也能上手。
四、我们提供的服务
我们可提供以下模拟服务:①多组学数据整合与深度学习建模;②药物响应、疾病分型与生存分析预测;③生物标志物发现与特征重要性分析;④生信分析流程搭建与模型微调部署。如有类似模拟需求,欢迎私信聊聊。
如需相关服务,欢迎通过公众号“320科技工作室”联系我们。










全部评论 (0)