• 技术与方法 •
张巧生1,许俊杰1,孙振宇1,仲兆满1,刘婕1,吴延立2,李婉琴1,胡梦杰1,李鸿鹏3
1.江苏海洋大学计算机工程学院,连云港 222005
2.山东省菏泽市食品药品检验检测研究院,菏泽 274000
3.江苏海洋大学理学院,连云港 222005
A nonlinear multi-omics data integration and classification model based on pathway self-Attention and graph convolutional networks
Qiaosheng Zhang1,Junjie Xu1,Zhenyu Sun1,Zhaoman Zhong1,Jie Liu1,Yanli Wu2,Wanqin Li1,Mengjie Hu1,Hongpeng Li3
摘要:
丰富的组学数据极大地推动了多组学数据整合技术的发展,采用非线性嵌入方式整合数据在多组学研究中逐渐成为主流,这种方式能够通过提升嵌入的质量以显著改善对癌症的分析。然而,现有的多组学数据整合方法通常局限于组学测量,忽略了包括生物学通路在内的领域先验知识。本文提出了一种基于通路自注意力和图卷积网络(graph convolutional network, GCN)的多组学整合分类模型——PathTransGCN,该模型将生物学通路信息整合到多组学数据分析中,旨在提高癌症分类的准确性。从癌症基因组图谱(The Cancer Genome Atlas, TCGA)和UCSC Xena数据库中获取乳腺癌(breast cancer, BRCA)、非小细胞肺癌(non-small cell lung cancer, NSCLC)和低级别脑胶质瘤(low-grade glioma, LGG)的多组学数据,包括基因突变、DNA甲基化、拷贝数变异和基因表达,以评估模型在不同癌症下的泛化能力。首先,PathTransGCN利用通路自注意力模块学习样本在不同通路中的潜在表征,得到多组学整合向量。同时,基于相似性网络融合(similarity network fusion, SNF)方法构建患者样本相似性网络(patient similarity network, PSN)。然后,将整合后的向量和PSN共同输入到GCN中进行端到端训练,实现癌症亚型的精准分类。在对BRCA数据集的多组学数据进行分析时,PathTransGCN在癌症亚型五分类中的性能高于目前流行的几种算法(如MoGCN、DeePathNet等),准确率和F1分数分别达到87.6%和86.4%。此外,该模型在NSCLC和LGG数据集上均展现出良好的泛化能力,并能在通路水平上有效识别与疾病相关的关键生物标志物。实验结果表明,PathTransGCN在组学数据整合和分类结果的可解释性方面表现出色,在临床应用方面具有巨大潜力。