汉族人群具有复杂的遗传结构,不同地区人群存在一定程度的地域遗传差异,探究汉族人群的精细遗传结构,并构建高效的地域来源推断模型,对于揭示人群演化规律及实现精准祖源推断具有重要意义。然而当前针对国内汉族人群的祖源推断模型却较为缺乏。本研究旨在通过分析汉族人群高密度SNP数据,探索人群遗传结构与地理分布的关联,并基于机器学习算法构建地域来源推断模型,提升祖源推断技术对国内汉族人群的分辨力。研究选取来自中国8个省份的汉族人群全基因组SNP数据,通过连锁不平衡检验等进行质控并构建人群数据集,质控后共获得1,229份样本和208,193个SNP位点,首先应用主成分分析(principal component analysis,PCA)、ADMIXTURE聚类分析等方法进行遗传结构分析,结果表明不同地域的汉族存在一定程度的遗传结构差异,并据此将汉族人群划分为7个遗传分区。在此基础上,使用机器学习(machine learning,ML)算法,以PCA降维后主成分(principal component,PC)为输入特征,基于参考人群数据集5折交叉验证对比XGBoost(eXtreme gradient boosting)、随机森林(random forest,RF)和K近邻(K-nearest neighbors,KNN)等不同机器学习分类模型的预测性能,引入似然比(likelihood ratio,LR)方法作为评价指标,构建最优预测模型并在独立测试集中进行验证。结果表明,在参考集中,PCA-XGBoost模型预测性能最优,第1位预测准确率为87.66%,LR准确率为96.87%。在测试集中,PCA-XGBoost模型第1位预测准确率达到85%以上,LR准确率95%以上,表明该模型具有良好的泛化能力。综上,本研究开发的PCA-XGBoost预测模型兼具高效性、稳健性与高准确性,为群体遗传学及法医遗传学等相关研究提供了可靠的方法学工具。
精准识别单核苷酸分辨率下的转录因子结合位点(transcription factor binding sites, TFBSs)是解析基因表达调控网络的核心科学问题。为改进现有计算模型在跨细胞类型预测中的性能,本研究提出一种融合通道与空间注意力机制的深度学习模型。通过系统整合10个核心转录调控因子(包括CTCF、EGR1、FOXA1等)在13种典型人类细胞系(涵盖A549、GM12878、H1-hESC等)的51组染色质免疫沉淀测序(chromatin immunoprecipitation sequencing, ChIP-seq)数据和13组脱氧核糖核酸酶I高敏感位点测序(deoxyribonuclease I hypersensitive site sequencing, DNase-seq)数据对模型进行训练与测试,结果表明在23个测试的TF-细胞类型中表现出优异性能,平均受试者工作特征曲线下面积(area under receiver operating characteristic curve, AUROC)达到0.986,其中91%样本的AUROC超过0.970;平均精确率-召回率曲线下面积(area under precision recall curve, AUPRC)为0.169,较随机预测基线(0.000156)提升超1,000倍。相较于FactorNet、Leopard及DeepGRN等当前领域内具有代表性的模型,本模型在9个共有的TF-细胞类型数据集上,其AUROC均值展现出优势。可视化分析表明,模型能精准识别TF在不同细胞类型中的特异性结合位点。上述结果表明,本模型为跨细胞类型的TFBSs精准预测提供了高效计算工具,有望为基因表达调控机制的深入解析及相关疾病分子机理研究提供重要支撑。
丰富的组学数据极大地推动了多组学数据整合技术的发展,采用非线性嵌入方式整合数据在多组学研究中逐渐成为主流,这种方式能够通过提升嵌入的质量以显著改善对癌症的分析。然而,现有的多组学数据整合方法通常局限于组学测量,忽略了包括生物学通路在内的领域先验知识。本文提出了一种基于通路自注意力和图卷积网络(graph convolutional network,GCN)的多组学整合分类模型——PathTransGCN,该模型将生物学通路信息整合到多组学数据分析中,旨在提高癌症分类的准确性。从癌症基因组图谱(The Cancer Genome Atlas,TCGA)和UCSC Xena数据库中获取乳腺癌(breast cancer,BRCA)、非小细胞肺癌(non-small cell lung cancer,NSCLC)和低级别脑胶质瘤(low-grade glioma,LGG)的多组学数据,包括基因突变、DNA甲基化、拷贝数变异和基因表达,以评估模型在不同癌症中的泛化能力。首先,PathTransGCN利用通路自注意力模块学习样本在不同通路中的潜在表征,得到多组学整合向量。同时,基于相似性网络融合(similarity network fusion,SNF)方法构建患者样本相似性网络(patient similarity network,PSN)。然后,将整合后的向量和PSN共同输入到GCN中进行端到端训练,实现癌症亚型的精准分类。在对BRCA数据集的多组学数据进行分析时,PathTransGCN在癌症亚型五分类中的性能高于目前流行的几种算法(如MoGCN、DeePathNet等),准确率和F1分数分别达到87.6%和86.4%。此外,该模型在NSCLC和LGG数据集上均展现出良好的泛化能力,并能在通路水平上有效识别与疾病相关的关键生物标志物。实验结果表明,PathTransGCN在组学数据整合和分类结果的可解释性方面表现出色,在临床应用方面具有巨大潜力。
随着基因组测序技术的普及,利用基因组标记预测复杂性状已成为育种关键。然而,基因组数据高维稀疏及其内部遗传标记间复杂的非线性交互特性,极大提高了精准数据分析的难度与硬件部署成本。因此本研究提出了一种基于染色体编码的多头自注意力模型(multi-head self-attention model)——ChrFormer进行基因组预测。该模型采用染色体编码器将全基因组SNP数据压缩为20个染色体特征向量和1个全局特征向量,利用多头自注意力机制动态捕获跨染色体的长程互作效应,最终通过多层感知机(multilayer perceptron,MLP)实现从基因组特征到表型的精准预测。本研究选取4,875头大白猪50K SNP基因分型数据以及4项重要生产性状(100 kg和115 kg背膘厚、100 kg和115 kg日龄)作为研究对象,采用十折交叉验证方法,以皮尔逊相关系数作为评价指标,系统比较了ChrFormer与基因组最佳线性无偏预测(genomic best linear unbiased prediction,GBLUP)、贝叶斯方法A (BayesA)和典型深度学习方法——视觉几何组(visual geometry group,VGG)、前馈神经网络(feedforward neural network,FNN)的预测性能;并且从模型参数量、训练耗时和过拟合程度等方面分析各深度学习模型的优劣。结果显示,ChrFormer在所有测试性状上的预测精度均显著优于VGG和FNN深度学习模型。在100 kg背膘、115 kg背膘和115 kg日龄这3个性状上,其预测准确度超越了传统的GBLUP和BayesA方法。虽然ChrFormer的单次迭代训练时间较长(54.88 s),但模型参数量仅约为VGG和FNN的1/10,且表现出更稳定的抗过拟合特性。本研究验证了自注意力机制的ChrFormer模型在猪生长性状表型的基因组预测的实用性,其轻量化的架构特点和稳定的预测性能,为计算资源有限的育种场开展表型的精准预测提供了切实可行的技术方法。
单核苷酸变异(single nucleotide variations,SNVs)是最常见的人类致病突变形式,而碱基编辑技术则为治疗这类致病性变异提供了理想的解决方案。RNA编辑技术因其作用可逆、无需永久改变基因组而规避了长期风险,且编辑器体积小巧,已成为当前基因治疗的热点。其中mini-dCas13X.1介导的RNA腺嘌呤碱基编辑(mxABE)系统展现出高效的RNA碱基编辑效率,但仍然存在旁观者编辑(bystander editing)效应导致的非靶向核苷酸编辑,构成了主要的脱靶风险。本研究通过在sgRNA序列中删除与非靶向腺苷相对的核苷酸,有效降低了mxABE系统的旁观者编辑效应。体外实验结果表明,该策略将旁观者编辑率成功控制在5%以下,并仍能维持约70%的高效目标位点编辑。在杜氏肌营养不良症(Duchenne muscular dystrophy,DMD)小鼠模型中,通过单次单个腺病毒(adeno-associated virus,AAV)注射递送mxABE系统后,结果显示胫骨前肌观察到显著的治疗效果,并成功消除了非靶向腺苷的旁观者编辑。本研究为mxABE的RNA编辑系统治疗单基因遗传疾病治疗提供了新的精准靶向策略。
为了探索能提高犬体细胞克隆效率的新方法,本研究比较了糖酵解促进剂PS48和表观遗传修饰剂(DNA甲基化酶抑制剂RG108和组蛋白去乙酰化酶抑制剂Scriptaid)的不同处理浓度和时间对犬-猪异种体细胞核移植(interspecies somatic cell nuclear transfer,iSCNT)胚胎发育效率的影响。结果显示:(1) 5 μmol/L PS48处理犬耳成纤维细胞(canine ear fibroblasts,cEFs)和犬脂肪间充质干细胞(canine adipose tissue-derived mesenchymal stem cells,cAd-MSCs) 24 h显著增强了其后续iSCNT胚胎的发育能力,PS48处理cEFs组的iSCNT胚胎的卵裂率、4-细胞期率和8-细胞期率均显著高于对照组(46.90±1.64% vs 13.30±1.61%,32.30±1.55% vs 8.26±0.88%,10.62±1.68% vs 5.50±0.84%;P<0.05),PS48处理cAd-MSCs组的iSCNT胚胎的卵裂率和4-细胞期率显著高于对照组(49.51±3.00% vs 31.25±2.73%,26.21±2.08% vs 15.18±1.58%;P<0.05);(2) 20 μmol/L RG108处理cEFs和cAd-MSCs 48 h对iSCNT胚胎发育效率无显著影响,0 nmol/L、400 nmol/L、500 nmol/L和600 nmol/L Scriptaid分别处理cEFs和cAd-MSCs 24 h对iSCNT胚胎发育效率无显著影响;(3) 20 μmol/L RG108处理两种供体细胞来源iSCNT胚胎对其发育有显著促进作用(P<0.05),500 nmol/L Scriptaid处理cEFs来源的iSCNT胚胎16 h可显著提高其卵裂率和4-细胞期率(23.08±2.94% vs 9.47±1.70%,18.68±3.25% vs 6.32±1.07%;P<0.05)。本研究建立了能显著提高犬-猪iSCNT胚胎发育效率的新方法,有助于促进犬体细胞克隆技术的应用和发展。
在法庭科学领域,犯罪现场的混合DNA证据常包含多个个体遗传信息,其准确解析是案件侦破和司法裁决的关键。随着法医遗传学技术的发展,虽检测能力有所提升,但多供者分型解析仍存在瓶颈,传统方法难以同时精准推断嫌疑人基因型及贡献比例,无法满足复杂混合样本解析的高要求。针对上述问题,本文提出基于概率残差优化的伽马分布连续模型算法,通过构建两步概率评估架构,先基于等位基因排列组合生成候选基因型组合并计算初步贡献比例,再引入伽马分布假设构建概率密度函数,动态优化形状参数α和尺度参数β以计算残差概率权重,经迭代式极大似然估计同步优化基因型组合与贡献度参数,结合群体基因频率数据库输出最大似然值解析结果。该算法可为司法鉴定提供可量化评估的可靠工具,显著提升复杂混合样本解析准确性,增强混合DNA辅助侦查效能,对推动法庭科学技术进步、保障司法公正意义重大。