本发明涉及医药检测领域,具体涉及一种单细胞转录组预测胚胎着床的方法及应用。
背景技术:
1、目前没有效果较好的直接预测胚胎着床结局的方法,临床上常见的提高胚胎着床成功率的思路,是根据常规的pgt-a(指体外受精-胚胎移植技术)的结果,挑选没有染色体拷贝数变异的正常二倍体胚胎进行移植。pgt-a的移植成功率,只有40-50%。尽管之前的研究表明在年龄较大的女性中,pgt-a可以提高植入成功率和第一次胚胎移植后的活产率,但关于pgt-a在预后良好的女性中的临床有效性仍然缺乏数据证实。即使基因正常的囊胚也有50%以上的植入失败率,有研究显示pgt-a并未明显改善35岁以下女性的持续妊娠率、活产率或累积活产率。
2、文献《rna-seq as a tool for evaluating human embryo competence》用rna来计算拷贝数异常的情况,结合影像学信息,预估胚胎着床效果。这个技术计算染色体表达的方法是将每个整个染色体视为一个转录单位,针对每条染色体上的基因表达量总量,做一个z 分数标准化。z分数大于2或者小于-2的染色体作为异常值,从而判断胚胎的染色体核型,然后根据核型来评估不同已知的妊娠预测指标的表达趋势。但该文献记载的方法也有很大的局限性,主要有两方面的问题。首先,有些基因的表达量非常高,rpkm高达万级别,而有些基因的表达量却只有个位数。因此,高表达的基因对该基因所在的染色体转录本总量影响很大。尤其是当一些高表达的基因本身表达不稳定时,这些基因会为染色体核型的判断带来过大的内在噪音,但该方法只筛除了不表达的基因,却没有对高表达的基因做任何处理,导致一些基因数量较少的染色体,比如21号染色体,其核型的计算易被高表达基因所影响。此外,对于二倍体的人类胚胎滋养层细胞,往往个体之间基因的表达异质性较强,因此,直接以基因的表达量来衡量染色体倍型会带来较大的误差,而该方法仅仅在染色体层面上进行了标准化,并未在样本层面上进行任何矫正或者标准化,因此,样本间的表达总量差异本身就会带来偏差,导致低表达量(或低样本细胞数)的样本的染色体更容易被判定为缺失;反之亦然。这两个缺点直接导致的结果是,该方法对核型的计算就不够准确。因此,该方法的鲁棒性仍然存疑。其次,该文献记载的该方法仍然基于pgt-a的思想,即只排除染色体拷贝数变异的胚胎,因此该方法仍然无法识别那些基因组层面上正常但是转录组层面异常导致的着床失败的胚胎,且该方法对胚胎着床的预测准确性,最多就只能达到pgt-a的40-50%,仍然满足不了临床需求。本技术发明人团队在申请了专利申请号为cn202211322202.9,专利名称为一种鉴定人类胚胎细胞染色体变异的方法及应用的专利,解决了第一个问题。用基因的相对表达量进行对数据的标准化,而后计算标准化后的胚胎te组织的染色体表达量,该方法实现了用rna精准计算胚胎的染色体核型。然而,仅仅计算染色体拷贝数仍然不够用来预测胚胎的临床结局。
3、因此,目前仍需要开发其他的技术手段来评估胚胎的成功着床能力及后续发育潜能。
技术实现思路
1、针对现有技术的不足,本发明的目的在于提供一种单细胞转录组预测胚胎着床的方法及应用,利用单细胞转录组预测胚胎着床潜能的方法来推断发育潜能,作为一种用于评估胚胎着床能力的转录组分析方法。
2、为达到此发明目的,本发明采用以下技术方案:一种单细胞转录组预测胚胎着床的方法,包括如下步骤:
3、s1:对胚胎发育潜能初步评估;
4、s2:对发育异常的胚胎的排查;
5、所述s1步骤包括如下步骤:
6、(1)活检获得囊胚外滋养层细胞,进行单细胞转录组测序;
7、(2)对测序数据清洗、比对及比对后处理;
8、(3)对测序后的样本进行筛选,并生成基因表达矩阵;
9、(4)制作人类正常二倍体胚胎基因表达参考系;
10、(5)制作相对表达量矩阵,
11、(6)生成以染色体为单位的相对表达矩阵;
12、(7)确定染色体表达量正常和染色体表达量异常的划分阈值,并识别出异常表达的染色体;
13、(8)用移植过的临床样本来确定着床成功组与着床失败组在总表达量上的区别,再根据总表达量与染色体表达量评估胚胎发育潜能;
14、所述s2步骤包括如下步骤:
15、a:选取胚胎的囊胚期滋养层细胞的转录组数据为临床样本;
16、b:生成用于计算表达参考系的基因表达矩阵;
17、c:制作人类正常二倍体胚胎基因表达参考系;
18、d:制作相对表达量矩阵;
19、e:生成以染色体为单位的相对表达矩阵
20、f:用上述s1步骤中的步骤(7)所计算的阈值,判断临床样本的染色体表达异常情况;
21、g: 将胚胎样本的整体基因表达量按照大小排序,根据总表达量上的排序,区别“高发育潜能组”与“低发育潜能组”;
22、h:根据染色体表达情况和着床潜能评估,预测胚胎的着床结果;根据样本预测情况,结合临床需求,我们挑选了被预测为“成功”的样本进行临床移植。
23、在本发明的一些实施例中, 所述步骤(2)对测序数据清洗、比对及比对后处理的具体内容:用trim_galore 对数据质量进行清洗,默认参数去除二代测序接头序列、低质量碱基, 保留处理后序列长度大于36 bp的序列;然后用rsem以hg38作为参考基因组进行比对,使用rsem计算每个样本每个基因的表达水平。
24、在本发明的一些实施例中,所述步骤(3)对测序后的样本进行筛选,并生成基因表达矩阵的具体内容:得到每个样本的基因表达水平后,对样本进行质量过滤,以rpkm>1的基因数大于5000的样本为质量合格的样本;在质量合格的样本中,挑选已经被确认为没有染色体拷贝数变异的正常二倍体样本,用于制作表达量计算的参考系,剩下的样本用于训练模型,得到参数,得到每个样本的每个基因的表达量之后,制作一个列名为样本名,行名为基因名的矩阵。
25、在本发明的一些实施例中,所述步骤(4)制作人类正常二倍体胚胎基因表达参考系的具体内容:得到基因表达矩阵后,挑选合适的样本及其适用的基因,用于建立基因表达参考系;
26、首先,计算正常二倍体样本的表达总量的平均值:
27、 ,其中为样本量
28、其次,每一个样本的每个基因的表达量都同步上调/下调,使得基因表达总值和基因表达总量的平均值齐平:
29、
30、再将基因表达量矫正后,删除在所有二倍体样本中表达量平均值<1的基因,然后,余下基因的表达量计算变异系数,变异系数的计算如下:
31、,其中,cv为变异系数,sd为基因在各个样本中表达的标准差,mean为基因的平均表达水平;根据变异系数的分布情况,由高到低排列cv值,挑选cv值位于前25%的基因并筛除,剩下基因用来计算每一个基因在二倍体标准样本中的平均表达量,与基因共同形成一个新的矩阵,该矩阵为人类正常二倍体胚胎基因表达参考系:
32、。
33、在本发明的一些实施例中,所述步骤(5)制作相对表达量矩阵的具体内容:得到二倍体基因表达参考系后,可以根据转录本开始计算临床样本的cnv;
34、在上述步骤(4)生成的矩阵中,挑选出与参考系重合的基因,形成新的矩阵;新的矩阵中的每个基因,均除以参考系中相对应基因的平均表达量,从而生成相对表达量矩阵;具体来说,假设一个基因,在参考系中的表达量为 ,基因在待检测的所有样本中的表达量矩阵为:
35、
36、基因的相对表达矩阵则为:
37、
38、同理,则所有基因的相对表达量矩阵则为:
39、。
40、在本发明的一些实施例中,所述步骤(6)生成以染色体为单位的相对表达矩阵的具体内容:得到相对表达矩阵后,接下来以染色体为单位,计算染色体基因平均相对表达量;每个染色体计算其所包含的基因的平均表达量:
41、,其中 ,n为二倍体参考系中属于n号染色体的基因数量,为这些基因的相对表达量,每个染色体都做一次计算,得到一个以染色体为单位的相对表达矩阵;矩阵中的每一行即为某个样本每一条染色体的表达量,表达量矩阵为:
42、。
43、在本发明的一些实施例中,所述步骤(8)用移植过的临床样本来确定着床成功组与着床失败组在总表达量上的区别的具体内容:将已经进行过临床移植并且有临床结局的胚胎分为“成功组”和“失败组”,将其te组织rna表达量矩阵进行初步基因的筛选,将两组中不表达的基因筛除,然后以样本为单位,计算基因的表达总值。
44、在本发明的一些实施例中,所述步骤c制作人类正常二倍体胚胎基因表达参考系的具体内容:计算表达总量的平均值,然后将每一个样本的基因表达总量都同步上调/下调至平均值,删除表达量平均值 rpkm<1的基因,将剩下基因的表达量计算变异系数,然后根据基因的cv值的大小,挑选稳定表达的基因,用于建立基因表达参考系:
45、。
46、在本发明的一些实施例中,所述步骤d制作相对表达量矩阵的具体内容:得到二倍体基因表达参考系后,用于检测临床样本的染色体表达量,先在样本的表达矩阵中,挑选出与参考系重合的7390个基因形成新的矩阵,新的矩阵中的每个基因,均除以二倍体胚胎基因表达参考系中相对应基因的平均表达量,从而生成相对表达量矩阵:
47、
48、在本发明的一些实施例中,所述步骤e生成以染色体为单位的相对表达矩阵的具体内容:得到相对表达矩阵后,接下来以染色体为单位,计算染色体基因平均相对表达量,每个染色体循环计算其所包含的基因的平均表达量,得到一个染色体相对表达矩阵:
49、。
50、在本发明的一些实施例中,所述步骤g将胚胎样本的整体基因表达量按照大小排序,根据总表达量上的排序,区别“高发育潜能组”与“低发育潜能组”的具体内容:将胚胎样本的整体基因表达量按照大小排序,表达总量最高的前50%的样本被认为“低发育潜能组”,反之被认为“高发育潜能组”。
51、在本发明的一些实施例中,所述步骤h根据染色体表达情况和着床潜能评估,预测胚胎的着床结果的具体内容:根据染色体表达情况和着床潜能评估,预测胚胎的着床结局并且不带有任何异常表达的染色体的,被预测为能成功着床的胚胎。
52、另一方面,本发明还提供所述的一种单细胞转录组预测胚胎着床的方法在胚胎着床领域中的应用。
53、本发明的有益效果在于:
54、(1)本发明提供一种单细胞转录组预测胚胎着床的方法及应用,利用单细胞转录组预测胚胎着床潜能的方法来推断发育潜能,预测准确率达到66.7%,能显著高于经pgt-a筛选的胚胎的移植成功率;
55、 (2)在染色体层面上,相比以往仅仅用染色体拷贝数变异(cnv)来判断一个胚胎是否容易着床失败,本发明提供一种单细胞转录组预测胚胎着床的方法关注到不仅仅是基因组层面的cnv,而且专注到转录层面;转录异常本身也可能带来胚胎功能的异常,从而造成着床失败;因此,本方法摒弃了以往“cnv”的概念,将“染色体表达异常”作为新的概念,作为预测中一个参考标准,其结果的合理性远远高于以往的技术;
56、(3)除了染色体层面,在总体层面上,本发明提供一种单细胞转录组预测胚胎着床的方法开创性地从“基因表达总量”这个角度,发现了“着床成功”与“着床失败”的差异,并且以基因表达总量为标准,评估胚胎着床成功的可能性高低;将胚胎分为“低发育潜能组”和“高发育潜能组”,创新程度高;
57、(3)本发明提供一种单细胞转录组预测胚胎着床的方法结合了染色体层面和总体层面两个维度的信息,不仅评估胚胎的染色体异常,还评估胚胎整体的着床潜能,将这两个信息共同作为预测胚胎着床的标准,本发明的方法更具有现实参考价值,帮助临床医生根据预测结果选择移植的胚胎,并且准确率更高。