说“有“的小伙伴请留步。
你有没有发现这个问题:基因GO注释数据库,存在冗余:数据集之间,存在很多的共同基因。之所以这样,是因为GO是用分层的结构来组织的,GO术语之间,存在父子关系。
例如,一个基因,在GO数据库里面,可以注释为“细胞外信号诱导细胞凋亡”。然而, “细胞外信号诱导细胞凋亡“是一种“诱导细胞凋亡”,又是“细胞凋亡的正调控”,又是“细胞凋亡的调控”。你会问,有啥影响?
有冗余,对于基因GO功能的富集统计,你可能会得到很多没用的结果。
因为每个GO术语是单独统计的,但是这些GO术语之间又有层级关系,每个术语内的每个差异表达的基因都会被多次计数。
最后统计为显著的GO术语,是相对笼统的描述,用笼统去解释你特殊设计的实验,不能体现你的独特的发现。
想解决冗余怎么办?三个办法。
1 对GO术语数据库本身进行过滤:你一定见过GO slims。这样处理,数据库里面的GO术语,相似度高的就会被过滤掉,“减过肥“的GO术语用于统计计算;
2 富集结果保细不保粗:从 GO 的最低级别开始,使用颗粒度最细的术语并计算它们的富集 p 值。如果其不显著,则在层次结构中向上移动并照常计算 p 值。
3 聚类:利用GO术语相互之间共同的基因的重叠程度对GO术语聚类。在获得富集的基因功能集后, 选取这一类里面其中最显著的基因功能集作为该模块的标志基因功能集.
这三个办法,可以有效的消除GO分析中的冗余,让你的报告更有说服力。
你想知道在iPathwayGuide软件里,GO分析长什么 样子吗?留下你邮箱。如果你想完成你自己的实验数据,也可以联系我们。
关于分享报告:你自己的分析结果也可以分享给同伴。有按钮提示输入对方的电子邮件地址。如果他们没有帐户,则会提示他们创建帐户。注册后,他们将能够查看报告。