IF:10.8
文章名称:Multi-omics approaches to disease(综述)
链接:DOI 10.1186/s13059-017-1215-1
推荐原因:文献思路必备素材
面对多组学数据,找哪三个切入点?
表型、基因组、环境。
表型切入:旨在了解导致疾病的途径,而不是将挖掘的中心放在某个特定的位点上。
基因组切入:旨在确定GWAS位点对疾病的贡献机制。
环境切入:将环境作为一个主要变量来研究,探索它是如何扰乱途径,或如何与遗传变异相互作用。
表型切入的方法
往往从相关性入手,即是检验疾病或疾病相关的因素与组学数据的关联。一旦发现了关联,就找到了解释的逻辑框架,比如可以指出受影响的通路,比如给出不同因素在疾病发生发展中的作用。
举个例子。
转录组(RNA sequencing)和表观基因组(ChIP-seq ),希望从组学的角度,找到疾病(阿尔茨海默)的机制。文章里面提到一个分析思路(注:Gjoneska等,Conserved epigenomic signals in mice and humans reveal immune basis of Alzheimer's disease)。他分为以下几个步骤:
步骤 | 行动 | 结果 |
1 | 转录组差异分析 | 发现疾病发展过程中,转录组差异表达,和细胞群瞬时或持续的变化 |
2 | 转录组差异基因功能分析 | 识别转录组数据,哪些功能增强了,哪些功能抑制了。发现免疫相关基因持续增加,而突触和学习功能则持续下降。 |
3 | ChIP-seq增强子与启动子扫描 | 启动ChIP-seq分析,重点是扫描启动子和增强子。发现这些启动子和增强子在疾病组与对照组中显示出明显不同的染色质状态。 |
4 | 组学对应 + motif富集分析 | 作者展示了这些表观遗传学ChIP-seq的变化与观察到的基因表达的变化相对应,并使用富集分析来确定在激活的启动子和增强子中富集的转录因子的motifs |
5 | 与外部数据整合 | 作者利用现有的 GWAS 数据来观察与疾病相关的遗传变异是否与他们自己研究所识别的功能区域相重叠。
他们发现与疾病相关的遗传变异在免疫功能相关的增强子中明显富集,但在启动子或神经元功能相关的增强子中则没有。 |
6 | 独特的洞察 | 遗传易感性主要是通过免疫功能失调发挥作用,而神经元细胞的表观遗传变化 主要是由环境驱动的。 |
基因组切入的方法
对于疾病相关的遗传变异,假设特定的变异对疾病有贡献作用,而不是疾病的后果。这类变异形成了很强的基础,用于疾病病因学的机理研究和其他全息图层的相互作用建模。
很多人都知道GWAS。这类分析,经常可以识别出携带致病变异的位点,但是往往很难与离真正致病位点附近的其他变异区分出来,而这些其他的不致病的变异只是算出来跟致病的变异有关,但其实跟要研究的疾病没关系。
有什么办法可以规避GWAS分析的这个问题?因果变异分析。
以位点为中心整合更多的组学,可以帮助确定 GWAS 位点的因果单核苷酸多态性(SNP)和基因,然后 研究这些如何扰乱导致疾病的通路。
比如转录组 学,采用表达阵列或 RNA-Seq,被很多人用来识别GWAS位点的因果效应;而且,一些一些统计学方法已经被开发,来识别基于 GWAS 位点的 eQTL 的因果关系.目前,一些组织的 eQTLs大型数据集已经被做成了数据库供人参考。
举个例子。Claussnitzer 及其同事的研究(FTO obesity variant circuitry and adipocyte browning in humans),该研究涉及对与肥胖有最强关联的 FTO 位点的分析见下图。
这个研究结合基因组学、表观基因组学、转录组学和系统发育分析,确定了肥胖症中FTO基因座的功能元件、致病SNP和介导遗传效应的下游基因。圆圈代表该基因座中的基因,黄色圆圈代表被相应的全向性数据相关的基因。
a 基因组学:包含多个基因(圆圈)的FTO基因座蕴藏着人类最重要的肥胖相关单倍型。与风险等位基因有连锁不平衡关系的SNPs用颜色表示--蓝色代表非风险(正常)单倍型,红色代表风险单倍型。
b 表观基因组学:将原始相关区域缩小到包含脂肪特异性增强子的10kb。
c 转录组学:该技术被用来确定哪些候选基因在风险和正常单倍型之间有不同的表达,确定IRX3和IRX5为可能的下游目标。此外, conservation analysis表明rs1421085是FTO基因座上的致病SNP。CRISPRCas9将rs1421085从背景(TT)编辑为风险等位基因(CC),足以解释观察到的IRX3和IRX5的表达差异。
d 功能机制:使用correlation相关和富集分析来确定可能改变的通路,然后通过体外和体内研究加以证实。
图看完了。
有哪些重要的线索,把组学之间穿起来? 我们还是接着往下说这个例子。
首先通过表观研究,找到了一个在间质细胞中活跃的长增强子,被证明在风险和非风险单倍型中的活性不同。
于是研究者以此为出发点, 挖掘了涉及该增强子的长距离三维染色质(Hi-C)相互作用,找到了两个基因 IRX3 和 IRX5,其表达与 20 个风险等位基因和 18 个非风险等位基因 携带者的风险单倍型相关。
为了确定受影响的生物过程, 识别脂肪组织中 IRX3 和 IRX5 的表达与其他基因之间的相关性。观察到涉及线粒体功能和脂质代谢的基因的大量富集,这表明其可能在产热中发挥作用。
QTL登场。使用 FTO 位点的反式 QTL 分析的进一步工作表明,其对参与脂肪细胞褐变的基因有影响。然后研究了 24 个风险等位基因和 34 个非风险等位基因的脂肪细胞大小和线粒体 DNA 含量,结果显示有明显的差异,这与脂肪细胞对能量平衡的自主影响相一致。
因此,Claussnitzer 及其同事通过在原生脂肪细胞和小鼠中的实验操作证实了IRX2 和 IRX5 的作用。最后,利用跨物种保护预测 了 FTO 位点的致病变异,用 CRISPR-Cas9 靶向编辑确定了一个破坏 ARID5B 抑制器结合的单核苷酸变异。
环境切入的方法
在这种方法中,多组学分析被用来研究与疾病的机制联系,使用环境因素如饮食作为变量。这里有个细节要注意。 要准确评估环境或控制因素,如人类的饮食,是非常困难的,因此动物模型被证明对研究环境对疾病的影响特别有价值。
在此,有三个用于研究环境对疾病影响的多组学研究设计的思路。
一种研究设计是检查多种环境条件,以确定这些条件如何扰乱生理、分子和临床表型。例如,有人研究 25 种不同饮食对800多只小鼠的整体健康和寿命的贡献。他们比较了营养素的比例与大量的心脏代谢特征(如寿命、血清特征、肝脏线粒体活动、血压和葡萄糖耐量)之间的相互作用,以阐明与改善健康有关的特定饮食成分。最后发现,饮食中蛋白质和碳水化合物的比例被证明对生命后期的健康指标关联性很强,因而提供了机理上的洞察力。
第二种研究设计旨在了解遗传学和环境之间的相互作用。例如有人研究了高脂肪、高蔗糖饮食对大约 100 个不同近交系小鼠的影响。通过检查多个组织中的全转录组的表达和血浆中的代谢物,他们能够确定导致饮食引起的肥胖和糖尿病的途径和基因。
第三类研究设计涉及对特定底物反应的代谢物流动的统计模型。例如,bibliographic、 metabolomic、 genomic数据的整合,被用来重建代谢信号传导的信息流,从低等生物到高等生物都有涉及,而且应用已经探索了代谢组模型和其他信息层之间的各种联系,包括 转录组和蛋白质组。
跨多组学层的数据整合
关联分析必须提。如果两个 omics有 一个共同的驱动因素,或者一个元素扰乱了另一个元素,它们就会表现出相关性或关联性。
在多组学研究中,一个实际的考虑是同一对象在各组学层中ID的关联性,即所ID 转换。这需要使用路径数据库,如 KEGG。理想情况下,多组学数据集将被集合在同一组样本上,但有时候也有例外,因为GWAS 和表达数据,经常被在不同的受试者身上收集。在这种情况下,有可能根据基因型推断出遗传特征(eQTL)或表型。
在对多种数据类型进行建模时,从一个组学跨入到另一个组学很讲究。比如虽然许多蛋白质的水平与它们的转录物水平密切相关,同时还 有 eQTL 和蛋白质 QTL(pQTL),但大多数蛋白质-转录物对的相关性并不高。如果相关性不能解释,往往可以分析翻译、翻译后修饰等这几个角度。这说明,RNA的丰度可能会预测到蛋白的表达,但是另外一些蛋白的丰度可能无法从转录组或者基因组找答案。
所以,相关性来解释或者串联多组学,能做的事儿有限。
除了相关性, 还可以考虑物理相互作用。比如如从酵母双杂交分析或一系列的 "pulldowns "中发现的相互作用。
除了用蛋白来识别物理的相互作用,还可以在不同的层次上进行测量,例如在 ChIP-Seq 中,它可以探测特定蛋白的 DNA 结合。而且这种研究还可以再结合共表达的网络,比如对于疾病的研究,可以根据对照组和受影响个体之间分别发生的基因表达变化来构建共表达网络;对照组和疾病组之间的网络结构进行比较,可以确定与疾病状态最相关的紧密连接节点。
你有没有发现这个问题? 一般来说,共同表达或相互作 用网络是不定向的,即相互作用的因果性质是未知的。
如果你有基因组的数据,如疾病的 GWAS 位点或基因的 eQTLs,就 有可能用 DNA 作为锚来推断因果关系。但是如果不巧,你没有基因组数据怎么办?
贝叶斯网络可以成为一个好的抓手。比如有人研究了晚发性 AD 患者大脑的转录物水平,于是他分析了共表达和贝叶斯因果模型,以确定与疾病相关的模块和在疾病调节途径中重要的关键驱动基因。
这类研究可以把网络分析如何被用来将疾病研究的重点缩小到特定的细胞类型或组织的特定功能方面,大大促进了下游的机制工作和假设的产生。
继续学
上海易算生物科技有限公司 转载请注明出处
更多蛋白质组学技术信息请参阅我们的官方网站:
www.omicsolution.com
若有任何疑问,欢迎邮件或来电咨询:
marketing@omicsolution.com
support@omicsolution.com
+86-18221381405