很早以前我总结过IPA内分析模块间的关系:

帮助大家理清IPA结果,但这毕竟还是不够直观。

   随后IPA推出了Analysis Match功能(参见往期文章:IPA--Analysis Match 模块说明),类似于GSEA,将定量数据和已有研究进行整体匹配,为数据挖掘增加利器。而最新版本的IPA利用机器学习,进一步将现有的这几个分析模块(pathwayfunctionregulation)进行整合,助您飞速把握分析结果的整体概况。

背景介绍

在IPA的知识库中的信息一般是:文献A发现在B细胞/器官中,处理条件C vs D的情况下,某分子X和某表型Y有关联,该发现用了E实验方法检测。这样的形式进行数据库索引和数据分析。因此缺乏表型-表型间的关联信息(毕竟大部分文献都只会讨论单一表型或者结论)。这个时候就需要全新开发的机器学习算法来为我们的数据牵线搭桥了。

比如说我们用乳腺癌的不同侵袭程度细胞系“claudin-low”luminal A(基于文献PMID 20813035)进行对比。文献结论中主要差别是claudin-low细胞的epithelial-mesenchymal transition (EMT)过程活跃,并且激活了转录因子诸如ZEB1, SNAI1SNAI2,以及有tissue-invasive的倾向,而将文献实验数据提交给IPA core analysis,得到的分析Graphic summary如下:

文献中由作者归纳得到的诸如CST5ZEB1的关联,以及进一步影响侵袭均得到了自动注释(右下角)。其中,实线和长实虚线均为IPA已知有关联的条目,而灰色点虚线连接的相关性为机器学习自动归纳,IPA数据库中并无直接条目进行关联。从图中看出,本次分析结果预测ZEB1激活(橙色),CST5受到抑制(蓝色)。自动学习关联的互作网络预测ZEBCST5的调控对下游分子影响是类似的。


我们还可以按照亚细胞定位排布相关分子以获得更直观的作用途径。


Graphical Summary设计思路

该算法基于一个启发式探索步骤,基于我们的数据分析结果中各个分析条目进行关联和打分。简单来说,该功能致力于将分析结果中的upstream regulators, diseases, functionspathways各个模块中显著activated  inhibited的结果进行关联构建网络,从而大大减少结果中的冗余度并提供更为直观的预测结果。

Graphical Summary 构建过程Graph算法

构建步骤如下

1.收集Core Analysis结果中得分靠前的各个条目。参与模块包括:Canonical pathways (aka “pathways”), upstream regulators (aka “regulators”), 以及functions/diseases (aka “processes”) 且相应结果必须满足以下得分要求:

a. p-value <= 0.05

b. 调控因子或生物学过程结果必须|z-score| >= 2

c. 调控因子的分子类型必须为基因(蛋白)而不是小分子

2. 将第一步中筛选出的最显著的各个结果汇总,并基于机器学习模型寻找它们之间的关联性,比如是否有和实验结果一致的激活、抑制的调控关系。3. 进一步构建子集,包含:

a.  2中得分最高的关联结果;

b. 并扩展到这些结果直接关联的其他网络;

得分的计算考虑以下因素,并进行归总和加权:      

1) 相关性连接的Machine Learning (ML)-预打分

2) 相关的两个结果各自的z-score

3) 若结果中存在调控因子的已知变化倍数,则加入打分考虑。4. 基于最大生成树(Kruskal’s algorithm)对结果进行精简5. 如果可能,加入后台文献数据用以支持相关性网络构建,并基于这些文献发现进一步的连接更多的节点,直到文献数量足够多。6.如果构建完毕的网络中没有分析结果中得分最高的通路和调控子信息,那么尝试将它们直接和该网络中的各个节点进行关联。

基于内容的机器学习

该算法的基于以下假定:因某个上游调控因子的活动而改变下游基因、蛋白或蛋白磷酸化表达量能够进一步引起生物功能、表型的改变。比如,如果两个基因AB对下游基因有类似的调控作用影响一系列下游基因的表达,我们从文献中又获知A基因在某种疾病中具有特定角色,那么我们就可以猜想B基因可能也有类似作用。

在机器学习模型中,molecules, functions, diseasespathwaysN维向量空间(N=100)中被编码为嵌入物。这些高维嵌入反映了实体间复杂关联,这些关联来自于文献中各种因果作用训练而来的模型。

   基因(以及其他分子)嵌入物由文献中摘取的基因/蛋白表达量或磷酸化信息,基于低秩矩阵近似方法计算的来,参见下图(ab)。这些嵌入反过来线性回归模型中在用做特征向量,代表文献中找到的分子-功能作用关系(下图中c, d)。该线性模型中的归一化的N维参数向量被用作生物学功能的嵌入向量。 各个实体所关联的向量无论分子、生物学过程或通路都等同对待用于计算。通过该方法,可以将两个具有相同作用过程的结果进行关联,或者将作用过程和某个通路通过它们相似的向量关系进行关联。相似性(或相反)的得分用于计算两个嵌入向量的点积(也被称为“余弦相似性”)并在卡值后作为结果输出。

视频内容请通过页面中的“核对公众号原文”观看。