---
title: "CKG|怎么利用临床知识图谱，将蛋白质组学数据整合到临床决策"
author: "通路向导"
account: "通路向导"
published_at: "2021-09-22T18:58:29+08:00"
captured_at: "2026-08-24T11:50:16.102253+08:00"
source_url: "https://mp.weixin.qq.com/s?__biz=MzI2MTI5NDAzNg==&mid=100002547&idx=1&sn=a52b86a4913e096732b1a3fd75ab37ec&chksm=6a5dd8485d2a515ea90390920e6f8f11c920f24b131241476405760be7aeffa144cafcdfa3f8#rd"
---

# CKG|怎么利用临床知识图谱，将蛋白质组学数据整合到临床决策
![图片 1](images/001.png)

今天不讲通路，改安利一篇对我工作有启发的文章。文章提到了一个工具 - 临床知识图谱(Clinical Knowledge Graph， CKG)，通讯作者是Matthias Mann。

本来这个内容是给我老板讲，也许你读的时候会觉得“怎么你今天一个劲的给我讲不花钱的招”，要有这个心理准备。

因为是给老板讲，所以不会展开操作细节。这个工具对我们有什么用？—用知识图谱的技术，给大量的分析结果做推理，以获取结论。

所以我是怀着一个小小的期望，如果你的工作标签是“机器学习”，“临床”，“多组学”，你想借鉴别人的分析流程，那我提到的这个文章也许能帮到你。是不是竞品不要紧，对工作有用就行。

![图片 2](images/002.png)

在蛋白质组学质谱技术领域， Matthias Mann是当之无愧的领先者。他是研究论文被引用最高的德国研究员，引用次数超过 279,000（google scholar），别人都在引用他的什么成果呢？

其实他的团队开发了很多算法，比如帮助肽的自动识别和量化，比如系统生物和临床知识挖掘，再比如我今天提到的这个工具：临床知识图谱 (Clinical Knowledge Graph， CKG)。

你知道很多人收到组学数据的报告，最烦什么吗？

最烦一大堆的表格，图片，而没有结论。尤其是做的还是多组学，别看一大堆的结果跑出来，很高深很耗时，还能体现服务器的工作量。

但是人家问你， 你算了一大堆， 你结论是什么？

“没结论，结果自己拿回去一张张看。“

这也就是为什么你要参考CKG（临床知识图谱）。做项目，不是堆砌一大堆的图表，而是获得某些结论，找到新的知识。我给你举几个例子。

---

先说第一个肿瘤治疗的例子（原文图6），是CKG对难治性癌症患者的候选治疗进行优先排序。这样的好处是，发现可用药的靶点和药物再利用的机会。

临床有一个痛点：患者并不按指南生病。尤其是肿瘤患者，在医院你会遇到很多种难治的病例，这类患者肿瘤转移了，能找到的药都用遍了，但是病情依然没改善，怎么办呢？医院的研究中心就得开展临床研究。

插一句话，这个工具不是人工智能医生，不是 “电脑弹出来一个方案，医生直接给患者用在身上“， 而是用在临床研究上。为了找到可用要的靶点和药物再利用的机会，就需要研究者，在有效和安全上取平衡。

所以，医生研究者和CKG研发团队，一起针对脐尿管癌难治性肺转移病例来做研究。

![图片 3](images/003.png)

首先， 需要做什么准备呢？

信息来源。CKG得识别文献中共同提到的药物-靶点-疾病三联体（来自330 万篇出版物），列出来与药物相关的副作用（72,000 个关联），以根据副作用找到类似的药物作用、适应症、靶点，以及将药物与功能通路联系起来。

接下来CKG还有哪些发现呢？

在将肺肿瘤与非癌性组织进行比较时， 有数百个显著调节的蛋白质，其中 188 种被上调（配对 t 检验，在原文的补充表 S2）。CKG锁定了已知与肺癌相关的蛋白质- 69个。

接下来，CKG 找到了对这些蛋白质具有抑制机制的药物。其中一个靶标是 LSD1/KDM1A，能重现了以往的研究。但是事情并没有结束。

CKG不仅自动将LSD1/KDM1A连接到反苯环丙胺—已批准用于患者的药物，而且还把追光灯打向了另一个分子：反式2-苯基环丙胺，这是一种已知对去甲基酶具有强效抑制作用的小分子，可能代表了其他选项。运行下来，总共针对 19 种排序靠前的蛋白质，确定了 60 种潜在药物。

事情到这里就结束了吗？没有。用来研究的药物集合，我前面说过， 你得同时满足有效、安全这两个标准。我们说的极端一点，有些药副作用太大，即使对癌细胞能有效干预，但是杀敌1000自损8000，不能成药。你得把这些药剔除。

因此CKG检索了在化疗方案中使用时，与上面找到的这些药物相关的所有副作用。根据不同的副作用指数、设置阈值来一步排序，优化了药物列表，针对 6 种蛋白质（HDAC1、THBS1、CDH1、PTGES 和 TXN）产出了6种药。

等等，还要考虑什么？文献清单。

最后， CKG给了你这份文献清单，有了它，方便你追溯药物和它对应的蛋白靶点以及疾病和受影响的组织的来源。

要知道，其他工具只能推荐单个化合物。 但是对于很多治疗，在临床上往往是联合使用的。CKG有什么不一样？做到了联合给药策略。

比如在这里，针对脐尿管癌难治性肺转移，CKG强调了Vorinostat和Trichostatin A这两个药的组合。它们抑制 HDAC1，而HDAC1 是一种组蛋白去乙酰化酶，可诱导与肿瘤进展相关的表观遗传抑制。此类抑制剂的组合已成功用于抑制表观遗传沉默及其恶性影响（文献略）。

此外，由于 HDAC1 和LSD1/KDM1A 都参与组蛋白修饰，CKG扩展了分析，以找到这些蛋白质之间可能的联系。CKG 揭示它们是几种多蛋白复合物的亚基。这包括 CoREST 复合物，在药物靶点上最近引起很多人的关注，CKG 为此检索了一篇描述 HDAC1 和 LSD1 抑制作用的论文。

这个例子， 挖掘了 CKG 数据库以识别已知与研究的疾病，发现了这些蛋白质的抑制药物，检索报告的副作用，并最终确定了基于共同提及的优先药物的可能组合的科学文献。

紧接着我会说第二个例子, 多组学分析。因为对于CKG的愿景，他们其实是在设想不同的团体和机构将拥有自己的本地版本的 CKG，以保护医疗保健数据的敏感性质，而且，还能支持跨平台的研究。

---

CKG 启动癌症生物标志物的发现和验证， 见文章图5（如下）. 数据采用的是文献上曾经发表的一篇多组学的案例。让我们把目光，放在Cancer Testis Antigen family 45（CT45）上，它属于卵巢血清腺癌长期存活的生物标志物。

![图片 4](images/004.png)

多组学(蛋白质组学、蛋白磷酸化等)的数据进入CKG流程，各自独立分析。

在分析中，蛋白质组的默认分析， 自动印证了已发表的结果，即确定 CT45 在化疗后长期缓解的患者中表达显着更高（图 5A）。而且， CKG 对高（前 25%）与低 CT45 表达进行Kaplan-Meier 生存分析，证实前者具有明显更长的无病生存期（图 5B）。

故事还没有结束。CKG告诉你新的知识。

而此前，关于 CT45 的细胞作用和功能的知识还属于新大陆，人们只是知道有它，但还没有被开发。然而，CKG 的默认分析立即产生了 CT45 的 24 个潜在相互作用分子，在 CKG 中进行分析后，在的进一步相互作用组学实验得到证实（图 5C）。

在CT45所涉及到的互作关系网络中，其中四个属于 PP4 复合体，与 DNA 损伤修复有关。这一点引起了人们注意。

因为很多患者所摄入的化疗药物，会导致肿瘤DNA 链间交联而导致肿瘤细胞的死亡。CT45， DNA损伤修复，肿瘤死亡？这其中一定有故事。

没错。CT45成为一个驱动力， 促使研究者再去观察细胞系模型中的磷酸化蛋白质组的结果。他们借助CKG发现， CT45 表达组相关 DNA损伤途径的激活。进一步分析导致这种表型的激酶以及与 CKG 中其他疾病的联系，将这些位点与上游激酶相关联，找到其所涉及的信号通路；再接着按图索骥的找到了几种已知的 DNA 损伤激酶（即 ATM/ATR）及其相应的受调节底物的线索，拿着卡铂的作用机制这一把钥匙，紧接着打开了其通过 DDR 对增殖的负调节的这扇门。

此外， CKG 暴露了一些其他相关的激酶和相互作用，例如 MAPK 活性的位点特异性激活，以及 CDC7 和 CDK7 底物调节的差异（图 5D）。

因此，CKG 无缝集成了不同层次的先验数据和不同维度的蛋白质组学数据，以提供对基因和蛋白质表达以及其他修饰的影响的新见解。

那你又会问了。这个工具只能对付癌症？不是的。原文的图4的案例不是癌症了，CKG用于肝病的生物标志物发现。我就不展开了。

![图片 5](images/005.png)

CKG到底是什么架构呢？就像下面这个图。

![图片 6](images/006.png)

它不光是一个分析的工具（数据进去---按钮/命令行----图表出来），它还可以用到知识图谱的技术，帮你推理，产生新的知识。

架构如下：

-

分析和可视化蛋白质组学数据 (analytics_core)，图B就是针对这个模块的分析流程；

-

图数据库(graphdb_builder)，这张图很大，目前由超过 1600 万个节点和 2.2 亿个关系组成，内容来自大量的、复杂的、互联的、多维的实验数据、公共数据库和文献；

-

连 接 并查 询 这 个 图 数 据 库 （graphdb_connector）；

-

带有分析模板的 Jupyter notebook 存储库。

所以如果你也感兴趣，可以点击“阅读原文“找到这篇文章，有时间你就读，没时间你先把我这篇收藏，以后再慢慢看。

相关阅读：

临床大队列蛋白质组学你真的会做么？

通路分析里面的级联反应

为什么癌症精准治疗需要蛋白质组学？

如何解决基因GO功能富集分析的冗余性问题？

www.omicsolution.com

若有任何疑问，欢迎邮件或来电咨询：

marketing@omicsolution.com

support@omicsolution.com

+86-18221381405

- END -
