直播主题:Noninvasive urinary protein signatures associated with colorectal cancer diagnosis and metastasis
涉及文章:Nat Commun 13, 2757 (2022). https://doi.org/10.1038/s41467-022-30391-8
内容受众:科研院所 | 第三方机构 | 医院
细分领域:尿液蛋白标志物
(一)嘉宾介绍
![]()
王玲(主持人):欢迎各位专家各位同道来参加本次会议,同时我也非常感谢今天的重要嘉宾,来自中国医学科学院基础医学研究所的郭正光副研究员,感谢他接受易算生物的邀请。郭老师:很高兴有这个机会,跟大家分享最新成果。也想借此机会分享做尿液蛋白组心得,希望有帮助。首先我来介绍基础所中心实验室的质谱平台,同时也是医科院蛋白质组学研究中心。王玲(主持人):让我做一个大胆的推测,我无法确切知道到底是哪一年,但是可以大致猜猜时间范围。肯定不会太晚。应该是在人类基因组计划草图出来以后,发现很多现象无法单纯用基因组解释,得接着往蛋白功能上靠,所以应该是2000年初以后;应该是人类蛋白质组组织 (HUPO)成立初的时间。我再保守一点猜,应该是2000-2003年这个区间。郭老师:猜的非常准确,蛋白质中心是2002年成立,是国内最早开展蛋白质组学的工作的几个单位之一。在2002年时,采用的是国际上主流的蛋白质组学研究仪器LCQ XP+电喷雾离子阱质谱仪和Voyager激光辅助解离飞行时间质谱仪,蛋白分离用的仪器是二维双向电泳仪和二维液相色谱仪,说起来是非常“上古时期”的仪器。到了2007年的时候,医科院蛋白质组学中心依托于医科院基础所中心实验室,设备也发生比较大升级。王玲(主持人):屏幕前的朋友,刚好能了解一下医科院蛋白质组学中心发展过程。再到了2009年的时候,购置了当时最先进的LTQ Orbitrap Velos和UltraflexExtreme,迎来了高分辨的时代;2010年TripleTOF 5600 , 再到了2014年有了6500 QTRAP, 这是用来做靶向分析的质谱仪。2015年有了LTQ Orbitap Fusion Lumos,当时最先进的型号;2021年也就是去年,有了 Orbitrap Exploris 480 ,是当年最新的质谱仪。所以中心也见证了蛋白组学质谱检测技术的升级迭代。在2011年与Thermofisher公司、ABsciex公司成立了临床蛋白质组学合作实验室,利用高灵敏度和高精确度检测技术,用高通量的办法进行医科院的临床蛋白质组学以及转化医学的研究。(二)文章背景
![]()
郭老师:最近,我们在Nature Communications发表了 “Noninvasive urinary protein signatures associated with colorectal cancer diagnosis and metastasis”这篇文章。这个工作,是和中国医学科学院肿瘤医院赵晓航教授团队历时七年共同完成的,中国医学科学院肿瘤医院孙玉琳老师和我是文章共同一作,共同通讯作者分别是中国医学科学院肿瘤医院赵晓航教授、基础医学研究所孙伟教授。这个研究,利用高通量蛋白质组学和免疫学技术, 在尿液中发现了更为灵敏的结直肠癌早期诊断、转移风险预测的尿液蛋白标志物组合,也在组织标本里面验证了这些标志物的差异化表达,可以作为目前临床上诊断、筛查方法的有效补充。王玲(主持人):请屏幕前的朋友也在听的时候,在留言区写下您的好问题。(三)研究背景
郭老师:结直肠癌(CRC)是全球第三大常见恶性肿瘤,也是癌症死亡的第二大原因。CRC患者的5年生存率为:I期和II期疾病无转移的患者为90%,LNM患者(III期)为71%,远处扩散的患者(IV期)为14%。因此,结肠癌的早期诊断和确认转移,对于提高患者的生存率很重要。影像学检查、粪便免疫化学检查(FIT)和血清癌胚抗原(CEA)检查不足以对结直肠癌(CRC)的转移和复发进行早期发现和评估。比如影像学的检查的高成本、小病灶的漏诊,以及CEA对发病初期的灵敏性较低,目前的单一监测策略不足以评估转移和复发。(四)取样类型的考虑因素(为什么选择尿液)
一类是组织,包括;新鲜组织、石蜡包埋组织、显微切割组织。另一类是体液。包括:血液、尿液、唾液、脑脊液等。像你们单位要是做临床蛋白质组学研究,一般是做组织比较多,还是做血液比较多?你一般会怎么样安排?王玲(主持人):组织和血液都挺多,尤其临床大队列,或者多组学。客户如果样本类型丰富,都可以拿过来质检。有一个省力的方法,合作对象能够尽量多的提供什么类型样本,就收什么样本,再往下安排质检,合格以后安排实验。但我知道这不是唯一的选择。是否您会做其他考虑?郭老师:这两种(组织和血液)是临床上最常见的,也是最常用的,他们各自有优势,也各自有问题。组织样本,主要来自于手术和活检,取材相对困难,是侵入型的,不太适合做生物标志物。这个项目,目标是疾病筛查的生物标志物,组织显然不是特别适合。为什么呢?大家想想看,比方患者去医院,想做疾病筛查或者常规体检,不能一上来就做手术或穿刺吧?你搁谁也不干,所以做组织一般是确诊才能取出。但是,取组织也有它的优势。直接取材自病灶,所以能直接反映初病灶的细胞分子变化机制。所以能给机制研究提供更多线索,这是组织样本的优势之一;组织样本的另外一个优势,是可以提供转录组和基因组学的信息,适合跟蛋白组学联合使用,多组学分析得到更好结果。包括近年来CPTAC他们发表的文章,都是基于组织水平上的肿瘤和癌旁。体液样本比较好取材,更适合biomarker研究。体液样本里面血液是检验科最常用的,它虽然取样容易,应用也多,但应用于蛋白质组学并不是唯一最佳选择。为何这么讲,主要是因为其成分的复杂性和超广的蛋白质丰度范围, 如丰度最高的20种蛋白质就占血浆蛋白质组总量的90%以上。而中低丰度蛋白,可能只在血浆中占1%以下的丰度,但是实际生物标志物,往往是一些中低丰度的蛋白。由于高丰度蛋白的抑制的现象,所以导致在血浆中找到好的分子特别困难。所以质谱你不去高丰度,基本上能鉴定到的在1000个左右,而去除高丰度成本也会变得高,所以做蛋白质组研究,更推荐尿液(去做biomarker)。体液蛋白质组学是蛋白质组学的重要分支。体液(包括血浆,羊水,尿液,唾液等)的蛋白质组的改变不仅可以反映正常的生理功能,也能够反映出病理过程。体液可能成为反映健康和疾病的窗口,成为疾病早期诊断,检测疾病进程,和药物疗效的生物样本。王玲(主持人):敲黑板这里是重点,郭老师要讲尿液蛋白质组了。郭老师:尿液可以反映全身组织器官的生理病理变化。一般常规的认为尿液,主要是反映出肾脏和泌尿系统疾病的变化,其实不然。几年前我们做了当时全世界最大的尿液蛋白质组数据库,鉴定到了6000上下的蛋白。分析这些蛋白的来源,发现这些蛋白的来源不一,不是都是来自于肾脏和泌尿系统的,而是来自于全身多个组织器官比方说像脑,消化道,心脏,肺脏,实际它们的这些蛋白,都能够在尿液中找到,因此,它可以反映出全身组织器官的生理和病理变化。![]()
Sci Rep. 2017 Jun 8;7(1):3024另外,相对于血液来说,尿液的高丰度抑制的现象相对较小,比较容易鉴定低丰度蛋白,就像刚才说,1小时做血,只能够鉴定到几百个蛋白,而做尿,轻轻松松就可以上3000以上,三四千,甚至更多,所以研究尿液,发现中低丰度蛋白的概率会大大的提高了,王玲(主持人):那样基本上比普通的血液,三倍到六倍左右提升了。郭老师:对,王老师也应该做过这类的样本,确实差距很大,尤其在中低丰度蛋白。我的导师高友鹤教授, 他一直致力于尿液蛋白质组学的研究。他提出理论:相对于血液来说,尿液是生物体的废弃物,而血液是走全身的体液循环的,为全身多个组织和器官提供内环境,所以,血液必须要保持相对稳态状态,他不能有太大的变化,否则,可能会影响全身的生理功能, 血液相对会稳态。疾病状态下有很大可能是把过高的蛋白从身体里面排出去,最好的出口就是尿液。所以相对于血液,尿液是生物体的废弃物,无需保持身体内环境的功能,因此无需保持稳态,可以富集人体内的生理病理改变。因此,尿液能反映更大的变化,是疾病生物标志物,特别是疾病早期诊断的重要来源。王玲(主持人):郭老师这句话很重要,所以我要重复一遍。相对于血液,尿液是生物体的废弃物,无需保持稳态,可以富集人体内的生理和病理的变化,能反映更大的变化。郭老师:接下来我再举几个例子。是比较早的2013年在国外做工作(注:Tianfu Wu et al @ UT Southwestern Medical Center|Molecular & Cellular Proteomics (2013) 12:1170–1179),做的系统性红斑狼疮的生物标志物,发现了在尿液中,他能够找到的标志物,能够对疾病有更好的诊断和区分,而这个蛋白,在血液中,基本上在相对于正常样本来说是没有变化的,所以这篇文章反映了尿液,会比血液更加灵敏。王玲(主持人):对尿液蛋白biomarker关心的朋友可以找这篇看一下。郭老师:对。我再举一个高友鹤教授的一个工作,这是一个大鼠星形胶质瘤模型,造模以后,收集尿液发现临床表征,影像学能观察到肿瘤之前就能够发现尿液蛋白质组已经能产生很大的变化了,这也反映了可能在疾病早期诊断中能有很大的用武之地。而这些年来,做尿液相关的文章也是越来越多,更多人关注的领域。因此这次做CRC标志物,也是选择尿液作为发现标志物的来源。(五)分组和入组考虑因素有哪些?
郭老师:确定要做尿液,就要收样了。王玲你知道要是做临床尿液蛋白质组研究,在样本入组和分组的阶段,做哪些准备?王玲(主持人):三点需要注意。假如说我手头上刚好有前瞻性的临床研究,那明早儿我有任务,要跟医院做好对接,那我手头上一定会有清单。- 在哪些必要条件里面我会设置好分层,也是你是多中心,可能每个中心它分层情况会不会不一样,所以这些细节我会跟对方沟通好;
- 那最后,要找好对接医生,这个人得固定,不能今天是A,明天是B,得统一,他来保证数据完整和可靠,尤其是在数据清洗阶段。
郭老师:你说的有道理,提到了入组清单。样本的入组是保证实验成功的基础。那么一起看一下我这边清单。首先,有样本分组,比如要有疾病组对照组;比如疾病你分不同阶段,肿瘤分了不同分级,在疾病内部也要分组,根据分型和你的研究目的来分组。此外,你也要获得全面的临床信息。主要包括并不限于,患者的年龄,性别,疾病的诊断的情况,还有与疾病诊断相关的生化指标、血尿常规资料,是基本的信息。当然,不是所有的标本,都能够满足的实验的条件,入组的时候,排除掉不符合实验需求的病例,怎么排除呢?1、如果是疾病样本:假如你研究A疾病,最好入组患者就是单纯的A疾病,避免伴随的B疾病或C疾病造成的干扰。所以要排除掉;另外你要考虑入组患者有没有接受治疗,是否治疗对采样和你的结果造成影响。尤其是你做尿液样本,做的如果不是肾脏或泌尿系统的疾病,首先要保证肾功能正常,如果患者肾功能发生异常,会产生大量的蛋白尿,会对尿液蛋白质组产生很大的影响,甚至影响超过你要研究的目标疾病本身的影响。2、如果是正常样本:没有明显的相关的疾病,要求也要求肾脏功能正常,无蛋白尿。3、质谱分析样本质控:即使你发现前面收集样本的时候很注意,到后面还会发现不合格样本的存在。比如发生降解的样本,鉴定深度过低的样本,存在明显血细胞污染、蛋白尿、urine pelltes 污染的样本。这类样本可能会影响后期的分析,也需要给予排除。王玲(主持人):所以您这里提到了很关键的点,尽管收集的是尿液样本,也要关注是否血细胞污染。郭老师: 是的。尿液本身比较稀,如果有血尿,可能血红细胞的成分会特别多,甚至会掩盖掉尿液中成分变化,所以这些因素也是要考虑到。另外,免疫分析也有相关的质控,比如要看看CV指标。王玲(主持人):没错,这些整理可以避免走很多弯路,导致最后发现都用不上。郭老师:讲完样本的排除,我接下来要讲单中心与多中心的考虑。如果做相对小规模研究,一般收单中心的样本。但是如果现在,想要发比较高水平文章,样本量比较大,会更加偏好于多中心的样本,因为多中心相对更有代表性,获得的结论也更有推广可能性,可信度更高一些。多中心的样本的收集也更困难。不同的中心,收集的标准一定要统一化。郭老师:不同中心采样或者储存条件的不同,对结果也会有影响。而且涉及到了多个单位,相对协调上更复杂。王玲(主持人):是的,这些都要提前写清楚。我记得有几个项目,有的单位样本很多,有的单位送的比较少,信息上来比较杂,出现了偏倚。郭老师:我讲个事儿。我们曾经做过50个正常人尿液蛋白质组分析,发现,性别和年龄对尿液蛋白质组,也有很明显的影响。所以在不同组别之间做比较,在实验设计阶段,特别要强调各组别的性别、年龄尽量匹配,避免性别年龄本身的差异对实验结果干扰。![]()
Mol Cell Proteomics. 2019 Jun;18(6):1110-1122王玲(主持人):这是很关键的点,年龄和性别影响尿液蛋白质组。很多人可能会没有注意到。郭老师:对,尤其是性别影响的更明显一些,年龄也会有影响,所以要求尽量各组匹配。接下来我讲讲这个项目的的样本分组和入组信息。关注CRC疾病的不同转移阶段。Nat Commun. 2022 May 19;13(1):2757.组别:分了四组,包括健康对照(HC),无转移(CRC-NM),淋巴结转移(CRC-LNM)、远端转移(CRC-DM)这四组样本。分别有质控。比方说像患者标本,把治疗的患者,接受过治疗的患者,还有伴随其他肿瘤的患者,或者是肾功能异常的患者,去掉。这些是在样本入组的时候就要考虑。收集到的临床信息,可以包括性别、年龄、肿瘤分化程度、病理分化程度。![]()
Nat Commun. 2022 May 19;13(1):2757.另外在这个项目里面,也特别收集了CEA、CA19-9。这两个是目前临床应用于结肠癌筛查或者是转移的两个标志物,所以这两个指标收集进来。还有包括肿瘤的位置,肿瘤的TNM分期等。所以临床信息很重要,尤其要发临床方面的杂志,它更加特别看重。王玲(主持人):这张表可以作为临床信息整理模板了。包括各项指标、分层、统计方法。郭老师:可以。除了这些信息,涉及到你自己疾病领域各自要讨论的因素,比如做心血管这方面,血压,血糖这些很重要的一些因素,跟疾病有关的这些信息尽量要收集到全,否则到时候最后的发表文章,发现好多信息都没有,最后肯定有影响。(六)选择三角策略,还是矩形策略?
郭老师:大家如果看蛋白组学研究文章,会有不同的策略,分为两种,一种是三角策略,一种是矩形策略。![]()
三角策略一般分为三个阶段。发现阶段,用的少量样本比如十个左右,找到比较多的潜在差异蛋白,比如成百上千个蛋白。第二阶段,这些蛋白筛选出来感兴趣的,大约十几个几十个蛋白,再去更大规模比如说几十个到百人的样本中,利用靶向蛋白质组学的技术,对前期筛选的蛋白进行确认。郭老师:对,这是第二个阶段。到第三个阶段的时候,把人群进行进一步扩大,对前期筛选的比较有前途的标志物,用免疫学的方法,比如ELISA,对成百上千人进行大规模的验证,是三角形的策略。而矩形策略,现在因为质谱通量越来越大,所以可以直接在蛋白组水平,对成百上千的人直接分析了。你可以把患者,直接分为发现组和验证组。通过“shot-gun”进行全蛋白质组学的全扫描,鉴定找到发现组、验证组共同蛋白,进而识别差异蛋白或者标志物。王玲(主持人):各有优势。可能从最近设计的项目上,从流行从趋势看,矩形更倾向,也就是上下一样粗。郭老师:矩形的确现在很火。但是早些年,质谱分析通量和成本有限,早年质谱比较贵,通量也做不了太多,往往采用了三角策略。但是这些年,随着质谱技术进步,通量和稳定性大大提高,所以现在通过做质谱做上百人,现在已经不是很困难的事情了。所以现在越来越多的研究,采用矩形的策略,不局限于少数的几个蛋白,可能为以后的研究发现,提供更多线索。但是当时情况不一样。时间跨度比较大。虽然这篇文章刚发,但是项目做好多年了,前期蛋白组发现阶段,还是在2016年做的。王玲(主持人):矩形策略是在2017年才提出来的,比你们开展那会儿晚了一年。所以现在质谱技术日新月异,得跟得上时代的发展,往往几年以后,很多策略都会发生明显的改变,有一些迭代。我们利用的三角策略,你看在前期发现的阶段,是用了36例的样本,用在发现阶段后面,在verification的阶段,是用了82的样本,而在后边的免疫学验证的阶段,扩大样本量到了400多个样本。![]()
Nat Commun. 2022 May 19;13(1):2757.(七)质谱平台的考虑因素
质谱平台怎么选择?我个人觉得高灵敏度高分辨率就可以了,市面上各个仪器平台,主流的这些质谱可以满足定量需求。这篇文章我们(郭老师)是在自己平台做,所以因地制宜用了自己的仪器。前面我们说到了三角策略。在这个项目里面,我们在发现蛋白质组阶段,用的“Orbitrap Fusion Lumos Tribrid ”;在靶向蛋白质阶段,采用“Triple TOF 5600” 来做。接下来的定量,在发现蛋白质组阶段,用的TMT定量技术去找到差异表达的蛋白;再往下靶向高通量蛋白质组阶段,采用了PRM来定量验证尿液中的差异蛋白。TMT目前是很成熟的技术,比如最新的TMT试剂已经能实现同时对18个样本进行标记,重复性会比较好。我们当时做的是10-作为规格,也就是同时对10个样本标记,通量较高。在实验中,四组样本,每组9例分别用126、127 N、127 C、128 N、128 C、129 N、129 C、130 N和130 C 10-plex TMT试剂进行标记。来自所有四组的混合样本用131 TMT试剂进行标记。这四组都一样,以它作为参照,可以把四次实验整合在一起定量。其实到你在这个环节目前除了TMT, DIA也可以作为你的选择。王玲(主持人):DIA,数据非依赖性采集,Data Independent Acquisition。郭老师:传统的叫DDA,数据依赖性采集。传统的方法是一个随机过程,虽然可同时获得被测蛋白的一级质谱和碎片信息,母离子的筛选主要是离子强度高的离子,且需要依靠研究者预先设定的条件,比如选择 top-20 的母离子,然后再进行二级采集。但是可能会导致随机性问题。这一次做和下一次做可能挑的前20个母离子也不太一样,所以有的时候可能这次能做出蛋白,下次就做不出来了。而且,一些低丰度蛋白,可能采集不到。郭老师:DDA的二次离子的采集输入取决于一次离子的扫描结果。由于采集方法的局限性, 造成低丰度肽信息丢失,而DIA技术它的优势是不需要预先选择母离子,而是全景式的扫描,数据没有遗漏,而且蛋白的覆盖率,定量的准确率都比较高,相对于DDA的模式,DIA的缺失值更少,鉴定的定量的结果,可重复性也更高,数据也是可回溯的。接下来,假如你通过发现蛋白质组学,有了很多感兴趣的差异蛋白,后面你对这些蛋白要进一步确认和验证了。这里你需要用靶向数据采集。王玲(主持人):靶向蛋白组,我第一个想到的是MRM技术。我也相信屏幕前的朋友也有自己答案,大家可以想想自己答案。也请郭老师揭晓。郭老师:除了你说的MRM,还有近些年比较新兴起来的PRM技术,也属于最广泛的靶向的方法之一,这次的项目采用了它。考虑到了PRM,能利用四级杆质量分析器的选择检测能力,在一级质谱中选择性地检测目标肽段的母离子信息,因此对母离子得到的所有子离子进行全扫描.PRM基于高分辨质谱,精度更高、抗背景干扰能力更强。而且,它不进行子离子优化,所以实验上相对来说也比较简单。基于这些考虑,这个项目的验证阶段,是采用了PRM的方法,对前期筛选的差异蛋白进行进一步的确认。(八)蛋白质组发现阶段
郭老师:接下来是如何利用蛋白质组找到CRC诊断或转移模型的?首先是发现阶段,进行差异蛋白的寻找。Nat Commun. 2022 May 19;13(1):2757.通过36个样本的这4组定量结果,PCA的非监督分析,观察HCs和不同阶段的CRC患者之间的尿蛋白谱的差异。Nat Commun. 2022 May 19;13(1):2757.看蛋白差异怎么比较呢?在NM、LNM或DM和HC之间,找到了肿瘤与正常之间的差异蛋白作为结肠癌相关蛋白。此外,还根据这以在这结肠癌的三个不同的阶段,内部进行了比较,随着结肠癌发展阶段,从最开始无转移,到后边局部的转移,到后边的远端转移差异蛋白也进行了分析,通过这些分析,找到一些与结肠癌进展相关的差异蛋白。接下来再对这些蛋白做IPA分析。发现于结肠癌相关蛋白,富集于肿瘤相关的途径,包括肿瘤生长、肿瘤侵袭、免疫反应、代谢和信号传导途径;而于结肠癌进展相关的蛋白,主要是参与免疫,细胞的侵袭和转移代谢,肿瘤发生,血管发生等等通路。此外,在疾病和生物功能分析中,细胞死亡和细胞凋亡相关的蛋白质越来越被抑制,而肿瘤增殖、迁移和蛋白质代谢模块的蛋白质,则随着CRC的发展和进展而逐渐被激活。免疫反应模块仅在CRC早期阶段(NM组)被激活,而肿瘤侵袭相关蛋白仅在CRC晚期阶段(DM组)被激活。典型通路分析显示,肿瘤代谢相关通路和肿瘤生存相关通路在CRC中被激活。肿瘤侵袭相关通路,如RAC、FAK、CDC42和RhoA通路,随着CRC的发展而日益被激活。总之,上述结果表明,尿液蛋白质组学可以反映CRC的肿瘤生长和恶性程度的增强,以及转移性CRC的肿瘤侵袭状况。(九)生物标志物的确认和模型的建立
Nat Commun. 2022 May 19;13(1):2757.是如何从前面找到的几百个差异蛋白,到筛选到只有几个蛋白? 通过以下几步。首先:关心随着结直肠癌进展是逐渐变化的些蛋白,它是随着结直肠癌进展逐渐增加或者是逐渐下降趋势的蛋白,找到了166个。接下来:这166个通过PRM靶向来验证。其中有66个蛋白通过了PRM的QC,所以这些蛋白有比较好的定量。之后:在这66个蛋白中,有41个蛋白在PRM验证的趋势,和TMT的趋势是一致的,而且在疾病和对照组之间存在统计学差异。进一步:要找生物标志物,选择了上调的23个,在正常人里面比较低,而在疾病组里面比较高。下一步:这23个蛋白里面,如果要找蛋白的组合,需要每个蛋白的表达尽量都是独立的(Proteins with less interdependency),相互依赖性较低,所以是用了皮尔森相关系数去卡阈值, 筛选到了14个蛋白。接下来:对这14个蛋白通过随机森林进行特征筛选,此外通过ROC曲线的分析,找到了8个潜在的蛋白,对这些蛋白进行组合,找到了模型。郭老师:前面提到的,在结肠癌发病过程中,转移对预后有很大影响,所以,我们除了找到结肠癌诊断模型之外,还找到结肠癌是否转移的判断模型。在诊断模型里,是拿疾病与正常对照作为参考,看是否模型能够区分健康人和和肿瘤患者。而在转移模型里,是在疾病内部进行区分,看模型是否能够区分无转移组和转移组。Nat Commun. 2022 May 19;13(1):2757.41个蛋白质的热图显示,18个蛋白质在CRC中被明显下调。23个蛋白质被上调,而且有一些上调的蛋白随着CRC的发展呈现出逐渐增加的趋势。B图是把我前面提到的那14个蛋白,用随机森林的模型进行特征筛选。左边是对诊断贡献最大的蛋白,右边是对转移贡献最大蛋白。C做AUC,通过找到在这两个模型中,AUC大的蛋白,再通过B和C找到了共有8个蛋白。王玲(主持人):所以B,C都是从A图, 的上调里面抽出来继续往下挖。Nat Commun. 2022 May 19;13(1):2757.D图,在诊断模型里,在B和C里,在同时在随机森林和AUC都表现比较好的8个蛋白,通过组合的分析,发现其中三个蛋白的组合效果好,见下面E图。你会发现CORO1C等三个蛋白组合,可以有效的区分正常正健康人和疾病组,AUC可以达到0.86。而且模型,对于疾病的早期,比方说对于无转移期的早期的诊断也有用,AUC可以到达0.8。而F图,在转移模型里面,同时考虑AUC和随机森林贡献的这8个蛋白也进行组合,找到了4个蛋白组合可以有效的预测转移,AUC可以达到0.78.王玲(主持人):我看到E图觉得很好奇。E左图是把所有的CRC合并在一起,和HC组比较;右图是单独NM拿出来,作为早期和HC去比。我这样理解对吗?如果在诊断模型中,把疾病末期的远端转移组,放在诊断模型已经不太合适了,因为它已经疾病很明显了,所以是把无转移组(NM)和局部转移(LNM)组合在一起,跟HC来进行比较。顺便在这个时候,提醒屏幕前的朋友,如果做诊断模型,太晚期的样本可以考虑剔除。(十)模型的免疫学验证
郭老师:接下来,对模型做免疫学验证。你知道什么叫免疫学验证吗?Nat Commun. 2022 May 19;13(1):2757.王玲(主持人):郭老师cue到的是重点。我理解是用抗体,把前面找到的关键蛋白,高低表达做验证。郭老师:正确。一般会用ELISA或者免疫组化的方法。但是在这里,用了不太常用的“dot plot”对前面筛选到的五个蛋白做验证。![]()
Nat Commun. 2022 May 19;13(1):2757你看到了吗?五个蛋白,四个不同的分组表达趋势,都是随着疾病的进展,它的表达量越来越高。王玲(主持人):这里是重点。要听一听和前面有哪些不一样。在诊断模型中,样本量比较大,所以区分成了training组,validation组。用training组来建模,在validation组来验证模型。诊断模型,用logistic回归的方法建模。可以发现这三个蛋白,AUC可以达到0.79、0.8左右。Nat Commun. 2022 May 19;13(1):2757如果是做诊断的话,如果你得到的AUC0.6,认为会比较弱,鉴别区分就不大。所以这次的结果比较明显,而到了转移模型也就是上面的c图,平均神经网络的算法,它的这四个蛋白组合的,它在转移模型的AUC是0.7,差强人意。大家比较常用的cea指标AUC至少0.72。但是如果把cea,跟我们这四个蛋白做组合,它AUC可以到0.74,还是能够比传统的只用cea,还是有一点点进步的。郭老师:对,来看看,现在发现到的模型是否能够跟临床的,现在常用的方法来比,或者是能否作为临床方法补充?Nat Commun. 2022 May 19;13(1):2757做CRC诊断筛查,经典方法是FIT粪便潜血实验,对CRC的灵敏度是60%多,这是经典方法。如果把FIT和诊断模型联合, 可以把CRC诊断灵敏度从60%多一点,提升到了百分之85左右,所以,诊断模型,可以作为CRC的FIT方法有效补充。而对于转移模型,传统的CEA的方法,它对于转移的CRC的灵敏度,是在58%,而如果联合我们的结果,可以提升对于CRC患者诊断灵敏度,提升了25%左右。所以转移模型,也可以作为经典CEA方法有效补充。所以综上所述,尿液蛋白模型,有助于CRC诊断和转移预测。(十一)组织水平的验证
郭老师:接下来是组织水平验证。要看这几个尿液蛋白是否在肿瘤组织中也有相似变化,也进一步跟临床数据来比较。于是扩大了样本量,选取了好几百例样本在组织上,用组织芯片进行分析。Nat Commun. 2022 May 19;13(1):2757.郭老师:对。主要是聚焦在诊断模型的这三个蛋白。对肿瘤以及癌旁组织,分别对CORO1C、RAD23B和ARPC5检测。Nat Commun. 2022 May 19;13(1):2757.发现相对于癌旁组织,这几个蛋白在肿瘤中表达明显更高,而且到了DM组也就是远端转移组,达到最高水平。而且我们也制作了临床意义的球形图。圆圈中的数字为样本量,圆圈旁边标记百分比。你发现在CORO1C,表达量是跟肿瘤的T分期和M分期显著相关。而RED23B的,表达量,也是跟肿瘤的T分期,N分期,M分期,有显著关联性。而ARPC5,也是跟肿瘤的TNM分期,有显著关联性。说明这几个蛋白,能够反映出分期的不同。最后进行了生存曲线的分析。因为组织芯片,它包括有生存曲线的数据,拿把这数据拿出来,做生存曲线的分析,发现:Nat Commun. 2022 May 19;13(1):2757.CORO1C蛋白水平高的CRC患者的无复发生存(RFS)时间较短(P = 0.0075),但总生存时间无显著区别(P = 0.9171)。RAD23B与CRC患者与总生存时间明显相关(P = 0.0124),且RAD23B在肿瘤中高表达的明显有更差的总生存。因此,这两种尿液蛋白在诊断和转移特征中都是共有的,CORO1C和RAD23B的高水平组织表达确实促进了CRC中恶性细胞的转移潜力,它们可能会在肿瘤预后、复发, 会起到一定预测的作用。(十二)文章回顾
这个项目的工作就到这里。到目前为止,是最大最系统的利用尿液蛋白质组,发现CRC标志物的文章,用到了discovery-verification-validation流程。与单独的 FIT 相比,生成的诊断标志物与 FIT 检验相结合,显示出灵敏度提高, 从61%提高到了85%。到了转移模型,如果与经典的CEA指标组合,可以提高转移灵敏度,从58%提高到83%。所以可以作为经典方法的补充。在一些疾病的早期中,这些诊断的标志物,能够发生发生明显的变化,说明panel,是有可能是用于早期诊断。上述结果,提示尿液蛋白质组,可以全面反映,不同阶段的CRC生理病理变化,甚至是在早期的阶段也能反映。想要在进一步,可以做多中心的进一步验证,目前还是基于单中心结果。另外,虽然发现了几个CRC的标志物,但是他们在结直肠癌发病进展过程中,他们发挥什么作用,还有待于进一步研究。但是我还想强调,这里面有一个蛋白,实际上在赵晓航老师团队,他们后续进一步研究,确实发现了蛋白,在结直肠癌的转移过程中很重要。他们的工作,后面也发表在了cancer letters上。(十三)十五个有趣的问题
13.1:组织验证的必要性
王玲(主持人):最后一步就是组织验证了。在您的项目中,不光安排了尿液,还安排了组织。郭老师:是。很多人会关心虽然尿液里面发现了东西,但是这些东西哪儿来,也包括以前我投文章申请基金,很多人都在关心的问题。的确是很多人还是希望能从组织中,源头上找到变化。我想说一点:组织验证来自于术后的样本或者穿刺样本,此外还有一些商品化的组织芯片,可以买到比较常见肿瘤的芯片,而且信息比较全。因为你想去临床收集那么多样,也不是很容易的事,而且涉及到人力也很复杂,做手术的人也不一样,也有各种伦理方面的要求。王玲(主持人):因此,您最终选择了组织芯片做组织验证。
13.2:做尿液蛋白组和尿液外泌体蛋白组,这两个区别大吗?
郭老师:理论上尿液蛋白也包含了尿液外泌体蛋白,还有尿液本身的蛋白,是并集。尿液外泌体蛋白相当于是子集,它被认为可能更直接跟疾病有关,但是提取本身有一定困难。有一些课题组倾向外泌体,但是我这边直接做全尿的蛋白更多些,因为可能会富集一些疾病里面分泌出来的一些物质,对生物标志物研究也会有富集。
13.3:尿液水分很多,蛋白如何浓缩,尿液采集容易被污染,如何保障采集标准化和合适的储存?
- 如何浓缩?尿液相对较稀,比较常见两种方法来浓缩。一个是丙酮沉淀,把蛋白沉淀下来再复溶,就浓缩了。接下来我要说第二种,实验室自己做了一个叫“尿膜”的方法。把尿吸附在特殊的膜上,只要直接保存膜,用的时候融出来就可以。
- 如果保证采集标准化?一般采集中段尿,和大家差不多。
- 如何对尿液合适的储存?比如检验科刚收集完尿液,可以暂时放四度冰箱,但是尽快当天要转移到-20或-80冰箱长期保存,最好是-80。保存一两年没有明显影响,-20会差很多,基本上个把月能维持。
王玲(主持人):所以大家可以记一下,长期保存,-80最合适。收集完样本最好一天就要冻起来。人手不够要提前申请人手帮忙。
13.4:定量结果好坏如何判别?
王玲(主持人):蛋白定量尤其是尿液蛋白定量结果的好坏,取决于哪些办法判别?刚才您结果展示了PCA。其实还有哪些要素去看?郭老师:首先从定性上看蛋白数。蛋白鉴定数,多肽鉴定数、谱图数,这些是否和以往或实验基本数量差不多,质谱原始文件看信号强度是否也和之前差不多。此外做定量,一般会引进QC样本。QC是质控样本,一般是所有样本的混合,在分析过程中,分析了几个样本以后会穿插有QC样本,通过看它的相关性或者CV高低,来看整个质谱仪稳定性的好坏。
13.5:怎么保证质谱仪性能稳定?
王玲(主持人):做TMT和PRM上机,仪器的参数需要调整。作为全国最大的质谱平台之一,您那边怎么保证这些参数的调整达到性能的最佳?咱们是液相和质谱联用,质谱要看信号强度是不是比较好,会不会是仪器脏了,需要定期校准,因为时间长了质量轴会发生偏移。另外要看喷雾状态是不是稳定,要等到都是好状态的时候再开展实验。到色谱,看看是不是峰相对较窄,有无明显拖尾,或者明显死体积,保留时间是否稳定,需要定期的观察。每个时间都有足够的样本安排质谱分析,不能说有的时候样本特别多安排不过来分析不过来,有的时间又被浪费了,要做梯度优化,另外分析时间的长短和鉴定深度要权衡。比如说样本做两个小时肯定鉴定到的更多,但是机时占用就会多,机时和鉴定数量之间会有比较和权衡。此外,尤其到了PRM(这篇文章里面用到的靶向蛋白质组),因为采集模式相对特殊,要预设母离子,所以一般是采用schedule的模式,是在某时时间内,在保留时间内,只采集某一些离子,能够保证在一次实验内能够分析更多的肽,来完成针对目标蛋白/肽段离子进行靶向监测和采集。
13.6:PRM验证结果的多层过滤去掉冗余特征,有必要吗?
王玲(主持人):在进行PRM验证的时候,您这边对数据做了多层的过滤。这些过滤的考虑因素有哪些?如果有人觉得,这么做好麻烦,去掉了这么多层过滤行不行?我不想做“Proteins with less interdependency”,从差异表达直接跳到了特征选择,行不行?郭老师:也可以。当初考虑到组合这么多的过滤条件效果更好。假如我前面筛选到了一些蛋白,直接做了验证,那么别人也会很好奇,怎么就从那么多蛋白里面挑出来这些?一百多个蛋白里面最后蹦出来三四个。审稿人包括读者,也会有疑惑:“是你其他蛋白都不好用就这有这些蛋白好用么?”所以你合理的过程合理的解释越多,读起来也越清楚。王玲(主持人):否则就是太跳跃了,怎么从那一百多个跳到了三四个蛋白还构建了模型,而且结果还很好,得给人解释清晰。郭老师:所以想给大家一个合理的解释,是通过路径,找到的这些分子。
13.7:特征选择,选择了随机森林的原因
王玲(主持人):到了特征选择(PRM),文章发表出来的时候,我们知道是用的随机森林的办法。但是放在做特征选择的当时,你们是通过它的算法原理,还是通过什么策略,选择了随机森林呢?郭老师:也没有比较更多的算法。因为随机森林最常用,不太容易过拟合,比较稳健。所以就采用了约定俗成的这个方法。也许很多生信人会比较多个方法,然后去看哪个更好,这也是合适的做法。
13.8:模型的免疫学验证,过滤掉了122个样本?
王玲(主持人):为什么(免疫验证)会去掉122个没有CEA的样本?为什么是CEA?![]()
郭老师:最开始提到,对于CRC这个肿瘤的诊断和转移,CEA指标是非常重要的临床参考。找到的标志物组合要跟它做比较,甚至要跟CEA指标一起做组合再跟CEA单独监测的时候做比较,所以这方面需要临床数据比较齐全的样本。王玲(主持人):所以你们最开始收到的样本,可能很多没有测这个指标或者有测但是没有收集上来?举个例子,我今天穿越回去了,我看见你们到了免疫验证这个阶段了我在医院里说,不行啊,这些数据必须给,不然浪费(蛋白组)了。郭老师:当时这122个样本实际上也做(蛋白组)了,当时实际上有数据。后来文章写道这里了,发现必须得组合(CEA指标+蛋白)到一起效果更好,所以干脆为了整个数据的整齐性,就干脆不要(没有CEA指标的122个蛋白样本)了。如果有的有CEA,有的没有CEA,前后又会造成不一致,事情也讲不清楚,会带来混淆。所以最后就干脆做了这个调整。王玲(主持人):最开始设计的时候可能没想到得做组合,后面发现加入了CEA,组合了以后结果更好。
13.9:很多实验室其实没有您中心条件,拥有这么多设备。假如我实验室没有免疫验证平台,这个项目还可以怎么调整?郭老师:当前设计是三角策略。假如只有质谱平台,没有免疫平台,就把确认的两个步骤合二为一。你相当于做更大量的样本。比方说PRM代替了免疫的方法,也做几百个,用它做定量可以。此外你还可以做成矩形策略,你可以看见很多文章都是相当于做了高通量的,上百个几千个样本的蛋白组,后续有一些也没有做更多验证,样本量你够了,上来了,也就可以了。不一定非得用三角策略来做,质谱你做到了几百例,规模也是比较容易实现的,尽可能多的个体和条件,测量尽可能多的蛋白质。与三角策略相比,初始发现队列会更大,理想情况下包含数百或数千名参与者,从而更有可能找到标志物。![]()
王玲(主持人):最开始我想到了去掉免疫验证平台。但是矩形策略这块也给了我一个好的方向,屏幕前的朋友可以根据自己情况尝试这两个方法的其中一种。
13.10:为了确认 PRM 分析 的结果,使用相同的蛋白质分子,重新训练了Immunoassay模型?
王玲(主持人):看到了免疫验证这里,您用了逻辑回归模型做诊断模型,用平均神经网络做转移模型。那和刚才的质谱PRM验证的模型是不是同一个模型?郭老师:这里蛮有意思的。最开始也试图把原来的模型直接平移到这边(免疫平台),但是我发现还是有些问题,数据形式也不一样而且量纲也不一样。所以,直接用到的是PRM的结论给移植过来了,保留了这几个关键蛋白。最后模型,因为要考虑到免疫学它的数据特点,相当于重新算了新模型。
13.11:诊断模型和转移模型,用的机器学习的方法为何不同?
王玲(主持人):我这里还比较好奇,在做诊断的时候用逻辑回归,到了做转移的时候用平均神经网络。比如我在做这个项目,我放在过去几年前没有今天的视角,我可能就一个模型就下去了。会不会我的结果就不好?郭老师:逻辑回归最常用,被广泛应用于特征筛选和联合诊断模型的建立。在这个项目里面,在诊断模型里面,样本量比较大,可以分为实验组和验证组,实验组用回归来建模。而到了转移模型,是看肿瘤样本里面,转移的和未转移的去比,把HC去掉了。但是未转易的样本比较少,而且不太平衡,就相当于NM组样本量整体数量少,转移组样本又特别多,建模效果不会特别好,而且每个组数量少容易过拟合,所以后来对转移模型采用了另外一个策略。王玲(主持人):而且基于前面的机器学习的算法,你们在做验证的时候,诊断用了K折交叉验证,转移用了留一法?郭老师:对,逻辑回归的时候用了K折交叉验证,平均神经网络用了留一法。其实比逻辑回归效果差一些,但是也是科学性角度,最后呈现的是这个结果。
13.12:哪个环节花费的时间最长?
王玲(主持人):到了组织验证这个步骤,看起来涉及到肿瘤样本的数量达到了最大,比如看到了933,503,503这几个样本数。当时这么设计,是医院给提供多少,越多越好,还是有上下限度?郭老师:考虑到用的策略是三角策略。如果你是想做比较大的文章,到了最后的验证阶段基本都要上百例,包括免疫验证的“dot plot”已经用到了四百多例了, 到了组织验证这块至少也得这个数, 审稿也是要求尽量更多。也是想尽了办法,在经费允许的范围内,买了更多的芯片做。不过组织芯片,可以做到样本量比较大,比你自己去收样要容易很多。王玲(主持人):933、509、509,他们分别代表什么?郭老师:933代表了CORO1C,另外两个蛋白(RAD23B、ARPC5)也分别509个样本。王玲(主持人):其实更稳妥的是,如果有幸跟郭老师做一个项目, 用样本量估算工具里面算过以后,再跟郭老师验证一下更周全一些。郭老师:实际上更多还是需要经验,帮你考虑到最后实际能收多少,或者可能达到的基本数量,有多大能力就做多大事儿。王玲(主持人):我发现组织芯片的环节,做了三个分子,但是前面看到了两套模型。诊断模型用了三个蛋白,转移模型用了四个蛋白。到了组织验证这里,似乎有了转折。在当时发生了什么事儿?郭老师:因为在这里,主要集中在诊断模型上,因为在组织芯片里,要进行肿瘤和癌旁的分析,所以主要是看看这几个诊断相关的蛋白,是不是真正在肿瘤组织中确实是高表达的。当然,另外一个原因也是审稿人更加关心诊断这块的数据,所以在诊断做了强化。王玲(主持人):我发现组织芯片的环节,所以组织验证做了三个分子,针对的是诊断模型。假如我精力时间都允许,那把两个模型都安排了也可以的吗?郭老师:也可以。但实际上这个是补充,时间精力也有限,所以主要做了这一块(诊断)。把其中一个问题说明清楚,就行了。
13.13:这个项目如果换成血液,应该会有哪些改动?
王玲(主持人):今天来到直播间的朋友,也许除了做尿液或者粪便,很可能也做了血液。如果是血液样本,这场讲座的思路可不可以借鉴进来?哪些地方又需要改变?我听完您前面的讲座,会想到“蛋白高丰度去除”这个环节,不知道还有哪些地方需要调整?郭老师:你说的对,血液需要去除高丰度蛋白,当然也是需要你根据经费来选择到底要不要去。因为尿液基本上因为肾功能正常的尿液没有高丰度蛋白,所以一般不用去。我在这里补充一下:但如果你是做肾病,它的尿液也会更接近血液,所以高丰度蛋白也需要考虑用一些方法去高丰度。郭老师:血液相对会稳定性好,此外你后续的分析思路可以借鉴。比方说前面的发现-确认-验证,以及组织水平验证,都没有问题。但是血里面你还得注意一个问题。郭老师:因为血,它是有包括血清和血浆两种形式,血清和血浆实际都可以做项目,但是,你同一个项目,一定要统一,要用血清就都用血清,用血浆就都用血浆。尤其是多中心了,涉及单位多,有的中心用血清,有的中心用血浆,肯定结果不能比,尿液就相对简单一点,都是用平常的管子收就行。郭老师:血液如果你做血浆,你还要注意不同的抗凝管,有的地方用肝素的抗凝管,有的地方用柠檬酸钠的抗凝管,都会对结果造成影响,最好要统一。王玲(主持人):非常好,学到了,尤其多个单位合作的,血清血浆这里得统一,抗凝管最好也统一。
13.14:这个项目哪些地方,可能大家容易出现问题?
郭老师:我认为容易在前面出问题。临床收集样本,比如刚开始临床分组可能有问题,或者临床信息不全,可能导致你最后结果不太好收场了。此外你样本质量也要多留意。如果你前期没有控制的好,样本有很多降解污染,后面你就比较难做了。所以前面你得把关好,从实验设计阶段,最开始怎么入组,要解决什么科学问题,怎么设计你最开始就得想清楚,别一开始什么都先做着,到最后你才发现很多数据你都用不了。王玲(主持人):对,所以屏幕前的朋友也请注意,如果你在公司里面,不光要考虑做实验做质谱这方面的能力,另外要有全局把控,尤其对临床术语,临床设计,临床场景里面解决了什么问题, 怎么一步步到最后的也要提前考虑。
13.15:有哪些结果,和最开始的预期不一样?
郭老师:咱们课题本身不是以假说驱动的,发现到了新东西,所以从蛋白质组学来说风险没那么大,你怎么着都能找到新东西。不像做分子生物学,你可能得假设几个分子之间有相互作用预测得出来但是做不出来。所以相对灵活一些。但要说跟最开始想的不一样,就是转移模型,单独用没有找到特别好的效果,所以最后是跟CEA联合使用,以此作为创新点,把它(转移模型)的价值给体现出来。王玲(主持人):通过这种联系把biomarker的有用性给抓出来了。在我印象里,要么比现有手段敏感,要么比现有手段发现的早,您的新发现属于第三种:跟现有marker融合以后发现结果更好。
最后, 感谢郭老师,感谢大家对本次直播话题的关注!marketing@omicsolution.com
support@omicsolution.com
+86-18221381405