---
title: "富集分析计算P值时，要避开这个问题"
author: "通路向导"
account: "通路向导"
published_at: "2021-09-14T15:44:33+08:00"
captured_at: "2026-08-24T11:50:16.120886+08:00"
source_url: "https://mp.weixin.qq.com/s?__biz=MzI2MTI5NDAzNg==&mid=100002514&idx=1&sn=422d74f9ce8b4e9d1312cee1611f6346&chksm=6a5dd8695d2a517f3d6f2cde7971395c45117b1c8c103fa4dec9d91ab395bbe705aa67138f20#rd"
---

# 富集分析计算P值时，要避开这个问题
挑选那些“看起来很熟悉”或“有意义”的路径，你的结果就会有严重的偏差

---

做个小调研：你做过通路富集和功能富集分析吗？

做过的朋友请听题：reference set你一般选择某个物种的所有的基因，还是被测量的基因？

答案是被测量的基因。

换一句话说， 做富集分析计算P值，你除了需要上传差异基因，也应该上传非差异基因。带测量值所有基因，就是你的reference set。

---

两个原因

第一个原因：“必须在场才能获胜”

我们都有过收到抽奖券的经历，而抽奖券上写着“必须在场才能获胜”。所谓抽奖， 其实是建立候选人池，从中抽取中奖（并试图让你留在那里，但这超出了本讨论的范围）。执行通路分析和其他富集分析与此有些相似。

候选人池的大小会极大地影响获胜的几率，这一点不能忽视。

以我们的抽奖券为例，假设发放了 1000 张彩票，并且只有一位中奖者。从表面上看，你会认为获胜的几率是千分之一。但是现在让我们假设， 实际参加人群只有 100 人。因为我们“必须在场才能获胜”，所以我们现在的获胜几率实际上是 100 分之一。

此外，如果抽奖组织者想作弊，他们可以例如在一个小房间里进行抽奖，他们只邀请他们的朋友和亲戚。如果这个房间在开奖时只有 10 人，那么中奖的几率现在是十分之一。所以几率实际上取决于从中选择中奖彩票的那一组。通路和其他基于富集的分析也是这个道理。

假设你有 1000 个重要基因或蛋白质，它们是差异表达 (DE)。你面临的问题变成了在尝试理解哪些途径或 GO 术语是重要的时，应该使用什么背景。在分析过程中计算的 p 值只是告诉你给定途径偶然显著的几率的另一种方式。而且，正如我们在抽奖实验中看到的，背景的选择会对结果（赔率）产生巨大影响。

紧接着我们会说第二个原因：默认导致误报

我们从公共数据集(GSE47363) 中提取了 1172 个重要基因（p<0.05和 Log2FC>|0.6|），并通过简单的富集分析对其进行了分析。

第一个实验中，我们使用了一组被测量的基因作为背景，大约有 20000 个基因。然后运行了完全相同的一组 DE 基因，但这次我们使用了另一个流行的基于网络的通路分析软件提供的“NCBI 基因”作为背景（大约30,000 个基因）。请参见下面的图 1。

![图片 1](images/001.png)

图 1：比较一组具有不同背景的 DEG 的通路结果。

发现问题了吗？ 在左侧，我们使用测量的基因集 (20k)。在右侧，我们使用来自 NCBI 的 30k 基因作为背景。请注意重要途径的数量和 p 值的巨大差异。

虽然两种情况下的顶部路径相同，但你会发现其他地方几乎没有相同：

在使用适当背景获得的第一组结果中，我们看到总共 64 条重要途径（FDR p 值<0.05）。

而你看到的第二组结果，以所有NCBI基因为背景，有150多个重要通路！这样的结果显然没法给你做参考。

另外你发现，当使用 整个NCBI基因作为背景时，会注意到 p 值更显著。

---

问题来了

你可以说：“嗯，第一条路是一样的。因此，如果一条途径真正相关，无论背景如何，它都将处于领先地位。”

不对。两组结果在最顶端的路径相同的事实只是巧合。为了进一步说明，我们比较了使用所有测量的基因，或使用整个 NCBI 基因数据库作为参考背景，来看对单个途径的影响。

在这个例子中，我们使用了36000 个测量基因，其中 10% 是差异表达的（3600 个基因）。这两个数字与你在典型的 RNA-seq 实验中得到的数字相似。

正如你在下面的表 1 中看到的，当我们使用测量基因的总列表作为背景时，我们发现这条通路在我们的数据集中没有富集，p 值为 0.19。

但是，保持其他所有内容相同，使用数据库中的默认参考集(个数为52,000)进行分析，该路径现在具有显著性，p 值为 0.02。仅通过使用“默认”参考，我们就确定了在我们的数据集中富集的GO 术语，它很可能是误报。

![图片 2](images/002.png)

表 1：比较使用不同背景的单一途径的结果。在左侧，我们使用测量的基因集 (36k)。在右侧，我们使用来自 NCBI 的 52k 基因作为背景。请注意，当使用较大的参考集时，p 值变得显著。

---

我们的总结

p值的真正目的是为我们提供方法来区分真正与表型有关的通路，以及可能偶然具有一些差异表达基因的通路。应仔细研究 p 值小于显著性阈值（例如 5%）的所有途径，而不仅仅是最高结果或前三名。如果你有太多重要的路径，而你只从它们中挑选那些“看起来很熟悉”或“有意义”的路径，你的结果就会有严重的偏差。顺便说一句，如果你只调查那些你已经知道的现象，你永远不会发现新的现象。

使用适当的基因或蛋白质背景集可以对显著结果的数量和假阳性的数量产生巨大影响。在分析数据时，你必须使用被测量的整套基因作为适当的背景。不多也不少！这不是建议，这是必须的，以确保你的发现的科学有效性。

这就是为什么在 iPathwayGuide 中，我们要求你提交整个基因列表或明确指定背景。如果你曾经使用过只要求你提交重要基因的应用程序，请问问自己，“当获奖者被选中时，谁在房间里？”

---

感兴趣iPathwayGuide的小伙伴，可联系

www.omicsolution.com

若有任何疑问，欢迎邮件或来电咨询：

marketing@omicsolution.com

support@omicsolution.com

+86-18221381405

- END
