UniProt在2022年中进行多项重大更新,其中最主要的当然是网站改版,增加了大量的可视化和搜索功能。其次自然是序列数量的继续膨胀。
Reference Proteome增加到了22114种
其余主要大的更新如下:
1.MANE Select
很多人为NCBI和UniProt的序列间找共同点而头疼。UniProt的2022第一版更新的Cross-ref中添加了 MANE-Select(NCBI 和 EBI 之间的匹配注释)转录本资源。NCBI和EMBL-EBI(MANE)的匹配注释是NCBI和EMBL-EBI之间的合作,旨在提供人类蛋白质编码基因的最小匹配RefSeq和Ensembl转录本。该转录本得到了实验数据的充分支持,并代表了该基因的生物学功能。
MANE-Select 在https://www.ensembl.org/info/genome/genebuild/mane.html和https://www.ncbi.nlm.nih.gov/refseq/MANE/提供。
Resource abbreviation | MANE-Select |
Resource identifier | Ensembl transcript sequence ID |
Optional information 1 | Ensembl protein sequence ID |
Optional information 2 | RefSeq nucleotide sequence ID |
Optional information 3 | RefSeq protein sequence ID |
2.对 AlphaFoldDB 的交叉引用
今年另一大新闻就是AlphaFoldDB的上线,UniProt也第一时间交叉引用了AlphaFoldDB:人类蛋白质组和其他关键蛋白质的蛋白质结构预测数据库。
AlphaFoldDB可在https://alphafold.ebi.ac.uk/使用。
3.使用ChEBI注释UniProtKB中的生物学相关配体
UniProtKB描述了对蛋白质功能至关重要的生物学相关配体的性质和结合位点,例如激活剂,抑制剂,辅因子和底物。2022年起采用ChEBI(生物学感兴趣的化学实体)的注释替换了这些配体的原有文本描述,以提供UniProtKB中蛋白质中生物学相关配体及其结合位点的高质量计算可处理注释。这种增强的数据集为研究和预测蛋白质和小分子配体之间功能相关的相互作用提供了更好的支持。
4.谷歌蛋白质名称预测
UniProt与Google Research的Max Bileschi和Lucy Colwell团队合作,预测UniProtKB/TrEMBL蛋白的名称。UniProt 2021_02 版本数据用于训练基于T5X 框架的名为 ProtNLM 的模型。该模型使用对蛋白质序列及其文本描述进行编码的共享词汇表(T5 方法)。生成TEXT文本作为UniProt 蛋白质名称输出。专家人工评估了随机选择的模型预测蛋白质名称的子集,并使用分层置信度分数进行模型构建。自动验证工具还检查了预测名称是否作为属于同一 UniRef50 2022_01 簇的任何蛋白质的完整 UniProt 条目的子字符串出现。
从上个月推出的最新版本2022_04 开始,这些名称预测将用作所有 TrEMBL 条目的推荐名称,没有注释到的则名称将继续标注“Uncharacterized protein”(本版本中还剩余49292040 个条目没有注释成功)。这些蛋白质名称的来源在其Evidence标记中注释。