1. 各种ID名称介绍
Gene ID 也称Entrez ID/EntrezGene ID ,是 NCBI 使用的能够对众多数据库进行联合搜索的搜索引擎, 其对不同的 Gene 进行了编号, 每个 gene 的编号就是 entrez gene id,就是一串数字,比如:TP53 的Gene ID是:7157。因为entrez ID相对稳定, 所以也被其他数据库, 如 KEGG 等采用。不同物种的同一个基因的Gene ID是不同的。NCBI的RefSeq数据库ID,一般是两个大写首字母,加下划线,后面为数字。两个首字母 ”NC”、”NM”、”NP_”分别代表DNA、mRNA、Protein。
Gene Symbol ,是HGNC数据库为基因提供的官方名称,HGNC是人类基因命名委员会(HUGO Gene Nomenclature Committee);人类基因组命名委员会。有专门的数据库:https://www.genenames.org/。主要是按基因的功能起的名字,字母一般为英文全称的缩写,由大写字母和数字组成,如TP53基因的Official Symbol就是由HGNC所提供。
Ensembl ID,是在Ensembl数据库中对基因的命名,常见的物种前缀:“ENS“表示Homo sapiens (Human),”ENSMUS“表示Mus musculus (Mouse),”ENSDAR“表示Danio rerio (Zebrafish);而常见的序列类型用G、P、T、分别表示gene、protein和transcript。
2. 什么时候需要进行gene转换:
Ensembl ID---转换为---gene symbol: 如TCGA数据库,进行差异基因分析以及后续分析时需要gene symbol,需要通过ensembl网站上的ensmbol与gene symbol对应的文件“Homo_sapiens.GRCh38.84.chr.gtf”,然后通过“perl”软件进行转换。
gene symbol---转换为---gene ID: 进行后续的KEGG,GO分析需要,用R语言中的“org.Hs.eg.db”包,进行数据库中的一一搜索,运行脚本即可。
gene probe---转换为---gene symbol: 表达芯片数据集需要后续分析时,尤其是GEO数据库。