单细胞转录组学习笔记-16-用Scater包分析文章数据

刘小泽写于19.8.20-第三单元第九讲：使用Scater包
笔记目的：根据生信技能树的单细胞转录组课程探索smart-seq2技术相关的分析技术
课程链接在：http://jm.grazy.cn/index/mulitcourse/detail.html?cid=53

首先再次了解文章数据

单细胞转录组学习笔记-4-获取Github代码包以及准备工作

单细胞转录组学习笔记-5-熟悉文献作者提供的两个表达矩阵

载入数据，创建对象

rm(list = ls()) 
Sys.setenv(R_MAX_NUM_DLLS=999)
## 首先载入文章的数据
load(file='../input.Rdata')
# 原始表达矩阵
counts=a
counts[1:4,1:4];dim(counts) # 2万多个基因，768个细胞
library(stringr) 
# 样本信息
meta=df
> head(meta) 
               g plate  n_g all
SS2_15_0048_A3 1  0048 2624 all
SS2_15_0048_A6 1  0048 2664 all
SS2_15_0048_A5 2  0048 3319 all
SS2_15_0048_A4 3  0048 4447 all
SS2_15_0048_A1 2  0048 4725 all
SS2_15_0048_A2 3  0048 5263 all

Scater需要利用SingleCellExperiment这个对象（需要注意的是，官方友情提示，在导入对象之前，最好是将表达量数据存为矩阵）

options(warn=-1) # 全局关闭warning信息
suppressMessages(library(scater))
## 创建 scater 要求的对象
sce <- SingleCellExperiment(
  assays = list(counts = as.matrix(counts)), 
  colData = meta
)

> sce
class: SingleCellExperiment 
dim: 24582 768 
metadata(0):
assays(1): counts
rownames(24582): 0610005C13Rik 0610007P14Rik ... ERCC-00170
  ERCC-00171
rowData names(0):
colnames(768): SS2_15_0048_A3 SS2_15_0048_A6 ... SS2_15_0049_P22
  SS2_15_0049_P24
colData names(4): g plate n_g all
reducedDimNames(0):
spikeNames(0):

预处理

如果要计算CPM值，之前一直使用log2(edgeR::cpm(dat)+1)进行计算，这个包自己做了一个函数：calculateCPM()

exprs(sce) <- log2(calculateCPM(sce ) + 1)
# 计算结果保存在
> assayNames(sce)
[1] "counts"    "logcounts"
# 然后取出来计算结果也很简单
> counts(sce)[1:3,1:3]
              SS2_15_0048_A3 SS2_15_0048_A6 SS2_15_0048_A5
0610005C13Rik              0              0              0
0610007P14Rik              0              0             18
0610009B22Rik              0              0              0
> logcounts(sce)[1:3,1:3]
              SS2_15_0048_A3 SS2_15_0048_A6 SS2_15_0048_A5
0610005C13Rik              0              0       0.000000
0610007P14Rik              0              0       6.458664
0610009B22Rik              0              0       0.000000

注意：表达矩阵的标准命名中，exprs和logcounts是同义词，它是为了和老版本的scater函数兼容
> identical(exprs(sce), logcounts(sce))
[1] TRUE

拿到基因名，检测是否存在线粒体基因、ERCC spike-in（利用feature信息对细胞进行质控）

genes=rownames(rowData(sce))
> length(genes[grepl('^MT-',genes)])
[1] 0
> length(genes[grepl('^ERCC-',genes)])
[1] 92
# 这也是标准的ERCC，目前赛默飞公司提供的就设置了92个不同长度和GC含量的细菌RNA序列

利用calculateQCMetrics函数进行QC：

# 官方给定的写法是：
example_sce <- calculateQCMetrics(example_sce, 
    feature_controls = list(ERCC = 1:20, mito = 500:1000),
    cell_controls = list(empty = 1:5, damaged = 31:40))
# 这里添加feature_controls信息即可
sce <- calculateQCMetrics(sce, 
                          feature_controls = list(ERCC = grep('^ERCC',genes)))

之后过滤：

# 至少在5个细胞中有表达量的基因可以留下
keep_feature <- rowSums(exprs(sce) > 0) > 5
> table(keep_feature)
keep_feature
FALSE  TRUE 
10427 14155 
sce <- sce[keep_feature,]
# 然后看看细胞中总表达量
boxplot(sce$total_features_by_counts )
# 根据下图设置总表达量低于2000的细胞被舍去
keep.n <- sce$total_features_by_counts > 2000
filtered_sce <- sce[,keep.n]
# 最终过滤了一万多基因，几十个细胞
> dim(filtered_sce)
[1] 14155   693

image

对过滤的结果可视化

首先调几个基因看看基因表达量和384孔板这个批次有没有关系：

plotExpression(sce, rownames(sce)[1:6],
    x = "plate", exprs_values = "logcounts")

image

另外简单看看高表达基因的占比：

默认显示前50个基因。图中每一行表示一个基因，每个线条(bar)表示这个基因在不同细胞的表达量(可以想象成把基因表达量的箱线图转了一下)。圆圈是每个基因表达量的中位数，并且在图中经过了排序。

plotHighestExprs(sce, exprs_values = "counts")

图中可以发现top50中很多ERCC的存在，但是看到第一个ERCC在很多样本中占比超过了15%，也就是说那些样本中有超过15%的reads都”浪费“在了这种不相关的外源序列上，减少了自身的比对量

image

降维1-PCA分析

默认情况下，runPCA会根据500个变化差异最显著的feature的log-count值进行计算，当然这个数量可以通过ntop参数修改。

sce <- runPCA(sce)
plotPCA(sce)
# SingleCellExperiment对象中包含了reducedDims接口，其中存储了细胞降维后的坐标，可以用reducedDim、reducedDims函数获取，而具体降维的名称用reducedDimNames获取
> reducedDimNames(sce)
[1] "PCA"

image

这样的结果需要再加上表型信息，才能看出来是否有批次效应

plotReducedDim(sce, use_dimred = "PCA", 
                shape_by= "plate", 
                colour_by= "g")

PCA结果

可以看到，四组层次聚类结果在PCA中也能够分开，并且每组细胞都含有两个细胞板信息，细胞板混杂在一起说明没有批次效应

降维2-tSNE

注意：tsne只是一种降维的方法，最后只给出一个坐标。根据坐标是能明白这一群和那一群能分得开，但还不能确定这一群就是单独的一组。为了找到这个依据，就是要进行聚类

set.seed(1000)
sce <- runTSNE(sce, perplexity=10)
plotTSNE(sce, 
         shape_by= "plate", 
         colour_by= "g")

从图中可以看到，之前用层次聚类定义的4群细胞，现在主要有3群（第1群和第2群混在了一起）

tSNE结果

降维3- DiffusionMap

sce <- runDiffusionMap(sce)
plotDiffusionMap(sce,  
                 shape_by= "plate", 
                 colour_by= "g")

# 此时sce也记录了，做过三次降维处理，但每次都不冲突，存储在平行位置
> sce@reducedDims
List of length 3
names(3): PCA TSNE DiffusionMap

DiffusionMap结果

聚类1-K-means

以t-SNE结果为例

# 提取tsne降维后的主成分坐标，这个坐标就相当于一个新的矩阵，只不过不记录表达量而记录坐标(供后续聚类使用)
> head(sce@reducedDims$TSNE,3)
         [,1]      [,2]
[1,] 13.99815 -17.82133
[2,] 14.94079 -14.26358
[3,] 10.63692 -23.44417
# Kmeans需要的参数主要是：一个数值矩阵，一个自定义的分群数量
kmeans(sce@reducedDims$TSNE,centers = 4)
# 它的结果主要包含：
# Available components:
[1] "cluster"      "centers"      "totss"        "withinss"    
[5] "tot.withinss" "betweenss"    "size"         "iter"        
[9] "ifault" 

# 我们选择第一个”cluster“，就是记录的分组信息
> head(kmeans(sce@reducedDims$TSNE,centers = 4)$cluster)
[1] 4 4 4 3 1 3
# 最后将分组信息添加到sce的表型信息中
colData(sce)$tSNE_kmeans <- as.character(kmeans(sce@reducedDims$TSNE,
                                                centers = 4)$cluster)
plotTSNE(sce,  colour_by = "tSNE_kmeans")

image

聚类2-层次聚类hclust：

# 重点：将tsne的结果当成一个矩阵即可，让其中的坐标分成4群就行
hc=hclust(dist( sce@reducedDims$TSNE ))
clus = cutree(hc, 4) 
colData(sce)$tSNE_hc <-  as.character(clus)
plotTSNE(sce,  colour_by = "tSNE_hc")

image

聚类3-SC3包

另外，有个R包SC3 也提供了聚类的算法，是基于K-means的，用一下试试

library(SC3) # BiocManager::install('SC3')
sce <- sc3_estimate_k(sce) # 先预估一下聚类亚群
sce@metadata$sc3$k_estimation # 预估13个亚群
rowData(sce)$feature_symbol <- rownames(rowData(sce))

# 接下来正式运行，kn参数表示的预估聚类数
# 我们这里自定义为4组
kn <- 4 
start=Sys.time()
sce <- sc3(sce, ks = kn, biology = TRUE) # 运行会很慢
end=Sys.time()
(dur=end-start)
# 总共需要5分钟左右

# 会将聚类结果放入表型信息(sce@colData)中去，默认叫sc3_cluster，这里人为改个名称 
sc3_cluster="sc3_4_clusters"
# 最后进行可视化--比较之前tSNE的Kmeans聚类和SC3的聚类的一致性
sc3_plot_consensus(sce, k = kn, show_pdata = c("tSNE_kmeans",sc3_cluster))

比较tSNE-Kmeans和SC3-Kmeans

再用table函数看看二者分群的相关性：

> table(colData(sce)$tSNE_kmeans,colData(sce)$sc3_4_clusters)
   
      1   2   3   4
  1  14  42  44   6
  2 194   0   0   0
  3  36 147   0   7
  4 278   0   0   0

同理，也能看看SC3结果与hclust的聚类相关性
sc3_plot_consensus(sce, k = kn, show_pdata = c("g",sc3_cluster))

人面猴
序言：七十年代末，一起剥皮案震惊了整个滨河市，随后出现的几起案子，更是在滨河造成了极大的恐慌，老刑警刘岩，带你破解...
沈念sama阅读 196,200评论 5赞 462
死咒
序言：滨河连续发生了三起死亡事件，死亡现场离奇诡异，居然都是意外死亡，警方通过查阅死者的电脑和手机，发现死者居然都...
沈念sama阅读 82,526评论 2赞 373
救了他两次的神仙让他今天三更去死
文/潘晓璐我一进店门，熙熙楼的掌柜王于贵愁眉苦脸地迎上来，“玉大人，你说我怎么就摊上这事。” “怎么了？”我有些...
开封第一讲书人阅读 143,321评论 0赞 325
道士缉凶录：失踪的卖姜人
文/不坏的土叔我叫张陵，是天一观的道长。经常有香客问我，道长，这世上最难降的妖魔是什么？我笑而不...
开封第一讲书人阅读 52,601评论 1赞 267
港岛之恋（遗憾婚礼）
正文为了忘掉前任，我火速办了婚礼，结果婚礼上，老公的妹妹穿的比我还像新娘。我一直安慰自己，他们只是感情好，可当我...
茶点故事阅读 61,446评论 5赞 358
恶毒庶女顶嫁案：这布局不是一般人想出来的
文/花漫我一把揭开白布。她就那样静静地躺着，像睡着了一般。火红的嫁衣衬着肌肤如雪。梳的纹丝不乱的头发上，一...
开封第一讲书人阅读 46,345评论 1赞 273
城市分裂传说
那天，我揣着相机与录音，去河边找鬼。笑死，一个胖子当着我的面吹牛，可吹牛的内容都是我干的。我是一名探鬼主播，决...
沈念sama阅读 36,753评论 3赞 387
双鸳鸯连环套：你想象不到人心有多黑
文/苍兰香墨我猛地睁开眼，长吁一口气：“原来是场噩梦啊……” “哼！你这毒妇竟也来了？” 一声冷哼从身侧响起，我...
开封第一讲书人阅读 35,405评论 0赞 255
万荣杀人案实录
序言：老挝万荣一对情侣失踪，失踪者是张志新（化名）和其女友刘颖，没想到半个月后，有当地人在树林里发现了一具尸体，经...
沈念sama阅读 39,712评论 1赞 294
护林员之死
正文独居荒郊野岭守林人离奇死亡，尸身上长有42处带血的脓包…… 初始之章·张勋以下内容为张勋视角年9月15日...
茶点故事阅读 34,743评论 2赞 314
白月光启示录
正文我和宋清朗相恋三年，在试婚纱的时候发现自己被绿了。大学时的朋友给我发了我未婚夫和他白月光在一起吃饭的照片。...
茶点故事阅读 36,529评论 1赞 326
活死人
序言：一个原本活蹦乱跳的男人离奇死亡，死状恐怖，灵堂内的尸体忽然破棺而出，到底是诈尸还是另有隐情，我是刑警宁泽，带...
沈念sama阅读 32,369评论 3赞 315
日本核电站爆炸内幕
正文年R本政府宣布，位于F岛的核电站，受9级特大地震影响，放射性物质发生泄漏。R本人自食恶果不足惜，却给世界环境...
茶点故事阅读 37,770评论 3赞 300
男人毒药：我在死后第九天来索命
文/蒙蒙一、第九天我趴在偏房一处隐蔽的房顶上张望。院中可真热闹，春花似锦、人声如沸。这庄子的主人今日做“春日...
开封第一讲书人阅读 29,026评论 0赞 19
一桩弑父案，背后竟有这般阴谋
文/苍兰香墨我抬头看了看天上的太阳。三九已至，却和暖如春，着一层夹袄步出监牢的瞬间，已是汗流浃背。一阵脚步声响...
开封第一讲书人阅读 30,301评论 1赞 251
情欲美人皮
我被黑心中介骗来泰国打工，没想到刚下飞机就差点儿被人妖公主榨干…… 1. 我叫王不留，地道东北人。一个月前我还...
沈念sama阅读 41,732评论 2赞 342
代替公主和亲
正文我出身青楼，却偏偏与公主长得像，于是被迫代替她去往敌国和亲。传闻我的和亲对象是个残疾皇子，可洞房花烛夜当晚...
茶点故事阅读 40,927评论 2赞 336

单细胞转录组学习笔记-16-用Scater包分析文章数据

首先再次了解文章数据

载入数据，创建对象

预处理

对过滤的结果可视化

降维1-PCA分析

降维2-tSNE

降维3- DiffusionMap

聚类1-K-means

聚类2-层次聚类hclust：

聚类3-SC3包

推荐阅读更多精彩内容