《R语言实战》学习笔记---Chapter5(11) 高级数据管理 一个数据处理的小示例

一个数据处理的小示例

用书中的数据处理的例子,作为本章学习的实践总结:

一组学生参加了数学、 科学和英语考试。 为了给所有学生确定一个单一的成绩衡量指标, 需要将这些科目的成绩组合起来。另外, 你还想将前20%的学生评定为A, 接下来20%的学生评定为B, 依次类推。最后, 按字母顺序对学生排序。

数据如下表所示:

学生姓名 数学 科学 英语
John Davis 502 95 25
Angela Williams 600 99 22
Bullwinkle Moose 412 80 18
David Jones 358 82 15
Janice Markhammer 495 75 20
Cheryl Cushing 512 85 28
Reuven Ytzrhak 410 80 15
Greg Knox 625 95 30
Joel England 573 89 27
Mary Rayburn 522 86 18

需要处理的问题可以拆分成3个:

  • 各科成绩标准化;
  • 总成绩按20%分段评级;
  • 学生名称依据字母顺序排序;

步骤1

我们来依次解决问题,首先把表格数据转换成R中的数据框。

options(digits=2)用于设定计算结果的有效位数。

Student <- c("John Davis", "Angela Williams", "Bullwinkle Moose",
             "David Jones", "Janice Markhammer", "Cheryl Cushing",
             "Reuven Ytzrhak", "Greg Knox", "Joel England",
             "Mary Rayburn")
Math <- c(502, 600, 412, 358, 495, 512, 410, 625, 573, 522)
Science <- c(95, 99, 80, 82, 75, 85, 80, 95, 89, 86)
English <- c(25, 22, 18, 15, 20, 28, 15, 30, 27, 18)
roster <- data.frame(Student, Math, Science, English,
                       stringsAsFactors=FALSE)
> roster
             Student Math Science English
1         John Davis  502      95      25
2    Angela Williams  600      99      22
3   Bullwinkle Moose  412      80      18
4        David Jones  358      82      15
5  Janice Markhammer  495      75      20
6     Cheryl Cushing  512      85      28
7     Reuven Ytzrhak  410      80      15
8          Greg Knox  625      95      30
9       Joel England  573      89      27
10      Mary Rayburn  522      86      18

步骤2

我们可以看到,三科成绩存在数量级级别的差距,直接进行求和运算显然不妥,我们需要对数据进行标准化,使其可以进行运算和比较。

R提供了一个scale函数,将原始数据用单位标准差来表示, 而不是以原始的尺度来表示。

> z <- scale(roster[,2:4])
> z
        Math Science English
 [1,]  0.013   1.078   0.587
 [2,]  1.143   1.591   0.037
 [3,] -1.026  -0.847  -0.697
 [4,] -1.649  -0.590  -1.247
 [5,] -0.068  -1.489  -0.330
 [6,]  0.128  -0.205   1.137
 [7,] -1.049  -0.847  -1.247
 [8,]  1.432   1.078   1.504
 [9,]  0.832   0.308   0.954
[10,]  0.243  -0.077  -0.697
attr(,"scaled:center")
   Math Science English 
    501      87      22 
attr(,"scaled:scale")
   Math Science English 
   86.7     7.8     5.5 

步骤3

然后使用apply函数将mean函数分别运用到各行数据,计算每一行的均值来获得综合得分,并使用cbind函数添加到原数据框中:

score <- apply(z, 1, mean)
roster <- cbind(roster, score)
roster
             Student Math Science English score score
1         John Davis  502      95      25  0.56  0.56
2    Angela Williams  600      99      22  0.92  0.92
3   Bullwinkle Moose  412      80      18 -0.86 -0.86
4        David Jones  358      82      15 -1.16 -1.16
5  Janice Markhammer  495      75      20 -0.63 -0.63
6     Cheryl Cushing  512      85      28  0.35  0.35
7     Reuven Ytzrhak  410      80      15 -1.05 -1.05
8          Greg Knox  625      95      30  1.34  1.34
9       Joel England  573      89      27  0.70  0.70
10      Mary Rayburn  522      86      18 -0.18 -0.18

步骤4

然后使用quantile函数按照20%进行分段计算分位数:

y <- quantile(roster$score, c(0.8, 0.6, 0.4, 0.2))
> y
  80%   60%   40%   20% 
 0.74  0.44 -0.36 -0.89 

步骤5

然后使用逻辑运算符进行数据的重编码,将成绩重编码为等级字符,创建一个变量grade

roster$grade[roster$score >= y[1]] <- 'A'
roster$grade[y[1] > roster$score & roster$score >= y[2] ] <- 'B'
roster$grade[y[2] > roster$score & roster$score >= y[3] ] <- 'C'
roster$grade[y[3] > roster$score & roster$score >= y[4] ] <- 'D'
roster$grade[roster$score < y[4]] <- 'E'
roster

             Student Math Science English score score grade
1         John Davis  502      95      25  0.56  0.56     B
2    Angela Williams  600      99      22  0.92  0.92     A
3   Bullwinkle Moose  412      80      18 -0.86 -0.86     D
4        David Jones  358      82      15 -1.16 -1.16     E
5  Janice Markhammer  495      75      20 -0.63 -0.63     D
6     Cheryl Cushing  512      85      28  0.35  0.35     C
7     Reuven Ytzrhak  410      80      15 -1.05 -1.05     E
8          Greg Knox  625      95      30  1.34  1.34     A
9       Joel England  573      89      27  0.70  0.70     B
10      Mary Rayburn  522      86      18 -0.18 -0.18     C

说明一下上面的语句,roster$grade直接在数据集roster中创建了一个新变量grade[roster$score >= y[1]]是子集选取的语句,符合条件的子集被赋值。

步骤6

根据姓名的首字母排序问题,首先使用strsplit函数将姓名进行拆分,分隔符为空格,返回对象为列表

> name<- strsplit(roster$Student, split = " ")
> str(name)
List of 10
 $ : chr [1:2] "John" "Davis"
 $ : chr [1:2] "Angela" "Williams"
 $ : chr [1:2] "Bullwinkle" "Moose"
 $ : chr [1:2] "David" "Jones"
 $ : chr [1:2] "Janice" "Markhammer"
 $ : chr [1:2] "Cheryl" "Cushing"
 $ : chr [1:2] "Reuven" "Ytzrhak"
 $ : chr [1:2] "Greg" "Knox"
 $ : chr [1:2] "Joel" "England"
 $ : chr [1:2] "Mary" "Rayburn"

步骤7:使用函数sapply() 提取列表中各个成分作为Firstname和Lastname变量, "[" 是一个可以提取某个对象的一部分的函数,1和2指定位置。

Firstname <- sapply(name, "[", 1) 
Lastname <- sapply(name, "[", 2) 
roster <- cbind(Firstname, Lastname, roster[,-1])
    Firstname   Lastname Math Science English score score.1 grade
1        John      Davis  502      95      25  0.56    0.56     B
2      Angela   Williams  600      99      22  0.92    0.92     A
3  Bullwinkle      Moose  412      80      18 -0.86   -0.86     D
4       David      Jones  358      82      15 -1.16   -1.16     E
5      Janice Markhammer  495      75      20 -0.63   -0.63     D
6      Cheryl    Cushing  512      85      28  0.35    0.35     C
7      Reuven    Ytzrhak  410      80      15 -1.05   -1.05     E
8        Greg       Knox  625      95      30  1.34    1.34     A
9        Joel    England  573      89      27  0.70    0.70     B
10       Mary    Rayburn  522      86      18 -0.18   -0.18     C

步骤7

最后,使用order函数进行排序:

roster[order(Lastname,Firstname),]
    Firstname   Lastname Math Science English score score.1 grade
6      Cheryl    Cushing  512      85      28  0.35    0.35     C
1        John      Davis  502      95      25  0.56    0.56     B
9        Joel    England  573      89      27  0.70    0.70     B
4       David      Jones  358      82      15 -1.16   -1.16     E
8        Greg       Knox  625      95      30  1.34    1.34     A
5      Janice Markhammer  495      75      20 -0.63   -0.63     D
3  Bullwinkle      Moose  412      80      18 -0.86   -0.86     D
10       Mary    Rayburn  522      86      18 -0.18   -0.18     C
2      Angela   Williams  600      99      22  0.92    0.92     A
7      Reuven    Ytzrhak  410      80      15 -1.05   -1.05     E

好了,到此,这个数据处理的实践例子就做完了。

到此为止,我觉得要入门R语言,看这本书到这里基本就可以了。R的基本语法、数据结构、处理数据的基本方式都涵盖了。后续在应用中需要什么包就再去学习。

©著作权归作者所有,转载或内容合作请联系作者
  • 序言:七十年代末,一起剥皮案震惊了整个滨河市,随后出现的几起案子,更是在滨河造成了极大的恐慌,老刑警刘岩,带你破解...
    沈念sama阅读 206,214评论 6 481
  • 序言:滨河连续发生了三起死亡事件,死亡现场离奇诡异,居然都是意外死亡,警方通过查阅死者的电脑和手机,发现死者居然都...
    沈念sama阅读 88,307评论 2 382
  • 文/潘晓璐 我一进店门,熙熙楼的掌柜王于贵愁眉苦脸地迎上来,“玉大人,你说我怎么就摊上这事。” “怎么了?”我有些...
    开封第一讲书人阅读 152,543评论 0 341
  • 文/不坏的土叔 我叫张陵,是天一观的道长。 经常有香客问我,道长,这世上最难降的妖魔是什么? 我笑而不...
    开封第一讲书人阅读 55,221评论 1 279
  • 正文 为了忘掉前任,我火速办了婚礼,结果婚礼上,老公的妹妹穿的比我还像新娘。我一直安慰自己,他们只是感情好,可当我...
    茶点故事阅读 64,224评论 5 371
  • 文/花漫 我一把揭开白布。 她就那样静静地躺着,像睡着了一般。 火红的嫁衣衬着肌肤如雪。 梳的纹丝不乱的头发上,一...
    开封第一讲书人阅读 49,007评论 1 284
  • 那天,我揣着相机与录音,去河边找鬼。 笑死,一个胖子当着我的面吹牛,可吹牛的内容都是我干的。 我是一名探鬼主播,决...
    沈念sama阅读 38,313评论 3 399
  • 文/苍兰香墨 我猛地睁开眼,长吁一口气:“原来是场噩梦啊……” “哼!你这毒妇竟也来了?” 一声冷哼从身侧响起,我...
    开封第一讲书人阅读 36,956评论 0 259
  • 序言:老挝万荣一对情侣失踪,失踪者是张志新(化名)和其女友刘颖,没想到半个月后,有当地人在树林里发现了一具尸体,经...
    沈念sama阅读 43,441评论 1 300
  • 正文 独居荒郊野岭守林人离奇死亡,尸身上长有42处带血的脓包…… 初始之章·张勋 以下内容为张勋视角 年9月15日...
    茶点故事阅读 35,925评论 2 323
  • 正文 我和宋清朗相恋三年,在试婚纱的时候发现自己被绿了。 大学时的朋友给我发了我未婚夫和他白月光在一起吃饭的照片。...
    茶点故事阅读 38,018评论 1 333
  • 序言:一个原本活蹦乱跳的男人离奇死亡,死状恐怖,灵堂内的尸体忽然破棺而出,到底是诈尸还是另有隐情,我是刑警宁泽,带...
    沈念sama阅读 33,685评论 4 322
  • 正文 年R本政府宣布,位于F岛的核电站,受9级特大地震影响,放射性物质发生泄漏。R本人自食恶果不足惜,却给世界环境...
    茶点故事阅读 39,234评论 3 307
  • 文/蒙蒙 一、第九天 我趴在偏房一处隐蔽的房顶上张望。 院中可真热闹,春花似锦、人声如沸。这庄子的主人今日做“春日...
    开封第一讲书人阅读 30,240评论 0 19
  • 文/苍兰香墨 我抬头看了看天上的太阳。三九已至,却和暖如春,着一层夹袄步出监牢的瞬间,已是汗流浃背。 一阵脚步声响...
    开封第一讲书人阅读 31,464评论 1 261
  • 我被黑心中介骗来泰国打工, 没想到刚下飞机就差点儿被人妖公主榨干…… 1. 我叫王不留,地道东北人。 一个月前我还...
    沈念sama阅读 45,467评论 2 352
  • 正文 我出身青楼,却偏偏与公主长得像,于是被迫代替她去往敌国和亲。 传闻我的和亲对象是个残疾皇子,可洞房花烛夜当晚...
    茶点故事阅读 42,762评论 2 345

推荐阅读更多精彩内容