Linux获取PM2.5检测信息

1.<em>绿色呼吸</em> 获取当前时间监测数据,写入pm25.txt文件

reing@reing-Lenovo-Y430P:~/桌面$ curl http://www.pm25.com/city/beijing.html > pm25.txt
  % Total    % Received % Xferd  Average Speed   Time    Time     Time  Current
                                 Dload  Upload   Total   Spent    Left  Speed
100  212k    0  212k    0     0   596k      0 --:--:-- --:--:-- --:--:--  597k

pm25.txt中各监测站信息由<li></li>标签维护,每组<li></li>中包含<span> <a>..等标签。

//pm25.txt 部分内容
<a class="pjadt_location" href="/city/mon/aqi/北京/万寿西宫.html" title="查看万寿西宫详细数据">万寿西宫</a>
                                        <span class="pjadt_aqi">121<i class=""></i></span>
                                        <span class="pjadt_quality"><em class="pjadt_quality_bglevel_3">轻度污染</em></span>
                                        <a class="pjadt_wuranwu" href="/news/387.html" title="颗粒物(PM10)" target="_blank">颗粒物(PM10)</a>
                                        <span class="pjadt_pm25">3 <em>μg/m³</em><i class=""></i></span>
                                        <span class="pjadt_pm10">192 <em>μg/m³</em><i class=""></i></span>
                                        <div class="clear"></div>
                                    </li>
                                                                        <li class="pj_area_data_item pj_area_data_item_darkbg">
                                        <b></b>
                                        <a class="pjadt_location" href="/city/mon/aqi/北京/定陵.html" title="查看定陵详细数据">定陵</a>
                                        <span class="pjadt_aqi">26<i class=""></i></span>
                                        <span class="pjadt_quality"><em class="pjadt_quality_bglevel_1">优</em></span>
                                        <a class="pjadt_wuranwu" href="javascript:void(0)" title="—" target="_blank">—</a>
                                        <span class="pjadt_pm25">3 <em>μg/m³</em><i class=""></i></span>
                                        <span class="pjadt_pm10">5 <em>μg/m³</em><i class=""></i></span>
                                        <div class="clear"></div>
                                    </li>
                                                                        <li class="pj_area_data_item pj_area_data_item_darkbg">
                                        <b></b>
                                        <a class="pjadt_location" href="/city/mon/aqi/北京/东四.html" title="查看东四详细数据">东四</a>

2. 使用tr命令删除所有换行,写入new.txt

reing@reing-Lenovo-Y430P:~/桌面$ tr "\n" " " < pm25.txt > new.txt

pm25.txt中内含标签之间有换行符,不删除的话监测点信息分布在不同行,不易使用awk命令处理,因此使用tr命令删除所有换行

//new.txt部分内容
li class="pj_area_data_item pj_area_data_item_darkbg">                                         <b></b>                                         <a class="pjadt_location" href="/city/mon/aqi/北京/万寿西宫.html" title="查看万寿西宫详细数据">万寿西宫</a>                                         <span class="pjadt_aqi">121<i class=""></i></span>                                         <span class="pjadt_quality"><em class="pjadt_quality_bglevel_3">轻度污染</em></span>                                         <a class="pjadt_wuranwu" href="/news/387.html" title="颗粒物(PM10)" target="_blank">颗粒物(PM10)</a>                                         <span class="pjadt_pm25">3 <em>μg/m³</em><i class=""></i></span>                                         <span class="pjadt_pm10">192 <em>μg/m³</em><i class=""></i></span>                                         <div class="clear"></div>                                     </li>                                                                         <li class="pj_area_data_item pj_area_data_item_darkbg">                                         <b></b>                                         <a class="pjadt_location" href="/city/mon/aqi/北京/定陵.html" title="查看定陵详细数据">定陵</a>                                         <span class="pjadt_aqi">26<i class=""></i></span>                                         <span class="pjadt_quality"><em class="pjadt_quality_bglevel_1">优</em></span>                                         <a class="pjadt_wuranwu" href="javascript:void(0)" title="—" target="_blank">—</a>                                         <span class="pjadt_pm25">3 <em>μg/m³</em><i class=""></i></span>                                         <span class="pjadt_pm10">5 <em>μg/m³</em><i class=""></i></span>                                         <div class="clear"></div>                                     </li>

3. 使用sed命令为特定行前添加换行,写入new2.txt

reing@reing-Lenovo-Y430P:~/桌面$ sed -e 's/<li/\n<li/g' -e 's/更新时间:/\n更新时 间: /g' new.txt > new2.txt

各个监测点之间,监测点和冗余信息之间需要换行区分,否则信息集中在同一行。同时要为保证取到更新时间,需要对更新时间前添加换行,并在“更新时间:”后添加空格以分离“更新时间:”和具体日期

//new2.txt部分内容
<li class="pj_area_data_item pj_area_data_item_darkbg">                                         <b></b>                                         <a class="pjadt_location" href="/city/mon/aqi/北京/万寿西宫.html" title="查看万寿西宫详细数据">万寿西宫</a>                                         <span class="pjadt_aqi">121<i class=""></i></span>                                         <span class="pjadt_quality"><em class="pjadt_quality_bglevel_3">轻度污染</em></span>                                         <a class="pjadt_wuranwu" href="/news/387.html" title="颗粒物(PM10)" target="_blank">颗粒物(PM10)</a>                                         <span class="pjadt_pm25">3 <em>μg/m³</em><i class=""></i></span>                                         <span class="pjadt_pm10">192 <em>μg/m³</em><i class=""></i></span>                                         <div class="clear"></div>                                     </li>                                                                         
<li class="pj_area_data_item pj_area_data_item_darkbg">                                         <b></b>                                         <a class="pjadt_location" href="/city/mon/aqi/北京/定陵.html" title="查看定陵详细数据">定陵</a>                                         <span class="pjadt_aqi">26<i class=""></i></span>                                         <span class="pjadt_quality"><em class="pjadt_quality_bglevel_1">优</em></span>                                         <a class="pjadt_wuranwu" href="javascript:void(0)" title="—" target="_blank">—</a>                                         <span class="pjadt_pm25">3 <em>μg/m³</em><i class=""></i></span>                                         <span class="pjadt_pm10">5 <em>μg/m³</em><i class=""></i></span>                                         <div class="clear"></div>                                     </li>

4. 使用sed命令将标签替换为空格,写入new3.txt

reing@reing-Lenovo-Y430P:~/桌面$ sed 's/<[^>]*>/ /g' new2.txt > new3.txt

目的在于删除所有标签,只保留下显示信息,但要保证信息之间有至少一个空格,因此将标签换为空格,作为信息的划分

//new3.txt部分内容
万寿西宫                                           121                                              轻度污染                                            颗粒物(PM10)                                           3  μg/m³                                              192  μg/m³                                                                                                                                                              
                                                                                      定陵                                           26                                              优                                            —                                           3  μg/m³                                              5  μg/m³

5. 使用awk命令提取更新时间

reing@reing-Lenovo-Y430P:~/桌面$ date='awk '/更新时间/{print $2}' new3.txt'
reing@reing-Lenovo-Y430P:~/桌面$ time=`awk '/更新时间/{print $3}' new3.txt`
reing@reing-Lenovo-Y430P:~/桌面$ export date
reing@reing-Lenovo-Y430P:~/桌面$ export time
//通过awk命令提取到更新时间的日期和时刻,添加到环境变量,以便在后续输出时,awk变量能够访问shell变量

6. 使用awk命令提取各地点的信息,同时间写入new4.txt

reing@reing-Lenovo-Y430P:~/桌面$ awk '/细颗粒物\(PM2\.5\)/{printf "%s ", ENVIRON["date"];printf "%s,", ENVIRON["time"];printf "%s,%s\n",$1,$2}' < new3.txt > new4.txt
//匹配“细颗粒物(PM2.5)”找到信息所在行,提取监测点名称和污染指数,连同更新时间一并写入最终文件

结果

//new4.txt内容
2017-03-29 12:00,东四,214
2017-03-29 12:00,农展馆,211
2017-03-29 12:00,官园,150
2017-03-29 12:00,海淀区万柳,189
2017-03-29 12:00,顺义新城,215
2017-03-29 12:00,怀柔镇,205
2017-03-29 12:00,昌平镇,158
2017-03-29 12:00,奥体中心,198
2017-03-29 12:00,古城,214
2017-03-29 12:00,东四,214
2017-03-29 12:00,农展馆,211
2017-03-29 12:00,官园,179
2017-03-29 12:00,海淀区万柳,195
2017-03-29 12:00,顺义新城,215
2017-03-29 12:00,怀柔镇,205
2017-03-29 12:00,昌平镇,182
2017-03-29 12:00,奥体中心,198
2017-03-29 12:00,古城,214
最后编辑于
©著作权归作者所有,转载或内容合作请联系作者
  • 序言:七十年代末,一起剥皮案震惊了整个滨河市,随后出现的几起案子,更是在滨河造成了极大的恐慌,老刑警刘岩,带你破解...
    沈念sama阅读 199,830评论 5 468
  • 序言:滨河连续发生了三起死亡事件,死亡现场离奇诡异,居然都是意外死亡,警方通过查阅死者的电脑和手机,发现死者居然都...
    沈念sama阅读 83,992评论 2 376
  • 文/潘晓璐 我一进店门,熙熙楼的掌柜王于贵愁眉苦脸地迎上来,“玉大人,你说我怎么就摊上这事。” “怎么了?”我有些...
    开封第一讲书人阅读 146,875评论 0 331
  • 文/不坏的土叔 我叫张陵,是天一观的道长。 经常有香客问我,道长,这世上最难降的妖魔是什么? 我笑而不...
    开封第一讲书人阅读 53,837评论 1 271
  • 正文 为了忘掉前任,我火速办了婚礼,结果婚礼上,老公的妹妹穿的比我还像新娘。我一直安慰自己,他们只是感情好,可当我...
    茶点故事阅读 62,734评论 5 360
  • 文/花漫 我一把揭开白布。 她就那样静静地躺着,像睡着了一般。 火红的嫁衣衬着肌肤如雪。 梳的纹丝不乱的头发上,一...
    开封第一讲书人阅读 48,091评论 1 277
  • 那天,我揣着相机与录音,去河边找鬼。 笑死,一个胖子当着我的面吹牛,可吹牛的内容都是我干的。 我是一名探鬼主播,决...
    沈念sama阅读 37,550评论 3 390
  • 文/苍兰香墨 我猛地睁开眼,长吁一口气:“原来是场噩梦啊……” “哼!你这毒妇竟也来了?” 一声冷哼从身侧响起,我...
    开封第一讲书人阅读 36,217评论 0 254
  • 序言:老挝万荣一对情侣失踪,失踪者是张志新(化名)和其女友刘颖,没想到半个月后,有当地人在树林里发现了一具尸体,经...
    沈念sama阅读 40,368评论 1 294
  • 正文 独居荒郊野岭守林人离奇死亡,尸身上长有42处带血的脓包…… 初始之章·张勋 以下内容为张勋视角 年9月15日...
    茶点故事阅读 35,298评论 2 317
  • 正文 我和宋清朗相恋三年,在试婚纱的时候发现自己被绿了。 大学时的朋友给我发了我未婚夫和他白月光在一起吃饭的照片。...
    茶点故事阅读 37,350评论 1 329
  • 序言:一个原本活蹦乱跳的男人离奇死亡,死状恐怖,灵堂内的尸体忽然破棺而出,到底是诈尸还是另有隐情,我是刑警宁泽,带...
    沈念sama阅读 33,027评论 3 315
  • 正文 年R本政府宣布,位于F岛的核电站,受9级特大地震影响,放射性物质发生泄漏。R本人自食恶果不足惜,却给世界环境...
    茶点故事阅读 38,623评论 3 303
  • 文/蒙蒙 一、第九天 我趴在偏房一处隐蔽的房顶上张望。 院中可真热闹,春花似锦、人声如沸。这庄子的主人今日做“春日...
    开封第一讲书人阅读 29,706评论 0 19
  • 文/苍兰香墨 我抬头看了看天上的太阳。三九已至,却和暖如春,着一层夹袄步出监牢的瞬间,已是汗流浃背。 一阵脚步声响...
    开封第一讲书人阅读 30,940评论 1 255
  • 我被黑心中介骗来泰国打工, 没想到刚下飞机就差点儿被人妖公主榨干…… 1. 我叫王不留,地道东北人。 一个月前我还...
    沈念sama阅读 42,349评论 2 346
  • 正文 我出身青楼,却偏偏与公主长得像,于是被迫代替她去往敌国和亲。 传闻我的和亲对象是个残疾皇子,可洞房花烛夜当晚...
    茶点故事阅读 41,936评论 2 341

推荐阅读更多精彩内容

  • linux资料总章2.1 1.0写的不好抱歉 但是2.0已经改了很多 但是错误还是无法避免 以后资料会慢慢更新 大...
    数据革命阅读 12,127评论 2 34
  • 基础命令 主要的命令和快捷键 Linux系统命令由三部分组成:cmd + [options]+[operation...
    485b1aca799e阅读 1,082评论 0 0
  • 转载 原文的排版和内容都更加友好,并且详细,我只是在这里贴出了一部分留作自己以后参考和学习,如希望更详细了解AWK...
    XKirk阅读 3,181评论 2 25
  • 本文承接之前写的三十分钟学会AWK一文,在学习完AWK之后,趁热打铁又学习了一下SED,不得不说这两个工具真的堪称...
    mylxsw阅读 4,379评论 3 74
  • 1、上夜班前 A:若是提前知道晚上要轮夜班,在中午有时间的话一定要睡一会,小憩一会,晚上就不会太困倦。 B:夜班前...
    m曲终杯盏凉阅读 4,303评论 0 15