服务挂了,怎么自动恢复?
大家或许都碰到过这样的情况:
tomcat挂了,站点应用访问不了
service出core了,服务挂了
架构设计上,避免单点,使用故障自动转移固然能够保证系统的高可用,是否还有其他的方案,让挂掉的服务自动启动呢,这里给大伙推荐一个常见的运维工具 supervisor。
画外音:supervisor是很常见的运维工具,以下几个小问题旨在让不熟悉的同学简单了解相关原理,献丑了。
supervisor是什么?
答:用Python开发的通用的进程管理工具。
supervisor有什么用?
答:supervisor能把一个普通进程变为后台daemon进程,并监控进程状态,在进程异常退出时能够自动重启(或者告警),同时还提供一些相关的管理功能。
supervisor是怎么做到的?
答:supervisor通过fork/exec的方式,把被管理的进程当作其子进程来启动,在被管理的子进程异常退出时(例如tomcat出异常挂掉,或者服务出core挂掉,或者收到异常信号挂掉),作为父进程可以获取相关信息,以选择后续如何处理。
之前没用过supervisor,这玩意是否靠谱?
答:额,supervisor诞生10年以上了,绝对靠谱,绝大部分运维同学都熟知它。
作为程序员,了解一些运维的知识有用么?
答:额,知道“&”与“nohup”的区别,对写程序可能没帮助,但对理解整个技术体系及思路肯定是有好处的。
希望没有浪费这一分钟。
调研:“&”与“nohup”的区别是啥呀?
测试代码如下:
是一个输出hello与循环轮数的死循环程序,每输出一行就休眠1秒。
使用 ./a.out 前台运行程序,会是什么效果呢?
程序每隔一秒会在终端输出一个字符串。
此时如果键入Ctrl+C ,程序会收到一个SIGINT信号,如果不做特殊处理,程序的默认行为是终止(如上图)。
使用 ./a.out& 后台运行程序,会是什么效果呢?
如上图:
首先会在终端显示进程号是32389
键入Ctrl + C,发出SIGINT信号,程序会继续运行
need-to-insert-img
ps确认一下,确认进程依然在运行,进程号是32389。
此时如果关掉session,程序会收到一个SIGHUP信号,此时会怎么样呢?
ps再次确认,可以看到关闭session之后,进程号是32389的a.out进程也关闭了。
使用nohup ./a.out 又会是什么效果呢?
使用nohup 运行程序a.out,会发现:
前台没有出现进程号
有一个“忽略输入,输出至nohup.out”的提示
hello的输出也没有出现在前台
手动ps看进程号,这次a.out的进程号是32437。
此时如果关掉session,程序会收到一个SIGHUP信号,程序会不会关闭呢?
关掉session后,再次ps看一下,ID为32437的a.out进程还在。
这些只能通过kill把程序干掉了,killall之后,ps查看进程已经关闭。
killall之后,查看发现多了一个nohup.out文件,不过这个文件的大小是0,有点奇怪,启动程序的时候,明明提示了“appending output to nohup.out”呀,先把问题遗留在这,测试一下Ctrl +C。
仍如上图,使用nohup启动a.out,如果键入Ctrl+C ,程序收到SIGINT信号后,直接关闭了。
最后测试一下nohup和&同时使用,即用nohup./a.out &运行程序,又会是什么效果呢?
使用nohup ./a.out &运行程序后,可以看到:
会在终端显示进程号是32524
也会有一个“忽略输入,输出至nohup.out”的提示
键入Ctrl + C,发送SIGINT信号,似乎没反应。
关闭session,发送SIGHUP信号,再来看看。
ID为32524的进程依然存在,后续也只能用kill来关闭它。
结论
使用&后台运行程序:
结果会输出到终端
使用Ctrl + C发送SIGINT信号,程序免疫
关闭session发送SIGHUP信号,程序关闭
使用nohup运行程序:
结果默认会输出到nohup.out
使用Ctrl + C发送SIGINT信号,程序关闭
关闭session发送SIGHUP信号,程序免疫
平日线上经常使用nohup和&配合来启动程序:
同时免疫SIGINT和SIGHUP信号
同时,还有一个最佳实践:
不要将信息输出到终端标准输出,标准错误输出,而要用日志组件将信息记录到日志里
尾巴
nohup启动a.out,程序终止后,为啥nohup.out的大小是0?“hello”的字符串哪去了?