数据库服务器主机重启故障诊断分析 _服务器

某客户RAC数据库服务器主机轮流发生集群与主机重启，数据库连接不上问题，如下为故障诊断思路。

一、故障现象告警日志:

Sun Feb 09 14:18:42 2020Auto-tuning: Shutting down background process GTX2Sun Feb 09 15:06:00 2020NOTE: ASMB terminatingErrors in file /opt/oracle/App/diag/rdbms/xxxx/xxxx1/trace/xxxx1_asmb_7463.trc:ORA-15064: communication failure with ASM instanceORA-03113: end-of-file on communication channelProcess ID:Session ID: 68 Serial number: 5Errors in file /opt/oracle/app/diag/rdbms/xxxx/xxxx1/trace/xxxx1_asmb_7463.trc:Errors in file /opt/oracle/app/diag/rdbms/xxxx/xxxx1/trace/xxxx1_asmb_7463.trc:ORA-15064: communication failure with ASM instanceORA-03113: end-of-file on communication channelProcess ID:Session ID: 68 Serial number: 5ASMB (ospid: 7463): terminating the instance due to error 15064Termination issued to instance processes. Waiting for the processes to exitSun Feb 09 15:06:11 2020Instance termination failed to kill one or more processesInstance terminated by ASMB, pid = 7463Sun Feb 09 15:12:24 2020Starting ORACLE instance (normal)************************ Large Pages Information *******************Per process system memlock (soft) limit = UNLIMITEDTotal Shared Global Region in Large Pages = 0 KB (0%)Large Pages used by this instance: 0 (0 KB)Large Pages unused system wide = 0 (0 KB)Large Pages configured system wide = 0 (0 KB)Large Page size = 2048 KBRECOMMENDATION: Total System Global Area size is 24 GB. For optimal performance, prior to the next instance restart: 1. Increase the number of unused large pages byat least 12289 (page size 2048 KB, total size 24 GB) system wide to get 100% of the System Global Area allocated with large pages********************************************************************

文章插图

从数据库告警日志可以发现，核心进程asmb 在2.9日15.06分突然提示正在终止，随后一节点数据库报错，不能与 ASM通信, 也就是连不上 ASM存储,检查ASM告警日志发现，核心进程ASMB 在2.9日15.06分被kill 掉，随后一节点的ASM实例挂掉，导致一节点数据库也紧跟着挂掉
二、故障原因从15:03开始

文章插图

一节点开始报 voting file所在的磁盘， IO通信有超时的现象，磁盘hang住, 到15.05分开始 ocr_vote磁盘离线，一节点被剔出集群，

文章插图

后续检查主机，发现主机重启过，检查操作系统日志，发现从15.02分开始， : INFO: task ocssd.bin:16080 blocked for more than 120 seconds. 有任务被hung 住，

文章插图

该错误是由于IO子系统的处理速度不够快，不能在120秒将缓存中的数据全部写入磁盘。IO系统响应缓慢，导致越来越多的请求堆积，最终IO 耗尽，系统内存全部被占用，导致系统失去响应，发生故障。
三、故障解决建议一：【数据库服务器主机重启故障诊断分析】可以调整操作系统参数，
vm.dirty_ratio=20vm.dirty_background_ratio=3目前操作系统配置文件/etc/sysctl.conf 中没有这两个参数，建议调整， sysctl -p 生效，（调整该操作系统参数不用重启主机） vm.dirtybackgroundratio 这个参数指定了当文件系统缓存脏页数量达到系统内存百分之多少时（如5%）就会触发pdflush/flush/kdmflush等后台回写进程运行，将一定缓存的脏页异步地刷入外存;
操作系统参数说明:
vm.dirty_ratio 这个参数则指定了当文件系统缓存脏页数量达到系统内存百分之多少时（如10%），系统不得不开始处理缓存脏页（因为此时脏页数量已经比较多，为了避免数据丢失需要将一定脏页刷入外存）；在此过程中很多应用进程可能会因为系统转而处理文件IO而阻塞。
建议二:另外在检查中，发现该主机未配置大页，建议配置大页，可以极大提升数据库性能
后期调整后至今没有发现主机重启，故障解决。

原文阅读：
https://www.modb.pro/db/22702?YYF
更多数据库相关干货，欢迎访问墨天轮官网：https://www.modb.pro/?YYF

上一页
1
2
下一页

推荐阅读

决战！平安京|决战平安京，返校季大揭秘，新手最全攻略！！！

十大蓝牙小音箱排行榜，酷狗蘑蘑小音节奏闪灯一键DJ“城会玩”

风筝|《追风筝的人》：每个人终其一生，都在追逐属于自己的命运

电视剧|同样是扮演“乞丐”，孙俪流鼻涕，周星驰抢狗盆，而他本色出演！

赵露思|《骄阳似我》又传出新阵容，李现将搭档赵露思，你认为符合吗？

顶级奢侈品集团Kering的代表品牌及产地和代表作品或风格有哪些

易简财经|27万股民今夜无眠，黄了！两家券商千亿级合并告吹

华为|华为迎来大消息！俄外长刚刚表态，俄罗斯准备与中国以及华为开展5G技术合作

『包不同』疫情之下，京东有惊喜！

#泌尿外科李成方#长期疲劳会影响身体的哪些部分？

亚美尼亚人|二十世纪初，亚美尼亚人遭到了大屠杀，100万人死于土耳其人之手

『雷帝网』CFO称汽车业回报周期长亏损是阶段性的，恒大健康亏近50亿

拜登|美国下任总统已定？拜登犯下“致命”错误，这次奥巴马也“保不住”他！

精子能有杀菌消炎作用吗

怎么样让别人愿意了解自己

时尚旅游守在富豪门前32年，谁能让他动就奖励一万，印度最“尽职”保安

口腔科张兴医生：种植牙要如何护理？牙科医生教你4招，轻松延长使用寿命！很实用

权志龙否认吸毒传闻，曾被指在机场行为异常，疑似毒瘾发作，12年前曾承认吸毒

李云迪和朗朗谁厉害？

高三最后一个学期是啥心态、

mysql数据库时间类型datetime、bigint、timestamp的查询效率比较 java互联网架构

MLDB是每个数据科学家梦寐以求的数据库

Python元类实战，通过元类实现数据库ORM框架

索泰推出被动散热迷你主机：搭载十代 i3，双网口

没有服务器，也可以进行小程序开发

六大数据库加密技术的优劣势解读

什么是服务器，服务器都有哪些种类

阿里数据库开发规范解释：关联查询，为什么要建议小表驱动大表？

分布式数据库调优实践

服务器上网友上传重复图片太多，几步操作检测重复图片并删除