GBase 8a
其他
文章

网络延时导致集群节点检测超时

发表于2024-03-27 19:08:10143次浏览2个评论

问题现象:用户侧业务偶现部分任务异常中断,经排查数据库日志发现出现问题时有大量cfg_connect_timeout的错误。连接超时报错原因,一般是对面服务没有启动,网络不通或延迟高,对面CPU等资源负荷高没有及时响应

 

告警信息:

原因分析:

连接超时报错原因,一般是对面服务没有启动,网络不通或延迟高,对面CPU等资源负荷高没有及时响应。

1:从节点system日志来看连接超时节点的服务进程运行正常,未发生重启。可排除服务异常的原因。

2:使用之前hadoop的ping脚本检查有时会有丢包现象。

3:统计发生断联节点的nmon日志来看,断联时间点有的节点磁盘IO和网络使用率比较高。

综合上述排查分析第二和第三种原因可能性比较大。针对上述第三种原因可能性,进行降低计算节点并发的方式进行缓解,4月14日已调整,同时调整管理节点检测超时时间为10000毫秒(10秒)并进行观察。

处理过程:1、调整管理节点检测超时时间为10000毫秒(10秒)

            修改/etc/corosync/corosync.conf文件中cfg_connnect_timeout值为10000(毫秒)  重启corosync进程生效

建议与总结:定期清理垃圾数据,并关注网络质量。

评论

登录后才可以发表评论
曾云林发表于 2个月前
闪闪发光
崔哥发表于 2个月前
楼上黄昏欲望休,玉梯横绝月中钩。芭蕉不展丁香结,同向春风各自愁。东南日出照高楼,楼上离人唱石州。总把春山扫眉黛,不知供得几多愁?