GBase 8a
其他
文章
网络延时导致集群节点检测超时
发表于2024-03-27 19:08:10143次浏览2个评论
问题现象:用户侧业务偶现部分任务异常中断,经排查数据库日志发现出现问题时有大量cfg_connect_timeout的错误。连接超时报错原因,一般是对面服务没有启动,网络不通或延迟高,对面CPU等资源负荷高没有及时响应
告警信息:无
原因分析:
连接超时报错原因,一般是对面服务没有启动,网络不通或延迟高,对面CPU等资源负荷高没有及时响应。
1:从节点system日志来看连接超时节点的服务进程运行正常,未发生重启。可排除服务异常的原因。
2:使用之前hadoop的ping脚本检查有时会有丢包现象。
3:统计发生断联节点的nmon日志来看,断联时间点有的节点磁盘IO和网络使用率比较高。
综合上述排查分析第二和第三种原因可能性比较大。针对上述第三种原因可能性,进行降低计算节点并发的方式进行缓解,4月14日已调整,同时调整管理节点检测超时时间为10000毫秒(10秒)并进行观察。
处理过程:1、调整管理节点检测超时时间为10000毫秒(10秒)
修改/etc/corosync/corosync.conf文件中cfg_connnect_timeout值为10000(毫秒) 重启corosync进程生效
建议与总结:定期清理垃圾数据,并关注网络质量。
热门帖子
- 12025-12-01浏览数:182763
- 22023-05-09浏览数:25057
- 42023-09-25浏览数:18525
- 52020-05-11浏览数:17528