一种手动同步gcware数据规避GBase 8a集群异常变慢的方法
一、集群环境
集群版本:GBase8a_MPP_Cluster -8.6.2_build33-R11-redhat7.3-x86_64.
操作系统:CentOS7.6
二、问题概述
由于软硬件原因,GBase 8a集群coor节点长时间掉线后,再次启动集群服务,可能会因为需要同步的gcware数据量太大,导致集群响应变慢的现象,可能会对集群业务造成较大影响。
此时,gcadmin执行会出现如下异常信息:
exec_cmd_show_cluster crm get cluster mode ERROR: [6]-->[GC_AIS_ERR_TRY_AGAIN]
gcadmin show cluster failed
corosync日志出现如下异常信息:
crm_syn_process [ENTER]
crm_syn_process [BARRIER] 4 – 5
三、处理方法
此时,可通过手动同步gcware数据,快速解决上述问题,降低对集群业务的影响。具体流程如下:
1、切换至root账户,停止所有coor节点服务
service gcware stop
2、切换至root账户,手动同步gcware数据
用正常coor节点的/var/lib/gcware (选择REDOLOG文件后缀数字最大的那个coor节点)覆盖异常的coor节点。备注:覆盖前,把异常节点的/var/lib/gcware给mv走。
3、切换至root账户,在所有coor节点单独启动gcware服务:
export GCLUSTER_HOME=/gbase/gcluster/server/
/usr/sbin/gcwexec
4、切换至gbase账户,确认gcadmin执行正常
5、用gcluster_services all start命令启动集群服务
6、启动coor节点gcmonit、gcmmonit服务
gcmonit.sh start
注意:不要使用service gcware start来启动
热门帖子
- 12025-12-01浏览数:182759
- 22023-05-09浏览数:25044
- 42023-09-25浏览数:18519
- 52020-05-11浏览数:17526
如上这一步,现场谁敢随意操作?