GBase 8a
运维管理
文章

一种手动同步gcware数据规避GBase 8a集群异常变慢的方法

发表于2024-10-15 15:54:3184次浏览1个评论

一、集群环境

集群版本:GBase8a_MPP_Cluster -8.6.2_build33-R11-redhat7.3-x86_64.

操作系统:CentOS7.6

 

二、问题概述

由于软硬件原因,GBase 8a集群coor节点长时间掉线后,再次启动集群服务,可能会因为需要同步的gcware数据量太大,导致集群响应变慢的现象,可能会对集群业务造成较大影响。

此时,gcadmin执行会出现如下异常信息:

exec_cmd_show_cluster crm get cluster mode ERROR: [6]-->[GC_AIS_ERR_TRY_AGAIN]

gcadmin show cluster failed

corosync日志出现如下异常信息:

crm_syn_process [ENTER]

crm_syn_process [BARRIER] 4 – 5

 

三、处理方法

此时,可通过手动同步gcware数据,快速解决上述问题,降低对集群业务的影响。具体流程如下:

1、切换至root账户,停止所有coor节点服务

service gcware stop

2、切换至root账户,手动同步gcware数据

用正常coor节点的/var/lib/gcware (选择REDOLOG文件后缀数字最大的那个coor节点)覆盖异常的coor节点。备注:覆盖前,把异常节点的/var/lib/gcware给mv走。

3、切换至root账户,在所有coor节点单独启动gcware服务:

export GCLUSTER_HOME=/gbase/gcluster/server/

/usr/sbin/gcwexec

4、切换至gbase账户,确认gcadmin执行正常

5、用gcluster_services all start命令启动集群服务

6、启动coor节点gcmonit、gcmmonit服务

gcmonit.sh start

注意:不要使用service gcware start来启动

评论

登录后才可以发表评论
一头猪发表于 1年前
停止所有coor节点服务
如上这一步,现场谁敢随意操作?