问题反馈日志搜集
1、性能类问题
现场需排除外部因素影响,如是否出现了资源瓶颈、是否存在表锁冲突;排查数据倾斜;排查性能问题只发生在固定的几个节点还是所有节点;确认现场硬件是否存在故障,确认硬盘的基准性能(DD测试),确认网络是否存在大量丢包情况
建议现场在发生sql性能问题后,进行该问题的重现和确认,具体方式为:打开trace、使用一个新的数据库用户如testuser重新执行性能问题sql,便于进行trace日志搜集,trace日志中包含有执行该sql的数据库用户名,如gbase_testuser_[sessionid]_[timestemp].trc
提供gnode和gcluster的trace日志;
提供表结构、表数据量、数据分布是否倾斜、数据样例;
1.1 sql trace信息
路径:(所有节点的)
/opt/gcluster/log/gcluster/gbase_user_*.trc
/opt/gnode/log/gbase/gbase_user_*.trc
1.2 gc和gn当时的show full processlist信息
1.3 gn和gc的config配置文件
路径:
/opt/gcluster/config/gbase_8a_gcluster.cnf
//opt/gnode/config/gbase_8a_gbase.cnf
1.4 nmon信息
收集当前问题节点的nmon情况,如可以稳定重现问题,请开启nmon,间隔2分钟进行nmon信息抓取
1.5 集群show lock信息
gcadmin showlock
1.6 集群ddlevent dmlevent信息
gcadmin showddlevent
gcadmin showdmlevent
/var/lib/gcware/FEVENTLOG
1.7 集群syncserver log信息
各节点的/opt/gcluster/log/gcluster/syncserver.log
1.8 涉及加载问题的提供dispserver、 dispcli、 gbloader日志信息
2、宕机或进程僵死类问
2.1 夯住进程的pstack信息
确认夯住或僵死的进程发生在gnode还是gcluster,在打印pstack的同时截取对应gn或gc的show full processlist,推荐:获取show processlist后打印pstack堆栈,然后间隔10秒再次打印pstack之后再次截取一个showprocesslist;
提供夯住的或者导致进程宕机的具体sql,及sql对应的表结构、表数据量信息以
加载服务宕机请提供 dispcli dispserver进程信息
2.2 gcadmin showlock状态(进程夯住问题)
2.3 所有节点gc和gn当时的show full processlist信息
2.4 加载服务对应的日志文件(加载服务宕机情况)
dispcli 和dispserver以及对应节点的gbloader日志信息,如果能问题重现该问题,请将dispserver log level调整为4,并重现问题,记录日志
2.5 节点的system,express日志信息
/opt/gcluster/log/gcluster/
/opt/gnode/log/gbase/
2.6 操作系统message日志信息
/var/log/message信息
2.7 corosync日志信息
/var/log/corosync.log
发生宕机时间点的gc和gn层的show processlist信息
2.8 交换机相关日志文件
收集交换机相关日志文件,可以对当时的网络数据传输情况进行判断分析
3、结果集错误类问题
3.1 sql涉及表的建表语句
3.2 sql源文件
3.3 重现该场景的最小数据环境
如现场可以提供,请提供能够重现该问题的最小数据环境,供家里重现分析该问题。
3.3 sql trace信息
收集gn层和gc层的trace信息
gn层trace信息 /opt/gnode/log/gbase
gc层trace信息 /opt/gcluster/log/gcluster
评论
热门帖子
- 12025-12-01浏览数:182763
- 22023-05-09浏览数:25056
- 42023-09-25浏览数:18525
- 52020-05-11浏览数:17528