GBase 8a
性能调优
文章

集群运行一段时间性能下降

发表于2025-06-26 09:46:4136次浏览0个评论

集群运行一段时间后,作业(跑批、加载)性能会逐渐下降,重启后性能会变快。

采集集群数据节点信息,分析整理发现操作系统物理内存基本吃满。

Cached内存平均分布在50~70G

tcmalloc之application占用70G不等

三堆∑heap=100~110G(固定)

swap分布在30G左右(swap总配置128G)

问题结果分析:

数据节点整体内存:110G(内存池)+78G(不受pct控制的DTS内存、元数据等)≈190G,再加上操作系统cache的内存60G左右,造成物理内存几乎耗尽,由于swap配置很大,系统会自动触发swap交换机制,进而影响集群整体作业。

解决方案:

1、降低swap大小,建议设置为物理内存10%,不超过64G,主要考虑系统运行稳定性,当物理内存因某种情况用完时,不会因内存不足而崩溃。
2、并合理配置pct,(physical memory + swap) * gbase_memory_pct_target的值建议在物理内存内。
3、降低任务并发量,大批量的高并发任务、大数据量会瞬时占用较大内存。
4、集群版本升级

评论已关闭