以多模多态夯实数智变革的数字根基——专访南大通用GBase 8c产品经营部总经理张益

发布时间:2026-08-26

第十七届中国数据库技术大会(DTCC 2026)在京圆满召开。本届大会期间举办了南大通用GBase 8c专场技术论坛,全面展示“AI原生数据库到产业落地”的创新实践。会后,南大通用GBase 8c产品经营部总经理张益接受ITPUB的采访,双方围绕GBase 8c的产品战略、多模多态架构、AI时代的数据库创新以及重点行业落地实践进行了深入探讨。

以下为本次专访实录:

Q1:在公司整体产品矩阵里,GBase 8c承担什么样的战略角色?

张益:GBase 8c是南大通用自主研发的新一代原生分布式数据库。

当前,AI应用对数据库提出了前所未有的挑战:大模型训练数据量达PB级,传统存储扩容困难;AI训练与推理负载波动剧烈,计算资源需要按需扩缩容;Agent并发访问带来百万级并发需求;RAG、语义搜索等新场景要求数据库具备原生向量支持。

“数据库必须从单纯的数据存储引擎进化为AI基础设施的核心组件。”张益表示。而“多模多态”正是GBase 8c应对这一进化的核心架构理念。

 

Q2:GBase 8c过去一年取得了哪些进展?

张益:过去一年,GBase 8c在产品能力和市场认可两方面均取得关键进展。

技术层面,产品持续增强了HTAP和DB4AI能力。2026年5月,GBase 8c V6通过国家安全可靠测评。

在行业落地方面,GBase 8c已在金融、电信、医疗、政务等关键行业实现规模化应用——泸州银行信贷业务系统跑批效率提升显著,运营商结算系统承载月处理话单量达百亿级,省级全民健康信息平台中心系统存储数据量达5PB。

 

Q3:如何理解GBase 8c的多模多态?为什么要做多模多态?在多模多态方面取得了哪些成果?

张益: “多模多态”是GBase 8c应对AI时代挑战的核心架构理念。

为什么要做多模多态?面对AI时代PB级数据、弹性扩缩容、百万级并发等新挑战,传统数据库架构已无法兼顾。

所谓多模,是指数据模型的多模态统一。GBase 8c支持结构化、向量、图、时序等多种数据类型的统一存储,降低开发运维复杂度,避免用户为不同数据类型维护多套独立系统。

在存储引擎层面,GBase 8c提供OLTP行存储、OLAP列存储和HTAP行列融合存储三种模式。

行存储按行物理连续存储,支持高并发读写和行级锁,适合事务密集型业务;列存储按列物理连续存储,配合CU压缩单元和向量化执行,适合复杂聚合分析;行列融合存储则让一张表同时拥有行存和列存两种物理形式,查询优化器自动为OLTP和OLAP选择最优路径,通过增量缓冲和后台批量行转列机制实现准实时同步。

所谓多态,是指部署形态的灵活适配。GBase 8c提供三种部署形态:主备部署简洁高效,适用于较低数据量、追求极致单机性能且要求数据备份的场景;分布式部署支持全组件冗余和计算存储分离,可根据业务需求对计算和存储能力分别进行水平扩展,适用于大数据量高并发且追求数据高安全性的场景;存算分离部署基于共享对象存储,支持秒级扩缩容和快速分支创建,在工作负载波动大或有明显间歇性的场景下,能够大幅降低成本,更好服务于AI Agent等现代开发流程。

在多模多态方面,我们过去一年进行了系统性推进。通过DBCOMPATIBILITY参数支持Oracle、MySQL、PostgreSQL、SQLServer等多种语法兼容模式,并配套提供涵盖迁移评估、全量迁移、增量同步、数据校验、反向同步在内的自动化迁移同步工具,最大限度降低用户迁移改造成本。

 

Q4:GBase 8c在智能化的AI4DB与DB4AI两方面做了哪些工作?能否分享一些落地实践?

张益:在智能化方向上,我们围绕DB4AI与AI4DB两条路径同步推进。

DB4AI方面,最大的创新是原生向量存储与标量向量融合检索。当前大部分AI应用都是在传统业务上构建新的AI能力,存在传统标量数据与向量数据的多标签过滤查询需求。GBase 8c实现了向量数据与关系型数据的深度融合,支持在单条SQL中完成复杂的Join操作与向量相似性搜索。

具体而言,系统会先按照标量过滤条件生成过滤位图,再通过ANN检索算法获取向量数据,将同时满足位图过滤和向量检索条件的数据返回,不满足时则自动扩大候选集再次检索。内置HNSW、IVF、PQ等多种量化索引,支持向量相似度、标量过滤与全文搜索的混合检索。

在存算分离架构层面,计算层采用完全无状态设计,节点不保存持久化数据,状态通过WAL流式同步到存储层。
这带来了四项核心能力:一是秒级扩缩容,计算节点可随时增减,无需数据迁移;二是Scale-to-Zero,负载降低时计算资源可缩减至零,空闲成本趋近于零;三是无状态节点故障后可快速重建,业务零中断,实现秒级故障恢复;四是基于WAL日志的Copy-on-Write数据分支,创建分支时无需复制实际数据,仅记录分支点日志位置,新分支与原始数据共享历史数据页,写入时才复制被修改页面。
数据分支能力使得AI模型训练中的A/B测试、敏捷迭代、快速试错回滚等场景可以秒级开展,各分支完全隔离互不影响。存储层采用分布式架构,数据分片存储于多个节点,支持水平扩展至PB级容量,通过多副本机制保证可靠性。

AI4DB方面,GBase 8c通过AIOps智能运维组件,将人工智能算法与数据库内核深度结合,围绕数据库的“自动驾驶”能力持续探索。目前已具备索引推荐、SQL语句智能调优、参数自动推荐等能力,可辅助DBA进行数据库的日常运维与性能优化。未来将在异常检测、性能预测、故障自愈等方向持续深化。

 

Q5:什么样的数据库才算是真正的AI原生数据库?GBase 8c未来有怎样的计划?

张益: 我认为真正的AI原生数据库不能简单等同于“传统数据库加向量插件”。

从GBase 8c的实践来看,AI原生数据库至少应在三个层面实现突破:在架构层面支持弹性伸缩和无状态计算,在数据层面支持多模融合,在查询层面支持标量与向量的深度一体化,同时提供面向AI工作流的工程化能力。

未来,GBase 8c将继续深化多模多态架构,在向量检索能力、存算分离弹性调度、AI工作流支持等方向持续投入。我们将进一步丰富图数据和时序数据的原生支持,完善智能化查询优化与资源调度能力,推动GBase 8c从“支持AI的数据库”向“真正的AI原生数据库”演进。

我们的目标很明确:让用户在数据规模爆炸和负载剧烈波动的环境下,依然能够获得稳定、高效、低成本的数据服务。