金融级数据库容灾技术报告(2021年)_47页_1mb
报告摘要
金融级数据库容灾技术报告总结
一、容灾备份概述
1. 定义与分类
- 容灾备份(灾备):利用技术手段建立数据应急方式,保障信息系统在灾难时能正常运行,实现业务连续性。
- 容灾分类:
- 按距离:本地容灾(主机集群)、异地容灾(远程数据复制)。
- 按保护级别:数据级容灾(数据备份)、应用级容灾(应用系统复制)、业务级容灾(业务连续性保障)。
2. 灾备发生方式
- 灾难原因:
- IT系统问题(如服务器、数据库故障);
- 信息安全管理问题(如系统升级失败、权限混乱);
- 自然灾害(如地震、火灾)。
- 典型事件:
- 2017年Gitlab遭受DDoS攻击;
- 2018年TSB银行系统升级混乱;
- 2014年三星数据中心火灾。
3. 灾难恢复指标
- RTO(恢复时间目标):系统恢复时间,金融行业要求至少达到4级(≤30分钟)。
- RPO(恢复点目标):数据丢失容忍度,金融行业要求为0,即数据无丢失。
4. 备份定义与分类
- 备份分类:
- 按数据量:全量备份、增量备份、差异备份;
- 按频率:定时备份、实时备份;
- 按对象:字节级、块级、文件级;
- 按存储介质:冷备、热备。
5. 容灾与备份的区别
- 容灾是备份的延伸,不能替代备份。
- 容灾保障业务连续性,备份保障数据完整性。
二、分布式数据库容灾架构
1. 单中心容灾
- 部署在单一生产中心,支持多可用区部署。
- 适用于对容灾要求不高的内部业务系统。
- 仅能应对部分节点故障,无法应对数据中心级灾难。
2. 同城互备
- 生产中心和灾备中心具有相同资源配置。
- 支持主备切换,适用于中等容灾需求。
- 同城距离近,网络延时小,支持强同步或异步同步。
3. 同城双活
- 业务系统同时通过生产中心和灾备中心访问。
- 数据强一致性,支持负载均衡和自动故障切换。
- 适用于高可用性要求的金融系统。
4. 两地三中心容灾
- 在同城双活基础上增加一个远距离容灾中心。
- 能抵御地震、洪水等区域级灾难。
- 通常采用异步同步机制,确保最终一致性。
三、数据库容灾技术
1. 数据备份与恢复
- 数据备份:
- 物理备份:复制数据文件及日志,效率高但存储占用大;
- 逻辑备份:通过SQL语句实现,灵活但效率较低。
- 数据恢复:
- 支持按时间点恢复,恢复时间取决于备份方式和数据量。
- 支持部分库表恢复,降低恢复时间开销。
2. 数据同步与传输
- 主从复制:异步复制,主库更新事件同步到从库。
- 半同步复制:提升数据一致性,但存在数据丢失风险。
- 组复制(MGR):基于分布式一致性协议,支持多主写入。
- 分组强同步:提高同步可靠性,保障数据一致性。
- 云数据同步服务(DTS):支持跨数据库迁移、同步和订阅,实现异地容灾。
3. 故障自动切换
- 计算节点故障切换:通过负载均衡实现秒级切换。
- 存储节点故障切换:自动主从切换,确保数据一致性。
- 切换流程:
- 故障检测;
- 切换准备;
- 主从切换;
- 路由调整。
4. 分布式事务容灾
- 金融业务需强一致性,常用两阶段提交、Paxos、Raft等协议。
- GaiaDB-X:
- 自研DMVCC算法,解决全局读一致性问题;
- 支持XA协议,保障事务一致性;
- 提供基于全局事务点的备份恢复机制。
5. 应用应激防护
- 过载保护:通过限流策略保障系统稳定性;
- SQL入侵防御:识别非法SQL并拦截或告警;
- 数据回滚:误删数据可通过回收站快速恢复;
- 弹性扩容:支持计算和存储节点的水平扩展。
四、分布式数据库容灾方案
1. 节点故障
- 计算节点:通过负载均衡实现秒级切换;
- 存储节点主库故障:自动主从切换,数据补齐后恢复;
- 存储节点从库故障:从集群中移除故障节点,补充新副本。
2. 网络故障
- 查询影响:跨专线查询可能带来延时,但不影响系统可用性;
- 写入影响:网络抖动可能导致同步中断,需配置同步退化或强同步策略;
- 应对策略:
- 异步同步:提升写入性能,但RPO>0;
- 强同步:保障数据一致性,但增加事务提交延时。
3. 同城双活生产中心灾难
- 当生产中心出现灾难,灾备中心自动接管所有流量。
- 支持主从切换和分片拓扑调整,确保数据一致性。
- RTO通常在30秒至1分钟之间,RPO=0。
4. 两地三中心主区域灾难
- 主区域灾难导致生产中心和同城灾备中心全部故障,系统切换至异地灾备中心。
- 异地灾备中心承载全流量,恢复服务。
- 支持异步同步,实现数据最终一致性。
五、总结与展望
1. 混合业务负载降低容灾复杂度
- 支持OLTP和OLAP,统一数据服务架构;
- 简化数据流和存储结构,降低容灾方案复杂性。
2. 人工智能改善容灾处置灵活性
- 引入AI算法实现智能监控、预测和预警;
- 提升系统异常检测和灾难处置的灵活性与精准度。
3. 云原生实现容灾过程可编排
- 云原生数据库支持Serverless架构;
- 容灾过程可自动化编排,提升系统可用性与灾备效率。
4. 混沌工程提升容灾架构韧性
- 通过模拟故障场景验证系统边界;
- 提升分布式系统的容错与容灾能力,增强系统稳定性。
参考文献
- 2021 中国灾备行业白皮书. 国际灾难恢复(中国)协会(DRI China).
- 2017-2022年中国灾备行业深度研究及市场前景预测报告. 智研咨询集团.
- 银行业信息系统灾难恢复管理规范. JR/T 0044-2008.
- 证券期货业数据分类分级指引. JR/T 0158-2018.
- 证券期货经营机构信息系统备份能力标准. JR/T 0059-2010.
- 分布式数据库技术金融应用规范 灾难恢复要求. JR/T0205-2020.
- The State of Software-Defined Storage, Hyperconverged and Cloud Storage. DataCore.
- MySQL官方手册:Replication, Semisynchronous Replication, Group Replication.
- Windows Server 故障转移群集与 SQL Server 官方文档.
- 什么是 Always On 可用性组?. SQL Server 官方文档.
- Shao J, Yin B, Chen B, et al. Read Consistency in Distributed Database Based on DMVCC. IEEE, 2017.
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载