1.
概述:为什么在美国与香港同时部署多可用区
1) 目标:提高可用性、缩短故障切换时间、满足跨境用户就近访问需求。
2) 范围:公有云(US region 与 HK region)、VPC、负载均衡、数据库主备、备份与快照、DNS/域名切换与CDN。
3) 读者:运维工程师、SRE、云架构师以及中小型互联网产品负责人。
4) 原则:RPO 优先定义(例如目标RPO=15分钟,RTO=5分钟-30分钟),再做网络和存储部署。
5) 成果:实现美港双活或主从跨区热备,自动化备份与快速故障切换流程。
2.
规划与备份策略设定
1) RPO/RTO 建议:关键业务 RPO=15min、RTO≤5min;常规服务 RPO=4小时、RTO≤1小时。
2) 备份频率:数据库主库增量每5-15分钟,完整快照每日一次,文件系统差异备份每小时。
3) 保留策略:短期保留 7 天、滚动快照 30 天、长期合规保留 365 天(冷存储)。
4) 异地同步:异地复制到香港(跨区域复制)并保留至少 2 个快照周期以防误删除。
5) 验证:每周做一次恢复演练并记录恢复时间与数据一致性,确保 RTO/RPO 达标。
3.
网络与多可用区设计(示例配置)
1) VPC 设计:主 VPC(US)与备 VPC(HK),每个 VPC 至少 3 个子网分布在不同可用区(AZ)。示例 CIDR:10.0.0.0/16(US)、10.1.0.0/16(HK)。
2) 公私网划分:公有子网用于负载均衡器(ELB/ALB),私有子网用于应用与数据库实例。
3) 负载均衡与健康检查:使用跨可用区的公网 LB,健康检查频率 10s,且对 HK 节点做地理流量调度。
4) 路由容灾:配合低 TTL(60s)DNS 与地理路由策略,出现区域故障时 DNS 在 1 分钟内引导流量。
5) 示范 IP 与 AZ 名称:US 主节点子网 10.0.10.0/24(us-east-1a),HK 节点子网 10.1.10.0/24(ap-east-1a)。
4.
存储、备份与恢复方案(含表格示例)
1) 主存储类型:业务服务器使用 NVMe/SSD(示例 100GB),数据库使用高 IOPS SSD(示例 500GB)。
2) 快照策略:以块存储快照为主,支持增量快照以节省空间,默认每日全量+小时增量。
3) 冷备与归档:超过 30 天的备份转冷存档(例如对象存储 Glacier 或云冷存)。
4) 恢复演示数据:主 DB 500GB,增量备份平均 10GB/小时,7 天数据大致使用量估算如下表。
| 资源 |
容量 |
备份频率 |
7天估算占用 |
| 数据库主库 |
500 GB |
快照每日全量 + 1 小时增量 |
500GB(全量) + 7×10GB(增量)=570GB |
| 应用服务器卷 |
100 GB × 4 台 |
每日差异备份 |
约 400GB × 0.3(增量压缩)=120GB |
5) 说明:上述估算未计压缩与重复数据删除(通常可节省 30%-70%)。
5.
容灾切换与演练流程
1) 监控与检测:使用多点健康检查(内外部),阈值触发后自动执行预设 runbook。
2) 切换顺序:流量切换(DNS/CCR)→ LB 引导到备区→ 恢复数据库副本为读写→ 验证一致性→ 通知回滚策略。
3) DNS & TTL:生产 DNS TTL 设置为 60 秒,结合自动化脚本下发新解析。
4) 自动化工具:使用 Terraform/Ansible/CloudFormation 进行基础设施即代码、以及备份脚本自动化。
5) 测试频率:每月做一次灾备演练、每季度做一次完整恢复演练并记录 RTO/RPO 实测数据。
6.
安全与 DDoS 防护配置要点
1) 基础防护:安全组仅开放必要端口(80/443 公网、SSH 限制来源 IP),NACL 设置细粒度规则。
2) CDN+WAF:前置全球 CDN(降低源站带宽)、开启 WAF 规则集抵御常见 Web 攻击。
3) DDoS 服务:启用云厂商防护(例如 Cloudflare / AWS Shield / 腾讯云 Anti-DDoS),并配置突发流量告警。
4) 限速与黑洞:对异常流量触发速率限制、智能清洗或临时黑洞路由,保护核心资源。
5) 日志与溯源:集中化日志(ELK/Prometheus+Grafana),保留至少 90 天以便溯源分析攻击向量。
7.
真实案例:跨国电商站点部署示例与配置清单
1) 背景:某中型电商,日均请求峰值 10k RPS,用户分布美洲与东亚,要求 99.95% 可用性。
2) 架构:US 主区域(处理结算流量)、HK 次区域(处理亚太流量);主 DB 放在 US,HK 作为异地只读副本并可提升为主。
3) 服务器配置(示例):US 应用集群 6 台:4 vCPU/8GB/100GB NVMe;DB 主:8 vCPU/32GB/500GB SSD;HK 备:3 台 4 vCPU/8GB,DB 只读副本同规格。
4) 备份计划:DB 增量 5 分钟一次,快照每日 02:00 全量,备份异地复制至 HK 对象存储并保留 30 天。
5) 成效:一次真实故障(US 区块存储故障)中断后,DNS 切换耗时 90s,所有服务在 3 分钟内回到正常,数据一致性经校验无丢失,达成 RTO≤5min(实际 3 分钟)、RPO < 15min。
来源:部署教程美国香港云服务器 多可用区容灾与备份配置指南