這是 SAA 考試佔比最高領域(設計韌性架構)的核心,卻最容易被跳過。本章先把兩個衡量指標 RTO(多久能救回來) 與 RPO(最多能接受掉多少資料) 弄懂,再對照 四種災難復原策略(Backup & Restore → Pilot Light → Warm Standby → Multi-Site)在「成本 vs 復原速度」上的取捨。最後把前面各章學過的服務(S3 跨區複製、Aurora 全球資料庫、DynamoDB Global Table、Route 53 Failover)串成一張完整的備援地圖——考試最愛考「這個 RTO/RPO 要求,該選哪種策略」。
整個災難復原(DR, Disaster Recovery)的選型,都建立在這兩個問題上。考試題目會用它們的數字大小暗示你該選哪種策略:
AWS 官方把 DR 策略分成四種,由「便宜但慢」到「昂貴但快」排列。這是本章最核心、最常考的一張心智圖:
DR 策略是「觀念」,真正落地要靠前面章節學過的這些跨 Region 複製能力。把它們串起來就是一張備援地圖:
當你有一堆不同服務(EC2、EBS、RDS、DynamoDB、EFS、Storage Gateway…)各自要備份時,逐個設定既麻煩又容易漏。AWS Backup 就是把這些備份「集中管理」的服務:
這三個詞常被混用,但考試會故意把它們當誘答選項。它們解決的是不同層級的問題:
| 策略 | RPO / RTO | DR 區平時狀態 | 成本 | 何時選它 |
|---|---|---|---|---|
| ① Backup & Restore | 數小時(最長) | 只有備份資料,無運算 | 💲 最低 | 預算有限、可容忍較長停機 |
| ② Pilot Light | RPO 分鐘 / RTO 數十分鐘 | 核心 DB 持續複製待命,應用層關閉 | 💲💲 低 | 關鍵資料需即時、應用可稍後啟動 |
| ③ Warm Standby | RPO / RTO 皆分鐘級 | 完整但縮小規模的環境持續運行 | 💲💲💲 中高 | 停機成本高、需快速承接流量 |
| ④ Multi-Site Active/Active | 近乎即時(秒級) | 全規模雙區同時服務流量 | 💲💲💲💲 最高 | 金融/關鍵系統、近乎零停機 |
| 需求情境 | 建議策略 | 理由 |
|---|---|---|
| 預算有限,可停機數小時、掉數小時資料 | Backup & Restore | 平時只付備份儲存費,最省 |
| 資料一筆都不想多掉(RPO 極小),但 RTO 可接受數十分鐘 | Pilot Light | DB 持續複製確保 RPO,應用災難時再啟動 |
| 停機每分鐘都是損失,需數分鐘內恢復 | Warm Standby | 縮小版環境隨時待命,放大規模即可承接 |
| 金融/關鍵系統,幾乎零容忍停機與資料遺失 | Multi-Site Active/Active | 雙區同時服務,故障切換近乎無感 |
| 全球用戶要低延遲讀寫,且要能自動撐過區域故障 | Aurora Global DB / DynamoDB Global Tables | 跨區複製 <1 秒,天生跨 Region 備援 |
| 服務 | 跨區備援機制 | 關鍵特性 |
|---|---|---|
| S3 | Cross-Region Replication(CRR) | 需先開版本控制,非同步複製物件 |
| RDS | 跨區 Read Replica / 快照跨區複製 | 災難時手動 Promote 成主庫 |
| Aurora | Global Database | 次區延遲 <1 秒,可 <1 分鐘提升為主區 |
| DynamoDB | Global Tables | 多區多主動寫入,天生 Active/Active |
| Route 53 | Failover 路由 + Health Check | 主站掛掉自動把流量切到備援站 |
| EBS | Snapshot 跨區複製 | 異地重建磁碟/EC2 |
| 多服務統管 | AWS Backup(跨區/跨帳號複製) | 單一策略 + Vault Lock 防刪改 |
點擊卡片翻面查看答案,共 6 張。