"High-Availability"
- 單點故障盤點
要系統性找出哪些元件掛了整個系統就跟著掛時,用 pre-mortem 反推失敗路徑、依賴 budget 算可用性上限、以及按 blast radius 排序缺口
- 冗餘設計模式
在 active-passive、active-active、multi-region 之間選冗餘模式時,用資料同步方式與 standby 是否服務流量來區分,並知道冗餘不等於備份
- Failover 機制
設計單點掛掉自動切到替代路徑的機制時,釐清觸發靠探活、故障域要先劃定、恢復順序的循環等待風險、以及 rollback 與 roll-forward 怎麼選
- Disaster recovery 策略
設計災難復原時,先確認恢復路徑走得通再談 RTO/RPO、用 restore drill 把估值變量值、以及知道恢復不是切回流量就結束
- 高可用的成本
判斷高可用值不值得時,用停機的商業代價衡量冗餘的 2x 成本、按可用性等級階梯評估投資、以及知道沒驗證的冗餘等於白付
- Redis Sentinel 與 failover 時序:從 master 死掉到 client 重連的每一段
Redis Sentinel 的 failover 不是一個瞬間動作,是 down 偵測 → quorum 確認 → 選主 → 提升 → 配置廣播 → client 重連的一條時序鏈,每一段都有自己的延遲與失敗模式。本文展開 Sentinel 的判定模型與這條時序、5 個讓 failover 卡住或丟資料的 production 踩坑,以及 Sentinel 撐不住該往 Cluster 或 managed 走的邊界