"Systemd"
- systemd watchdog 與自動重啟
在單機 systemd 上做服務自動恢復時,釐清 watchdog 主動報活與 restart policy 被動拉起是兩套機制、以及為什麼要先重啟幾次才放棄
- Process supervisor 選型
在 systemd、supervisord、Docker restart policy、Kubernetes 之間選服務監管方式時,用平台能不能分開表達 startup、readiness、liveness、drain 當判準
- 程序、服務與狀態怎麼判
要判斷一個程式活著沒、某個系統服務現在由誰提供、桌面 session 有沒有被鎖、或終端機多工器的 session 還在不在時,用對的權威來源而不是靠畫面或猜的名字
- 服務掛了怎麼自動知道:從肉眼盯到主動告警
不想每次都手動 systemctl 檢查服務死活、想讓機器在 service 掛掉時主動推播通知、或擔心整台機器當掉沒人知道時回來讀
- logind Session 與 Seat(VT 與輸入權的持有者)
compositor 從 SSH 起不來報 seat / DRM 錯、想確認哪個 session 在 active VT、或 loginctl 輸出跟畫面狀態對不上時讀
- systemd OnFailure(失敗觸發鉤子)
想讓某個服務進 failed 時自動觸發告警或修復動作、或發現 OnFailure 每次重啟中途都觸發把告警洗爆時讀
- systemd drop-in(不改原檔的設定疊加)
想覆寫套件裝的 systemd unit 又不被升級蓋掉、一次對所有 service 套一條設定、或搞不清 systemctl edit 改了哪個檔時讀
- 一個修法埋下三步後的雷:pacman 404 → -Syu 升 kernel → docker 起不來
Arch 上裝套件 404、修完之後 docker daemon 突然起不來、iptables 報 nf_tables 錯誤時回來讀 — 症狀與根因差三步的因果鏈與判讀法。