變數說明
$instance VM / 主機名稱
·
$name Pod / Container / Job / 掛載點 等資源名稱
·
$cluster 叢集名稱
·
$value 告警當下數值
SS 大核心
124
Disaster 82High 22Warning 20停用 17
SS TW2 小核心
119
Disaster 77High 22Warning 20停用 14
SSPRE 大核心
124
Disaster 82High 22Warning 20停用 16
SSPRE 小核心
94
Disaster 60High 15Warning 19停用 13
搜尋嚴重度Oncall規則檔啟用
blackbox
| 告警名稱 | 啟用 | 嚴重度 | 持續時間 | Interval | Oncall | 摘要 | PromQL |
|---|---|---|---|---|---|---|---|
| K8s BlackBoxExporter 監控服務失聯 | Y | Disaster | 2m | 10s | 網路組 | $instance $name 監控服務失聯,無法進行探偵監控 | |
| K8s 服務 Port 探測失敗 | N | Disaster | 2m | 10s | 系統組 | $instance $name 端口檢測異常 |
certificate
| 告警名稱 | 啟用 | 嚴重度 | 持續時間 | Interval | Oncall | 摘要 | PromQL |
|---|---|---|---|---|---|---|---|
| K8s Api Server 客戶端憑證7天後到期 | Y | High | 0m | 30m | SS 項目憑證將到期,請安排更換 | ||
| K8s Api Server 客戶端憑證1天後到期 | Y | Disaster | 0m | 30m | 系統組 | SS 項目憑證將到期,請立即處理 | |
| K8s Api Server 伺服器端憑證7天後到期 | Y | High | 0m | 30m | SS 項目憑證將到期,請安排更換 | ||
| K8s Api Server 伺服器端憑證1天後到期 | Y | Disaster | 0m | 30m | 系統組 | SS 項目憑證將到期,請立即處理 | |
| K8s客戶端憑證7天後到期 | N | High | 0m | 30m | SS 項目憑證將到期,請安排更換 | ||
| K8s客戶端憑證1天後到期 | N | Disaster | 0m | 30m | 系統組 | SS 項目憑證將到期,請立即處理 | |
| K8s伺服器端憑證7天後到期 | Y | High | 0m | 30m | SS 項目憑證將到期,請安排更換 | ||
| K8s伺服器端憑證1天後到期 | Y | Disaster | 0m | 30m | 系統組 | SS 項目憑證將到期,請立即處理 |
chronyd
| 告警名稱 | 啟用 | 嚴重度 | 持續時間 | Interval | Oncall | 摘要 | PromQL |
|---|---|---|---|---|---|---|---|
| K8s節點系統時鐘偏差超過±2s | Y | High | 3m | 1m | $instance 系統時鐘偏差 $values | ||
| K8s監控節點系統時鐘偏差超過±10s | Y | Disaster | 3m | 1m | 網路組 | $instance 系統時鐘偏差 $values | |
| K8s核心節點系統時鐘偏差超過±10s | Y | Disaster | 3m | 1m | 系統組 | $instance 系統時鐘偏差 $values | |
| K8s監控節點Chronyd服務異常 | Y | Disaster | 3m | 1m | 網路組 | $instance 服務異常 | |
| K8s核心節點Chronyd服務異常 | Y | Disaster | 3m | 1m | 系統組 | $instance 服務異常 | |
| K8s節點 Chrony-Exporter 監控服務失聯 | Y | Disaster | 3m | 1m | 網路組 | $instance $name監控服務失聯,無法獲取Chrony狀態 | |
| 主機系統時鐘偏差超過±2s | Y | High | 3m | 1m | $instance 系統時鐘偏差 $values | ||
| 主機系統時鐘偏差超過±10s | Y | Disaster | 3m | 1m | 系統組 | $instance 系統時鐘偏差 $values | |
| 主機Chronyd服務異常 | Y | Disaster | 3m | 1m | 系統組 | $instance 服務異常 | |
| 主機 Chrony-Exporter 監控服務失聯 | Y | Disaster | 3m | 1m | 網路組 | $instance $name監控服務失聯,無法獲取Chrony狀態 |
cluster-disaster
| 告警名稱 | 啟用 | 嚴重度 | 持續時間 | Interval | Oncall | 摘要 | PromQL |
|---|---|---|---|---|---|---|---|
| K8s 核心Pod異常 | Y | Disaster | 2m | 10s | 系統組 | $instance: $name | |
| K8s 監控Pod異常 | Y | Disaster | 2m | 10s | 網路組 | $instance: $name | |
| K8s NodeExporter 監控服務失聯 | Y | Disaster | 2m | 10s | 網路組 | $instance: $name | |
| K8s監控節點重啟 | Y | Disaster | 0m | 10s | 網路組 | $instance | |
| K8s核心節點重啟 | Y | Disaster | 0m | 10s | 系統組 | $instance | |
| K8s監控節點狀態Not Ready | Y | Disaster | 2m | 10s | 網路組 | 請確認 $instance 節點狀態 | |
| K8s核心節點狀態Not Ready | Y | Disaster | 2m | 10s | 系統組 | 請確認 $instance 節點狀態 | |
| K8s監控節點失聯 | Y | Disaster | 2m | 10s | 網路組 | $instance 無法連接 | |
| K8s核心節點失聯 | Y | Disaster | 2m | 10s | 系統組 | $instance 無法連接 | |
| K8s監控節點狀態反覆異常 | Y | Disaster | 2m | 10s | 網路組 | $instance 狀態不穩定,15分鐘內變動 $value 次 | |
| K8s核心節點狀態反覆異常 | Y | Disaster | 2m | 10s | 系統組 | $instance 狀態不穩定,15分鐘內變動 $value 次 | |
| K8s Deployment 監控服務已移除 | Y | Disaster | 2m | 10s | 網路組 | SS: $name 服務已移除 | |
| K8s Deployment 核心服務已移除 | Y | Disaster | 2m | 10s | 系統組 | SS: $name 服務已移除 | |
| K8s Statefulset 監控服務已移除 | Y | Disaster | 2m | 10s | 網路組 | SS: $name 服務已移除 | |
| K8s Statefulset 核心服務已移除 | Y | Disaster | 2m | 10s | 系統組 | SS: $name 服務已移除 | |
| K8s Daemonset 監控服務已移除 | Y | Disaster | 2m | 10s | 網路組 | SS: $name 服務已移除 | |
| K8s Daemonset 核心服務已移除 | Y | Disaster | 2m | 10s | 系統組 | SS: $name 服務已移除 | |
| K8s核心節點記憶體使用率>90% | Y | Disaster | 2m | 10s | 系統組 | $instance 目前使用率 $value% | |
| K8s監控節點記憶體使用率>90% | Y | Disaster | 2m | 10s | 網路組 | $instance 目前使用率 $value% | |
| K8s核心節點CPU使用率>90% | Y | Disaster | 2m | 10s | 系統組 | $instance 目前使用率 $value% | |
| K8s監控節點CPU使用率>90% | Y | Disaster | 2m | 10s | 網路組 | $instance 目前使用率 $value% | |
| K8s核心節點IOWait使用率>20% | N | Disaster | 2m | 10s | 系統組 | $instance 目前使用率 $value% | |
| K8s監控節點IOWait使用率>20% | N | Disaster | 2m | 10s | 網路組 | $instance 目前使用率 $value% | |
| K8s核心節點硬碟使用率>90% | Y | Disaster | 2m | 10s | 系統組 | $instance: $name 目前使用率 $value% | |
| K8s監控節點硬碟使用率>90% | Y | Disaster | 2m | 10s | 網路組 | $instance: $name 目前使用率 $value% | |
| K8s監控服務崩潰 | Y | Disaster | 2m | 10s | 網路組 | $instance: $name 狀態CrashLoopBackOff | |
| K8s核心服務崩潰 | Y | Disaster | 2m | 10s | 系統組 | $instance: $name 狀態CrashLoopBackOff | |
| K8s核心節點FD使用率>90% | Y | Disaster | 2m | 10s | 系統組 | $instance 節點檔案描述符(File Descriptor)使用接近滿載 | |
| K8s監控節點FD使用率>90% | Y | Disaster | 2m | 10s | 網路組 | $instance 節點檔案描述符(File Descriptor)使用接近滿載 | |
| K8s監控節點網卡異常 | Y | Disaster | 2m | 10s | 網路組 | $instance 的 網卡[$name]頻繁斷線 | |
| K8s核心節點網卡異常 | Y | Disaster | 2m | 10s | 系統組 | $instance 的 網卡[$name]頻繁斷線 | |
| K8s核心服務10分鐘重啟超過2次 | Y | Disaster | 0m | 10s | 系統組 | $instance: $name | |
| K8s監控服務10分鐘重啟超過2次 | Y | Disaster | 0m | 10s | 網路組 | $instance: $name | |
| K8s 核心Container狀態異常 | Y | Disaster | 2m | 10s | 系統組 | $instance: $name pod的容器狀態異常 |
cluster
| 告警名稱 | 啟用 | 嚴重度 | 持續時間 | Interval | Oncall | 摘要 | PromQL |
|---|---|---|---|---|---|---|---|
| K8s Deployment 服務版本同步卡住 | Y | Warning | 15m | 10s | SS: $name | ||
| K8s Deployment 服務健康副本數不足 | Y | Warning | 15m | 10s | SS: $name | ||
| K8s Deployment 服務滾動更新停滯 | Y | Warning | 15m | 10s | SS: $name | ||
| K8s StatefulSet 服務版本同步卡住 | Y | Warning | 15m | 10s | SS: $name | ||
| K8s StatefulSet 服務健康副本數不足 | Y | Warning | 15m | 10s | SS: $name | ||
| K8s StatefulSet 服務滾動更新停滯 | Y | Warning | 15m | 10s | SS: $name | ||
| K8s Daemonset 服務部署副本數不足 | Y | Warning | 15m | 10s | SS: $name 有 $value 個Pod未成功部署 | ||
| K8s Daemonset 服務節點排程錯誤 | Y | Warning | 15m | 10s | SS: $name 有 $value 個Pod跑在錯誤的節點上 | ||
| K8s Daemonset 服務滾動更新停滯 | Y | Warning | 15m | 10s | SS: $name | ||
| K8s cronjob 未成功執行 | Y | High | 0m | 10s | SS: $name | ||
| K8s cronjob 執行失敗 | Y | High | 0m | 10s | SS: $name | ||
| K8s cronjob 已暫停 | Y | High | 0m | 10s | SS: $name | ||
| K8s節點記憶體使用率>80% | Y | High | 2m | 10s | $instance 目前使用率 $value% | ||
| K8s節點CPU使用率>80% | Y | High | 2m | 10s | $instance 目前使用率 $value% | ||
| K8s節點IOWait使用率>10% | N | High | 2m | 10s | $instance 目前使用率 $value% | ||
| K8s節點硬碟使用率>80% | Y | High | 2m | 10s | $instance: $name 目前使用率 $value% | ||
| K8s容器CPU配額不足 | Y | High | 5m | 10s | $instance: $name CPU有 $value 時間在等待 | ||
| K8s節點系統附載偏高 | N | Warning | 15m | 10s | $instance 每顆 CPU load 超過2 | ||
| K8s節點FD使用率>80% | Y | High | 2m | 10s | $instance 節點檔案描述符(File Descriptor)使用偏高 |
evaluation
| 告警名稱 | 啟用 | 嚴重度 | 持續時間 | Interval | Oncall | 摘要 | PromQL |
|---|---|---|---|---|---|---|---|
| Prometheus 規則評估耗時偏高 | Y | High | 10m | 1m | SS 項目的 $name 告警規則耗時已接近interval配置 | ||
| Prometheus 規則評估已逾時 | Y | Disaster | 10m | 1m | 網路組 | SS 項目的 $name 告警規則耗時已超過interval配置,告警可能存在延遲的情況 |
middleware
| 告警名稱 | 啟用 | 嚴重度 | 持續時間 | Interval | Oncall | 摘要 | PromQL |
|---|---|---|---|---|---|---|---|
| K8s RedisExporter 監控服務失聯 | N | Disaster | 2m | 10s | 網路組 | $instance $name 監控服務失聯,無法獲取redis狀態 | |
| K8s Redis節點Down | Y | Disaster | 2m | 10s | 系統組 | SS $cluster-redis 節點Down | |
| K8s Redis叢集節點數不足 | Y | Disaster | 2m | 10s | 系統組 | SS $cluster-redis 叢集節點數異常,目前剩 $value 個 | |
| K8s Redis Slave 斷線 | Y | Disaster | 2m | 10s | 系統組 | SS $cluster-redis的master沒有Slave | |
| K8s MinIO 失聯 | N | Disaster | 2m | 10s | 系統組 | SS $name 服務失聯,請確認MinIO狀態 | |
| K8s MinIO 節點離線 | N | Disaster | 2m | 10s | 系統組 | SS $name 叢集有 $value 個節點離線 | |
| K8s MinIO 磁碟離線 | N | Disaster | 2m | 10s | 系統組 | SS $name 叢集有 $value 顆磁碟離線 | |
| K8s Nacos 失聯 | Y | Disaster | 2m | 10s | 系統組 | SS $name 節點 $name 連線中斷,請確認nacos狀態 | |
| K8s Nacos 叢集節點數不足 | N | Disaster | 2m | 10s | 系統組 | SS $name 叢集存活節點僅剩 $value 個 | |
| K8s KafkaExporter 監控服務失聯 | Y | Disaster | 2m | 10s | 網路組 | SS $name 監控服務失聯,無法獲取kafka狀態 | |
| K8s Kafka Broker 數量不足 | N | Disaster | 2m | 10s | 系統組 | SS Kafka 叢集 Broker 數量異常,目前僅剩 $value 個 | |
| K8s Kafka 資料副本未同步 | N | Disaster | 5m | 10s | 系統組 | SS Kafka 有$value個Partition副本未完成同步 | |
| K8s Kafka Connectors 同步異常 | Y | Disaster | 2m | 10s | 系統組 | SS 項目 Kafka 的 $name 狀態異常($value),目前無法正常同步 | |
| K8s kafka-mirromaker 失聯 | Y | Disaster | 2m | 10s | 系統組 | SS $name 服務失聯,請確認kafka-mirromaker服務狀態 |
system
| 告警名稱 | 啟用 | 嚴重度 | 持續時間 | Interval | Oncall | 摘要 | PromQL |
|---|---|---|---|---|---|---|---|
| K8s HPA副本數無法自動調整 | Y | High | 15m | 10s | SS $name 自動擴縮容超過 15 分鐘無法達到目標副本數 | ||
| K8s HPA達最大副本數 | Y | High | 15m | 10s | SS $name HPA 已擴展至 maxReplicas 上限 | ||
| K8s HPA低於最低副本數 | Y | High | 15m | 10s | SS $name HPA運行副本數已低於 minReplicas | ||
| K8s 元件版本不一致 | Y | Warning | 15m | 10s | SS集群偵測到$value種不同版本的核心元件,版本不一致可能導致相容性問題 | ||
| K8s API Server 請求錯誤率偏高 | Y | Warning | 15m | 10s | SS API Server 請求錯誤率達 $value ,可能影響集群運作 | ||
| K8s API Server 請求被中斷 | Y | Warning | 15m | 10s | SS API Server 主動中斷請求比例達 $value ,服務可能存在過載問題 | ||
| K8s 擴展 API 服務錯誤 | Y | Warning | 15m | 10s | SS 擴展API [$name] 出現 $name 錯誤 | ||
| K8s 擴展 API 服務異常 | Y | Warning | 15m | 10s | SS 擴展API [$name] 過去 10 分鐘可用率僅 $value% | ||
| K8s 管理元件檢查延遲 | Y | Warning | 15m | 10s | $instance 的Pod狀態檢查耗時 $value 秒 | ||
| K8s API 服務無回應 | Y | Disaster | 5m | 10s | 系統組 | SS Prometheus抓取不到API服務,請確認服務是否正常 | |
| K8s 核心服務 PV 異常 | Y | Disaster | 5m | 10s | 系統組 | SS $name 狀態異常 | |
| K8s 監控服務 PV 異常 | Y | Disaster | 5m | 10s | 網路組 | SS $name 狀態異常 | |
| K8s 核心服務 PVC 異常 | Y | Disaster | 5m | 10s | 系統組 | SS $name 狀態異常 | |
| K8s 監控服務 PVC 異常 | Y | Disaster | 5m | 10s | 網路組 | SS $name 狀態異常 |
vm-disaster
| 告警名稱 | 啟用 | 嚴重度 | 持續時間 | Interval | Oncall | 摘要 | PromQL |
|---|---|---|---|---|---|---|---|
| 主機失聯 | Y | Disaster | 2m | 10s | 系統組 | $instance | |
| 主機重啟 | Y | Disaster | 0m | 10s | 系統組 | $instance | |
| 主機記憶體使用>90% | Y | Disaster | 2m | 10s | 系統組 | $instance 目前使用率 $value% | |
| 主機CPU使用率>90% | Y | Disaster | 2m | 10s | 系統組 | $instance 目前使用率 $value% | |
| 主機IOWait使用率>20% | N | Disaster | 2m | 10s | 系統組 | $instance 目前使用率 $value% | |
| 主機硬碟空間使用>90% | Y | Disaster | 2m | 10s | 系統組 | $instance: $name 目前使用率 $value% | |
| 主機 swarm-scheduler-exporter 監控服務失聯 | Y | Disaster | 2m | 10s | 網路組 | $instance 監控服務無法連線 | |
| 監控容器停止 | Y | Disaster | 2m | 10s | 網路組 | $instance: $name | |
| 核心容器停止 | Y | Disaster | 2m | 10s | 系統組 | $instance: $name | |
| 主機FD使用率>90% | Y | High | 2m | 10s | 系統組 | $instance 節點檔案描述符(File Descriptor)使用偏高 | |
| 主機網卡異常 | Y | Disaster | 2m | 10s | 系統組 | $instance 的 網卡[$name]頻繁斷線 | |
| 主機監控容器已移除 | Y | Disaster | 2m | 10s | 網路組 | $instance: $name 服務已移除 | |
| 主機核心容器已移除 | Y | Disaster | 2m | 10s | 系統組 | $instance: $name 服務已移除 | |
| 主機核心服務10分鐘重啟超過2次 | Y | Disaster | 0m | 10s | 系統組 | $instance: $name | |
| 主機監控服務10分鐘重啟超過2次 | Y | Disaster | 0m | 10s | 網路組 | $instance: $name |
vm
| 告警名稱 | 啟用 | 嚴重度 | 持續時間 | Interval | Oncall | 摘要 | PromQL |
|---|---|---|---|---|---|---|---|
| 主機記憶體使用>80% | Y | High | 2m | 10s | $instance 目前使用率 $value% | ||
| 主機CPU使用率>80% | Y | High | 2m | 10s | $instance 目前使用率 $value% | ||
| 主機IOWait使用率>10% | N | High | 2m | 10s | $instance 目前使用率 $value% | ||
| 主機硬碟空間使用>80% | Y | High | 2m | 10s | $instance: $name 目前使用率 $value% | ||
| 主機系統負載偏高 | N | Warning | 15m | 10s | $instance 每顆 CPU load 超過2 | ||
| 主機FD使用率>80% | Y | High | 2m | 10s | $instance 節點檔案描述符(File Descriptor)使用偏高 |
blackbox
| 告警名稱 | 啟用 | 嚴重度 | 持續時間 | Interval | Oncall | 摘要 | PromQL |
|---|---|---|---|---|---|---|---|
| K3s BlackBoxExporter 監控服務失聯 | Y | Disaster | 2m | 10s | 網路組 | $instance/$name 監控服務失聯,無法進行探偵監控 | |
| K3s 服務 Port 探測失敗 | N | Disaster | 2m | 10s | 系統組 | $instance $name 端口檢測異常 |
certificate
| 告警名稱 | 啟用 | 嚴重度 | 持續時間 | Interval | Oncall | 摘要 | PromQL |
|---|---|---|---|---|---|---|---|
| K3s Api Server 客戶端憑證7天後到期 | Y | High | 0m | 30m | SS-TW2 項目憑證將到期,請安排更換 | ||
| K3s Api Server 客戶端憑證1天後到期 | Y | Disaster | 0m | 30m | 系統組 | SS-TW2 項目憑證將到期,請立即處理 | |
| K3s Api Server 伺服器端憑證7天後到期 | Y | High | 0m | 30m | SS-TW2 項目憑證將到期,請安排更換 | ||
| K3s Api Server 伺服器端憑證1天後到期 | Y | Disaster | 0m | 30m | 系統組 | SS-TW2 項目憑證將到期,請立即處理 | |
| K3s客戶端憑證7天後到期 | N | High | 0m | 30m | SS-TW2 項目憑證將到期,請安排更換 | ||
| K3s客戶端憑證1天後到期 | N | Disaster | 0m | 30m | 系統組 | SS-TW2 項目憑證將到期,請立即處理 | |
| K3s伺服器端憑證7天後到期 | Y | High | 0m | 30m | SS-TW2 項目憑證將到期,請安排更換 | ||
| K3s伺服器端憑證1天後到期 | Y | Disaster | 0m | 30m | 系統組 | SS-TW2 項目憑證將到期,請立即處理 |
chronyd
| 告警名稱 | 啟用 | 嚴重度 | 持續時間 | Interval | Oncall | 摘要 | PromQL |
|---|---|---|---|---|---|---|---|
| K3s節點系統時鐘偏差超過±2s | Y | High | 3m | 1m | $instance 系統時鐘偏差 $values | ||
| K3s監控節點系統時鐘偏差超過±10s | Y | Disaster | 3m | 1m | 網路組 | $instance 系統時鐘偏差 $values | |
| K3s核心節點系統時鐘偏差超過±10s | Y | Disaster | 3m | 1m | 系統組 | $instance 系統時鐘偏差 $values | |
| K3s監控節點Chronyd服務異常 | Y | Disaster | 3m | 1m | 網路組 | $instance 服務異常 | |
| K3s核心節點Chronyd服務異常 | Y | Disaster | 3m | 1m | 系統組 | $instance 服務異常 | |
| K3s節點 Chrony-Exporter 監控服務失聯 | Y | Disaster | 3m | 1m | 網路組 | $instance $name監控服務失聯,無法獲取Chrony狀態 | |
| 主機系統時鐘偏差超過±2s | Y | High | 3m | 1m | $instance 系統時鐘偏差 $values | ||
| 主機系統時鐘偏差超過±10s | Y | Disaster | 3m | 1m | 系統組 | $instance 系統時鐘偏差 $values | |
| 主機Chronyd服務異常 | Y | Disaster | 3m | 1m | 系統組 | $instance 服務異常 | |
| 主機 Chrony-Exporter 監控服務失聯 | Y | Disaster | 3m | 1m | 網路組 | $instance $name監控服務失聯,無法獲取Chrony狀態 |
cluster-disaster
| 告警名稱 | 啟用 | 嚴重度 | 持續時間 | Interval | Oncall | 摘要 | PromQL |
|---|---|---|---|---|---|---|---|
| K3s 核心Pod異常 | Y | Disaster | 2m | 10s | 系統組 | $instance: $name | |
| K3s 監控Pod異常 | Y | Disaster | 2m | 10s | 網路組 | $instance: $name | |
| K3s NodeExporter 監控服務失聯 | Y | Disaster | 2m | 10s | 網路組 | $instance: $name | |
| K3s監控節點重啟 | Y | Disaster | 0m | 10s | 網路組 | $instance | |
| K3s核心節點重啟 | Y | Disaster | 0m | 10s | 系統組 | $instance | |
| K3s監控節點狀態Not Ready | Y | Disaster | 2m | 10s | 網路組 | 請確認 $instance 節點狀態 | |
| K3s核心節點狀態Not Ready | Y | Disaster | 2m | 10s | 系統組 | 請確認 $instance 節點狀態 | |
| K3s監控節點失聯 | Y | Disaster | 2m | 10s | 網路組 | $instance 無法連接 | |
| K3s核心節點失聯 | Y | Disaster | 2m | 10s | 系統組 | $instance 無法連接 | |
| K3s監控節點狀態反覆異常 | Y | Disaster | 2m | 10s | 網路組 | $instance 狀態不穩定,15分鐘內變動 $value 次 | |
| K3s核心節點狀態反覆異常 | Y | Disaster | 2m | 10s | 系統組 | $instance 狀態不穩定,15分鐘內變動 $value 次 | |
| K3s Deployment 監控服務已移除 | Y | Disaster | 2m | 10s | 網路組 | SS-TW2: $name 服務已移除 | |
| K3s Deployment 核心服務已移除 | Y | Disaster | 2m | 10s | 系統組 | SS-TW2: $name 服務已移除 | |
| K3s Statefulset 監控服務已移除 | Y | Disaster | 2m | 10s | 網路組 | SS-TW2: $name 服務已移除 | |
| K3s Statefulset 核心服務已移除 | Y | Disaster | 2m | 10s | 系統組 | SS-TW2: $name 服務已移除 | |
| K3s Daemonset 監控服務已移除 | Y | Disaster | 2m | 10s | 網路組 | SS-TW2: $name 服務已移除 | |
| K3s Daemonset 核心服務已移除 | Y | Disaster | 2m | 10s | 系統組 | SS-TW2: $name 服務已移除 | |
| K3s核心節點記憶體使用率>90% | Y | Disaster | 2m | 10s | 系統組 | $instance 目前使用率 $value% | |
| K3s監控節點記憶體使用率>90% | Y | Disaster | 2m | 10s | 網路組 | $instance 目前使用率 $value% | |
| K3s核心節點CPU使用率>90% | Y | Disaster | 2m | 10s | 系統組 | $instance 目前使用率 $value% | |
| K3s監控節點CPU使用率>90% | Y | Disaster | 2m | 10s | 網路組 | $instance 目前使用率 $value% | |
| K3s核心節點IOWait使用率>20% | N | Disaster | 2m | 10s | 系統組 | $instance 目前使用率 $value% | |
| K3s監控節點IOWait使用率>20% | N | Disaster | 2m | 10s | 網路組 | $instance 目前使用率 $value% | |
| K3s核心節點硬碟使用率>90% | Y | Disaster | 2m | 10s | 系統組 | $instance: $name 目前使用率 $value% | |
| K3s監控節點硬碟使用率>90% | Y | Disaster | 2m | 10s | 網路組 | $instance: $name 目前使用率 $value% | |
| K3s監控服務崩潰 | Y | Disaster | 2m | 10s | 網路組 | $instance: $name 狀態CrashLoopBackOff | |
| K3s核心服務崩潰 | Y | Disaster | 2m | 10s | 系統組 | $instance: $name 狀態CrashLoopBackOff | |
| K3s核心節點FD使用率>90% | Y | Disaster | 2m | 10s | 系統組 | $instance 節點檔案描述符(File Descriptor)使用接近滿載 | |
| K3s監控節點FD使用率>90% | Y | Disaster | 2m | 10s | 網路組 | $instance 節點檔案描述符(File Descriptor)使用接近滿載 | |
| K3s監控節點網卡異常 | Y | Disaster | 2m | 10s | 網路組 | $instance 的 網卡[$name]頻繁斷線 | |
| K3s核心節點網卡異常 | Y | Disaster | 2m | 10s | 系統組 | $instance 的 網卡[$name]頻繁斷線 | |
| K3s核心服務10分鐘重啟超過2次 | Y | Disaster | 0m | 10s | 系統組 | $instance: $name | |
| K3s監控服務10分鐘重啟超過2次 | Y | Disaster | 0m | 10s | 網路組 | $instance: $name | |
| K3s 核心Container狀態異常 | Y | Disaster | 2m | 10s | 系統組 | $instance: $name pod的容器狀態異常 |
cluster
| 告警名稱 | 啟用 | 嚴重度 | 持續時間 | Interval | Oncall | 摘要 | PromQL |
|---|---|---|---|---|---|---|---|
| K3s Deployment 服務版本同步卡住 | Y | Warning | 15m | 10s | SS-TW2: $name | ||
| K3s Deployment 服務健康副本數不足 | Y | Warning | 15m | 10s | SS-TW2: $name | ||
| K3s Deployment 服務滾動更新停滯 | Y | Warning | 15m | 10s | SS-TW2: $name | ||
| K3s StatefulSet 服務版本同步卡住 | Y | Warning | 15m | 10s | SS-TW2: $name | ||
| K3s StatefulSet 服務健康副本數不足 | Y | Warning | 15m | 10s | SS-TW2: $name | ||
| K3s StatefulSet 服務滾動更新停滯 | Y | Warning | 15m | 10s | SS-TW2: $name | ||
| K3s Daemonset 服務部署副本數不足 | Y | Warning | 15m | 10s | SS-TW2: $name 有 $value 個Pod未成功部署 | ||
| K3s Daemonset 服務節點排程錯誤 | Y | Warning | 15m | 10s | SS-TW2: $name 有 $value 個Pod跑在錯誤的節點上 | ||
| K3s Daemonset 服務滾動更新停滯 | Y | Warning | 15m | 10s | SS-TW2: $name | ||
| K3s cronjob 未成功執行 | Y | High | 0m | 10s | SS-TW2: $name | ||
| K3s cronjob 執行失敗 | Y | High | 0m | 10s | SS-TW2: $name | ||
| K3s cronjob 已暫停 | Y | High | 0m | 10s | SS-TW2: $name | ||
| K3s節點記憶體使用率>80% | Y | High | 2m | 10s | $instance 目前使用率 $value% | ||
| K3s節點CPU使用率>80% | Y | High | 2m | 10s | $instance 目前使用率 $value% | ||
| K3s節點IOWait使用率>10% | N | High | 2m | 10s | $instance 目前使用率 $value% | ||
| K3s節點硬碟使用率>80% | Y | High | 2m | 10s | $instance: $name 目前使用率 $value% | ||
| K3s容器CPU配額不足 | Y | High | 5m | 10s | $instance: $name CPU有 $value 時間在等待 | ||
| K3s節點系統附載偏高 | N | Warning | 15m | 10s | $instance 每顆 CPU load 超過2 | ||
| K3s節點FD使用率>80% | Y | High | 2m | 10s | $instance 節點檔案描述符(File Descriptor)使用偏高 |
evaluation
| 告警名稱 | 啟用 | 嚴重度 | 持續時間 | Interval | Oncall | 摘要 | PromQL |
|---|---|---|---|---|---|---|---|
| Prometheus 規則評估耗時偏高 | Y | High | 10m | 1m | SS-TW2 項目的 $name 告警規則耗時已接近interval配置 | ||
| Prometheus 規則評估已逾時 | Y | Disaster | 10m | 1m | 網路組 | SS-TW2 項目的 $name 告警規則耗時已超過interval配置,告警可能存在延遲的情況 |
middleware
| 告警名稱 | 啟用 | 嚴重度 | 持續時間 | Interval | Oncall | 摘要 | PromQL |
|---|---|---|---|---|---|---|---|
| K3s RedisExporter 監控服務失聯 | N | Disaster | 2m | 10s | 網路組 | $instance $name 監控服務失聯,無法獲取redis狀態 | |
| K3s Redis節點Down | Y | Disaster | 2m | 10s | 系統組 | SS-TW2 $cluster-redis 節點Down | |
| K3s Redis叢集節點數不足 | Y | Disaster | 2m | 10s | 系統組 | SS-TW2 $cluster-redis 叢集節點數異常,目前剩 $value 個 | |
| K3s Redis Slave 斷線 | Y | Disaster | 2m | 10s | 系統組 | SS-TW2 $cluster-redis的master沒有Slave | |
| K3s Nacos 失聯 | Y | Disaster | 2m | 10s | 系統組 | SS-TW2 $name 節點 $name 連線中斷,請確認nacos狀態 | |
| K3s Nacos 叢集節點數不足 | N | Disaster | 2m | 10s | 系統組 | SS-TW2 $name 叢集存活節點僅剩 $value 個 | |
| K3s KafkaExporter 監控服務失聯 | Y | Disaster | 2m | 10s | 網路組 | SS-TW2 $name 監控服務失聯,無法獲取kafka狀態 | |
| K3s Kafka Broker 數量不足 | N | Disaster | 2m | 10s | 系統組 | SS-TW2 Kafka 叢集 Broker 數量異常,目前僅剩 $value 個 | |
| K3s Kafka 資料副本未同步 | N | Disaster | 5m | 10s | 系統組 | SS-TW2 Kafka 有$value個Partition副本未完成同步 |
system
| 告警名稱 | 啟用 | 嚴重度 | 持續時間 | Interval | Oncall | 摘要 | PromQL |
|---|---|---|---|---|---|---|---|
| K3s HPA副本數無法自動調整 | Y | High | 15m | 10s | SS-TW2 $name 自動擴縮容超過 15 分鐘無法達到目標副本數 | ||
| K3s HPA達最大副本數 | Y | High | 15m | 10s | SS-TW2 $name HPA 已擴展至 maxReplicas 上限 | ||
| K3s HPA低於最低副本數 | Y | High | 15m | 10s | SS-TW2 $name HPA運行副本數已低於 minReplicas | ||
| K3s 元件版本不一致 | Y | Warning | 15m | 10s | SS-TW2集群偵測到$value種不同版本的核心元件,版本不一致可能導致相容性問題 | ||
| K3s API Server 請求錯誤率偏高 | Y | Warning | 15m | 10s | SS-TW2 API Server 請求錯誤率達 $value ,可能影響集群運作 | ||
| K3s API Server 請求被中斷 | Y | Warning | 15m | 10s | SS-TW2 API Server 主動中斷請求比例達 $value ,服務可能存在過載問題 | ||
| K3s 擴展 API 服務錯誤 | Y | Warning | 15m | 10s | SS-TW2 擴展API [$name] 出現 $name 錯誤 | ||
| K3s 擴展 API 服務異常 | Y | Warning | 15m | 10s | SS-TW2 擴展API [$name] 過去 10 分鐘可用率僅 $value% | ||
| K3s 管理元件檢查延遲 | Y | Warning | 15m | 10s | $instance 的Pod狀態檢查耗時 $value 秒 | ||
| K3s API 服務無回應 | Y | Disaster | 5m | 10s | 系統組 | SS-TW2 Prometheus抓取不到API服務,請確認服務是否正常 | |
| K3s 核心服務 PV 異常 | Y | Disaster | 5m | 10s | 系統組 | SS-TW2 $name 狀態異常 | |
| K3s 監控服務 PV 異常 | Y | Disaster | 5m | 10s | 網路組 | SS-TW2 $name 狀態異常 | |
| K3s 核心服務 PVC 異常 | Y | Disaster | 5m | 10s | 系統組 | SS-TW2 $name 狀態異常 | |
| K3s 監控服務 PVC 異常 | Y | Disaster | 5m | 10s | 網路組 | SS-TW2 $name 狀態異常 |
vm-disaster
| 告警名稱 | 啟用 | 嚴重度 | 持續時間 | Interval | Oncall | 摘要 | PromQL |
|---|---|---|---|---|---|---|---|
| 主機失聯 | Y | Disaster | 2m | 10s | 系統組 | $instance | |
| 主機重啟 | Y | Disaster | 0m | 10s | 系統組 | $instance | |
| 主機記憶體使用>90% | Y | Disaster | 2m | 10s | 系統組 | $instance 目前使用率 $value% | |
| 主機CPU使用率>90% | Y | Disaster | 2m | 10s | 系統組 | $instance 目前使用率 $value% | |
| 主機IOWait使用率>20% | N | Disaster | 2m | 10s | 系統組 | $instance 目前使用率 $value% | |
| 主機硬碟空間使用>90% | Y | Disaster | 2m | 10s | 系統組 | $instance: $name 目前使用率 $value% | |
| 主機 swarm-scheduler-exporter 監控服務失聯 | Y | Disaster | 2m | 10s | 網路組 | $instance 監控服務無法連線 | |
| 監控容器停止 | Y | Disaster | 2m | 10s | 網路組 | $instance: $name | |
| 核心容器停止 | Y | Disaster | 2m | 10s | 系統組 | $instance: $name | |
| 主機FD使用率>90% | Y | High | 2m | 10s | 系統組 | $instance 節點檔案描述符(File Descriptor)使用偏高 | |
| 主機網卡異常 | Y | Disaster | 2m | 10s | 系統組 | $instance 的 網卡[$name]頻繁斷線 | |
| 主機監控容器已移除 | Y | Disaster | 2m | 10s | 網路組 | $instance:$name 服務已移除 | |
| 主機核心容器已移除 | Y | Disaster | 2m | 10s | 系統組 | $instance: $name 服務已移除 | |
| 主機核心服務10分鐘重啟超過2次 | Y | Disaster | 0m | 10s | 系統組 | $instance: $name | |
| 主機監控服務10分鐘重啟超過2次 | Y | Disaster | 0m | 10s | 網路組 | $instance: $name |
vm
| 告警名稱 | 啟用 | 嚴重度 | 持續時間 | Interval | Oncall | 摘要 | PromQL |
|---|---|---|---|---|---|---|---|
| 主機記憶體使用>80% | Y | High | 2m | 10s | $instance 目前使用率 $value% | ||
| 主機CPU使用率>80% | Y | High | 2m | 10s | $instance 目前使用率 $value% | ||
| 主機IOWait使用率>10% | N | High | 2m | 10s | $instance 目前使用率 $value% | ||
| 主機硬碟空間使用>80% | Y | High | 2m | 10s | $instance: $name 目前使用率 $value% | ||
| 主機系統負載偏高 | N | Warning | 15m | 10s | $instance 每顆 CPU load 超過2 | ||
| 主機FD使用率>80% | Y | High | 2m | 10s | $instance 節點檔案描述符(File Descriptor)使用偏高 |
blackbox
| 告警名稱 | 啟用 | 嚴重度 | 持續時間 | Interval | Oncall | 摘要 | PromQL |
|---|---|---|---|---|---|---|---|
| K8s BlackBoxExporter 監控服務失聯 | Y | Disaster | 2m | 10s | 網路組 | $instance $name 監控服務失聯,無法進行探偵監控 | |
| K8s 服務 Port 探測失敗 | N | Disaster | 2m | 10s | 系統組 | $instance $name 端口檢測異常 |
certificate
| 告警名稱 | 啟用 | 嚴重度 | 持續時間 | Interval | Oncall | 摘要 | PromQL |
|---|---|---|---|---|---|---|---|
| K8s Api Server 客戶端憑證7天後到期 | Y | High | 0m | 30m | SSPRE 項目憑證將到期,請安排更換 | ||
| K8s Api Server 客戶端憑證1天後到期 | Y | Disaster | 0m | 30m | 系統組 | SSPRE 項目憑證將到期,請立即處理 | |
| K8s Api Server 伺服器端憑證7天後到期 | Y | High | 0m | 30m | SSPRE 項目憑證將到期,請安排更換 | ||
| K8s Api Server 伺服器端憑證1天後到期 | Y | Disaster | 0m | 30m | 系統組 | SSPRE 項目憑證將到期,請立即處理 | |
| K8s客戶端憑證7天後到期 | N | High | 0m | 30m | SSPRE 項目憑證將到期,請安排更換 | ||
| K8s客戶端憑證1天後到期 | N | Disaster | 0m | 30m | 系統組 | SSPRE 項目憑證將到期,請立即處理 | |
| K8s伺服器端憑證7天後到期 | Y | High | 0m | 30m | SSPRE 項目憑證將到期,請安排更換 | ||
| K8s伺服器端憑證1天後到期 | Y | Disaster | 0m | 30m | 系統組 | SSPRE 項目憑證將到期,請立即處理 |
chronyd
| 告警名稱 | 啟用 | 嚴重度 | 持續時間 | Interval | Oncall | 摘要 | PromQL |
|---|---|---|---|---|---|---|---|
| K8s節點系統時鐘偏差超過±2s | Y | High | 3m | 1m | $instance 系統時鐘偏差 $values | ||
| K8s監控節點系統時鐘偏差超過±10s | Y | Disaster | 3m | 1m | 網路組 | $instance 系統時鐘偏差 $values | |
| K8s核心節點系統時鐘偏差超過±10s | Y | Disaster | 3m | 1m | 系統組 | $instance 系統時鐘偏差 $values | |
| K8s監控節點Chronyd服務異常 | Y | Disaster | 3m | 1m | 網路組 | $instance 服務異常 | |
| K8s核心節點Chronyd服務異常 | Y | Disaster | 3m | 1m | 系統組 | $instance 服務異常 | |
| K8s節點 Chrony-Exporter 監控服務失聯 | Y | Disaster | 3m | 1m | 網路組 | $instance $name監控服務失聯,無法獲取Chrony狀態 | |
| 主機系統時鐘偏差超過±2s | Y | High | 3m | 1m | $instance 系統時鐘偏差 $values | ||
| 主機系統時鐘偏差超過±10s | Y | Disaster | 3m | 1m | 系統組 | $instance 系統時鐘偏差 $values | |
| 主機Chronyd服務異常 | Y | Disaster | 3m | 1m | 系統組 | $instance 服務異常 | |
| 主機 Chrony-Exporter 監控服務失聯 | Y | Disaster | 3m | 1m | 網路組 | $instance $name監控服務失聯,無法獲取Chrony狀態 |
cluster-disaster
| 告警名稱 | 啟用 | 嚴重度 | 持續時間 | Interval | Oncall | 摘要 | PromQL |
|---|---|---|---|---|---|---|---|
| K8s 核心Pod異常 | Y | Disaster | 2m | 10s | 系統組 | $instance: $name | |
| K8s 監控Pod異常 | Y | Disaster | 2m | 10s | 網路組 | $instance: $name | |
| K8s NodeExporter 監控服務失聯 | Y | Disaster | 2m | 10s | 網路組 | $instance: $name | |
| K8s監控節點重啟 | Y | Disaster | 0m | 10s | 網路組 | $instance | |
| K8s核心節點重啟 | Y | Disaster | 0m | 10s | 系統組 | $instance | |
| K8s監控節點狀態Not Ready | Y | Disaster | 2m | 10s | 網路組 | 請確認 $instance 節點狀態 | |
| K8s核心節點狀態Not Ready | Y | Disaster | 2m | 10s | 系統組 | 請確認 $instance 節點狀態 | |
| K8s監控節點失聯 | Y | Disaster | 2m | 10s | 網路組 | $instance 無法連接 | |
| K8s核心節點失聯 | Y | Disaster | 2m | 10s | 系統組 | $instance 無法連接 | |
| K8s監控節點狀態反覆異常 | Y | Disaster | 2m | 10s | 網路組 | $instance 狀態不穩定,15分鐘內變動 $value 次 | |
| K8s核心節點狀態反覆異常 | Y | Disaster | 2m | 10s | 系統組 | $instance 狀態不穩定,15分鐘內變動 $value 次 | |
| K8s Deployment 監控服務已移除 | Y | Disaster | 2m | 10s | 網路組 | SSPRE: $name 服務已移除 | |
| K8s Deployment 核心服務已移除 | Y | Disaster | 2m | 10s | 系統組 | SSPRE: $name 服務已移除 | |
| K8s Statefulset 監控服務已移除 | Y | Disaster | 2m | 10s | 網路組 | SSPRE: $name 服務已移除 | |
| K8s Statefulset 核心服務已移除 | Y | Disaster | 2m | 10s | 系統組 | SSPRE: $name 服務已移除 | |
| K8s Daemonset 監控服務已移除 | Y | Disaster | 2m | 10s | 網路組 | SSPRE: $name 服務已移除 | |
| K8s Daemonset 核心服務已移除 | Y | Disaster | 2m | 10s | 系統組 | SSPRE: $name 服務已移除 | |
| K8s核心節點記憶體使用率>90% | Y | Disaster | 2m | 10s | 系統組 | $instance 目前使用率 $value% | |
| K8s監控節點記憶體使用率>90% | Y | Disaster | 2m | 10s | 網路組 | $instance 目前使用率 $value% | |
| K8s核心節點CPU使用率>90% | Y | Disaster | 2m | 10s | 系統組 | $instance 目前使用率 $value% | |
| K8s監控節點CPU使用率>90% | Y | Disaster | 2m | 10s | 網路組 | $instance 目前使用率 $value% | |
| K8s核心節點IOWait使用率>20% | N | Disaster | 2m | 10s | 系統組 | $instance 目前使用率 $value% | |
| K8s監控節點IOWait使用率>20% | N | Disaster | 2m | 10s | 網路組 | $instance 目前使用率 $value% | |
| K8s核心節點硬碟使用率>90% | Y | Disaster | 2m | 10s | 系統組 | $instance: $name 目前使用率 $value% | |
| K8s監控節點硬碟使用率>90% | Y | Disaster | 2m | 10s | 網路組 | $instance: $name 目前使用率 $value% | |
| K8s監控服務崩潰 | Y | Disaster | 2m | 10s | 網路組 | $instance: $name 狀態CrashLoopBackOff | |
| K8s核心服務崩潰 | Y | Disaster | 2m | 10s | 系統組 | $instance: $name 狀態CrashLoopBackOff | |
| K8s核心節點FD使用率>90% | Y | Disaster | 2m | 10s | 系統組 | $instance 節點檔案描述符(File Descriptor)使用接近滿載 | |
| K8s監控節點FD使用率>90% | Y | Disaster | 2m | 10s | 網路組 | $instance 節點檔案描述符(File Descriptor)使用接近滿載 | |
| K8s監控節點網卡異常 | Y | Disaster | 2m | 10s | 網路組 | $instance 的 網卡[$name]頻繁斷線 | |
| K8s核心節點網卡異常 | Y | Disaster | 2m | 10s | 系統組 | $instance 的 網卡[$name]頻繁斷線 | |
| K8s核心服務10分鐘重啟超過2次 | Y | Disaster | 0m | 10s | 系統組 | $instance: $name | |
| K8s監控服務10分鐘重啟超過2次 | Y | Disaster | 0m | 10s | 網路組 | $instance: $name | |
| K8s 核心Container狀態異常 | Y | Disaster | 2m | 10s | 系統組 | $instance: $name pod的容器狀態異常 |
cluster
| 告警名稱 | 啟用 | 嚴重度 | 持續時間 | Interval | Oncall | 摘要 | PromQL |
|---|---|---|---|---|---|---|---|
| K8s Deployment 服務版本同步卡住 | Y | Warning | 15m | 10s | SSPRE: $name | ||
| K8s Deployment 服務健康副本數不足 | Y | Warning | 15m | 10s | SSPRE: $name | ||
| K8s Deployment 服務滾動更新停滯 | Y | Warning | 15m | 10s | SSPRE: $name | ||
| K8s StatefulSet 服務版本同步卡住 | Y | Warning | 15m | 10s | SSPRE: $name | ||
| K8s StatefulSet 服務健康副本數不足 | Y | Warning | 15m | 10s | SSPRE: $name | ||
| K8s StatefulSet 服務滾動更新停滯 | Y | Warning | 15m | 10s | SSPRE: $name | ||
| K8s Daemonset 服務部署副本數不足 | Y | Warning | 15m | 10s | SSPRE: $name 有 $value 個Pod未成功部署 | ||
| K8s Daemonset 服務節點排程錯誤 | Y | Warning | 15m | 10s | SSPRE: $name 有 $value 個Pod跑在錯誤的節點上 | ||
| K8s Daemonset 服務滾動更新停滯 | Y | Warning | 15m | 10s | SSPRE: $name | ||
| K8s cronjob 未成功執行 | Y | High | 0m | 10s | SSPRE: $name | ||
| K8s cronjob 執行失敗 | Y | High | 0m | 10s | SSPRE: $name | ||
| K8s cronjob 已暫停 | Y | High | 0m | 10s | SSPRE: $name | ||
| K8s節點記憶體使用率>80% | Y | High | 2m | 10s | $instance 目前使用率 $value% | ||
| K8s節點CPU使用率>80% | Y | High | 2m | 10s | $instance 目前使用率 $value% | ||
| K8s節點IOWait使用率>10% | N | High | 2m | 10s | $instance 目前使用率 $value% | ||
| K8s節點硬碟使用率>80% | Y | High | 2m | 10s | $instance: $name 目前使用率 $value% | ||
| K8s容器CPU配額不足 | Y | High | 5m | 10s | $instance: $name CPU有 $value 時間在等待 | ||
| K8s節點系統附載偏高 | N | Warning | 15m | 10s | $instance 每顆 CPU load 超過2 | ||
| K8s節點FD使用率>80% | Y | High | 2m | 10s | $instance 節點檔案描述符(File Descriptor)使用偏高 |
evaluation
| 告警名稱 | 啟用 | 嚴重度 | 持續時間 | Interval | Oncall | 摘要 | PromQL |
|---|---|---|---|---|---|---|---|
| Prometheus 規則評估耗時偏高 | Y | High | 10m | 1m | SSPRE 項目的 $name 告警規則耗時已接近interval配置 | ||
| Prometheus 規則評估已逾時 | Y | Disaster | 10m | 1m | 網路組 | SSPRE 項目的 $name 告警規則耗時已超過interval配置,告警可能存在延遲的情況 |
middleware
| 告警名稱 | 啟用 | 嚴重度 | 持續時間 | Interval | Oncall | 摘要 | PromQL |
|---|---|---|---|---|---|---|---|
| K8s RedisExporter 監控服務失聯 | N | Disaster | 2m | 10s | 網路組 | $instance $name 監控服務失聯,無法獲取redis狀態 | |
| K8s Redis節點Down | Y | Disaster | 2m | 10s | 系統組 | SSPRE $cluster-redis 節點Down | |
| K8s Redis叢集節點數不足 | Y | Disaster | 2m | 10s | 系統組 | SSPRE $cluster-redis 叢集節點數異常,目前剩 $value 個 | |
| K8s Redis Slave 斷線 | Y | Disaster | 2m | 10s | 系統組 | SSPRE $cluster-redis的master沒有Slave | |
| K8s MinIO 失聯 | Y | Disaster | 2m | 10s | 系統組 | SSPRE $name 服務失聯,請確認MinIO狀態 | |
| K8s MinIO 節點離線 | N | Disaster | 2m | 10s | 系統組 | SSPRE $name 叢集有 $value 個節點離線 | |
| K8s MinIO 磁碟離線 | N | Disaster | 2m | 10s | 系統組 | SSPRE $name 叢集有 $value 顆磁碟離線 | |
| K8s Nacos 失聯 | Y | Disaster | 2m | 10s | 系統組 | SSPRE $name 節點 $name 連線中斷,請確認nacos狀態 | |
| K8s Nacos 叢集節點數不足 | N | Disaster | 2m | 10s | 系統組 | SSPRE $name 叢集存活節點僅剩 $value 個 | |
| K8s KafkaExporter 監控服務失聯 | Y | Disaster | 2m | 10s | 網路組 | SSPRE $name 監控服務失聯,無法獲取kafka狀態 | |
| K8s Kafka Broker 數量不足 | N | Disaster | 2m | 10s | 系統組 | SSPRE Kafka 叢集 Broker 數量異常,目前僅剩 $value 個 | |
| K8s Kafka 資料副本未同步 | N | Disaster | 5m | 10s | 系統組 | SSPRE Kafka 有$value個Partition副本未完成同步 | |
| K8s Kafka Connectors 同步異常 | Y | Disaster | 2m | 10s | 系統組 | >- | |
| K8s kafka-mirromaker 失聯 | Y | Disaster | 2m | 10s | 系統組 | SSPRE $name 服務失聯,請確認kafka-mirromaker服務狀態 |
system
| 告警名稱 | 啟用 | 嚴重度 | 持續時間 | Interval | Oncall | 摘要 | PromQL |
|---|---|---|---|---|---|---|---|
| K8s HPA副本數無法自動調整 | Y | High | 15m | 10s | SSPRE $name 自動擴縮容超過 15 分鐘無法達到目標副本數 | ||
| K8s HPA達最大副本數 | Y | High | 15m | 10s | SSPRE $name/$name HPA 已擴展至 maxReplicas 上限 | ||
| K8s HPA低於最低副本數 | Y | High | 15m | 10s | SSPRE $name HPA運行副本數已低於 minReplicas | ||
| K8s 元件版本不一致 | Y | Warning | 15m | 10s | SSPRE集群偵測到$value種不同版本的核心元件,版本不一致可能導致相容性問題 | ||
| K8s API Server 請求錯誤率偏高 | Y | Warning | 15m | 10s | SSPRE API Server 請求錯誤率達 $value ,可能影響集群運作 | ||
| K8s API Server 請求被中斷 | Y | Warning | 15m | 10s | SSPRE API Server 主動中斷請求比例達 $value ,服務可能存在過載問題 | ||
| K8s 擴展 API 服務錯誤 | Y | Warning | 15m | 10s | SSPRE 擴展API [$name] 出現 $name 錯誤 | ||
| K8s 擴展 API 服務異常 | Y | Warning | 15m | 10s | SSPRE 擴展API [$name] 過去 10 分鐘可用率僅 $value% | ||
| K8s 管理元件檢查延遲 | Y | Warning | 15m | 10s | $instance 的Pod狀態檢查耗時 $value 秒 | ||
| K8s API 服務無回應 | Y | Disaster | 5m | 10s | 系統組 | SSPRE Prometheus抓取不到API服務,請確認服務是否正常 | |
| K8s 核心服務 PV 異常 | Y | Disaster | 5m | 10s | 系統組 | SSPRE $name 狀態異常 | |
| K8s 監控服務 PV 異常 | Y | Disaster | 5m | 10s | 網路組 | SSPRE $name 狀態異常 | |
| K8s 核心服務 PVC 異常 | Y | Disaster | 5m | 10s | 系統組 | SSPRE $name 狀態異常 | |
| K8s 監控服務 PVC 異常 | Y | Disaster | 5m | 10s | 網路組 | SSPRE $name 狀態異常 |
vm-disaster
| 告警名稱 | 啟用 | 嚴重度 | 持續時間 | Interval | Oncall | 摘要 | PromQL |
|---|---|---|---|---|---|---|---|
| 主機失聯 | Y | Disaster | 2m | 10s | 系統組 | $instance | |
| 主機重啟 | Y | Disaster | 0m | 10s | 系統組 | $instance | |
| 主機記憶體使用>90% | Y | Disaster | 2m | 10s | 系統組 | $instance 目前使用率 $value% | |
| 主機CPU使用率>90% | Y | Disaster | 2m | 10s | 系統組 | $instance 目前使用率 $value% | |
| 主機IOWait使用率>20% | N | Disaster | 2m | 10s | 系統組 | $instance 目前使用率 $value% | |
| 主機硬碟空間使用>90% | Y | Disaster | 2m | 10s | 系統組 | $instance: $name 目前使用率 $value% | |
| 主機swarm-scheduler-exporter監控服務失聯 | Y | Disaster | 2m | 10s | 網路組 | $instance 監控服務無法連線 | |
| 監控容器停止 | Y | Disaster | 2m | 10s | 網路組 | $instance: $name | |
| 核心容器停止 | Y | Disaster | 2m | 10s | 系統組 | $instance: $name | |
| 主機FD使用率>90% | Y | High | 2m | 10s | 系統組 | $instance 節點檔案描述符(File Descriptor)使用偏高 | |
| 主機網卡異常 | Y | Disaster | 2m | 10s | 系統組 | $instance 的 網卡[$name]頻繁斷線 | |
| 主機監控容器已移除 | Y | Disaster | 2m | 10s | 網路組 | $instance: $name 服務已移除 | |
| 主機核心容器已移除 | Y | Disaster | 2m | 10s | 系統組 | $instance: $name 服務已移除 | |
| 主機核心服務10分鐘重啟超過2次 | Y | Disaster | 0m | 10s | 系統組 | $instance: $name | |
| 主機監控服務10分鐘重啟超過2次 | Y | Disaster | 0m | 10s | 網路組 | $instance: $name |
vm
| 告警名稱 | 啟用 | 嚴重度 | 持續時間 | Interval | Oncall | 摘要 | PromQL |
|---|---|---|---|---|---|---|---|
| 主機記憶體使用>80% | Y | High | 2m | 10s | $instance 目前使用率 $value% | ||
| 主機CPU使用率>80% | Y | High | 2m | 10s | $instance 目前使用率 $value% | ||
| 主機IOWait使用率>10% | N | High | 2m | 10s | $instance 目前使用率 $value% | ||
| 主機硬碟空間使用>80% | Y | High | 2m | 10s | $instance: $name 目前使用率 $value% | ||
| 主機系統負載偏高 | N | Warning | 15m | 10s | $instance 每顆 CPU load 超過2 | ||
| 主機FD使用率>80% | Y | High | 2m | 10s | $instance 節點檔案描述符(File Descriptor)使用偏高 |
blackbox
| 告警名稱 | 啟用 | 嚴重度 | 持續時間 | Interval | Oncall | 摘要 | PromQL |
|---|---|---|---|---|---|---|---|
| K3s BlackBoxExporter 監控服務失聯 | Y | Disaster | 2m | 10s | 網路組 | $instance/$name 監控服務失聯,無法進行探偵監控 | |
| K3s 服務 Port 探測失敗 | N | Disaster | 2m | 10s | 系統組 | $instance $name 端口檢測異常 |
certificate
| 告警名稱 | 啟用 | 嚴重度 | 持續時間 | Interval | Oncall | 摘要 | PromQL |
|---|---|---|---|---|---|---|---|
| K3s Api Server 客戶端憑證7天後到期 | Y | High | 0m | 30m | SSPRE-S 項目憑證將到期,請安排更換 | ||
| K3s Api Server 客戶端憑證1天後到期 | Y | Disaster | 0m | 30m | 系統組 | SSPRE-S 項目憑證將到期,請立即處理 | |
| K3s Api Server 伺服器端憑證7天後到期 | Y | High | 0m | 30m | SSPRE-S 項目憑證將到期,請安排更換 | ||
| K3s Api Server 伺服器端憑證1天後到期 | Y | Disaster | 0m | 30m | 系統組 | SSPRE-S 項目憑證將到期,請立即處理 | |
| K3s客戶端憑證7天後到期 | N | High | 0m | 30m | SSPRE-S 項目憑證將到期,請安排更換 | ||
| K3s客戶端憑證1天後到期 | N | Disaster | 0m | 30m | 系統組 | SSPRE-S 項目憑證將到期,請立即處理 | |
| K3s伺服器端憑證7天後到期 | Y | High | 0m | 30m | SSPRE-S 項目憑證將到期,請安排更換 | ||
| K3s伺服器端憑證1天後到期 | Y | Disaster | 0m | 30m | 系統組 | SSPRE-S 項目憑證將到期,請立即處理 |
chronyd
| 告警名稱 | 啟用 | 嚴重度 | 持續時間 | Interval | Oncall | 摘要 | PromQL |
|---|---|---|---|---|---|---|---|
| K3s節點系統時鐘偏差超過±2s | Y | High | 3m | 1m | $instance 系統時鐘偏差 $values | ||
| K3s監控節點系統時鐘偏差超過±10s | Y | Disaster | 3m | 1m | 網路組 | $instance 系統時鐘偏差 $values | |
| K3s核心節點系統時鐘偏差超過±10s | Y | Disaster | 3m | 1m | 系統組 | $instance 系統時鐘偏差 $values | |
| K3s監控節點Chronyd服務異常 | Y | Disaster | 3m | 1m | 網路組 | $instance 服務異常 | |
| K3s核心節點Chronyd服務異常 | Y | Disaster | 3m | 1m | 系統組 | $instance 服務異常 | |
| K3s節點 Chrony-Exporter 監控服務失聯 | Y | Disaster | 3m | 1m | 網路組 | $instance $name監控服務失聯,無法獲取Chrony狀態 |
cluster-disaster
| 告警名稱 | 啟用 | 嚴重度 | 持續時間 | Interval | Oncall | 摘要 | PromQL |
|---|---|---|---|---|---|---|---|
| K3s 核心Pod異常 | Y | Disaster | 2m | 10s | 系統組 | $instance: $name | |
| K3s 監控Pod異常 | Y | Disaster | 2m | 10s | 網路組 | $instance: $name | |
| K3s NodeExporter 監控服務失聯 | Y | Disaster | 2m | 10s | 網路組 | $instance: $name | |
| K3s監控節點重啟 | Y | Disaster | 0m | 10s | 網路組 | $instance | |
| K3s核心節點重啟 | Y | Disaster | 0m | 10s | 系統組 | $instance | |
| K3s監控節點狀態Not Ready | Y | Disaster | 2m | 10s | 網路組 | 請確認 $instance 節點狀態 | |
| K3s核心節點狀態Not Ready | Y | Disaster | 2m | 10s | 系統組 | 請確認 $instance 節點狀態 | |
| K3s監控節點失聯 | Y | Disaster | 2m | 10s | 網路組 | $instance 無法連接 | |
| K3s核心節點失聯 | Y | Disaster | 2m | 10s | 系統組 | $instance 無法連接 | |
| K3s監控節點狀態反覆異常 | Y | Disaster | 2m | 10s | 網路組 | $instance 狀態不穩定,15分鐘內變動 $value 次 | |
| K3s核心節點狀態反覆異常 | Y | Disaster | 2m | 10s | 系統組 | $instance 狀態不穩定,15分鐘內變動 $value 次 | |
| K3s Deployment 監控服務已移除 | Y | Disaster | 2m | 10s | 網路組 | SSPRE-S: $name 服務已移除 | |
| K3s Deployment 核心服務已移除 | Y | Disaster | 2m | 10s | 系統組 | SSPRE-S: $name 服務已移除 | |
| K3s Statefulset 監控服務已移除 | Y | Disaster | 2m | 10s | 網路組 | SSPRE-S: $name 服務已移除 | |
| K3s Statefulset 核心服務已移除 | Y | Disaster | 2m | 10s | 系統組 | SSPRE-S: $name 服務已移除 | |
| K3s Daemonset 監控服務已移除 | Y | Disaster | 2m | 10s | 網路組 | SSPRE-S: $name 服務已移除 | |
| K3s Daemonset 核心服務已移除 | Y | Disaster | 2m | 10s | 系統組 | SSPRE-S: $name 服務已移除 | |
| K3s核心節點記憶體使用率>90% | Y | Disaster | 2m | 10s | 系統組 | $instance 目前使用率 $value% | |
| K3s監控節點記憶體使用率>90% | Y | Disaster | 2m | 10s | 網路組 | $instance 目前使用率 $value% | |
| K3s核心節點CPU使用率>90% | Y | Disaster | 2m | 10s | 系統組 | $instance 目前使用率 $value% | |
| K3s監控節點CPU使用率>90% | Y | Disaster | 2m | 10s | 網路組 | $instance 目前使用率 $value% | |
| K3s核心節點IOWait使用率>20% | N | Disaster | 2m | 10s | 系統組 | $instance 目前使用率 $value% | |
| K3s監控節點IOWait使用率>20% | N | Disaster | 2m | 10s | 網路組 | $instance 目前使用率 $value% | |
| K3s核心節點硬碟使用率>90% | Y | Disaster | 2m | 10s | 系統組 | $instance: $name 目前使用率 $value% | |
| K3s監控節點硬碟使用率>90% | Y | Disaster | 2m | 10s | 網路組 | $instance: $name 目前使用率 $value% | |
| K3s監控服務崩潰 | Y | Disaster | 2m | 10s | 網路組 | $instance: $name 狀態CrashLoopBackOff | |
| K3s核心服務崩潰 | Y | Disaster | 2m | 10s | 系統組 | $instance: $name 狀態CrashLoopBackOff | |
| K3s核心節點FD使用率>90% | Y | Disaster | 2m | 10s | 系統組 | $instance 節點檔案描述符(File Descriptor)使用接近滿載 | |
| K3s監控節點FD使用率>90% | Y | Disaster | 2m | 10s | 網路組 | $instance 節點檔案描述符(File Descriptor)使用接近滿載 | |
| K3s監控節點網卡異常 | Y | Disaster | 2m | 10s | 網路組 | $instance 的 網卡[$name]頻繁斷線 | |
| K3s核心節點網卡異常 | Y | Disaster | 2m | 10s | 系統組 | $instance 的 網卡[$name]頻繁斷線 | |
| K3s核心服務10分鐘重啟超過2次 | Y | Disaster | 0m | 10s | 系統組 | $instance: $name | |
| K3s監控服務10分鐘重啟超過2次 | Y | Disaster | 0m | 10s | 網路組 | $instance: $name | |
| K3s 核心Container狀態異常 | Y | Disaster | 2m | 10s | 系統組 | $instance: $name pod的容器狀態異常 |
cluster
| 告警名稱 | 啟用 | 嚴重度 | 持續時間 | Interval | Oncall | 摘要 | PromQL |
|---|---|---|---|---|---|---|---|
| K3s Deployment 服務版本同步卡住 | Y | Warning | 15m | 10s | SSPRE-S: $name | ||
| K3s Deployment 服務健康副本數不足 | Y | Warning | 15m | 10s | SSPRE-S: $name | ||
| K3s Deployment 服務滾動更新停滯 | Y | Warning | 15m | 10s | SSPRE-S: $name | ||
| K3s StatefulSet 服務版本同步卡住 | Y | Warning | 15m | 10s | SSPRE-S: $name | ||
| K3s StatefulSet 服務健康副本數不足 | Y | Warning | 15m | 10s | SSPRE-S: $name | ||
| K3s StatefulSet 服務滾動更新停滯 | Y | Warning | 15m | 10s | SSPRE-S: $name | ||
| K3s Daemonset 服務部署副本數不足 | Y | Warning | 15m | 10s | SSPRE-S: $name 有 $value 個Pod未成功部署 | ||
| K3s Daemonset 服務節點排程錯誤 | Y | Warning | 15m | 10s | SSPRE-S: $name 有 $value 個Pod跑在錯誤的節點上 | ||
| K3s Daemonset 服務滾動更新停滯 | Y | Warning | 15m | 10s | SSPRE-S: $name | ||
| K3s cronjob 未成功執行 | Y | High | 0m | 10s | SSPRE-S: $name | ||
| K3s cronjo b執行失敗 | Y | High | 0m | 10s | SSPRE-S: $name | ||
| K3s cronjob 已暫停 | Y | High | 0m | 10s | SSPRE-S: $name | ||
| K3s節點記憶體使用率>80% | Y | High | 2m | 10s | $instance 目前使用率 $value% | ||
| K3s節點CPU使用率>80% | Y | High | 2m | 10s | $instance 目前使用率 $value% | ||
| K3s節點IOWait使用率>10% | N | High | 2m | 10s | $instance 目前使用率 $value% | ||
| K3s節點硬碟使用率>80% | Y | High | 2m | 10s | $instance: $name 目前使用率 $value% | ||
| K3s容器CPU配額不足 | Y | High | 5m | 10s | $instance: $name CPU有 $value 時間在等待 | ||
| K3s節點系統附載偏高 | N | Warning | 15m | 10s | $instance 每顆 CPU load 超過2 | ||
| K3s節點FD使用率>80% | Y | High | 2m | 10s | $instance 節點檔案描述符(File Descriptor)使用偏高 |
evaluation
| 告警名稱 | 啟用 | 嚴重度 | 持續時間 | Interval | Oncall | 摘要 | PromQL |
|---|---|---|---|---|---|---|---|
| Prometheus 規則評估耗時偏高 | Y | High | 10m | 1m | SSPRE-S 項目的 $name 告警規則耗時已接近interval配置 | ||
| Prometheus 規則評估已逾時 | Y | Disaster | 10m | 1m | 網路組 | SSPRE-S 項目的 $name 告警規則耗時已超過interval配置,告警可能存在延遲的情況 |
middleware
| 告警名稱 | 啟用 | 嚴重度 | 持續時間 | Interval | Oncall | 摘要 | PromQL |
|---|---|---|---|---|---|---|---|
| K3s RedisExporter 監控服務失聯 | N | Disaster | 2m | 10s | 網路組 | $instance $name 監控服務失聯,無法獲取redis狀態 | |
| K3s Redis節點Down | Y | Disaster | 2m | 10s | 系統組 | SSPRE-S $cluster-redis 節點Down | |
| K3s Redis叢集節點數不足 | N | Disaster | 2m | 10s | 系統組 | SSPRE-S $cluster-redis 叢集節點數異常,目前剩 $value 個 | |
| K3s Redis Slave 斷線 | N | Disaster | 2m | 10s | 系統組 | SSPRE-S $cluster-redis的master沒有Slave | |
| K3s Nacos 失聯 | Y | Disaster | 2m | 10s | 系統組 | SSPRE-S $name 節點 $name 連線中斷,請確認nacos狀態 | |
| K3s Nacos 叢集節點數不足 | N | Disaster | 2m | 10s | 系統組 | SSPRE-S $name 叢集存活節點僅剩 $value 個 | |
| K3s KafkaExporter 監控服務失聯 | Y | Disaster | 2m | 10s | 網路組 | SSPRE-S $name 監控服務失聯,無法獲取kafka狀態 | |
| K3s Kafka Broker 數量不足 | N | Disaster | 2m | 10s | 系統組 | SSPRE-S Kafka 叢集 Broker 數量異常,目前僅剩 $value 個 | |
| K3s Kafka 資料副本未同步 | N | Disaster | 5m | 10s | 系統組 | SSPRE-S Kafka 有$value個Partition副本未完成同步 |
system
| 告警名稱 | 啟用 | 嚴重度 | 持續時間 | Interval | Oncall | 摘要 | PromQL |
|---|---|---|---|---|---|---|---|
| K3s HPA副本數無法自動調整 | Y | High | 15m | 10s | SSPRE-S $name 自動擴縮容超過 15 分鐘無法達到目標副本數 | ||
| K3s HPA達最大副本數 | Y | High | 15m | 10s | SSPRE-S $name HPA 已擴展至 maxReplicas 上限 | ||
| K3s HPA低於最低副本數 | Y | High | 15m | 10s | SSPRE-S $name HPA運行副本數已低於 minReplicas | ||
| K3s 元件版本不一致 | Y | Warning | 15m | 10s | SSPRE-S集群偵測到$value種不同版本的核心元件,版本不一致可能導致相容性問題 | ||
| K3s API Server 請求錯誤率偏高 | Y | Warning | 15m | 10s | SSPRE-S API Server 請求錯誤率達 $value ,可能影響集群運作 | ||
| K3s API Server 請求被中斷 | Y | Warning | 15m | 10s | SSPRE-S API Server 主動中斷請求比例達 $value ,服務可能存在過載問題 | ||
| K3s 擴展 API 服務錯誤 | Y | Warning | 15m | 10s | SSPRE-S 擴展API [$name] 出現 $name 錯誤 | ||
| K3s 擴展 API 服務異常 | Y | Warning | 15m | 10s | SSPRE-S 擴展API [$name] 過去 10 分鐘可用率僅 $value% | ||
| K3s 管理元件檢查延遲 | Y | Warning | 15m | 10s | $instance 的Pod狀態檢查耗時 $value 秒 | ||
| K3s API 服務無回應 | Y | Disaster | 5m | 10s | 系統組 | SSPRE-S Prometheus抓取不到API服務,請確認服務是否正常 | |
| K3s 核心服務 PV 異常 | Y | Disaster | 5m | 10s | 系統組 | SSPRE-S $name 狀態異常 | |
| K3s 監控服務 PV 異常 | Y | Disaster | 5m | 10s | 網路組 | SSPRE-S $name 狀態異常 | |
| K3s 核心服務 PVC 異常 | Y | Disaster | 5m | 10s | 系統組 | SSPRE-S $name 狀態異常 | |
| K3s 監控服務 PVC 異常 | Y | Disaster | 5m | 10s | 網路組 | SSPRE-S $name 狀態異常 |