SaaS Prometheus 告警規則儀表板

4 個環境  ·  461 條告警規則  ·  更新時間:2026-07-30
變數說明 $instance VM / 主機名稱 · $name Pod / Container / Job / 掛載點 等資源名稱 · $cluster 叢集名稱 · $value 告警當下數值
SS 大核心
124
Disaster 82High 22Warning 20停用 17
SS TW2 小核心
119
Disaster 77High 22Warning 20停用 14
SSPRE 大核心
124
Disaster 82High 22Warning 20停用 16
SSPRE 小核心
94
Disaster 60High 15Warning 19停用 13
搜尋嚴重度Oncall規則檔啟用
blackbox
告警名稱啟用嚴重度持續時間IntervalOncall摘要PromQL
K8s BlackBoxExporter 監控服務失聯YDisaster2m10s網路組$instance $name 監控服務失聯,無法進行探偵監控
K8s 服務 Port 探測失敗NDisaster2m10s系統組$instance $name 端口檢測異常
certificate
告警名稱啟用嚴重度持續時間IntervalOncall摘要PromQL
K8s Api Server 客戶端憑證7天後到期YHigh0m30mSS 項目憑證將到期,請安排更換
K8s Api Server 客戶端憑證1天後到期YDisaster0m30m系統組SS 項目憑證將到期,請立即處理
K8s Api Server 伺服器端憑證7天後到期YHigh0m30mSS 項目憑證將到期,請安排更換
K8s Api Server 伺服器端憑證1天後到期YDisaster0m30m系統組SS 項目憑證將到期,請立即處理
K8s客戶端憑證7天後到期NHigh0m30mSS 項目憑證將到期,請安排更換
K8s客戶端憑證1天後到期NDisaster0m30m系統組SS 項目憑證將到期,請立即處理
K8s伺服器端憑證7天後到期YHigh0m30mSS 項目憑證將到期,請安排更換
K8s伺服器端憑證1天後到期YDisaster0m30m系統組SS 項目憑證將到期,請立即處理
chronyd
告警名稱啟用嚴重度持續時間IntervalOncall摘要PromQL
K8s節點系統時鐘偏差超過±2sYHigh3m1m$instance 系統時鐘偏差 $values
K8s監控節點系統時鐘偏差超過±10sYDisaster3m1m網路組$instance 系統時鐘偏差 $values
K8s核心節點系統時鐘偏差超過±10sYDisaster3m1m系統組$instance 系統時鐘偏差 $values
K8s監控節點Chronyd服務異常YDisaster3m1m網路組$instance 服務異常
K8s核心節點Chronyd服務異常YDisaster3m1m系統組$instance 服務異常
K8s節點 Chrony-Exporter 監控服務失聯YDisaster3m1m網路組$instance $name監控服務失聯,無法獲取Chrony狀態
主機系統時鐘偏差超過±2sYHigh3m1m$instance 系統時鐘偏差 $values
主機系統時鐘偏差超過±10sYDisaster3m1m系統組$instance 系統時鐘偏差 $values
主機Chronyd服務異常YDisaster3m1m系統組$instance 服務異常
主機 Chrony-Exporter 監控服務失聯YDisaster3m1m網路組$instance $name監控服務失聯,無法獲取Chrony狀態
cluster-disaster
告警名稱啟用嚴重度持續時間IntervalOncall摘要PromQL
K8s 核心Pod異常YDisaster2m10s系統組$instance: $name
K8s 監控Pod異常YDisaster2m10s網路組$instance: $name
K8s NodeExporter 監控服務失聯YDisaster2m10s網路組$instance: $name
K8s監控節點重啟YDisaster0m10s網路組$instance
K8s核心節點重啟YDisaster0m10s系統組$instance
K8s監控節點狀態Not ReadyYDisaster2m10s網路組請確認 $instance 節點狀態
K8s核心節點狀態Not ReadyYDisaster2m10s系統組請確認 $instance 節點狀態
K8s監控節點失聯YDisaster2m10s網路組$instance 無法連接
K8s核心節點失聯YDisaster2m10s系統組$instance 無法連接
K8s監控節點狀態反覆異常YDisaster2m10s網路組$instance 狀態不穩定,15分鐘內變動 $value 次
K8s核心節點狀態反覆異常YDisaster2m10s系統組$instance 狀態不穩定,15分鐘內變動 $value 次
K8s Deployment 監控服務已移除YDisaster2m10s網路組SS: $name 服務已移除
K8s Deployment 核心服務已移除YDisaster2m10s系統組SS: $name 服務已移除
K8s Statefulset 監控服務已移除YDisaster2m10s網路組SS: $name 服務已移除
K8s Statefulset 核心服務已移除YDisaster2m10s系統組SS: $name 服務已移除
K8s Daemonset 監控服務已移除YDisaster2m10s網路組SS: $name 服務已移除
K8s Daemonset 核心服務已移除YDisaster2m10s系統組SS: $name 服務已移除
K8s核心節點記憶體使用率>90%YDisaster2m10s系統組$instance 目前使用率 $value%
K8s監控節點記憶體使用率>90%YDisaster2m10s網路組$instance 目前使用率 $value%
K8s核心節點CPU使用率>90%YDisaster2m10s系統組$instance 目前使用率 $value%
K8s監控節點CPU使用率>90%YDisaster2m10s網路組$instance 目前使用率 $value%
K8s核心節點IOWait使用率>20%NDisaster2m10s系統組$instance 目前使用率 $value%
K8s監控節點IOWait使用率>20%NDisaster2m10s網路組$instance 目前使用率 $value%
K8s核心節點硬碟使用率>90%YDisaster2m10s系統組$instance: $name 目前使用率 $value%
K8s監控節點硬碟使用率>90%YDisaster2m10s網路組$instance: $name 目前使用率 $value%
K8s監控服務崩潰YDisaster2m10s網路組$instance: $name 狀態CrashLoopBackOff
K8s核心服務崩潰YDisaster2m10s系統組$instance: $name 狀態CrashLoopBackOff
K8s核心節點FD使用率>90%YDisaster2m10s系統組$instance 節點檔案描述符(File Descriptor)使用接近滿載
K8s監控節點FD使用率>90%YDisaster2m10s網路組$instance 節點檔案描述符(File Descriptor)使用接近滿載
K8s監控節點網卡異常YDisaster2m10s網路組$instance 的 網卡[$name]頻繁斷線
K8s核心節點網卡異常YDisaster2m10s系統組$instance 的 網卡[$name]頻繁斷線
K8s核心服務10分鐘重啟超過2次YDisaster0m10s系統組$instance: $name
K8s監控服務10分鐘重啟超過2次YDisaster0m10s網路組$instance: $name
K8s 核心Container狀態異常YDisaster2m10s系統組$instance: $name pod的容器狀態異常
cluster
告警名稱啟用嚴重度持續時間IntervalOncall摘要PromQL
K8s Deployment 服務版本同步卡住YWarning15m10sSS: $name
K8s Deployment 服務健康副本數不足YWarning15m10sSS: $name
K8s Deployment 服務滾動更新停滯YWarning15m10sSS: $name
K8s StatefulSet 服務版本同步卡住YWarning15m10sSS: $name
K8s StatefulSet 服務健康副本數不足YWarning15m10sSS: $name
K8s StatefulSet 服務滾動更新停滯YWarning15m10sSS: $name
K8s Daemonset 服務部署副本數不足YWarning15m10sSS: $name 有 $value 個Pod未成功部署
K8s Daemonset 服務節點排程錯誤YWarning15m10sSS: $name 有 $value 個Pod跑在錯誤的節點上
K8s Daemonset 服務滾動更新停滯YWarning15m10sSS: $name
K8s cronjob 未成功執行YHigh0m10sSS: $name
K8s cronjob 執行失敗YHigh0m10sSS: $name
K8s cronjob 已暫停YHigh0m10sSS: $name
K8s節點記憶體使用率>80%YHigh2m10s$instance 目前使用率 $value%
K8s節點CPU使用率>80%YHigh2m10s$instance 目前使用率 $value%
K8s節點IOWait使用率>10%NHigh2m10s$instance 目前使用率 $value%
K8s節點硬碟使用率>80%YHigh2m10s$instance: $name 目前使用率 $value%
K8s容器CPU配額不足YHigh5m10s$instance: $name CPU有 $value 時間在等待
K8s節點系統附載偏高NWarning15m10s$instance 每顆 CPU load 超過2
K8s節點FD使用率>80%YHigh2m10s$instance 節點檔案描述符(File Descriptor)使用偏高
evaluation
告警名稱啟用嚴重度持續時間IntervalOncall摘要PromQL
Prometheus 規則評估耗時偏高YHigh10m1mSS 項目的 $name 告警規則耗時已接近interval配置
Prometheus 規則評估已逾時YDisaster10m1m網路組SS 項目的 $name 告警規則耗時已超過interval配置,告警可能存在延遲的情況
middleware
告警名稱啟用嚴重度持續時間IntervalOncall摘要PromQL
K8s RedisExporter 監控服務失聯NDisaster2m10s網路組$instance $name 監控服務失聯,無法獲取redis狀態
K8s Redis節點DownYDisaster2m10s系統組SS $cluster-redis 節點Down
K8s Redis叢集節點數不足YDisaster2m10s系統組SS $cluster-redis 叢集節點數異常,目前剩 $value 個
K8s Redis Slave 斷線YDisaster2m10s系統組SS $cluster-redis的master沒有Slave
K8s MinIO 失聯NDisaster2m10s系統組SS $name 服務失聯,請確認MinIO狀態
K8s MinIO 節點離線NDisaster2m10s系統組SS $name 叢集有 $value 個節點離線
K8s MinIO 磁碟離線NDisaster2m10s系統組SS $name 叢集有 $value 顆磁碟離線
K8s Nacos 失聯YDisaster2m10s系統組SS $name 節點 $name 連線中斷,請確認nacos狀態
K8s Nacos 叢集節點數不足NDisaster2m10s系統組SS $name 叢集存活節點僅剩 $value 個
K8s KafkaExporter 監控服務失聯YDisaster2m10s網路組SS $name 監控服務失聯,無法獲取kafka狀態
K8s Kafka Broker 數量不足NDisaster2m10s系統組SS Kafka 叢集 Broker 數量異常,目前僅剩 $value 個
K8s Kafka 資料副本未同步NDisaster5m10s系統組SS Kafka 有$value個Partition副本未完成同步
K8s Kafka Connectors 同步異常YDisaster2m10s系統組SS 項目 Kafka 的 $name 狀態異常($value),目前無法正常同步
K8s kafka-mirromaker 失聯YDisaster2m10s系統組SS $name 服務失聯,請確認kafka-mirromaker服務狀態
system
告警名稱啟用嚴重度持續時間IntervalOncall摘要PromQL
K8s HPA副本數無法自動調整YHigh15m10sSS $name 自動擴縮容超過 15 分鐘無法達到目標副本數
K8s HPA達最大副本數YHigh15m10sSS $name HPA 已擴展至 maxReplicas 上限
K8s HPA低於最低副本數YHigh15m10sSS $name HPA運行副本數已低於 minReplicas
K8s 元件版本不一致YWarning15m10sSS集群偵測到$value種不同版本的核心元件,版本不一致可能導致相容性問題
K8s API Server 請求錯誤率偏高YWarning15m10sSS API Server 請求錯誤率達 $value ,可能影響集群運作
K8s API Server 請求被中斷YWarning15m10sSS API Server 主動中斷請求比例達 $value ,服務可能存在過載問題
K8s 擴展 API 服務錯誤YWarning15m10sSS 擴展API [$name] 出現 $name 錯誤
K8s 擴展 API 服務異常YWarning15m10sSS 擴展API [$name] 過去 10 分鐘可用率僅 $value%
K8s 管理元件檢查延遲YWarning15m10s$instance 的Pod狀態檢查耗時 $value 秒
K8s API 服務無回應YDisaster5m10s系統組SS Prometheus抓取不到API服務,請確認服務是否正常
K8s 核心服務 PV 異常YDisaster5m10s系統組SS $name 狀態異常
K8s 監控服務 PV 異常YDisaster5m10s網路組SS $name 狀態異常
K8s 核心服務 PVC 異常YDisaster5m10s系統組SS $name 狀態異常
K8s 監控服務 PVC 異常YDisaster5m10s網路組SS $name 狀態異常
vm-disaster
告警名稱啟用嚴重度持續時間IntervalOncall摘要PromQL
主機失聯YDisaster2m10s系統組$instance
主機重啟YDisaster0m10s系統組$instance
主機記憶體使用>90%YDisaster2m10s系統組$instance 目前使用率 $value%
主機CPU使用率>90%YDisaster2m10s系統組$instance 目前使用率 $value%
主機IOWait使用率>20%NDisaster2m10s系統組$instance 目前使用率 $value%
主機硬碟空間使用>90%YDisaster2m10s系統組$instance: $name 目前使用率 $value%
主機 swarm-scheduler-exporter 監控服務失聯YDisaster2m10s網路組$instance 監控服務無法連線
監控容器停止YDisaster2m10s網路組$instance: $name
核心容器停止YDisaster2m10s系統組$instance: $name
主機FD使用率>90%YHigh2m10s系統組$instance 節點檔案描述符(File Descriptor)使用偏高
主機網卡異常YDisaster2m10s系統組$instance 的 網卡[$name]頻繁斷線
主機監控容器已移除YDisaster2m10s網路組$instance: $name 服務已移除
主機核心容器已移除YDisaster2m10s系統組$instance: $name 服務已移除
主機核心服務10分鐘重啟超過2次YDisaster0m10s系統組$instance: $name
主機監控服務10分鐘重啟超過2次YDisaster0m10s網路組$instance: $name
vm
告警名稱啟用嚴重度持續時間IntervalOncall摘要PromQL
主機記憶體使用>80%YHigh2m10s$instance 目前使用率 $value%
主機CPU使用率>80%YHigh2m10s$instance 目前使用率 $value%
主機IOWait使用率>10%NHigh2m10s$instance 目前使用率 $value%
主機硬碟空間使用>80%YHigh2m10s$instance: $name 目前使用率 $value%
主機系統負載偏高NWarning15m10s$instance 每顆 CPU load 超過2
主機FD使用率>80%YHigh2m10s$instance 節點檔案描述符(File Descriptor)使用偏高
blackbox
告警名稱啟用嚴重度持續時間IntervalOncall摘要PromQL
K3s BlackBoxExporter 監控服務失聯YDisaster2m10s網路組$instance/$name 監控服務失聯,無法進行探偵監控
K3s 服務 Port 探測失敗NDisaster2m10s系統組$instance $name 端口檢測異常
certificate
告警名稱啟用嚴重度持續時間IntervalOncall摘要PromQL
K3s Api Server 客戶端憑證7天後到期YHigh0m30mSS-TW2 項目憑證將到期,請安排更換
K3s Api Server 客戶端憑證1天後到期YDisaster0m30m系統組SS-TW2 項目憑證將到期,請立即處理
K3s Api Server 伺服器端憑證7天後到期YHigh0m30mSS-TW2 項目憑證將到期,請安排更換
K3s Api Server 伺服器端憑證1天後到期YDisaster0m30m系統組SS-TW2 項目憑證將到期,請立即處理
K3s客戶端憑證7天後到期NHigh0m30mSS-TW2 項目憑證將到期,請安排更換
K3s客戶端憑證1天後到期NDisaster0m30m系統組SS-TW2 項目憑證將到期,請立即處理
K3s伺服器端憑證7天後到期YHigh0m30mSS-TW2 項目憑證將到期,請安排更換
K3s伺服器端憑證1天後到期YDisaster0m30m系統組SS-TW2 項目憑證將到期,請立即處理
chronyd
告警名稱啟用嚴重度持續時間IntervalOncall摘要PromQL
K3s節點系統時鐘偏差超過±2sYHigh3m1m$instance 系統時鐘偏差 $values
K3s監控節點系統時鐘偏差超過±10sYDisaster3m1m網路組$instance 系統時鐘偏差 $values
K3s核心節點系統時鐘偏差超過±10sYDisaster3m1m系統組$instance 系統時鐘偏差 $values
K3s監控節點Chronyd服務異常YDisaster3m1m網路組$instance 服務異常
K3s核心節點Chronyd服務異常YDisaster3m1m系統組$instance 服務異常
K3s節點 Chrony-Exporter 監控服務失聯YDisaster3m1m網路組$instance $name監控服務失聯,無法獲取Chrony狀態
主機系統時鐘偏差超過±2sYHigh3m1m$instance 系統時鐘偏差 $values
主機系統時鐘偏差超過±10sYDisaster3m1m系統組$instance 系統時鐘偏差 $values
主機Chronyd服務異常YDisaster3m1m系統組$instance 服務異常
主機 Chrony-Exporter 監控服務失聯YDisaster3m1m網路組$instance $name監控服務失聯,無法獲取Chrony狀態
cluster-disaster
告警名稱啟用嚴重度持續時間IntervalOncall摘要PromQL
K3s 核心Pod異常YDisaster2m10s系統組$instance: $name
K3s 監控Pod異常YDisaster2m10s網路組$instance: $name
K3s NodeExporter 監控服務失聯YDisaster2m10s網路組$instance: $name
K3s監控節點重啟YDisaster0m10s網路組$instance
K3s核心節點重啟YDisaster0m10s系統組$instance
K3s監控節點狀態Not ReadyYDisaster2m10s網路組請確認 $instance 節點狀態
K3s核心節點狀態Not ReadyYDisaster2m10s系統組請確認 $instance 節點狀態
K3s監控節點失聯YDisaster2m10s網路組$instance 無法連接
K3s核心節點失聯YDisaster2m10s系統組$instance 無法連接
K3s監控節點狀態反覆異常YDisaster2m10s網路組$instance 狀態不穩定,15分鐘內變動 $value 次
K3s核心節點狀態反覆異常YDisaster2m10s系統組$instance 狀態不穩定,15分鐘內變動 $value 次
K3s Deployment 監控服務已移除YDisaster2m10s網路組SS-TW2: $name 服務已移除
K3s Deployment 核心服務已移除YDisaster2m10s系統組SS-TW2: $name 服務已移除
K3s Statefulset 監控服務已移除YDisaster2m10s網路組SS-TW2: $name 服務已移除
K3s Statefulset 核心服務已移除YDisaster2m10s系統組SS-TW2: $name 服務已移除
K3s Daemonset 監控服務已移除YDisaster2m10s網路組SS-TW2: $name 服務已移除
K3s Daemonset 核心服務已移除YDisaster2m10s系統組SS-TW2: $name 服務已移除
K3s核心節點記憶體使用率>90%YDisaster2m10s系統組$instance 目前使用率 $value%
K3s監控節點記憶體使用率>90%YDisaster2m10s網路組$instance 目前使用率 $value%
K3s核心節點CPU使用率>90%YDisaster2m10s系統組$instance 目前使用率 $value%
K3s監控節點CPU使用率>90%YDisaster2m10s網路組$instance 目前使用率 $value%
K3s核心節點IOWait使用率>20%NDisaster2m10s系統組$instance 目前使用率 $value%
K3s監控節點IOWait使用率>20%NDisaster2m10s網路組$instance 目前使用率 $value%
K3s核心節點硬碟使用率>90%YDisaster2m10s系統組$instance: $name 目前使用率 $value%
K3s監控節點硬碟使用率>90%YDisaster2m10s網路組$instance: $name 目前使用率 $value%
K3s監控服務崩潰YDisaster2m10s網路組$instance: $name 狀態CrashLoopBackOff
K3s核心服務崩潰YDisaster2m10s系統組$instance: $name 狀態CrashLoopBackOff
K3s核心節點FD使用率>90%YDisaster2m10s系統組$instance 節點檔案描述符(File Descriptor)使用接近滿載
K3s監控節點FD使用率>90%YDisaster2m10s網路組$instance 節點檔案描述符(File Descriptor)使用接近滿載
K3s監控節點網卡異常YDisaster2m10s網路組$instance 的 網卡[$name]頻繁斷線
K3s核心節點網卡異常YDisaster2m10s系統組$instance 的 網卡[$name]頻繁斷線
K3s核心服務10分鐘重啟超過2次YDisaster0m10s系統組$instance: $name
K3s監控服務10分鐘重啟超過2次YDisaster0m10s網路組$instance: $name
K3s 核心Container狀態異常YDisaster2m10s系統組$instance: $name pod的容器狀態異常
cluster
告警名稱啟用嚴重度持續時間IntervalOncall摘要PromQL
K3s Deployment 服務版本同步卡住YWarning15m10sSS-TW2: $name
K3s Deployment 服務健康副本數不足YWarning15m10sSS-TW2: $name
K3s Deployment 服務滾動更新停滯YWarning15m10sSS-TW2: $name
K3s StatefulSet 服務版本同步卡住YWarning15m10sSS-TW2: $name
K3s StatefulSet 服務健康副本數不足YWarning15m10sSS-TW2: $name
K3s StatefulSet 服務滾動更新停滯YWarning15m10sSS-TW2: $name
K3s Daemonset 服務部署副本數不足YWarning15m10sSS-TW2: $name 有 $value 個Pod未成功部署
K3s Daemonset 服務節點排程錯誤YWarning15m10sSS-TW2: $name 有 $value 個Pod跑在錯誤的節點上
K3s Daemonset 服務滾動更新停滯YWarning15m10sSS-TW2: $name
K3s cronjob 未成功執行YHigh0m10sSS-TW2: $name
K3s cronjob 執行失敗YHigh0m10sSS-TW2: $name
K3s cronjob 已暫停YHigh0m10sSS-TW2: $name
K3s節點記憶體使用率>80%YHigh2m10s$instance 目前使用率 $value%
K3s節點CPU使用率>80%YHigh2m10s$instance 目前使用率 $value%
K3s節點IOWait使用率>10%NHigh2m10s$instance 目前使用率 $value%
K3s節點硬碟使用率>80%YHigh2m10s$instance: $name 目前使用率 $value%
K3s容器CPU配額不足YHigh5m10s$instance: $name CPU有 $value 時間在等待
K3s節點系統附載偏高NWarning15m10s$instance 每顆 CPU load 超過2
K3s節點FD使用率>80%YHigh2m10s$instance 節點檔案描述符(File Descriptor)使用偏高
evaluation
告警名稱啟用嚴重度持續時間IntervalOncall摘要PromQL
Prometheus 規則評估耗時偏高YHigh10m1mSS-TW2 項目的 $name 告警規則耗時已接近interval配置
Prometheus 規則評估已逾時YDisaster10m1m網路組SS-TW2 項目的 $name 告警規則耗時已超過interval配置,告警可能存在延遲的情況
middleware
告警名稱啟用嚴重度持續時間IntervalOncall摘要PromQL
K3s RedisExporter 監控服務失聯NDisaster2m10s網路組$instance $name 監控服務失聯,無法獲取redis狀態
K3s Redis節點DownYDisaster2m10s系統組SS-TW2 $cluster-redis 節點Down
K3s Redis叢集節點數不足YDisaster2m10s系統組SS-TW2 $cluster-redis 叢集節點數異常,目前剩 $value 個
K3s Redis Slave 斷線YDisaster2m10s系統組SS-TW2 $cluster-redis的master沒有Slave
K3s Nacos 失聯YDisaster2m10s系統組SS-TW2 $name 節點 $name 連線中斷,請確認nacos狀態
K3s Nacos 叢集節點數不足NDisaster2m10s系統組SS-TW2 $name 叢集存活節點僅剩 $value 個
K3s KafkaExporter 監控服務失聯YDisaster2m10s網路組SS-TW2 $name 監控服務失聯,無法獲取kafka狀態
K3s Kafka Broker 數量不足NDisaster2m10s系統組SS-TW2 Kafka 叢集 Broker 數量異常,目前僅剩 $value 個
K3s Kafka 資料副本未同步NDisaster5m10s系統組SS-TW2 Kafka 有$value個Partition副本未完成同步
system
告警名稱啟用嚴重度持續時間IntervalOncall摘要PromQL
K3s HPA副本數無法自動調整YHigh15m10sSS-TW2 $name 自動擴縮容超過 15 分鐘無法達到目標副本數
K3s HPA達最大副本數YHigh15m10sSS-TW2 $name HPA 已擴展至 maxReplicas 上限
K3s HPA低於最低副本數YHigh15m10sSS-TW2 $name HPA運行副本數已低於 minReplicas
K3s 元件版本不一致YWarning15m10sSS-TW2集群偵測到$value種不同版本的核心元件,版本不一致可能導致相容性問題
K3s API Server 請求錯誤率偏高YWarning15m10sSS-TW2 API Server 請求錯誤率達 $value ,可能影響集群運作
K3s API Server 請求被中斷YWarning15m10sSS-TW2 API Server 主動中斷請求比例達 $value ,服務可能存在過載問題
K3s 擴展 API 服務錯誤YWarning15m10sSS-TW2 擴展API [$name] 出現 $name 錯誤
K3s 擴展 API 服務異常YWarning15m10sSS-TW2 擴展API [$name] 過去 10 分鐘可用率僅 $value%
K3s 管理元件檢查延遲YWarning15m10s$instance 的Pod狀態檢查耗時 $value 秒
K3s API 服務無回應YDisaster5m10s系統組SS-TW2 Prometheus抓取不到API服務,請確認服務是否正常
K3s 核心服務 PV 異常YDisaster5m10s系統組SS-TW2 $name 狀態異常
K3s 監控服務 PV 異常YDisaster5m10s網路組SS-TW2 $name 狀態異常
K3s 核心服務 PVC 異常YDisaster5m10s系統組SS-TW2 $name 狀態異常
K3s 監控服務 PVC 異常YDisaster5m10s網路組SS-TW2 $name 狀態異常
vm-disaster
告警名稱啟用嚴重度持續時間IntervalOncall摘要PromQL
主機失聯YDisaster2m10s系統組$instance
主機重啟YDisaster0m10s系統組$instance
主機記憶體使用>90%YDisaster2m10s系統組$instance 目前使用率 $value%
主機CPU使用率>90%YDisaster2m10s系統組$instance 目前使用率 $value%
主機IOWait使用率>20%NDisaster2m10s系統組$instance 目前使用率 $value%
主機硬碟空間使用>90%YDisaster2m10s系統組$instance: $name 目前使用率 $value%
主機 swarm-scheduler-exporter 監控服務失聯YDisaster2m10s網路組$instance 監控服務無法連線
監控容器停止YDisaster2m10s網路組$instance: $name
核心容器停止YDisaster2m10s系統組$instance: $name
主機FD使用率>90%YHigh2m10s系統組$instance 節點檔案描述符(File Descriptor)使用偏高
主機網卡異常YDisaster2m10s系統組$instance 的 網卡[$name]頻繁斷線
主機監控容器已移除YDisaster2m10s網路組$instance:$name 服務已移除
主機核心容器已移除YDisaster2m10s系統組$instance: $name 服務已移除
主機核心服務10分鐘重啟超過2次YDisaster0m10s系統組$instance: $name
主機監控服務10分鐘重啟超過2次YDisaster0m10s網路組$instance: $name
vm
告警名稱啟用嚴重度持續時間IntervalOncall摘要PromQL
主機記憶體使用>80%YHigh2m10s$instance 目前使用率 $value%
主機CPU使用率>80%YHigh2m10s$instance 目前使用率 $value%
主機IOWait使用率>10%NHigh2m10s$instance 目前使用率 $value%
主機硬碟空間使用>80%YHigh2m10s$instance: $name 目前使用率 $value%
主機系統負載偏高NWarning15m10s$instance 每顆 CPU load 超過2
主機FD使用率>80%YHigh2m10s$instance 節點檔案描述符(File Descriptor)使用偏高
blackbox
告警名稱啟用嚴重度持續時間IntervalOncall摘要PromQL
K8s BlackBoxExporter 監控服務失聯YDisaster2m10s網路組$instance $name 監控服務失聯,無法進行探偵監控
K8s 服務 Port 探測失敗NDisaster2m10s系統組$instance $name 端口檢測異常
certificate
告警名稱啟用嚴重度持續時間IntervalOncall摘要PromQL
K8s Api Server 客戶端憑證7天後到期YHigh0m30mSSPRE 項目憑證將到期,請安排更換
K8s Api Server 客戶端憑證1天後到期YDisaster0m30m系統組SSPRE 項目憑證將到期,請立即處理
K8s Api Server 伺服器端憑證7天後到期YHigh0m30mSSPRE 項目憑證將到期,請安排更換
K8s Api Server 伺服器端憑證1天後到期YDisaster0m30m系統組SSPRE 項目憑證將到期,請立即處理
K8s客戶端憑證7天後到期NHigh0m30mSSPRE 項目憑證將到期,請安排更換
K8s客戶端憑證1天後到期NDisaster0m30m系統組SSPRE 項目憑證將到期,請立即處理
K8s伺服器端憑證7天後到期YHigh0m30mSSPRE 項目憑證將到期,請安排更換
K8s伺服器端憑證1天後到期YDisaster0m30m系統組SSPRE 項目憑證將到期,請立即處理
chronyd
告警名稱啟用嚴重度持續時間IntervalOncall摘要PromQL
K8s節點系統時鐘偏差超過±2sYHigh3m1m$instance 系統時鐘偏差 $values
K8s監控節點系統時鐘偏差超過±10sYDisaster3m1m網路組$instance 系統時鐘偏差 $values
K8s核心節點系統時鐘偏差超過±10sYDisaster3m1m系統組$instance 系統時鐘偏差 $values
K8s監控節點Chronyd服務異常YDisaster3m1m網路組$instance 服務異常
K8s核心節點Chronyd服務異常YDisaster3m1m系統組$instance 服務異常
K8s節點 Chrony-Exporter 監控服務失聯YDisaster3m1m網路組$instance $name監控服務失聯,無法獲取Chrony狀態
主機系統時鐘偏差超過±2sYHigh3m1m$instance 系統時鐘偏差 $values
主機系統時鐘偏差超過±10sYDisaster3m1m系統組$instance 系統時鐘偏差 $values
主機Chronyd服務異常YDisaster3m1m系統組$instance 服務異常
主機 Chrony-Exporter 監控服務失聯YDisaster3m1m網路組$instance $name監控服務失聯,無法獲取Chrony狀態
cluster-disaster
告警名稱啟用嚴重度持續時間IntervalOncall摘要PromQL
K8s 核心Pod異常YDisaster2m10s系統組$instance: $name
K8s 監控Pod異常YDisaster2m10s網路組$instance: $name
K8s NodeExporter 監控服務失聯YDisaster2m10s網路組$instance: $name
K8s監控節點重啟YDisaster0m10s網路組$instance
K8s核心節點重啟YDisaster0m10s系統組$instance
K8s監控節點狀態Not ReadyYDisaster2m10s網路組請確認 $instance 節點狀態
K8s核心節點狀態Not ReadyYDisaster2m10s系統組請確認 $instance 節點狀態
K8s監控節點失聯YDisaster2m10s網路組$instance 無法連接
K8s核心節點失聯YDisaster2m10s系統組$instance 無法連接
K8s監控節點狀態反覆異常YDisaster2m10s網路組$instance 狀態不穩定,15分鐘內變動 $value 次
K8s核心節點狀態反覆異常YDisaster2m10s系統組$instance 狀態不穩定,15分鐘內變動 $value 次
K8s Deployment 監控服務已移除YDisaster2m10s網路組SSPRE: $name 服務已移除
K8s Deployment 核心服務已移除YDisaster2m10s系統組SSPRE: $name 服務已移除
K8s Statefulset 監控服務已移除YDisaster2m10s網路組SSPRE: $name 服務已移除
K8s Statefulset 核心服務已移除YDisaster2m10s系統組SSPRE: $name 服務已移除
K8s Daemonset 監控服務已移除YDisaster2m10s網路組SSPRE: $name 服務已移除
K8s Daemonset 核心服務已移除YDisaster2m10s系統組SSPRE: $name 服務已移除
K8s核心節點記憶體使用率>90%YDisaster2m10s系統組$instance 目前使用率 $value%
K8s監控節點記憶體使用率>90%YDisaster2m10s網路組$instance 目前使用率 $value%
K8s核心節點CPU使用率>90%YDisaster2m10s系統組$instance 目前使用率 $value%
K8s監控節點CPU使用率>90%YDisaster2m10s網路組$instance 目前使用率 $value%
K8s核心節點IOWait使用率>20%NDisaster2m10s系統組$instance 目前使用率 $value%
K8s監控節點IOWait使用率>20%NDisaster2m10s網路組$instance 目前使用率 $value%
K8s核心節點硬碟使用率>90%YDisaster2m10s系統組$instance: $name 目前使用率 $value%
K8s監控節點硬碟使用率>90%YDisaster2m10s網路組$instance: $name 目前使用率 $value%
K8s監控服務崩潰YDisaster2m10s網路組$instance: $name 狀態CrashLoopBackOff
K8s核心服務崩潰YDisaster2m10s系統組$instance: $name 狀態CrashLoopBackOff
K8s核心節點FD使用率>90%YDisaster2m10s系統組$instance 節點檔案描述符(File Descriptor)使用接近滿載
K8s監控節點FD使用率>90%YDisaster2m10s網路組$instance 節點檔案描述符(File Descriptor)使用接近滿載
K8s監控節點網卡異常YDisaster2m10s網路組$instance 的 網卡[$name]頻繁斷線
K8s核心節點網卡異常YDisaster2m10s系統組$instance 的 網卡[$name]頻繁斷線
K8s核心服務10分鐘重啟超過2次YDisaster0m10s系統組$instance: $name
K8s監控服務10分鐘重啟超過2次YDisaster0m10s網路組$instance: $name
K8s 核心Container狀態異常YDisaster2m10s系統組$instance: $name pod的容器狀態異常
cluster
告警名稱啟用嚴重度持續時間IntervalOncall摘要PromQL
K8s Deployment 服務版本同步卡住YWarning15m10sSSPRE: $name
K8s Deployment 服務健康副本數不足YWarning15m10sSSPRE: $name
K8s Deployment 服務滾動更新停滯YWarning15m10sSSPRE: $name
K8s StatefulSet 服務版本同步卡住YWarning15m10sSSPRE: $name
K8s StatefulSet 服務健康副本數不足YWarning15m10sSSPRE: $name
K8s StatefulSet 服務滾動更新停滯YWarning15m10sSSPRE: $name
K8s Daemonset 服務部署副本數不足YWarning15m10sSSPRE: $name 有 $value 個Pod未成功部署
K8s Daemonset 服務節點排程錯誤YWarning15m10sSSPRE: $name 有 $value 個Pod跑在錯誤的節點上
K8s Daemonset 服務滾動更新停滯YWarning15m10sSSPRE: $name
K8s cronjob 未成功執行YHigh0m10sSSPRE: $name
K8s cronjob 執行失敗YHigh0m10sSSPRE: $name
K8s cronjob 已暫停YHigh0m10sSSPRE: $name
K8s節點記憶體使用率>80%YHigh2m10s$instance 目前使用率 $value%
K8s節點CPU使用率>80%YHigh2m10s$instance 目前使用率 $value%
K8s節點IOWait使用率>10%NHigh2m10s$instance 目前使用率 $value%
K8s節點硬碟使用率>80%YHigh2m10s$instance: $name 目前使用率 $value%
K8s容器CPU配額不足YHigh5m10s$instance: $name CPU有 $value 時間在等待
K8s節點系統附載偏高NWarning15m10s$instance 每顆 CPU load 超過2
K8s節點FD使用率>80%YHigh2m10s$instance 節點檔案描述符(File Descriptor)使用偏高
evaluation
告警名稱啟用嚴重度持續時間IntervalOncall摘要PromQL
Prometheus 規則評估耗時偏高YHigh10m1mSSPRE 項目的 $name 告警規則耗時已接近interval配置
Prometheus 規則評估已逾時YDisaster10m1m網路組SSPRE 項目的 $name 告警規則耗時已超過interval配置,告警可能存在延遲的情況
middleware
告警名稱啟用嚴重度持續時間IntervalOncall摘要PromQL
K8s RedisExporter 監控服務失聯NDisaster2m10s網路組$instance $name 監控服務失聯,無法獲取redis狀態
K8s Redis節點DownYDisaster2m10s系統組SSPRE $cluster-redis 節點Down
K8s Redis叢集節點數不足YDisaster2m10s系統組SSPRE $cluster-redis 叢集節點數異常,目前剩 $value 個
K8s Redis Slave 斷線YDisaster2m10s系統組SSPRE $cluster-redis的master沒有Slave
K8s MinIO 失聯YDisaster2m10s系統組SSPRE $name 服務失聯,請確認MinIO狀態
K8s MinIO 節點離線NDisaster2m10s系統組SSPRE $name 叢集有 $value 個節點離線
K8s MinIO 磁碟離線NDisaster2m10s系統組SSPRE $name 叢集有 $value 顆磁碟離線
K8s Nacos 失聯YDisaster2m10s系統組SSPRE $name 節點 $name 連線中斷,請確認nacos狀態
K8s Nacos 叢集節點數不足NDisaster2m10s系統組SSPRE $name 叢集存活節點僅剩 $value 個
K8s KafkaExporter 監控服務失聯YDisaster2m10s網路組SSPRE $name 監控服務失聯,無法獲取kafka狀態
K8s Kafka Broker 數量不足NDisaster2m10s系統組SSPRE Kafka 叢集 Broker 數量異常,目前僅剩 $value 個
K8s Kafka 資料副本未同步NDisaster5m10s系統組SSPRE Kafka 有$value個Partition副本未完成同步
K8s Kafka Connectors 同步異常YDisaster2m10s系統組>-
K8s kafka-mirromaker 失聯YDisaster2m10s系統組SSPRE $name 服務失聯,請確認kafka-mirromaker服務狀態
system
告警名稱啟用嚴重度持續時間IntervalOncall摘要PromQL
K8s HPA副本數無法自動調整YHigh15m10sSSPRE $name 自動擴縮容超過 15 分鐘無法達到目標副本數
K8s HPA達最大副本數YHigh15m10sSSPRE $name/$name HPA 已擴展至 maxReplicas 上限
K8s HPA低於最低副本數YHigh15m10sSSPRE $name HPA運行副本數已低於 minReplicas
K8s 元件版本不一致YWarning15m10sSSPRE集群偵測到$value種不同版本的核心元件,版本不一致可能導致相容性問題
K8s API Server 請求錯誤率偏高YWarning15m10sSSPRE API Server 請求錯誤率達 $value ,可能影響集群運作
K8s API Server 請求被中斷YWarning15m10sSSPRE API Server 主動中斷請求比例達 $value ,服務可能存在過載問題
K8s 擴展 API 服務錯誤YWarning15m10sSSPRE 擴展API [$name] 出現 $name 錯誤
K8s 擴展 API 服務異常YWarning15m10sSSPRE 擴展API [$name] 過去 10 分鐘可用率僅 $value%
K8s 管理元件檢查延遲YWarning15m10s$instance 的Pod狀態檢查耗時 $value 秒
K8s API 服務無回應YDisaster5m10s系統組SSPRE Prometheus抓取不到API服務,請確認服務是否正常
K8s 核心服務 PV 異常YDisaster5m10s系統組SSPRE $name 狀態異常
K8s 監控服務 PV 異常YDisaster5m10s網路組SSPRE $name 狀態異常
K8s 核心服務 PVC 異常YDisaster5m10s系統組SSPRE $name 狀態異常
K8s 監控服務 PVC 異常YDisaster5m10s網路組SSPRE $name 狀態異常
vm-disaster
告警名稱啟用嚴重度持續時間IntervalOncall摘要PromQL
主機失聯YDisaster2m10s系統組$instance
主機重啟YDisaster0m10s系統組$instance
主機記憶體使用>90%YDisaster2m10s系統組$instance 目前使用率 $value%
主機CPU使用率>90%YDisaster2m10s系統組$instance 目前使用率 $value%
主機IOWait使用率>20%NDisaster2m10s系統組$instance 目前使用率 $value%
主機硬碟空間使用>90%YDisaster2m10s系統組$instance: $name 目前使用率 $value%
主機swarm-scheduler-exporter監控服務失聯YDisaster2m10s網路組$instance 監控服務無法連線
監控容器停止YDisaster2m10s網路組$instance: $name
核心容器停止YDisaster2m10s系統組$instance: $name
主機FD使用率>90%YHigh2m10s系統組$instance 節點檔案描述符(File Descriptor)使用偏高
主機網卡異常YDisaster2m10s系統組$instance 的 網卡[$name]頻繁斷線
主機監控容器已移除YDisaster2m10s網路組$instance: $name 服務已移除
主機核心容器已移除YDisaster2m10s系統組$instance: $name 服務已移除
主機核心服務10分鐘重啟超過2次YDisaster0m10s系統組$instance: $name
主機監控服務10分鐘重啟超過2次YDisaster0m10s網路組$instance: $name
vm
告警名稱啟用嚴重度持續時間IntervalOncall摘要PromQL
主機記憶體使用>80%YHigh2m10s$instance 目前使用率 $value%
主機CPU使用率>80%YHigh2m10s$instance 目前使用率 $value%
主機IOWait使用率>10%NHigh2m10s$instance 目前使用率 $value%
主機硬碟空間使用>80%YHigh2m10s$instance: $name 目前使用率 $value%
主機系統負載偏高NWarning15m10s$instance 每顆 CPU load 超過2
主機FD使用率>80%YHigh2m10s$instance 節點檔案描述符(File Descriptor)使用偏高
blackbox
告警名稱啟用嚴重度持續時間IntervalOncall摘要PromQL
K3s BlackBoxExporter 監控服務失聯YDisaster2m10s網路組$instance/$name 監控服務失聯,無法進行探偵監控
K3s 服務 Port 探測失敗NDisaster2m10s系統組$instance $name 端口檢測異常
certificate
告警名稱啟用嚴重度持續時間IntervalOncall摘要PromQL
K3s Api Server 客戶端憑證7天後到期YHigh0m30mSSPRE-S 項目憑證將到期,請安排更換
K3s Api Server 客戶端憑證1天後到期YDisaster0m30m系統組SSPRE-S 項目憑證將到期,請立即處理
K3s Api Server 伺服器端憑證7天後到期YHigh0m30mSSPRE-S 項目憑證將到期,請安排更換
K3s Api Server 伺服器端憑證1天後到期YDisaster0m30m系統組SSPRE-S 項目憑證將到期,請立即處理
K3s客戶端憑證7天後到期NHigh0m30mSSPRE-S 項目憑證將到期,請安排更換
K3s客戶端憑證1天後到期NDisaster0m30m系統組SSPRE-S 項目憑證將到期,請立即處理
K3s伺服器端憑證7天後到期YHigh0m30mSSPRE-S 項目憑證將到期,請安排更換
K3s伺服器端憑證1天後到期YDisaster0m30m系統組SSPRE-S 項目憑證將到期,請立即處理
chronyd
告警名稱啟用嚴重度持續時間IntervalOncall摘要PromQL
K3s節點系統時鐘偏差超過±2sYHigh3m1m$instance 系統時鐘偏差 $values
K3s監控節點系統時鐘偏差超過±10sYDisaster3m1m網路組$instance 系統時鐘偏差 $values
K3s核心節點系統時鐘偏差超過±10sYDisaster3m1m系統組$instance 系統時鐘偏差 $values
K3s監控節點Chronyd服務異常YDisaster3m1m網路組$instance 服務異常
K3s核心節點Chronyd服務異常YDisaster3m1m系統組$instance 服務異常
K3s節點 Chrony-Exporter 監控服務失聯YDisaster3m1m網路組$instance $name監控服務失聯,無法獲取Chrony狀態
cluster-disaster
告警名稱啟用嚴重度持續時間IntervalOncall摘要PromQL
K3s 核心Pod異常YDisaster2m10s系統組$instance: $name
K3s 監控Pod異常YDisaster2m10s網路組$instance: $name
K3s NodeExporter 監控服務失聯YDisaster2m10s網路組$instance: $name
K3s監控節點重啟YDisaster0m10s網路組$instance
K3s核心節點重啟YDisaster0m10s系統組$instance
K3s監控節點狀態Not ReadyYDisaster2m10s網路組請確認 $instance 節點狀態
K3s核心節點狀態Not ReadyYDisaster2m10s系統組請確認 $instance 節點狀態
K3s監控節點失聯YDisaster2m10s網路組$instance 無法連接
K3s核心節點失聯YDisaster2m10s系統組$instance 無法連接
K3s監控節點狀態反覆異常YDisaster2m10s網路組$instance 狀態不穩定,15分鐘內變動 $value 次
K3s核心節點狀態反覆異常YDisaster2m10s系統組$instance 狀態不穩定,15分鐘內變動 $value 次
K3s Deployment 監控服務已移除YDisaster2m10s網路組SSPRE-S: $name 服務已移除
K3s Deployment 核心服務已移除YDisaster2m10s系統組SSPRE-S: $name 服務已移除
K3s Statefulset 監控服務已移除YDisaster2m10s網路組SSPRE-S: $name 服務已移除
K3s Statefulset 核心服務已移除YDisaster2m10s系統組SSPRE-S: $name 服務已移除
K3s Daemonset 監控服務已移除YDisaster2m10s網路組SSPRE-S: $name 服務已移除
K3s Daemonset 核心服務已移除YDisaster2m10s系統組SSPRE-S: $name 服務已移除
K3s核心節點記憶體使用率>90%YDisaster2m10s系統組$instance 目前使用率 $value%
K3s監控節點記憶體使用率>90%YDisaster2m10s網路組$instance 目前使用率 $value%
K3s核心節點CPU使用率>90%YDisaster2m10s系統組$instance 目前使用率 $value%
K3s監控節點CPU使用率>90%YDisaster2m10s網路組$instance 目前使用率 $value%
K3s核心節點IOWait使用率>20%NDisaster2m10s系統組$instance 目前使用率 $value%
K3s監控節點IOWait使用率>20%NDisaster2m10s網路組$instance 目前使用率 $value%
K3s核心節點硬碟使用率>90%YDisaster2m10s系統組$instance: $name 目前使用率 $value%
K3s監控節點硬碟使用率>90%YDisaster2m10s網路組$instance: $name 目前使用率 $value%
K3s監控服務崩潰YDisaster2m10s網路組$instance: $name 狀態CrashLoopBackOff
K3s核心服務崩潰YDisaster2m10s系統組$instance: $name 狀態CrashLoopBackOff
K3s核心節點FD使用率>90%YDisaster2m10s系統組$instance 節點檔案描述符(File Descriptor)使用接近滿載
K3s監控節點FD使用率>90%YDisaster2m10s網路組$instance 節點檔案描述符(File Descriptor)使用接近滿載
K3s監控節點網卡異常YDisaster2m10s網路組$instance 的 網卡[$name]頻繁斷線
K3s核心節點網卡異常YDisaster2m10s系統組$instance 的 網卡[$name]頻繁斷線
K3s核心服務10分鐘重啟超過2次YDisaster0m10s系統組$instance: $name
K3s監控服務10分鐘重啟超過2次YDisaster0m10s網路組$instance: $name
K3s 核心Container狀態異常YDisaster2m10s系統組$instance: $name pod的容器狀態異常
cluster
告警名稱啟用嚴重度持續時間IntervalOncall摘要PromQL
K3s Deployment 服務版本同步卡住YWarning15m10sSSPRE-S: $name
K3s Deployment 服務健康副本數不足YWarning15m10sSSPRE-S: $name
K3s Deployment 服務滾動更新停滯YWarning15m10sSSPRE-S: $name
K3s StatefulSet 服務版本同步卡住YWarning15m10sSSPRE-S: $name
K3s StatefulSet 服務健康副本數不足YWarning15m10sSSPRE-S: $name
K3s StatefulSet 服務滾動更新停滯YWarning15m10sSSPRE-S: $name
K3s Daemonset 服務部署副本數不足YWarning15m10sSSPRE-S: $name 有 $value 個Pod未成功部署
K3s Daemonset 服務節點排程錯誤YWarning15m10sSSPRE-S: $name 有 $value 個Pod跑在錯誤的節點上
K3s Daemonset 服務滾動更新停滯YWarning15m10sSSPRE-S: $name
K3s cronjob 未成功執行YHigh0m10sSSPRE-S: $name
K3s cronjo b執行失敗YHigh0m10sSSPRE-S: $name
K3s cronjob 已暫停YHigh0m10sSSPRE-S: $name
K3s節點記憶體使用率>80%YHigh2m10s$instance 目前使用率 $value%
K3s節點CPU使用率>80%YHigh2m10s$instance 目前使用率 $value%
K3s節點IOWait使用率>10%NHigh2m10s$instance 目前使用率 $value%
K3s節點硬碟使用率>80%YHigh2m10s$instance: $name 目前使用率 $value%
K3s容器CPU配額不足YHigh5m10s$instance: $name CPU有 $value 時間在等待
K3s節點系統附載偏高NWarning15m10s$instance 每顆 CPU load 超過2
K3s節點FD使用率>80%YHigh2m10s$instance 節點檔案描述符(File Descriptor)使用偏高
evaluation
告警名稱啟用嚴重度持續時間IntervalOncall摘要PromQL
Prometheus 規則評估耗時偏高YHigh10m1mSSPRE-S 項目的 $name 告警規則耗時已接近interval配置
Prometheus 規則評估已逾時YDisaster10m1m網路組SSPRE-S 項目的 $name 告警規則耗時已超過interval配置,告警可能存在延遲的情況
middleware
告警名稱啟用嚴重度持續時間IntervalOncall摘要PromQL
K3s RedisExporter 監控服務失聯NDisaster2m10s網路組$instance $name 監控服務失聯,無法獲取redis狀態
K3s Redis節點DownYDisaster2m10s系統組SSPRE-S $cluster-redis 節點Down
K3s Redis叢集節點數不足NDisaster2m10s系統組SSPRE-S $cluster-redis 叢集節點數異常,目前剩 $value 個
K3s Redis Slave 斷線NDisaster2m10s系統組SSPRE-S $cluster-redis的master沒有Slave
K3s Nacos 失聯YDisaster2m10s系統組SSPRE-S $name 節點 $name 連線中斷,請確認nacos狀態
K3s Nacos 叢集節點數不足NDisaster2m10s系統組SSPRE-S $name 叢集存活節點僅剩 $value 個
K3s KafkaExporter 監控服務失聯YDisaster2m10s網路組SSPRE-S $name 監控服務失聯,無法獲取kafka狀態
K3s Kafka Broker 數量不足NDisaster2m10s系統組SSPRE-S Kafka 叢集 Broker 數量異常,目前僅剩 $value 個
K3s Kafka 資料副本未同步NDisaster5m10s系統組SSPRE-S Kafka 有$value個Partition副本未完成同步
system
告警名稱啟用嚴重度持續時間IntervalOncall摘要PromQL
K3s HPA副本數無法自動調整YHigh15m10sSSPRE-S $name 自動擴縮容超過 15 分鐘無法達到目標副本數
K3s HPA達最大副本數YHigh15m10sSSPRE-S $name HPA 已擴展至 maxReplicas 上限
K3s HPA低於最低副本數YHigh15m10sSSPRE-S $name HPA運行副本數已低於 minReplicas
K3s 元件版本不一致YWarning15m10sSSPRE-S集群偵測到$value種不同版本的核心元件,版本不一致可能導致相容性問題
K3s API Server 請求錯誤率偏高YWarning15m10sSSPRE-S API Server 請求錯誤率達 $value ,可能影響集群運作
K3s API Server 請求被中斷YWarning15m10sSSPRE-S API Server 主動中斷請求比例達 $value ,服務可能存在過載問題
K3s 擴展 API 服務錯誤YWarning15m10sSSPRE-S 擴展API [$name] 出現 $name 錯誤
K3s 擴展 API 服務異常YWarning15m10sSSPRE-S 擴展API [$name] 過去 10 分鐘可用率僅 $value%
K3s 管理元件檢查延遲YWarning15m10s$instance 的Pod狀態檢查耗時 $value 秒
K3s API 服務無回應YDisaster5m10s系統組SSPRE-S Prometheus抓取不到API服務,請確認服務是否正常
K3s 核心服務 PV 異常YDisaster5m10s系統組SSPRE-S $name 狀態異常
K3s 監控服務 PV 異常YDisaster5m10s網路組SSPRE-S $name 狀態異常
K3s 核心服務 PVC 異常YDisaster5m10s系統組SSPRE-S $name 狀態異常
K3s 監控服務 PVC 異常YDisaster5m10s網路組SSPRE-S $name 狀態異常