Skip to main content
用于监控 Stable 节点和执行常规维护任务的综合指南。

监控堆栈概览

推荐堆栈

  • Prometheus:指标收集
  • Grafana:可视化和仪表板
  • AlertManager:告警路由和管理
  • Node Exporter:系统指标
  • Loki:日志聚合(可选)

快速监控设置

步骤 1:启用 Prometheus 指标

重启节点:

步骤 2:安装 Prometheus

步骤 3:安装 Grafana

关键监控指标

节点健康指标

系统指标

Grafana 仪表板设置

导入 Stable 仪表板

AlertManager 配置

安装 AlertManager

告警规则

健康检查脚本

维护任务

日常维护

监控最佳实践

  1. 设置冗余监控
    • 使用外部监控服务
    • 实现跨节点监控
    • 设置死人开关告警
  2. 防止告警疲劳
    • 基于基线调整告警阈值
    • 使用告警分组和抑制
    • 实现升级策略
  3. 数据保留
    • 至少保留 30 天指标
    • 归档重要日志
    • 定期备份监控配置

下一步

最后修改于 2026年4月2日