Skip to main content
Stable 노드 모니터링 및 일상적인 유지보수 작업을 위한 종합 가이드입니다.

모니터링 스택 개요

권장 스택

  • Prometheus: 메트릭 수집
  • Grafana: 시각화 및 대시보드
  • AlertManager: 알림 라우팅 및 관리
  • Node Exporter: 시스템 메트릭
  • Loki: 로그 집계 (선택사항)

빠른 모니터링 설정

1단계: Prometheus 메트릭 활성화

노드 재시작:

2단계: Prometheus 설치

3단계: Grafana 설치

주요 모니터링 메트릭

노드 상태 메트릭

시스템 메트릭

Grafana 대시보드 설정

Stable 대시보드 가져오기

커스텀 대시보드 가져오기

Grafana UI를 통해 대시보드 가져오기:

AlertManager 구성

AlertManager 설치

알림 규칙

로그 모니터링

Systemd 로그

로그 분석 스크립트

Loki 설정 (선택사항)

헬스 체크 엔드포인트

HTTP 엔드포인트

헬스 체크 스크립트

성능 모니터링

리소스 사용량 추적

쿼리 성능

모니터링 모범 사례

  1. 중복 모니터링 설정
    • 외부 모니터링 서비스 사용
    • 노드 간 교차 모니터링 구현
    • Dead man’s switch 알림 설정
  2. 알림 피로도 방지
    • 기준선을 바탕으로 알림 임계값 조정
    • 알림 그룹화 및 억제 사용
    • 에스컬레이션 정책 구현
  3. 데이터 보존
    • 최소 30일간 메트릭 보관
    • 중요 로그 아카이빙
    • 모니터링 설정 정기 백업

다음 단계

마지막 수정일 2026년 4월 2일