Skip to content

etcd 플러그인

etcd 플러그인은 etcd 클러스터를 하나의 Konduo 리소스로 등록하고 멤버, 엔드포인트, 알람, 제안 처리, MVCC DB 크기, 피어/네트워크 신호를 운영 화면에 제공합니다.

특징

  • HTTP 게이트웨이와 etcd v3 gRPC 클라이언트 경로를 모두 사용해 멤버, 상태, 알람 근거를 수집합니다.
  • 클러스터 멤버 발견, 리더, 학습자, 엔드포인트 상태, HashKV, NOSPACE 알람 정보를 진단에 연결합니다.
  • Prometheus 매핑팩과 Konduo 관리형 메트릭 수집을 지원합니다.
  • 압축, 조각 모음, 알람 해제, 스냅샷, 리더 이전 같은 복구 보조 작업은 확인과 대기 시간으로 보호됩니다.

등록 전 확인

  • etcd 클라이언트 엔드포인트 목록, TLS/mTLS, 기본 인증, 제한 시간 설정을 준비합니다.
  • /metrics가 별도 리스너에 노출된다면 metric_collection_endpoints를 설정합니다.
  • 관리형 수집의 쓰기 대상으로 Prometheus를 사용할 경우 Prometheus를 --web.enable-remote-write-receiver 옵션으로 실행해야 합니다.
  • gRPC-only 환경에서는 상태 기반 일부 항목만 수집될 수 있으므로 p99 지연과 히스토그램 기반 패널 수집 범위를 확인합니다.

운영 팁

  • 클라이언트 URL과 피어 URL은 의미가 다르므로 멤버 근거를 볼 때 구분합니다.
  • 게이트웨이 발견이 실패하면 대체 근거는 부분 상태로 해석합니다.
  • defrag와 compact는 멤버별 영향이 있으므로 revision, 대상 엔드포인트, 확인 문구를 확인한 뒤 실행합니다.

운영 화면

  • 멤버 화면은 멤버 ID, 이름, 클라이언트/피어 URL, 리더/학습자 상태, 엔드포인트 상태를 함께 보여줍니다.
  • alarm 화면은 NOSPACE 같은 cluster alarm을 확인하고 disarm이 필요한지 판단하는 근거를 제공합니다.
  • 진단은 HashKV, 제안 처리, DB 크기, 쿼터, 피어/클라이언트 지연 근거를 묶어 클러스터 일관성과 용량 위험을 확인합니다.
  • 스냅샷, 압축, 조각 모음, 리더 이전 작업은 복구 보조 작업으로 제공되며 자동 운영 대신 확인 기반으로 실행됩니다.

진단과 알림 관점

  • etcd 가용성은 엔드포인트 상태, 멤버 quorum, 리더 상태, 알람 상태를 함께 봐야 합니다.
  • 알림 규칙은 리더 손실, 제안 처리 실패, DB 쿼터 압박, 피어/클라이언트 지연, NOSPACE 알람 같은 etcd 도메인 위험을 다룹니다.
  • 관리형 수집과 Prometheus 매핑팩 모두 멤버별 라벨이 중요하므로 엔드포인트/멤버 라벨 불일치를 부분 근거로 다룹니다.
  • HashKV 차이는 즉시 데이터 손상으로 단정하지 않고 revision, 엔드포인트, 멤버 상태와 함께 확인합니다.

관리 경계

  • compact와 defrag는 성능과 저장소 상태에 영향을 줄 수 있으므로 멤버별 대상과 revision을 명확히 해야 합니다.
  • alarm disarm은 원인 제거 후 수행해야 하며, NOSPACE 상태에서 단순 disarm만 반복하지 않습니다.
  • 스냅샷은 복구 증거 확보용이며 백업 정책 전체를 대체하지 않습니다.
  • 멤버 추가/삭제나 클러스터 재구성 자동화는 CE 플러그인의 기본 관리 범위가 아닙니다.

대표 시나리오

  • 리더 전환이나 장애가 의심되면 리더, 학습자, 엔드포인트 상태, 쿼럼 가능성을 먼저 확인합니다.
  • DB 크기가 할당량에 접근하면 압축 리비전, 조각 모음 후보 멤버, NOSPACE 알람 여부를 함께 봅니다.
  • 지연 경고가 발생하면 클라이언트 요청 지연과 피어 왕복 시간, 제안 대기/실패를 같이 확인합니다.
  • 멤버별 HashKV가 다르면 revision과 엔드포인트 상태를 맞춘 뒤 재확인하고, 필요한 경우 upstream etcd 운영 절차로 확장합니다.

etcd Enterprise 확장

etcd Enterprise 확장은 Community etcd 플러그인 위에 MCP 설명자, 이상 징후 규칙, 플러그인 실행형 탐지기를 추가합니다. 쿼럼, 리더, 제안 처리, WAL/fsync 신호를 분석하여 클러스터 위험을 더 빠르게 드러내는 것이 목적입니다.

특징

  • MCP 카탈로그에서 etcd 리소스, 모니터링 개요, 진단, 메트릭 매핑, 이상 징후 규칙을 조회합니다.
  • 플러그인 실행형 이상 징후 탐지기는 etcd API 근거와 메트릭 근거를 함께 해석합니다.
  • 선언형 메트릭 규칙은 Prometheus 메트릭 소스를 통해 논리 메트릭 키를 해석합니다.
  • 시뮬레이터 고정 데이터는 리더 불안정, 쿼럼 위험, 디스크 지연, 제안 처리 적체 같은 시나리오를 검증합니다.

등록 전 확인

  • Community etcd 연결과 TLS 설정이 정상이어야 합니다.
  • 이상 징후 분석에는 Prometheus 메트릭 소스와 매핑팩 연결이 필요합니다.
  • MCP 사용자는 읽기 범위와 리소스 접근 권한을 가져야 합니다.

운영 팁

  • 리더 변경 빈도, 제안 처리 적체, fsync 지연을 한 신호만 보지 말고 쿼럼 상태와 함께 해석합니다.
  • 플러그인 탐지기 결과와 선언형 메트릭 규칙 결과가 다를 경우 메트릭 소스 수집 범위와 etcd API 접근 권한을 먼저 확인합니다.

운영 시나리오

  • 제어 평면 장애가 의심될 때 리더 안정성, 쿼럼 멤버 상태, 제안 적용 적체를 함께 보아 쓰기 경로 위험을 판단합니다.
  • 디스크 지연이 커질 때 WAL fsync와 백엔드 커밋 지연을 분리해 저장소 병목인지 클러스터 합의 병목인지 구분합니다.
  • MCP 카탈로그는 장애 분석 에이전트가 etcd 상태, 메트릭 수집 범위, 이상 징후 규칙을 빠르게 훑는 읽기 전용 진입점으로 사용합니다.

경계

  • 쿼럼 해석과 이상 징후 규칙 메타데이터는 EE 확장 계층에 두고, 공통 etcd 연결과 기본 상태 동작은 CE 플러그인에 둡니다.
  • 플러그인 모드 탐지기는 etcd API 근거가 필요한 규칙만 실행하며, 메트릭 임계값 규칙은 Core 선언형 평가기가 담당합니다.