백엔드 커리큘럼 심화: 메트릭 카디널리티 예산과 라벨 거버넌스 플레이북
Prometheus와 OpenTelemetry 메트릭이 라벨 폭증으로 비용·메모리·알람 품질을 망치지 않도록, 카디널리티 예산과 리뷰 기준을 숫자 중심으로 정리합니다.
Prometheus와 OpenTelemetry 메트릭이 라벨 폭증으로 비용·메모리·알람 품질을 망치지 않도록, 카디널리티 예산과 리뷰 기준을 숫자 중심으로 정리합니다.
API 요청을 단순 QPS가 아니라 CPU, DB 커넥션, 외부 API, 큐, 캐시 비용을 소비하는 작업 단위로 보고 예산을 설계하는 실무 기준을 정리합니다.
대용량 CSV·엑셀·JSONL export를 동기 다운로드가 아니라 snapshot, job, object artifact, 감사 로그, 만료 정책이 있는 운영 파이프라인으로 설계하는 기준을 정리합니다.
로그와 메트릭만으로 놓치기 쉬운 지연 전파를 분산 트레이싱으로 추적하는 도입 기준과 운영 체크포인트를 정리합니다.
국가·산업별 데이터 주권 요구를 만족하면서도 제품 속도와 운영 복잡도를 통제하기 위한 리전 분리 아키텍처 설계 기준을 실무 관점으로 정리합니다.
클라이언트가 이미 포기한 요청을 백엔드가 계속 처리하는 낭비를 줄이기 위해, 홉별 deadline 배분과 취소 전파를 숫자 기준으로 설계하는 방법을 정리합니다.
캐시 적중률보다 더 어려운 캐시 일관성 문제를 실무 기준으로 정리합니다. stale read 허용 범위, 무효화 지연 임계치, 재처리 규칙까지 숫자로 설명합니다.
멀티테넌트 환경에서 특정 고객 트래픽이 전체 서비스를 흔들지 않도록, WFQ/DRR 기반 공정성 제어와 운영 임계치를 실무 관점으로 정리합니다.
샤딩 키를 어떻게 고르고, 언제 리샤딩을 결정하며, 운영 중단 없이 이전하는지 실무 기준으로 정리합니다.
주문·결제·포인트 시스템에서 발생하는 데이터 불일치를 탐지하고 복구하는 Reconciliation 아키텍처를 실무 기준으로 정리합니다.