
1.25억 시계열의 파도를 견디는 대규모 TSDB 아키텍처와 시니어 엔지니어의 무중단 장비 교체 전략
네이버 검색의 폭발적인 인프라 성장을 뒷받침하는 대규모 시계열 데이터베이스(TSDB) 운영 경험을 공유합니다. 180대 규모의 VictoriaMetrics 클러스터를 운영하며 직면한 메모리 한계를 해결하기 위해, 분산 알고리즘의 내부 동작을 역이용한 지혜로운 무중단 마이그레이션 기법과 효율적인 Hot/Warm 계층화 구조를 다룹니다.
대규모 분산 저장소의 인프라 확장이나 무중단 마이그레이션을 준비하는 백엔드 및 SRE 엔지니어에게 강력히 추천합니다. 특히 VictoriaMetrics의 내부 샤딩 원리를 실무에 어떻게 적용할 수 있는지에 대한 깊이 있는 통찰을 제공합니다.
네이버 검색 인프라의 쿠버네티스 전환으로 컨테이너 수가 수백만 개로 폭증하며 메트릭 카디널리티가 급증했고, 이로 인해 기존 128GB 메모리 사양의 저장소 노드들이 OOM 위험과 쿼리 지연 문제에 직면했습니다.
180대 규모의 vmstorage 장비를 512GB로 업그레이드하기 위해 Hot Tier에는 랑데부 해싱과 복제 메커니즘을 고려한 '역순 장비 추가' 전략을, Warm Tier에는 vmbackup/vmrestore를 이용한 파일 시스템 수준의 증분 복제 및 세트 단위 점진 전환 방식을 적용했습니다.
서비스 중단과 메트릭 누락 없이 장비 교체를 완수했으며, 12.5억 개의 활성 시계열과 555조 개의 데이터포인트를 관리하는 환경에서 초당 500건 이상의 쿼리를 p99 300ms 이내의 속도로 안정적으로 처리하고 있습니다.
Trade-off
Hot/Warm 2계층 분리 구조를 통해 비용 효율성을 높였으나 이중 쓰기 및 조회 분기 로직의 관리 복잡성이 증가했으며, 무중단 전환 과정에서 일정 기간 기존 장비와 신규 장비를 동시에 운영하는 리소스 비용이 발생했습니다.
Prometheus와 호환되는 고성능 오픈소스 시계열 데이터베이스로, 높은 압축 효율과 독립적인 수평 확장이 가능한 컴포넌트 구조를 가집니다.
노드가 추가되거나 제거될 때 데이터 재배치를 최소화하는 분산 알고리즘으로, 각 키에 대해 모든 노드의 가중치를 계산하여 대상 노드를 결정합니다.
데이터의 신선도와 접근 빈도에 따라 저장 매체와 보관 주기를 분리하여 운영하는 계층형 저장 구조입니다.




