#Backend

네이버 검색의 대규모 메트릭 저장소, VictoriaMetrics 운영기

네이버 검색의 대규모 메트릭 저장소, VictoriaMetrics 운영기
01

Summary

555조 개의 데이터포인트를 무중단으로 옮기는 법: 네이버 검색의 VictoriaMetrics 운영기

1.25억 시계열의 파도를 견디는 대규모 TSDB 아키텍처와 시니어 엔지니어의 무중단 장비 교체 전략

네이버 검색의 폭발적인 인프라 성장을 뒷받침하는 대규모 시계열 데이터베이스(TSDB) 운영 경험을 공유합니다. 180대 규모의 VictoriaMetrics 클러스터를 운영하며 직면한 메모리 한계를 해결하기 위해, 분산 알고리즘의 내부 동작을 역이용한 지혜로운 무중단 마이그레이션 기법과 효율적인 Hot/Warm 계층화 구조를 다룹니다.

  • 0112.5억 활성 시계열과 555조 데이터포인트를 관리하는 국내 최대 규모의 VictoriaMetrics 운영 사례
  • 02데이터포인트당 0.92바이트라는 경이로운 압축 효율을 실운영 환경에서 입증
  • 03랑데부 해싱(Rendezvous Hashing)의 특성을 활용해 기존 노드 부하를 최소화한 '역순 장비 추가' 전략
  • 04SSD(Hot)와 HDD(Warm)를 조합한 2계층 아키텍처로 쿼리 성능과 스토리지 비용의 최적 균형 달성
  • 05API 호출 한계를 극복하기 위해 vmbackup/vmrestore 증분 복제를 활용한 테라바이트급 데이터 무중단 이관

RECOMMENDATION

대규모 분산 저장소의 인프라 확장이나 무중단 마이그레이션을 준비하는 백엔드 및 SRE 엔지니어에게 강력히 추천합니다. 특히 VictoriaMetrics의 내부 샤딩 원리를 실무에 어떻게 적용할 수 있는지에 대한 깊이 있는 통찰을 제공합니다.

The Problem

네이버 검색 인프라의 쿠버네티스 전환으로 컨테이너 수가 수백만 개로 폭증하며 메트릭 카디널리티가 급증했고, 이로 인해 기존 128GB 메모리 사양의 저장소 노드들이 OOM 위험과 쿼리 지연 문제에 직면했습니다.

The Solution

180대 규모의 vmstorage 장비를 512GB로 업그레이드하기 위해 Hot Tier에는 랑데부 해싱과 복제 메커니즘을 고려한 '역순 장비 추가' 전략을, Warm Tier에는 vmbackup/vmrestore를 이용한 파일 시스템 수준의 증분 복제 및 세트 단위 점진 전환 방식을 적용했습니다.

The Result

서비스 중단과 메트릭 누락 없이 장비 교체를 완수했으며, 12.5억 개의 활성 시계열과 555조 개의 데이터포인트를 관리하는 환경에서 초당 500건 이상의 쿼리를 p99 300ms 이내의 속도로 안정적으로 처리하고 있습니다.

Trade-off

Hot/Warm 2계층 분리 구조를 통해 비용 효율성을 높였으나 이중 쓰기 및 조회 분기 로직의 관리 복잡성이 증가했으며, 무중단 전환 과정에서 일정 기간 기존 장비와 신규 장비를 동시에 운영하는 리소스 비용이 발생했습니다.

03

Key Concepts

Concept · 01

VictoriaMetrics

Prometheus와 호환되는 고성능 오픈소스 시계열 데이터베이스로, 높은 압축 효율과 독립적인 수평 확장이 가능한 컴포넌트 구조를 가집니다.

  • 네이버 검색의 수만 대 물리 서버와 수백만 개 컨테이너 메트릭을 초당 2,000만 포인트 속도로 수집
  • vminsert, vmstorage, vmselect 구조로 설계되어 각 영역별 독립적인 리소스 확장이 용이함
Concept · 02

랑데부 해싱 (Rendezvous Hashing)

노드가 추가되거나 제거될 때 데이터 재배치를 최소화하는 분산 알고리즘으로, 각 키에 대해 모든 노드의 가중치를 계산하여 대상 노드를 결정합니다.

  • vminsert가 시계열 데이터를 특정 vmstorage 노드에 샤딩하여 할당하는 원리로 사용됨
  • 노드 추가 시 전체 키를 재배치하지 않고 일부만 새 노드로 이동시켜 Churn Rate 부하를 분산함
Concept · 03

Hot/Warm 2-Tier Architecture

데이터의 신선도와 접근 빈도에 따라 저장 매체와 보관 주기를 분리하여 운영하는 계층형 저장 구조입니다.

  • 최근 12개월 데이터는 SSD 기반 Hot 클러스터에 저장하여 전체 조회의 99.9%를 고성능으로 처리
  • 장기 보관용 36개월 데이터는 HDD 기반 Warm 클러스터에 저장하여 스토리지 비용을 획기적으로 절감