#AI

NVIDIA Dynamo 기반 Pinterest의 VLM 서빙 스택 구축기

NVIDIA Dynamo 기반 Pinterest의 VLM 서빙 스택 구축기
01

Summary

이미지 서빙을 85배 빠르게! 핀터레스트가 NVIDIA Dynamo와 B200으로 구축한 차세대 VLM 서빙 아키텍처

대용량 멀티턴 멀티모달 추론의 지연 시간과 비용을 획기적으로 낮춘 Pinterest의 기술 혁신

Pinterest는 이미지 중심의 개인화 AI 에이전트 서비스를 원활하게 지원하기 위해 새로운 VLM 서빙 인프라를 구축했습니다. 비싼 원본 이미지 픽셀 대신 사전 계산된 임베딩을 활용하고, 분산 추론과 고도화된 캐시 기법을 병합해 수백 장의 이미지 컨텍스트를 실시간 수준으로 처리하는 데 성공했습니다.

  • 01NVIDIA Blackwell B200 GPU 도입을 통한 대규모 인프라 TCO 절감 및 Hopper 대비 2배 이상의 지연 시간 개선
  • 02프리필(Prefill)과 디코드(Decode) 단계를 격리하여 리소스 효율성을 극대화한 분리형(Disaggregated) 서빙 구현
  • 03자체 인코더(PinCLIP) 기반 프로젝션 임베딩 기술로 비전 인코더 연산 병목을 완전히 제거하고 TTFT 최대 369배 가속
  • 04GPU, CPU DRAM, 로컬 NVMe 디스크를 아우르는 LMCache 다중 계층 캐싱을 통한 고성능 멀티턴 대화 보장
  • 05실제 프로덕션 환경의 에이전트 복잡성을 그대로 시뮬레이션할 수 있는 AIPerf 벤치마킹 프레임워크 적용

RECOMMENDATION

멀티모달 LLM을 실서비스에 도입할 때 높은 이미지 처리 비용과 KV 캐시 압박으로 고민 중인 AI 플랫폼 엔지니어 및 백엔드 개발자에게 강력히 추천합니다.

The Problem

시각-언어 모델(VLM) 서빙은 이미지 전처리 및 비전 인코더 연산으로 인해 프리필 단계의 부하가 매우 크고, 다량의 이미지와 멀티턴 대화 컨텍스트로 인해 극심한 KV 캐시 메모리 압박과 지연 시간 증가 문제를 겪었습니다.

The Solution

Pinterest는 엔비디아 블랙웰 B200 GPU와 다이나모(Dynamo) 오케스트레이션 프레임워크를 도입하여 프리필과 디코드 서빙 단계를 분리하고, CPU 및 디스크 다중 계층 KV 캐시 오프로딩(LMCache)과 원본 이미지 대신 사전 계산된 PinCLIP 프로젝션 임베딩을 활용하는 고성능 추론 아키텍처를 구축했습니다.

The Result

프로젝션 임베딩을 통해 첫 토큰 생성 시간(TTFT)이 평균 85배(최대 369배), 종단 간 지연 시간이 7.3배(최대 44배) 빨라졌으며, 동일 성능 대비 25배 더 넓은 비주얼 컨텍스트를 수용했습니다. 또한 멀티모달 KV-인지 라우팅 도입으로 TTFT p99가 평균 1.42배 개선되었습니다.

Trade-off

대용량 임베딩 페이로드 전송으로 인해 vLLM 프론트엔드 처리 병목 현상이 일시적으로 발생했으며, 가중치 및 프로젝터 설정을 단일 아티팩트로 통합 관리해야 하는 배포 복잡도가 증가했습니다.

03

Key Concepts

Concept · 01

Disaggregated Prefill/Decode Serving (분리형 프리필/디코드 서빙)

계산 집약적인 프리필(Prefill) 단계와 토큰을 하나씩 생성하는 디코드(Decode) 단계를 별도의 전 전용 하드웨어 및 워커 노드로 분리하여 병목을 해결하는 아키텍처입니다. 연산 특성이 다른 두 프로세스를 독립적으로 스케일링하여 지연 시간과 자원 효율성을 모두 극대화합니다.

  • Pinterest는 프리필과 디코드 인스턴스를 분리함으로써 첫 토큰 생성 시간(TTFT) 지연을 극적으로 낮추는 파레토 최적화를 달성했습니다.
Concept · 02

Projection Embeddings (프로젝션 임베딩)

사용자가 원본 이미지 파일(픽셀)을 실시간으로 서버에 전송하는 대신, 플랫폼 내에 미리 계산되어 저장되어 있던 이미지 벡터 임베딩을 사용하여 모델에 입력하는 방식입니다. 이를 VLM의 타깃 토큰 스페이스로 투영(Projection)함으로써 인라인데서의 고비용 비전 인코더 연산을 우회합니다.

  • Pinterest의 자체 이미지 인코더인 PinCLIP 임베딩을 활용하여 실시간 이미지 로딩, 디코딩, 전처리 비용을 완벽하게 제거했습니다.
  • 이를 통해 최대 250개의 핀(Pin) 이미지를 단 10개의 물리적 이미지 처리와 동일한 Latency로 VLM에 주입할 수 있었습니다.
Concept · 03

KV Cache Offloading & LMCache (KV 캐시 오프로딩 및 LMCache)

대규모 컨텍스트 생성 시 GPU 메모리(VRAM) 부족 문제를 해결하기 위해, 자주 사용되거나 이전에 처리된 키-값(KV) 상태들을 고속 호스트 메모리(CPU DRAM) 및 NVMe 디스크 드라이브로 임시 저장 및 백업해두는 기술입니다.

  • Dynamo 및 vLLM 아키텍처 내에 LMCache를 통합하여 멀티턴 환경에서 비주얼 토큰이 유발하는 VRAM 과부하 문제를 경감했습니다.
  • 비동기식 캐시 프리페칭 및 압축 기법을 병행하여 대화 맥락이 바뀔 때 발생하는 재연산 시간을 최소화했습니다.