#AI

GenPage: 넷플릭스의 엔드 투 엔드 생성형 홈 화면 구축을 향한 여정

GenPage: 넷플릭스의 엔드 투 엔드 생성형 홈 화면 구축을 향한 여정
01

Summary

넷플릭스 홈 화면, 이제 트랜스포머가 한 줄씩 통째로 '생성'한다

기존의 복잡한 랭킹 파이프라인을 걷어내고 GenPage로 달성한 20%의 성능 개선과 추천의 혁신

넷플릭스가 수만 개의 후보를 필터링하던 기존 방식을 버리고, LLM처럼 홈 화면 전체를 토큰 단위로 생성하는 GenPage 아키텍처를 공개했습니다. 이 글은 복잡한 추천 시스템을 단일 트랜스포머 모델로 통합하고, 강화 학습을 통해 사용자 만족도를 극대화한 기술적 여정을 다룹니다.

  • 01기존의 다단계 추천 스택을 단일 생성형 트랜스포머 모델로 통합
  • 02사용자 히스토리와 홈 화면 레이아웃을 모두 토큰화하여 처리하는 커스텀 토크나이저 활용
  • 03WBC와 RL(강화 학습)을 결합한 정교한 사후 학습 파이프라인 구축
  • 04페이지 전체 최적화를 위해 GRPO 변형 알고리즘인 Dr. GRPO 도입
  • 05운영 환경에서 서빙 레이턴시 20% 감소 및 주요 사용자 지표 개선 입증

RECOMMENDATION

추천 시스템의 복잡도를 줄이고 생성형 AI의 확장성을 활용하려는 ML 엔지니어에게 필독을 권합니다. 특히 대규모 트래픽 환경에서 LLM 구조를 추천에 적용하려는 팀에 유용한 인사이트를 제공합니다.

The Problem

넷플릭스 홈 화면은 다수의 행과 엔티티가 얽힌 복잡한 구조로, 기존의 다단계 파이프라인은 유지보수 비용이 높고 각 단계의 최적화 목표가 상충하는 고질적인 문제를 안고 있었습니다.

The Solution

이를 해결하기 위해 홈 화면 전체를 하나의 시퀀스로 생성하는 'GenPage' 트랜스포머 모델을 도입하였으며, 강화 학습(Dr. GRPO)을 통해 페이지 전체의 만족도를 직접 최적화했습니다.

The Result

실제 A/B 테스트 결과 기존 고도화된 시스템 대비 사용자 참여 지표가 유의미하게 상승했으며, 서빙 레이턴시를 20% 감소시키는 성과를 거두었습니다.

Trade-off

실시간 서빙 지연 시간 준수와 엔티티 콜드 스타트 대응이 필수적이며, 데이터 소스 요약 과정에서 수동적인 프롬프트 엔지니어링이 개입되는 한계가 존재합니다.

03

Key Concepts

Concept · 01

GenPage

넷플릭스가 개발한 생성형 추천 모델로, 사용자 맥락을 입력받아 홈 화면의 행과 콘텐츠를 자기회귀 방식으로 생성합니다.

  • 기존의 다단계 파이프라인을 단일 트랜스포머로 대체
  • 사용자 컨텍스트를 프롬프트로 처리하여 전체 레이아웃 구성
Concept · 02

Dr. GRPO

강화 학습 알고리즘인 GRPO의 변형으로, 편향을 완화하면서 페이지 단위의 보상을 최적화하여 만족도를 높이는 데 사용됩니다.

  • 페이지 전체 최적화를 통해 다양성과 만족도 향상
  • WBC 방식의 토큰별 최적화 한계를 극복하는 시퀀스 단위 학습
Concept · 03

Custom Tokenization

텍스트 대신 추천 도메인에 특화된 엔티티 ID, 액션 유형 등을 토큰으로 변환하여 추론 효율성을 극대화하는 기법입니다.

  • GPT-5 토크나이저 대비 시퀀스 길이를 대폭 압축
  • 비즈니스 로직을 제어하기 용이한 토큰-제품 개념 매핑