DevLog

엔지니어링 블로그를 한 곳에서 탐색하고, 최근 발행 흐름을 빠르게 파악할 수 있는 서비스 입니다.

Quick Links

  • Latest Feed
  • Engineering Directory

Support

  • 소개
  • 개인정보처리방침

Contribute

  • 원하는 블로그 추가 (준비 중)
  • Feedback

© 2026 DevLog Inc. All rights reserved.

본 사이트는 공개 RSS 피드를 통해 콘텐츠를 수집하며, 모든 콘텐츠의 저작권은 원저작자에게 있습니다.

Back to Feed
Read Original

Contents

Continue Reading

  • More from 토스
#AI

리더보드 1등 LLM, 토스에서도 1등일까? - Toss Benchmark 구축기

리더보드 1등 LLM, 토스에서도 1등일까? - Toss Benchmark 구축기
01

Summary

리더보드 1위 LLM의 반전? 토스가 직접 밝힌 실전 LLM 검증법!

영어와 한국어, 추론 설정에 따라 뒤바뀌는 모델들의 성능 순위와 토스만의 도메인 평가 노하우

공개 리더보드 점수만 믿고 LLM을 서비스에 도입했다가 예측과 다른 성능에 당황해 본 적이 있다면 주목할 만한 아티클입니다. 토스는 한국어 언어 전환 시 발생하는 성능 순위 역전과 Reasoning 모드 활성화 여부에 따른 점수 하락률을 정밀 검증하여, 실제 비즈니스 도메인에 최적화된 모델을 선별하는 자체 벤치마크 설계 전략을 가감 없이 공개합니다.

  • 01동일한 코딩/수학 문제여도 영어 원문 대비 한국어 번역본 제시 시 모델 간의 우위가 변동되는 순위 역전 현상 검증
  • 02한국어권 고유의 문화적 맥락과 지식 범위를 정확히 반영하기 위해 이원화된 벤치마크 설계
  • 03Reasoning 모드를 껐을 때 GLM-5.1 등 특정 모델에서 최대 30.6점의 큰 폭의 코딩 성능 하락 현상 발견
  • 04단순 텍스트 처리를 넘어 '3슬리브'를 '30EA'로 정교하게 매핑해야 하는 커머스 등의 실무 비즈니스 요구사항 평가 적용

+RECOMMENDATION

글로벌 LLM 모델을 한국어 서비스에 무작정 탑재하기 전, 실제 배포 시 구동될 한국어 환경과 추론(Reasoning) 제한 조건 및 도메인 데이터셋을 반영한 독자적인 프로토타입 평가 체계를 먼저 마련할 것을 강력히 권장합니다.

The Problem

공개 리더보드에서 우수한 성능을 기록한 LLM이라도 실제 한국어 요청 처리 능력, 서비스 비용 조절을 위한 추론 설정 변화, 그리고 금융 및 커머스 등 토스 고유의 비즈니스 도메인 업무 수행 능력을 충분히 보장하지 못하는 문제가 있었습니다.

The Solution

토스의 다양한 서비스 환경에 맞춰 한국어 범용 성능과 토스 도메인 특화 업무 처리 능력을 다각도로 검증할 수 있는 자체 평가 체계인 'Toss Benchmark'를 구축했습니다.

The Result

프롬프트 언어(영어 대비 한국어) 및 추론 설정(Reasoning vs Non-reasoning)에 따라 모델들의 성능 하락폭과 우위가 뒤바뀌는 순위 역전 현상을 정량적으로 포착하여 실제 프로덕션 서빙에 적합한 모델을 명확한 기준으로 선별할 수 있게 되었습니다.

Trade-off

자체 벤치마크 데이터셋 구축 및 품질 관리에 지속적인 리소스가 요구되며, 비즈니스 영역 확장에 따라 평가 도메인셋의 다양성을 지속적으로 확보하고 업데이트해야 하는 장기적 관리 비용이 존재합니다.

03

Key Concepts

Concept · 01

Toss Benchmark

토스 서비스 내 LLM 도입을 위해 한국어 범용 성능과 비즈니스 특화 도메인 능력을 동시 측정하도록 설계된 토스 자체의 평가 시스템입니다.

  • 수학과 코딩 영역에서 영어 원문과 한국어 번역본 간의 점수를 교차 분석하여 한국어 대응도 검증
  • 토스의 실무 비즈니스 프롬프트를 정제 및 반영하여 실제 서비스 적합도 측정
Concept · 02

Reasoning Mode

모델이 최종 답변을 도출하기 전에 논리적인 중간 사고 과정을 명시적으로 생성하여 문제 해결 성공률을 높이는 추론 작동 설정입니다.

  • 추론 모드 비활성화 시 일부 모델에서 발생한 20~30점대의 급격한 코딩 성능 변동폭 분석
  • 서비스 운영 지연 시간과 비용을 종합 검토하여 적절한 프로덕션 모델을 선별하는 중요 기준으로 활용
Concept · 03

Domain-Specific Evaluation

일반적인 언어 능력을 넘어 특정 도메인 고유의 세부 규칙, 카테고리 지식, 사내 비즈니스 정책을 정확하게 준수하며 문제를 해결하는지 평가하는 기법입니다.

  • '3슬리브'와 같은 모호한 캡슐 커피 단위를 '30EA' 규격으로 정교하게 매핑하는 속성 추출 가독성 검증
  • 가맹점 심사 지원, 광고 문구/이미지 검수, 카드 약관 혜택 분석 등 고난도 토스 업무와의 일치율 검사
Continue reading · same source

토스More from 토스

View all posts from 토스
  • 사용자를 위해 일부러 어렵게 만드는 경험, 어디까지 괜찮을까?

    UX DesignFriction UXBehavioral Design
    2일 전
  • 토스증권이 GPU-aware를 넘어 GPU-native 클러스터를 구축한 방법

    KubernetesGPUNVIDIA
    5일 전
  • App Router의 장점은 우리에게도 장점일까요?

    Next.jsApp RouterReact Server Components
    1주 전
  • AI가 팀 규칙을 지키도록 하는 방법

    LLMCoding AgentContext Window
    1주 전
  • 2. Beyond Our Expertise

    Technical WritingSingle Source of TruthGenerative AI
    1주 전

Source

토스
토스
Engineering Blog

Published · September 16, 2026

Topics

LLM BenchmarkModel EvaluationNLPReasoning ModeDomain Adaptation