
영어와 한국어, 추론 설정에 따라 뒤바뀌는 모델들의 성능 순위와 토스만의 도메인 평가 노하우
공개 리더보드 점수만 믿고 LLM을 서비스에 도입했다가 예측과 다른 성능에 당황해 본 적이 있다면 주목할 만한 아티클입니다. 토스는 한국어 언어 전환 시 발생하는 성능 순위 역전과 Reasoning 모드 활성화 여부에 따른 점수 하락률을 정밀 검증하여, 실제 비즈니스 도메인에 최적화된 모델을 선별하는 자체 벤치마크 설계 전략을 가감 없이 공개합니다.
글로벌 LLM 모델을 한국어 서비스에 무작정 탑재하기 전, 실제 배포 시 구동될 한국어 환경과 추론(Reasoning) 제한 조건 및 도메인 데이터셋을 반영한 독자적인 프로토타입 평가 체계를 먼저 마련할 것을 강력히 권장합니다.
공개 리더보드에서 우수한 성능을 기록한 LLM이라도 실제 한국어 요청 처리 능력, 서비스 비용 조절을 위한 추론 설정 변화, 그리고 금융 및 커머스 등 토스 고유의 비즈니스 도메인 업무 수행 능력을 충분히 보장하지 못하는 문제가 있었습니다.
토스의 다양한 서비스 환경에 맞춰 한국어 범용 성능과 토스 도메인 특화 업무 처리 능력을 다각도로 검증할 수 있는 자체 평가 체계인 'Toss Benchmark'를 구축했습니다.
프롬프트 언어(영어 대비 한국어) 및 추론 설정(Reasoning vs Non-reasoning)에 따라 모델들의 성능 하락폭과 우위가 뒤바뀌는 순위 역전 현상을 정량적으로 포착하여 실제 프로덕션 서빙에 적합한 모델을 명확한 기준으로 선별할 수 있게 되었습니다.
Trade-off
자체 벤치마크 데이터셋 구축 및 품질 관리에 지속적인 리소스가 요구되며, 비즈니스 영역 확장에 따라 평가 도메인셋의 다양성을 지속적으로 확보하고 업데이트해야 하는 장기적 관리 비용이 존재합니다.
토스 서비스 내 LLM 도입을 위해 한국어 범용 성능과 비즈니스 특화 도메인 능력을 동시 측정하도록 설계된 토스 자체의 평가 시스템입니다.
모델이 최종 답변을 도출하기 전에 논리적인 중간 사고 과정을 명시적으로 생성하여 문제 해결 성공률을 높이는 추론 작동 설정입니다.
일반적인 언어 능력을 넘어 특정 도메인 고유의 세부 규칙, 카테고리 지식, 사내 비즈니스 정책을 정확하게 준수하며 문제를 해결하는지 평가하는 기법입니다.




