DevLog

엔지니어링 블로그를 한 곳에서 탐색하고, 최근 발행 흐름을 빠르게 파악할 수 있는 서비스 입니다.

Quick Links

  • Latest Feed
  • Engineering Directory

Support

  • 소개
  • 개인정보처리방침

Contribute

  • 원하는 블로그 추가 (준비 중)
  • Feedback

© 2026 DevLog Inc. All rights reserved.

본 사이트는 공개 RSS 피드를 통해 콘텐츠를 수집하며, 모든 콘텐츠의 저작권은 원저작자에게 있습니다.

Back to Feed
Read Original

Contents

Continue Reading

  • More from Samsung Tech
  • Related reads#LLM
#Backend

구독만 하던 Codex와 Claude, LLM 서버로 바꿔 쓰기

구독만 하던 Codex와 Claude, LLM 서버로 바꿔 쓰기
01

Summary

구독만 하던 Codex와 Claude를 나만의 API 서버로 만드는 방법

Base URL 한 줄로 사내 LLM부터 유료 CLI까지 통합하고, 병렬 코드리뷰까지 구현한 LLM Gateway 구축기

로컬 PC에서 잠자고 있던 Codex와 Claude CLI 구독 자원을 고성능 API 서버로 탈바꿈시킨 엔지니어링 과정을 소개합니다. 서로 다른 프로바이더를 단일 어댑터로 규격화하고 백엔드 제어 기술을 통해 안정적인 시스템으로 고도화했습니다. LLM 자원의 낭비를 줄이고 업무 자동화 효율을 극대화할 수 있는 실무 힌트를 가득 담았습니다.

  • 01CLI 기반 LLM을 어댑터 패턴으로 추상화해 동일한 OpenAI 규격의 API로 노출
  • 02대기열과 한계 성능을 중앙에서 조율하는 Admission Control 메커니즘 구축
  • 03리소스 누수를 방지하기 위해 모든 비동기 체인에 취소 신호(Cancel Signal) 강제 관통
  • 04모델별 컨텍스트 창 및 추론 특성을 동적으로 알려주는 '/v1/model-traits' 설계
  • 05여러 LLM을 동시에 호출하여 서로 다른 관점으로 검증하는 멀티 LLM 병렬 코드리뷰 실현

+RECOMMENDATION

사내 AI 인프라가 분산되어 있어 통합이 필요하거나, 사내 LLM 자원의 비용 대 효율을 높이고 싶은 플랫폼/백엔드 엔지니어에게 이 아키텍처를 강력히 추천합니다.

The Problem

사내에서 사용 가능한 다양한 LLM 자원(사내 LLM, Codex CLI, Claude CLI 등)이 웹이나 CLI 등 서로 다른 인터페이스에 갇혀 있어 시스템 통합 및 자동화가 어려웠습니다. 개별 연동을 할 때마다 인증, 스트리밍, 에러 핸들링을 반복 구현해야 했고, 유료 자원의 활용 효율도 낮았습니다.

The Solution

CLI 기반의 Codex와 Claude를 어댑터 패턴으로 래핑하여 하나의 OpenAI 호환 API 규격으로 단일화하는 로컬 중계 서버 'LLM Gateway'를 구축했습니다. 중앙 조율자를 통한 동시성 제한(Admission Control), 모든 비동기 단계에 중단 신호를 관통시키는 구조, 그리고 모델별 특성을 반환하는 '/v1/model-traits' 엔드포인트를 도입했습니다.

The Result

개발자들은 base URL 변경만으로 16종의 LLM을 즉각 활용할 수 있게 되었으며, 새로운 LLM 연동 시간을 3분 내외로 단축했습니다. 또한, 유휴 LLM 자원을 병렬로 엮어 교차 검증을 수행하는 멀티 LLM 코드리뷰 시스템을 구축하여 검출력을 높였습니다.

Trade-off

CLI를 서버로 매핑함에 따라 프로세스 기동 비용을 제어하기 위한 세션 풀링 및 스레드 관리가 추가로 요구되는 오버헤드가 발생했습니다. 또한, 추론형 모델의 생각(Thinking) 단계에서 토큰 예산이 조기 소진되는 문제를 해결하기 위해 런타임 학습 및 강제 재시도 로직을 게이트웨이에 수동으로 더해야 했습니다.

03

Key Concepts

Concept · 01

어댑터 패턴 (Adapter Pattern)

인터페이스가 서로 호환되지 않는 클래스들을 중간에서 변환하여 일관된 방식으로 동작하도록 만드는 구조적 디자인 패턴입니다.

  • HTTP 통신을 사용하는 사내 LLM과 CLI 방식인 Codex, Claude를 모두 동일한 규격의 어댑터 인터페이스로 통일했습니다.
Concept · 02

입장 제어 (Admission Control)

시스템 부하를 관리하기 위해 진입하는 요청의 개수를 한계 용량에 맞춰 제한하고 대기시키는 관리 기법입니다.

  • 프로바이더별로 동시 처리 가능한 슬롯 수를 정의하고, 초과되는 요청을 대기열에 머물게 하는 톨게이트 역할을 부여했습니다.
Concept · 03

취소 신호 관통 (Signal Propagation)

비동기 체인에서 클라이언트가 연결을 중단했을 때, 이에 대응하여 하위 연동 작업들도 즉각 취소되도록 신호를 전달하는 흐름입니다.

  • 클라이언트 중단 시 어댑터의 슬롯이 영구 점유되는 현상을 막고자, 모든 await 단계에 취소 신호를 주입해 즉시 슬롯을 반환하게 했습니다.
Continue reading · same source

Samsung TechMore from Samsung Tech

View all posts from Samsung Tech
  • 몇 달 전에 풀었던 문제를 오늘 또 풀고 있었습니다 — AI와의 대화를 팀의 지식으로 자동 축적한 이야기

    Claude CodeLLM HooksContext Engineering
    2일 전
  • AI에게 분석을 맡기기 전에, '분석할 수 없음' 부터 가르치세요 — Wear OS 이슈 초도 분석을 자동화한 WOA Agent 개발기

    LLM AgentRAGAutomation
    1주 전
  • 한 명의 개발자가 여러 전문가와 일하는 방법: 역할형 AI 에이전트로 AWS 인프라 포털 만들기

    AI AgentAWSAgentic Coding
    1주 전
  • LLM에게 수백 MB 로그를 통째로 주지 마세요 — 근거를 "검증"할 수 있는 AI 이슈 분석 에이전트 개발기

    LLMAI AgentClean Architecture
    2주 전
  • LLM에게 계산을 시키지 마세요 — 숫자를 '신뢰'할 수 있는 AI 데이터 애널리스트 개발기

    LLMData AnalyticsMulti-Agent System
    1개월 전

Related reads#LLM

Explore #LLM
올리브영·sLLM

측정할 수 없으면 개선할 수 없다 - AI Pick 추천 카드를 위한 sLLM 정렬 학습기

#LLM1일 전
라인

LLM에게 어디까지 맡길 것인가: AI 에이전트 기반 광고 분석 리포트 자동화

#LLM2일 전
Samsung Tech·Claude Code

몇 달 전에 풀었던 문제를 오늘 또 풀고 있었습니다 — AI와의 대화를 팀의 지식으로 자동 축적한 이야기

#LLM2일 전
토스·LLM Benchmark

리더보드 1등 LLM, 토스에서도 1등일까? - Toss Benchmark 구축기

#LLM3일 전
Airbnb·AI Agents

모델을 넘어: 과학적 판단을 반영한 AI 인프라 엔지니어링

#LLM4일 전

Source

Samsung Tech
Samsung Tech
Engineering Blog

Published · September 14, 2026

Topics

LLMAPI GatewayOpenAIReverse ProxyConcurrency Control