DevLog

엔지니어링 블로그를 한 곳에서 탐색하고, 최근 발행 흐름을 빠르게 파악할 수 있는 서비스 입니다.

Quick Links

  • Latest Feed
  • Engineering Directory

Support

  • 소개
  • 개인정보처리방침

Contribute

  • 원하는 블로그 추가 (준비 중)
  • Feedback

© 2026 DevLog Inc. All rights reserved.

본 사이트는 공개 RSS 피드를 통해 콘텐츠를 수집하며, 모든 콘텐츠의 저작권은 원저작자에게 있습니다.

Back to Feed
Read Original

Contents

Continue Reading

  • More from 라인
  • Related reads#LLM
#AI

LLM에게 어디까지 맡길 것인가: AI 에이전트 기반 광고 분석 리포트 자동화

LLM에게 어디까지 맡길 것인가: AI 에이전트 기반 광고 분석 리포트 자동화
01

Summary

치명적인 계산 실수 방지! 라인이 밝히는 '계산과 해석 분리'로 구현한 광고 분석 에이전트 자동화 시스템

할루시네이션 없이 정확한 비즈니스 팩트 위에 LLM의 맥락 요약 능력을 결합하는 실무 아키텍처

본 아티클은 라인(LINE) 광고 데이터 분석 플랫폼 팀이 단순 프롬프트 방식을 포기하고 정교한 에이전트 아키텍처로 신뢰성 높은 리포트 자동화를 구현한 실전 엔지니어링 사례를 다룹니다. 결정론적 코드로 데이터를 검증하고, 비결정론적 LLM을 문장 해석 도구로 똑똑하게 제한해 비즈니스 데이터 처리의 신뢰성을 극대화한 방법론을 소개합니다. 더 나아가 ReAct 기반 동적 데이터 툴 호출부터 가드레일, 품질 평가 모니터링까지 에이전트 서비스 운영의 실용적 해법을 총망라합니다.

  • 01계산과 해석의 엄격한 역할 분리: 수치 기여도 분석과 후보 선정은 코드가 처리하여 LLM의 수학적 오류 원천 차단
  • 02ReAct 기반 동적 원인 탐색: 데이터 변화에 맞춰 5가지 커스텀 분석 툴(Tool Calling)을 에이전트가 스스로 선택하며 정밀 쿼리 실행
  • 03근거 등급화(Evidence Grading) 규칙: 에이전트가 찾아낸 원인 후보군을 기여도 정합성에 따라 등급화하여 신뢰성 있는 팩트만 선별
  • 04목적별 섹션 컨텍스트 제어: 리포트 섹션별로 필요한 컨텍스트만 분리 투입해 프롬프트 복잡도를 줄이고 출력물 품질 비약적 향상
  • 05Langfuse 기반 평가 시스템 구축: 데이터 집계부터 툴 호출, LLM 생성, 수동 검토 대기열까지의 전체 과정을 트레이싱하며 정성적/정량적 품질을 모니터링

+RECOMMENDATION

비즈니스 리포트 자동화, LLM 기반 데이터 분석 에이전트, 혹은 신뢰성이 최우선인 금융·광고 도메인의 GenAI 애플리케이션을 고민하는 모든 개발팀에 강력하게 권장합니다. 단순한 RAG를 넘어 엔터프라이즈 레벨의 결정론적 검증 프로세스와 LLM의 언어적 생성 기능을 어떻게 융합하는지 보여주는 실용 교과서입니다.

The Problem

매일 변동하는 광고 매출 지표의 원인을 규명하기 위해 담당자가 여러 시스템에 접속해 데이터를 직접 조회하고 수작업으로 리포트를 정리해야 하는 비효율이 발생했습니다. 또한 초기 시도에서 단일 프롬프트를 활용해 전체 리포트를 한 번에 생성하고자 하였으나 LLM의 직접 계산 오류, 중요 항목 누락, 그리고 불안정한 포맷팅 문제가 심각하게 발생했습니다.

The Solution

계산, 집계, 후보 선정 등 정확성이 보장되어야 하는 데이터 영역은 코드가 처리하도록 하고 LLM은 이 확정된 사실을 바탕으로 해석과 문장 생성에만 집중하도록 책임을 명확히 분리하였습니다. 아울러 고정된 DAG 분석 경로 대신 ReAct 에이전트 구조와 Tool Calling을 적용해 유연하게 데이터를 탐색하도록 하고, 탐색된 데이터의 정합성을 검증하기 위한 근거 등급화(Evidence Grading) 및 섹션별 컨텍스트 분리 기법을 도입했습니다.

The Result

매일 정밀하게 검증된 광고 성과 분석 리포트가 자동으로 생성되어 Slack과 이메일로 전송됨으로써 비즈니스 담당자가 데이터 취합 노력을 줄이고 의사결정에만 몰두할 수 있는 구조를 마련했습니다. 이에 더해 Langfuse 추적 및 평가 루브릭을 결합한 품질 채점 루프를 구현함으로써 프롬프트와 에이전트 정책 수정을 안전하게 비교 및 테스트하는 평가 체계를 확립했습니다.

Trade-off

에이전트의 탐색 과정에서 발생할 수 있는 무한 루프와 오진을 방지하기 위해 분석 차원 간의 이동 관계를 탐색 그래프 내로 엄격하게 제약해야 했습니다. 또한, 도메인 특성상 비즈니스 판단이 가미되어야 하므로 100% 자율적인 리포트 배포 대신 사람이 직접 검토 대기열에서 가치를 최종 필터링하는 파이프라인을 두어야 하며, 고성능 추론 모델의 다단계 호출 비용과 처리 레이턴시 부담이 다소 존재합니다.

03

Key Concepts

Concept · 01

ReAct (Reasoning and Acting)

LLM이 주어진 문제에 대해 생각(Reasoning)하고, 필요한 작업(Acting)을 취하며 단계별로 정답에 접근해나가는 자율 탐색 프레임워크입니다.

  • 고정된 분석 시나리오 대신, 에이전트가 당일의 데이터 결과와 중간 상태에 맞추어 다음으로 분석해야 할 차원과 테이블을 동적으로 결정하도록 설계했습니다.
  • 추가적인 원인 탐색이 필요한 시점에 한해 Trino 쿼리와 같은 외부 툴을 선택적으로 구동하는 에이전트의 행동 지침 역할을 수행합니다.
Concept · 02

Tool Calling (도구 호출)

사용자의 시스템 환경에 사전에 등록된 함수 명세서와 파라미터 구조를 LLM에게 전달하고, LLM이 필요에 따라 올바른 인자값을 담아 이를 선택 및 호출할 수 있게 지원하는 메커니즘입니다.

  • drill_down, compare_pattern, entity_context 등 데이터 분석에 특화된 5개 Python 함수를 설계해 에이전트에 통합했습니다.
  • 중복 연산 및 탐색 누수를 차단하기 위해 동일 인자 방지 장치 및 변동 요인별 최대 탐색 호출 횟수 제한(MAX_QUERIES)을 설정해 제어했습니다.
Concept · 03

Evidence Grading (근거 등급화)

에이전트가 수집한 다양한 상·하위 요인의 변화량과 변동 방향을 비즈니스 규칙 및 데이터 제약 조건에 대입하여 상호 논리적 타당성 여부를 등급별로 분류 및 검증하는 프로세스입니다.

  • 탐색 결과를 driver_eligible, caution_only, monitoring_signal 등 3가지 단계로 엄격하게 분리하여 리포트 기술에 신뢰도를 더했습니다.
  • 방향이 상충되거나 원인 기여 비율이 심하게 미약한 원인은 검증 단계에서 걸러내어 리포트에 수록되지 않도록 필터링했습니다.
Continue reading · same source

라인More from 라인

View all posts from 라인
  • AI를 전제로 다시 설계하다, Tech-Verse 2026 참관기

    AI AgentMCPDevOps
    1주 전
  • 장애 Alert의 원인을 스스로 찾다: SRE Observer 개발기

    SREObservabilityLLM
    2주 전
  • LLM Wiki: 코드 기준으로 자동 최신화되는 도메인 지식 SSOT 만들기

    LLMSSOTGitHub Actions
    3주 전
  • 일본어 상품 검색 정확도 높이기: Elasticsearch + Kuromoji에서 OpenSearch + Sudachi로

    OpenSearchSudachiElasticsearch
    1개월 전
  • 보안 업무를 위한 AI 에이전트 플랫폼 「SAGE」 개발기 1편: 판단은 사람에게 남기는 설계

    LLMMulti-AgentRAG
    1개월 전

Related reads#LLM

Explore #LLM
올리브영·sLLM

측정할 수 없으면 개선할 수 없다 - AI Pick 추천 카드를 위한 sLLM 정렬 학습기

#LLM1일 전
Samsung Tech·Claude Code

몇 달 전에 풀었던 문제를 오늘 또 풀고 있었습니다 — AI와의 대화를 팀의 지식으로 자동 축적한 이야기

#LLM2일 전
토스·LLM Benchmark

리더보드 1등 LLM, 토스에서도 1등일까? - Toss Benchmark 구축기

#LLM3일 전
Airbnb·AI Agents

모델을 넘어: 과학적 판단을 반영한 AI 인프라 엔지니어링

#LLM4일 전
Samsung Tech

구독만 하던 Codex와 Claude, LLM 서버로 바꿔 쓰기

#LLM5일 전

Source

라인
라인
Engineering Blog

Published · September 18, 2026

Topics

LLMAI AgentReActTool CallingLangfuse