#AI

LLM에게 계산을 시키지 마세요 — 숫자를 '신뢰'할 수 있는 AI 데이터 애널리스트 개발기

LLM에게 계산을 시키지 마세요 — 숫자를 '신뢰'할 수 있는 AI 데이터 애널리스트 개발기
01

Summary

LLM에게 계산기 쥐어주지 마라: 3,900만 행 시장 데이터를 정복한 하이브리드 AI 애널리스트

환각을 원천 배제한 100% 결정적 아키텍처로 자연어 질문에서 오차 없는 진짜 숫자를 구하는 법

사용자 질문의 해석은 유연한 AI가, 정확해야 하는 계산은 결정적인 코드가 나누어 처리하는 하이브리드 지능형 데이터 플랫폼인 AXIOM의 아키텍처를 상세 소개합니다. 화면에는 그럴듯하지만 세부 로직 오류로 합산이 뻥튀기되는 '4배 부풀리기 버그'의 고난도 차단 해법부터 로컬 LLM의 성능을 비결정성 제어와 프리파서로 통제하는 구체적 방법론을 다룹니다. 또한 기획 및 개발과 검증, 릴리즈의 모든 소프트웨어 제작 과정을 고도화된 에이전트 설계 기반으로 신속하게 전개해 낸 실전적인 DevRel 가이드를 선사합니다.

  • 01수치 연산을 직접 생성하지 않고 질의 명세만 구조화하여 SQL 처리 코드로 전송하는 '추출-계산-설명' 3단 파이프라인 정착
  • 02동일 시장의 관점 분리 에러 및 기간 중복 누적을 원천 방지하기 위해 전문가 상수 검증을 결합한 오라클 테스트 수립
  • 03질문에서 확실한 영역을 먼저 추출해 로컬 LLM의 불분명한 해석을 덮어쓰고 제어하는 문자열 경계 가드 프리파서 조립
  • 04최종 쿼리 명세가 일부 상이하더라도 최종 산출된 수치 결과가 정답과 완벽히 호환되면 통과를 판정하는 골드 평가 하니스 도입
  • 05리뷰 및 승인, 되돌리기 게이트를 명시적으로 인간 통제에 두는 최적의 멀티에이전트 소프트웨어 개발 워크플로 정착

RECOMMENDATION

사내 DB나 정형 데이터를 결합해 정합성이 보장된 RAG, 대시보드 혹은 BI 챗 에이전트를 실 서비스로 출시하려는 시스템 아키텍트와 시니어 엔지니어에게 적극 권장합니다. 완벽한 신뢰를 보장하기 위한 엣지 예외 방어 설계 기법의 정수가 담겨 있습니다.

The Problem

수천만 행에 달하는 복잡한 글로벌 시장 데이터 분석 과정에서, 파편화된 데이터 파일 구조와 주관적인 집계 규칙 적용으로 인해 담당자마다 결과 수치가 서로 다르고 단순 수치 추출에도 수십 분의 오랜 시간이 소요되었습니다. 또한 데이터 분석을 위해 LLM을 바로 활용할 경우 LLM 특유의 그럴듯한 거짓말을 만들어내는 환각 현상 때문에 연산 결과를 절대 신뢰할 수 없는 치명적인 문제가 있었습니다.

The Solution

LLM은 수치 계산을 배제하고 자연어 질문을 구조화된 질의 명세(QuerySpec)로 변환하는 '추출' 역할만 수행하게 한 후, 실제 수치 산출은 선언적으로 SQL을 합성해 실행하는 결정적 파이썬 코드 기반의 '메트릭 레이어'가 수행하도록 아키텍처를 이원화했습니다. 로컬 LLM의 구조적 한계를 보완하기 위해 확실한 패턴을 오버라이딩하는 '결정적 프리파서'를 전면 가동하고, 수치 정합성을 코드 레벨에서 통제하기 위해 오라클 테스트와 골드 평가 하니스의 이중 검증 체계를 구성했습니다.

The Result

수작업 시 수십 분씩 걸리던 데이터 추출 및 산출 업무가 대시보드와 AI 챗을 통해 수초 만에 일관된 수치로 정확하게 출력되도록 성능이 개선되었으며, 의사결정 수치를 재확인하기 위해 소모되던 협업 비용이 0으로 제거되었습니다. 1,000개 이상의 정밀 테스트와 70여 개 골드 평가 케이스가 상시 작동하여 스냅샷 갱신이나 신규 코드 배포 시에도 데이터의 완전성과 오차 범위를 극도로 안정되게 유지하고 있습니다.

Trade-off

로컬 LLM의 한계와 실생활 자연어 질문의 오용 사례들을 메우기 위해 사전 기반의 프리파서 규칙 및 예외 위생 처리 계층을 사람이 수동으로 지속 업데이트해야 하는 설계적 관리 공수가 수반됩니다. 또한 신규 분기 데이터 추가 시 원천 파일 내 비정형 필드의 의미 분석 검증 단계를 거쳐 수동으로 매핑 규칙을 업데이트해야 하며, 정답 기준 데이터가 변할 때마다 일부 하니스의 무효화 수동 상태(BAD-GOLD) 조작 처리가 요구됩니다.

03

Key Concepts

Concept · 01

QuerySpec (질의 명세)

자연어 질문에서 추려낸 분석 소스, 적용 메트릭, 벤더, 지역, 기간, 세그먼트 등의 제어 옵션들을 엄격한 Pydantic 타입 형태로 구체화시킨 사양 구조체입니다.

  • 텍스트 데이터를 직접 연산에 주입하지 않도록 보장하여 SQL 인젝션을 막고 계산 명세의 모호함을 원천 봉쇄합니다.
  • 로컬 LLM이 번역 및 구문 파싱을 수행하는 대상이자 API 반환 파이프라인의 핵심 인터페이스 객체로 동작합니다.
Concept · 02

Metric Layer (메트릭 레이어)

구조화된 질의 명세를 전달받아 적절한 바인딩 파라미터가 포함된 단일 SQL 쿼리로 기하학적 합성 및 처리를 완수하는 불변 규칙 코드 모음입니다.

  • 대시보드와 AI 챗봇이 동일한 데이터 엔진을 참조하게 하여 UI 컴포넌트와 챗 답변의 불일치를 구조적으로 격리합니다.
  • 평균판매가(ASP)처럼 단순 합산이 불가능하고 비율 분석이 들어가야 하는 복잡한 원천 비즈니스 모델을 재정의된 수식 기반으로 투명하게 결합 산출합니다.
Concept · 03

이중 평가 체계 (Oracle & Gold Evaluation)

시스템 계산식의 정확성을 실데이터와 상수로 연속 대비하는 '백엔드 오라클 테스트'와, 질문 명세의 올바른 해석 및 연산 정밀도를 모두 종합 점검하는 '골드 평가 하니스'가 입체적으로 구성된 평가망입니다.

  • 현업 도메인 최고 전문가들의 검증 수치 원본을 오라클 테스트 코드의 기댓값 상수로 매핑하여 코드 머지 전 변경점을 강제 차단합니다.
  • 실제 질문 70여 건의 누적 분석 경로를 바탕으로 정답 문자열의 일치가 아닌 최종 연산 수치의 일치 여부로 실전 합격을 가려냅니다.