#AI

엔지니어를 위한 AI 스킬 개선 가이드: 에이전트 성능 최적화를 위한 테스트 프로세스 구축

엔지니어를 위한 AI 스킬 개선 가이드: 에이전트 성능 최적화를 위한 테스트 프로세스 구축
01

Summary

"내 AI 에이전트는 왜 말을 안 들을까?" Pinterest가 찾은 AI 스킬 최적화의 해답

단순한 프롬프트를 넘어 정량적인 테스트 하네스로 AI 에이전트의 스킬 호출 성공률을 극대화하는 법

Pinterest 엔지니어링 팀이 AI 에이전트의 도메인 특화 스킬 호출 신뢰도를 높이기 위해 수행한 실험과 결과를 공유합니다. 객관적인 데이터 기반의 테스트 프로세스를 통해 Codex와 Claude의 성능 차이를 분석하고 실무적인 최적화 팁을 제공합니다.

  • 01Bash 스크립트를 활용한 AI 에이전트 전용 테스트 하네스 구축
  • 02Positive/Negative 케이스를 통한 스킬 호출 정확도 정량화
  • 03Frontmatter와 AGENTS.md를 활용한 스킬 로드 가이드 최적화
  • 04에이전트 모델(Codex vs Claude)별 최적화 기법의 영향력 차이 확인
  • 05명확하고 상세한 프롬프트 작성이 스킬 호출 성공의 핵심임을 증명

RECOMMENDATION

AI 에이전트를 도입한 팀이라면 정성적인 평가에 의존하기보다 본문의 테스트 하네스를 참고하여 정량적 지표를 먼저 구축할 것을 권장합니다.

The Problem

Pinterest의 iOS 아키텍처 지식을 가진 AI 에이전트가 특정 스킬을 호출하는 과정에서 불확실성이 발생하여 개발 워크플로우 자동화의 신뢰도가 떨어지는 문제가 있었습니다.

The Solution

Bash 기반의 테스트 하네스를 구축하여 긍정/부정 케이스를 테스트하고, 프론트매터(Frontmatter) 설명 추가, AGENTS.md 파일 활용, 명확한 지시어 사용 등의 최적화 전략을 도입했습니다.

The Result

초기 Codex 73%, Claude 62%였던 정확도가 최적화를 통해 개선되었으며, 특히 프론트매터에 컨텍스트를 추가하는 방식이 에이전트 종류와 무관하게 유의미한 성능 향상을 이끌어냈습니다.

Trade-off

AGENTS.md에 스킬 정보를 추가할 경우 컨텍스트 윈도우의 토큰을 추가로 소비하게 되며, AI에게 스스로 설정을 개선하도록 맡겼을 때 오히려 성능이 저하되는 부작용이 발견되었습니다.

03

Key Concepts

Concept · 01

Skill Invocation

AI 에이전트가 특정 도메인의 지식이나 도구(스킬)를 필요로 할 때 이를 정확하게 인식하고 활성화하는 과정입니다.

  • 에이전트가 특정 아키텍처 가이드를 로드해야 할 시점을 판단하는 신뢰도를 테스트함
Concept · 02

Test Harness

소프트웨어의 특정 기능을 테스트하기 위해 필요한 테스트 데이터, 실행 환경, 결과 수집 도구를 모은 자동화 프레임워크입니다.

  • Bash 스크립트를 사용하여 에이전트에 프롬프트를 전달하고 로그를 파싱해 성공률을 계산함
Concept · 03

Frontmatter

파일 최상단에 YAML 등의 형식으로 작성된 메타데이터 섹션으로, 에이전트에게 필요한 컨텍스트나 규칙을 전달합니다.

  • 스킬 설명에 아키텍처 구성 요소를 포함시켜 호출 성공률을 높이는 최적화 수단으로 활용됨