이밸 (Eval)
AI 용어AI 애플리케이션의 실제 성능을 체계적으로 측정하는 평가 체계
#dev#트렌드
정의
이밸은 모델이나 AI 애플리케이션이 원하는 대로 작동하는지 확인하기 위해 만드는 테스트 데이터셋, 채점 기준, 실행 파이프라인을 통틀어 가리키는 말이다. 범용 벤치마크가 실제 서비스 성능을 잘 예측하지 못한다는 인식이 퍼지면서, 각 팀이 자기 서비스에 맞는 골든 데이터셋과 자동 회귀 평가 체계를 직접 만드는 쪽으로 자리잡았다.
언제 쓰나
프롬프트나 모델을 바꿀 때마다 성능이 좋아졌는지 나빠졌는지 확인하고 싶을 때, 또는 배포 전 회귀 테스트를 하고 싶을 때 쓴다.
언제 안 쓰나
한 번 쓰고 버리는 실험적 프로토타입처럼 반복 검증이 필요 없는 경우엔 별도 이밸 체계를 갖출 필요가 없다.
Claude Code에선
Claude Code로 개발한 에이전트나 프롬프트를 수정할 때마다 테스트 케이스 세트를 돌려 이전보다 나빠지지 않았는지 확인하는 스크립트를 짜는 작업으로 나타난다.
예시
골든 데이터셋 수십 개 질문에 대해 프롬프트를 수정할 때마다 자동으로 답을 채점해 정확도 추이를 추적하는 파이프라인이 흔한 형태다.
바로 쓰는 프롬프트
{{애플리케이션/기능 설명}}에 대한 이밸 데이터셋을 만들려고 해. 대표적인 입력 케이스 10개와 각각의 기대 결과, 채점 기준을 표로 정리해줘.관련 용어
이 용어를 참조하는 용어
jt · via term-research · 복사 0 · KO