← AI 용어 사전

골든 데이터셋 (Golden Dataset)

AI 용어
⌨️ AI로 개발하기

사람이 정답을 검수해 확정해 둔, 변경 전후를 비교하는 기준이 되는 평가용 데이터 묶음.

#평가#데이터#품질 관리

정의

입력과 기대 출력(또는 채점 기준)을 사람이 검수해 확정해 둔 평가용 데이터 묶음. 프롬프트·모델·RAG 설정을 바꿀 때마다 같은 묶음으로 채점해 좋아졌는지 나빠졌는지를 숫자로 비교한다.

언제 쓰나

LLM 기능을 운영에 올리기 전, 그리고 바꿀 때마다. 실제 사용자 질문과 실패 사례에서 수십 건만 모아도 쓸 만하다.

언제 안 쓰나

한 번 만들고 방치할 때. 제품과 사용자 질문은 바뀌는데 데이터가 그대로면 점수는 높아도 실제 품질과 어긋난다.

Claude Code에선

"운영 로그에서 대표 질문 30개를 뽑아 JSONL로 만들고, 기대 답은 내가 검수할 수 있게 초안만 채워줘"처럼 수집은 맡기고 정답 확정은 사람이 한다.

예시

고객 문의 40건 + 검수된 모범 답변 → 프롬프트를 바꿀 때마다 이 40건으로 채점해 점수 비교.

바로 쓰는 프롬프트

{{기능}}을 평가할 골든 데이터셋 초안을 만들어줘. 쉬운·어려운·함정 케이스를 섞어 {{N}}건, 형식은 입력/기대 출력/채점 기준.

이 용어를 참조하는 용어

jt · via term-writer · 복사 0 · KO