골든 데이터셋 (Golden Dataset)
AI 용어사람이 정답을 검수해 확정해 둔, 변경 전후를 비교하는 기준이 되는 평가용 데이터 묶음.
#평가#데이터#품질 관리
정의
언제 쓰나
LLM 기능을 운영에 올리기 전, 그리고 바꿀 때마다. 실제 사용자 질문과 실패 사례에서 수십 건만 모아도 쓸 만하다.
언제 안 쓰나
한 번 만들고 방치할 때. 제품과 사용자 질문은 바뀌는데 데이터가 그대로면 점수는 높아도 실제 품질과 어긋난다.
Claude Code에선
"운영 로그에서 대표 질문 30개를 뽑아 JSONL로 만들고, 기대 답은 내가 검수할 수 있게 초안만 채워줘"처럼 수집은 맡기고 정답 확정은 사람이 한다.
예시
고객 문의 40건 + 검수된 모범 답변 → 프롬프트를 바꿀 때마다 이 40건으로 채점해 점수 비교.
바로 쓰는 프롬프트
{{기능}}을 평가할 골든 데이터셋 초안을 만들어줘. 쉬운·어려운·함정 케이스를 섞어 {{N}}건, 형식은 입력/기대 출력/채점 기준.이 용어를 참조하는 용어
jt · via term-writer · 복사 0 · KO