LLM-as-Judge
AI 용어사람 대신 다른 AI 모델이 답변의 품질을 채점하게 하는 방법
#dev#트렌드
정의
LLM-as-Judge는 사람이 일일이 답변을 채점하는 대신, 별도의 AI 모델에게 정확성이나 근거 충실도 같은 기준을 주고 답변 품질을 점수 매기게 하는 평가 방식이다. RAG 답변이 검색된 문서와 실제로 일치하는지 확인할 때 특히 많이 쓰인다. 다만 판정관으로 쓰는 모델에 따라 속도·비용이 들고, 기준이 프롬프트에 따라 흔들릴 수 있다는 한계도 있다.
언제 쓰나
대량의 응답을 사람이 일일이 확인하기 어렵거나, RAG 답변이 근거 문서에 충실한지 자동으로 점검해야 할 때 쓴다.
언제 안 쓰나
정답이 명확히 정해진 작업(수치 계산, 형식 검증 등)은 굳이 LLM 판정관 없이 규칙 기반 채점으로 충분하다.
Claude Code에선
Claude Code로 만든 에이전트나 프롬프트의 품질을 자동 회귀 테스트할 때, 답변을 다른 Claude 호출로 채점하게 하는 이밸 스크립트를 짜는 식으로 실제 쓰인다.
예시
RAG 챗봇의 답변이 검색된 문서 내용과 실제로 부합하는지 채점 모델에게 근거 충실도를 1~5점으로 매기게 해 회귀 테스트에 포함시키는 경우가 흔하다.
바로 쓰는 프롬프트
다음 질문-답변-근거 문서 세트를 보고, 답변이 근거 문서 내용에 충실한지 1~5점으로 채점하고 이유를 설명해줘.
질문: {{질문}}
답변: {{답변}}
근거 문서: {{문서}}jt · via term-research · 복사 0 · KO