보상 모델 (Reward Model)
AI 용어답변에 점수를 매겨 학습을 이끄는 보조 모델. RLHF의 심판 역할
#model
정의
보상 모델은 "이 답이 저 답보다 낫다"는 사람의 선호 데이터를 학습해, 새로운 답변에 점수를 매기는 별도의 모델이다. 사람이 모든 답을 일일이 채점할 수 없으니 채점자를 모델로 대신 세우는 셈이고, RLHF는 이 점수를 높이는 방향으로 본 모델을 다듬는다. 채점자가 틀리면 본 모델은 그 틀린 기준을 열심히 만족시키게 된다.
언제 쓰나
정답이 하나로 떨어지지 않는 작업(글쓰기, 대화, 요약)의 품질을 학습에 반영해야 할 때 쓴다.
언제 안 쓰나
정답을 기계적으로 검증할 수 있는 작업이라면 보상 모델 없이 검증 결과를 그대로 보상으로 쓰는 편이 낫다.
Claude Code에선
코드는 테스트를 돌려 맞고 틀림을 바로 알 수 있어, 사람 선호보다 검증 결과가 더 믿을 만한 보상이 된다.
예시
같은 질문에 대한 답변 두 개 중 사람이 고른 쪽을 높게 치도록 학습시키고, 그 점수로 본 모델을 조정한다.
바로 쓰는 프롬프트
{{작업}}의 답변 품질을 평가할 기준을 만들어줘. 사람이 선호를 비교할 때 볼 항목과, 점수가 왜곡될 수 있는 지점을 같이 적어줘.jt · via term-research · 복사 0 · KO