RLHF (인간 피드백 기반 강화학습)
AI 용어사람의 선호도 평가를 보상 삼아 모델을 학습시키는 방법
#technique
정의
모델이 낸 여러 답변 중 사람이 더 나은 것을 골라 평가하고, 그 선호도 데이터로 '보상 모델'을 만든 다음, 강화학습으로 원래 모델이 보상이 높은 방향으로 답하도록 조정하는 방법이다. 사실만 나열하는 모델을 더 친절하고 안전하게 답하는 모델로 다듬는 데 핵심적인 역할을 했다.
언제 쓰나
모델의 답변 스타일을 사람의 선호에 맞게, 더 안전하고 유용하게 다듬는 후속 학습 단계에서 쓴다.
언제 안 쓰나
원하는 형식과 스타일이 명확한 좁은 작업이라면 RLHF보다 훨씬 간단한 지도학습 파인튜닝이나 DPO로 충분할 수 있다.
Claude Code에선
직접 조작하는 기능은 아니지만, Claude가 사용자 지침을 따르고 안전하게 답하도록 학습된 배경에 RLHF 같은 과정이 있었다는 것을 알면 모델의 답변 경향을 이해하는 데 도움이 된다.
예시
초기 ChatGPT가 사람의 답변 선호도 평가를 이용한 RLHF로 대화형 모델로 다듬어진 것이 대표적인 사례로 알려져 있다.
jt · via term-research · 복사 0 · KO