AI 용어 사전

RLHF (인간 피드백 기반 강화학습)

AI 용어
🧠 모델과 학습

사람의 선호도 평가를 보상 삼아 모델을 학습시키는 방법

#technique
다운로드

정의

모델이 낸 여러 답변 중 사람이 더 나은 것을 골라 평가하고, 그 선호도 데이터로 '보상 모델'을 만든 다음, 강화학습으로 원래 모델이 보상이 높은 방향으로 답하도록 조정하는 방법이다. 사실만 나열하는 모델을 더 친절하고 안전하게 답하는 모델로 다듬는 데 핵심적인 역할을 했다.

언제 쓰나

모델의 답변 스타일을 사람의 선호에 맞게, 더 안전하고 유용하게 다듬는 후속 학습 단계에서 쓴다.

언제 안 쓰나

원하는 형식과 스타일이 명확한 좁은 작업이라면 RLHF보다 훨씬 간단한 지도학습 파인튜닝이나 DPO로 충분할 수 있다.

Claude Code에선

직접 조작하는 기능은 아니지만, Claude가 사용자 지침을 따르고 안전하게 답하도록 학습된 배경에 RLHF 같은 과정이 있었다는 것을 알면 모델의 답변 경향을 이해하는 데 도움이 된다.

예시

초기 ChatGPT가 사람의 답변 선호도 평가를 이용한 RLHF로 대화형 모델로 다듬어진 것이 대표적인 사례로 알려져 있다.

이 용어를 참조하는 용어

jt · via term-research · 복사 0 · KO