AI 용어 사전

DPO (Direct Preference Optimization)

AI 용어
🧠 모델과 학습

별도 보상 모델 없이 선호도 데이터로 직접 모델을 학습시키는 방법

#technique#트렌드
다운로드

정의

RLHF처럼 보상 모델을 따로 학습시키고 강화학습을 도는 대신, '어떤 답이 더 나은가'라는 선호도 데이터를 간단한 손실 함수 하나로 직접 모델 학습에 반영하는 방법이다. 보상 모델을 거치지 않고도 같은 효과를 낼 수 있다는 점이 밝혀지며 RLHF보다 구현이 단순하고 안정적인 대안으로 쓰이게 됐다.

언제 쓰나

RLHF의 복잡한 강화학습 루프 없이도 모델을 사람의 선호에 맞춰 조정하고 싶을 때 쓴다.

언제 안 쓰나

정답이 명확히 검증 가능한 수학·코드 문제라면 선호도 비교 방식인 DPO보다 RLVR 같은 방식이 더 적합할 수 있다.

Claude Code에선

직접 연결되진 않지만, 모델이 어떤 답을 '더 낫다'고 판단해 그 방향으로 학습되는 과정을 이해하면 모델별 답변 스타일 차이를 해석하는 데 도움이 된다.

예시

오픈소스 모델 커뮤니티에서 RLHF의 복잡한 파이프라인 대신 DPO로 선호도 학습을 진행하는 경우가 늘었다.

관련 용어

이 용어를 참조하는 용어

jt · via term-research · 복사 0 · KO