AI 용어 사전

RLVR (검증 가능한 보상 기반 강화학습)

AI 용어
🧠 모델과 학습

수학·코드처럼 정답이 명확한 문제에 이진 보상을 주는 학습법

#technique#트렌드
다운로드

정의

사람이나 별도 보상 모델의 판단에 의존하지 않고, 수학 문제나 코드 실행 결과처럼 정답이 객관적으로 검증 가능한 과제에 '맞았다/틀렸다'는 이진 보상만으로 모델을 강화학습시키는 방법이다. 보상 모델을 따로 학습시킬 필요가 없어 구조가 단순하고, 수학·코딩 벤치마크 성능을 크게 끌어올리는 데 기여했다.

언제 쓰나

코드 실행 성공 여부나 수학 정답처럼 자동으로 채점 가능한 과제로 모델의 추론 능력을 강화 학습시킬 때 쓴다.

언제 안 쓰나

정답이 주관적이거나 명확히 검증할 수 없는 글쓰기, 대화 스타일 같은 작업에는 RLVR을 적용하기 어렵다.

Claude Code에선

직접 연결되진 않지만, 추론 모델이 코딩 문제를 유독 잘 푸는 배경에는 코드가 실행 결과로 정오를 자동 검증할 수 있어 RLVR 학습에 적합했다는 점이 있다.

예시

코드 생성 모델을 학습시킬 때 테스트 케이스 통과 여부를 이진 보상으로 삼아 RLVR을 적용하는 방식이 대표적이다.

관련 용어

이 용어를 참조하는 용어

jt · via term-research · 복사 0 · KO