정렬 (Alignment)
AI 용어AI가 인간의 의도·가치에 맞게 행동하도록 조정하는 것
#concept
정의
정렬은 AI 모델이 단순히 똑똑한 것을 넘어, 실제로 인간이 원하는 방향으로 도움이 되고 해롭지 않게 행동하도록 학습·조정하는 작업 전반을 가리킨다. RLHF와 DPO가 이를 구현하는 대표적인 기술이며, 에이전트가 실제 행동까지 하게 되면서 '답변의 말투'를 넘어 '행동의 안전성'까지 다루는 범위로 넓어졌다.
언제 쓰나
모델을 실제 서비스에 내놓기 전, RLHF나 DPO 같은 후속 학습으로 사람의 선호와 안전 기준에 맞게 응답 경향을 조정해야 할 때 이 개념이 적용된다.
언제 안 쓰나
순수 연구 목적으로 모델의 원시 성능(추론 능력 등)만 평가할 때는 정렬 여부와 별개로 다뤄야 한다.
Claude Code에선
직접 연결되진 않지만, Claude Code가 위험한 명령 실행 전에 사용자 승인을 구하도록 설계된 것은 '행동의 안전성'까지 다루는 넓은 의미의 정렬이 실제 제품에 반영된 예로 볼 수 있다.
예시
RLHF로 사람이 선호하는 답변 스타일을 학습시키거나, DPO로 더 안전하고 도움이 되는 응답을 선택하도록 조정하는 과정이 대표적인 정렬 작업이다.
jt · via term-research · 복사 0 · KO