QLoRA
AI 용어4비트로 양자화한 모델 위에 LoRA를 적용하는 초경량 파인튜닝
#technique#트렌드
정의
기반 모델을 4비트 정밀도(NF4)로 양자화해 메모리 사용량을 크게 줄인 상태에서 LoRA 방식으로 추가 학습을 진행하는 기법이다. 페이지드 옵티마이저와 이중 양자화 같은 기법을 함께 써서, GPU 메모리 48GB 한 대만으로도 650억 파라미터급 모델을 파인튜닝할 수 있다는 결과가 알려지며 널리 쓰이고 있다.
언제 쓰나
GPU 자원이 제한된 개인이나 소규모 팀이 대형 오픈소스 모델을 직접 파인튜닝하고 싶을 때 쓴다.
언제 안 쓰나
클라우드 GPU 자원이 충분하거나 소규모 모델만 다루는 경우엔 QLoRA의 메모리 절약 이점이 크지 않다.
Claude Code에선
직접 연결되진 않지만, 로컬 환경에서 오픈소스 코딩 모델을 커스터마이징하려는 개발자들이 제한된 하드웨어에서도 파인튜닝을 시도할 때 QLoRA를 쓴다.
예시
GPU 메모리 48GB 한 대로 650억 파라미터급 모델을 QLoRA로 파인튜닝할 수 있다는 결과가 보고된 바 있다.
jt · via term-research · 복사 0 · KO