양자화 (Quantization)
AI 용어모델 숫자의 정밀도를 낮춰 크기와 연산량을 줄이는 기법
#technique
정의
모델 내부의 가중치를 32비트나 16비트 같은 높은 정밀도 숫자 대신 8비트, 4비트처럼 더 적은 비트로 표현해 모델 용량과 연산량을 줄이는 기법이다. 정밀도를 낮추는 만큼 성능이 약간 떨어질 수 있지만, 잘 설계하면 눈에 띄는 손실 없이 크기를 대폭 줄일 수 있다.
언제 쓰나
스마트폰 같은 기기에서 모델을 돌리거나(온디바이스 AI) 대형 모델의 서빙 비용을 낮추고 싶을 때 양자화를 적용한다.
언제 안 쓰나
서버 자원이 충분하고 최고 정밀도의 답변이 중요한 경우엔 양자화로 인한 미세한 성능 저하도 부담스러울 수 있다.
Claude Code에선
직접 연결되진 않지만, 로컬에서 코드 어시스턴트용 오픈소스 모델을 돌릴 때 양자화된 버전(예: 4비트 모델)을 선택해 메모리를 아끼는 식으로 개발자들이 실제로 마주치는 개념이다.
예시
8비트나 4비트로 양자화한 모델을 노트북이나 스마트폰에서 돌려 클라우드 없이 로컬 AI 기능을 구현하는 경우가 있다.
jt · via term-research · 복사 0 · KO