AI 용어 사전

스페큘레이티브 디코딩 (Speculative Decoding)

AI 용어
⚙️ 추론과 비용

작은 모델이 먼저 초안을 쓰고 큰 모델이 검증해 속도를 높이는 기법

#technique#트렌드
다운로드

정의

빠르고 가벼운 '초안' 모델이 다음에 나올 단어들을 여러 개 먼저 예측해두면, 정확도 높은 본 모델이 그 초안을 한꺼번에 검증해 맞는 부분만 채택하는 방식으로 생성 속도를 높이는 기법이다. 한 단어씩 순서대로 생성할 때보다 훨씬 빠르게 텍스트를 만들어낼 수 있다.

언제 쓰나

대형 모델의 응답 속도를 개선하고 싶은 서비스 제공자가 서버 측 최적화 기법으로 적용한다.

언제 안 쓰나

사용자가 프롬프트를 작성할 때 직접 고려할 개념은 아니며, 최종 사용자가 켜고 끄는 옵션이 아니다.

Claude Code에선

사용자가 직접 설정하는 기능은 아니지만, Claude Code에서 체감하는 응답 속도의 일부는 API 제공사 서버 측의 이런 디코딩 최적화 덕분일 수 있다.

예시

MoE 구조의 대형 모델을 서비스할 때 스페큘레이티브 디코딩을 적용해 응답 지연 시간을 줄이는 것이 최신 서빙 최적화 연구 주제로 다뤄진다.

이 용어를 참조하는 용어

jt · via term-research · 복사 0 · KO