스페큘레이티브 디코딩 (Speculative Decoding)
AI 용어작은 모델이 먼저 초안을 쓰고 큰 모델이 검증해 속도를 높이는 기법
#technique#트렌드
정의
빠르고 가벼운 '초안' 모델이 다음에 나올 단어들을 여러 개 먼저 예측해두면, 정확도 높은 본 모델이 그 초안을 한꺼번에 검증해 맞는 부분만 채택하는 방식으로 생성 속도를 높이는 기법이다. 한 단어씩 순서대로 생성할 때보다 훨씬 빠르게 텍스트를 만들어낼 수 있다.
언제 쓰나
대형 모델의 응답 속도를 개선하고 싶은 서비스 제공자가 서버 측 최적화 기법으로 적용한다.
언제 안 쓰나
사용자가 프롬프트를 작성할 때 직접 고려할 개념은 아니며, 최종 사용자가 켜고 끄는 옵션이 아니다.
Claude Code에선
사용자가 직접 설정하는 기능은 아니지만, Claude Code에서 체감하는 응답 속도의 일부는 API 제공사 서버 측의 이런 디코딩 최적화 덕분일 수 있다.
예시
MoE 구조의 대형 모델을 서비스할 때 스페큘레이티브 디코딩을 적용해 응답 지연 시간을 줄이는 것이 최신 서빙 최적화 연구 주제로 다뤄진다.
관련 용어
이 용어를 참조하는 용어
jt · via term-research · 복사 0 · KO