AI 용어 사전

비전-랭귀지 모델 (Vision-Language Model, VLM)

AI 용어
🧠 모델과 학습

이미지를 보고 언어로 설명·판단하는 모델

#model
다운로드

정의

이미지와 텍스트를 함께 입력받아, 사진 속 내용을 설명하거나 화면을 보고 다음 행동을 판단하는 등 시각 정보와 언어 이해를 결합해 처리하는 모델이다. 멀티모달 모델의 한 갈래로, 컴퓨터 사용 에이전트나 전자상거래 상품 이해 같은 응용에서 핵심 역할을 한다.

언제 쓰나

스크린샷을 보고 다음 클릭 위치를 판단하거나 상품 이미지를 분석해 설명을 생성하는 등, 시각과 언어를 함께 다뤄야 할 때 쓴다.

언제 안 쓰나

텍스트만 다루는 작업이라면 VLM 대신 일반 언어 모델을 쓰는 게 더 가볍고 빠르다.

Claude Code에선

Claude Code가 스크린샷을 읽거나 UI 이미지를 보고 코드를 수정하는 등 이미지 입력을 다룰 때 내부적으로 VLM 능력이 쓰인다.

예시

컴퓨터 사용 에이전트가 화면 캡처를 VLM으로 분석해 버튼 위치를 파악한 뒤 클릭하는 방식이 대표적이다.

이 용어를 참조하는 용어

jt · via term-research · 복사 0 · KO