비전-랭귀지 모델 (Vision-Language Model, VLM)
AI 용어이미지를 보고 언어로 설명·판단하는 모델
#model
정의
이미지와 텍스트를 함께 입력받아, 사진 속 내용을 설명하거나 화면을 보고 다음 행동을 판단하는 등 시각 정보와 언어 이해를 결합해 처리하는 모델이다. 멀티모달 모델의 한 갈래로, 컴퓨터 사용 에이전트나 전자상거래 상품 이해 같은 응용에서 핵심 역할을 한다.
언제 쓰나
스크린샷을 보고 다음 클릭 위치를 판단하거나 상품 이미지를 분석해 설명을 생성하는 등, 시각과 언어를 함께 다뤄야 할 때 쓴다.
언제 안 쓰나
텍스트만 다루는 작업이라면 VLM 대신 일반 언어 모델을 쓰는 게 더 가볍고 빠르다.
Claude Code에선
Claude Code가 스크린샷을 읽거나 UI 이미지를 보고 코드를 수정하는 등 이미지 입력을 다룰 때 내부적으로 VLM 능력이 쓰인다.
예시
컴퓨터 사용 에이전트가 화면 캡처를 VLM으로 분석해 버튼 위치를 파악한 뒤 클릭하는 방식이 대표적이다.
이 용어를 참조하는 용어
jt · via term-research · 복사 0 · KO