AI 용어 사전

벤치마크 (Benchmark)

AI 용어
🧠 모델과 학습

모델끼리 같은 조건에서 비교하기 위해 정해둔 표준 문제집

#concept
다운로드

정의

벤치마크는 여러 모델을 같은 잣대로 견주기 위해 정해놓은 문제와 채점 방식의 묶음이다. 수학·코딩·추론처럼 영역별로 나뉘어 있고, 발표되는 점수는 대부분 여기서 나온다. 문제집이 공개되어 있다 보니 학습 데이터에 섞여 들어가 점수만 오르는 오염 문제가 늘 따라다닌다.

언제 쓰나

모델을 고를 때 후보를 좁히는 1차 기준으로 쓴다. 내 작업과 성격이 비슷한 벤치마크를 골라 봐야 한다.

언제 안 쓰나

실제 서비스 성능을 대신하지는 못한다. 최종 판단은 내 데이터로 만든 자체 평가로 해야 한다.

Claude Code에선

코딩 벤치마크 점수가 높아도 내 코드베이스의 관례를 따르는지는 별개라, 결국 실제 작업으로 확인하게 된다.

예시

공개 벤치마크로 후보 세 개를 추린 뒤, 실제 사내 문의 200건으로 다시 재보는 식으로 쓴다.

바로 쓰는 프롬프트

{{작업}}에 맞는 자체 평가셋을 설계해줘. 공개 벤치마크로는 안 잡히는 우리 상황의 항목을 중심으로 만들어줘.

이 용어를 참조하는 용어

jt · via term-research · 복사 0 · KO