벤치마크 포화 (Benchmark Saturation)
AI 용어표준 벤치마크 점수가 실제 실무 성능을 더 이상 잘 구분하지 못하는 현상
#dev#트렌드
정의
벤치마크 포화는 MMLU 같은 널리 쓰이던 표준 벤치마크에서 여러 모델이 모두 만점에 가까운 점수를 받게 되면서, 그 점수만으로는 어느 모델이 실제 업무에 더 적합한지 구별하기 어려워진 상황을 가리킨다.
언제 쓰나
모델을 선택하거나 비교할 때, 이미 포화된 범용 벤치마크 점수보다 자기 서비스에 맞춘 자체 이밸 결과를 더 신뢰해야 한다는 판단 기준으로 쓰인다.
언제 안 쓰나
아직 포화되지 않은 특정 영역의 새로운 벤치마크를 비교할 때는 이 개념을 적용할 필요가 없다.
Claude Code에선
직접 연결되진 않지만, Claude Code로 어떤 모델을 쓸지 고를 때 공개 벤치마크 순위만 보지 말고 실제 작업(코드 생성, 도구 호출 정확도)에서 직접 비교해봐야 한다는 맥락으로 이해하면 된다.
예시
여러 최신 모델이 MMLU 같은 벤치마크에서 비슷하게 높은 점수로 몰리면서, 그 점수 차이만으로 어떤 모델이 실무에 더 나은지 판단하기 어려워진 상황이 자주 언급된다.
관련 용어
이 용어를 참조하는 용어
jt · via term-research · 복사 0 · KO