← AI 용어 사전

데이터 포이즈닝 (Data Poisoning)

AI 용어
🛡️ 안전과 신뢰

학습·검색 데이터에 조작된 내용을 섞어 모델이 틀리거나 악의적으로 동작하게 만드는 공격.

#보안#학습 데이터#공격 기법

정의

모델이 학습하거나 참조하는 데이터에 조작된 샘플을 심어 결과를 왜곡하는 공격. 파인튜닝 데이터에 특정 문구가 나오면 엉뚱하게 동작하는 백도어를 심거나, RAG 문서 저장소에 거짓 문서를 넣어 답을 오염시키는 식이다.

언제 쓰나

외부에서 수집한 데이터로 파인튜닝하거나, 사용자·외부인이 문서를 올릴 수 있는 RAG를 운영할 때 점검한다.

언제 안 쓰나

출처가 통제된 내부 데이터만 쓰는 소규모 실험에서는 우선순위가 낮다. 다만 외부 데이터가 섞이는 순간부터는 대상이 된다.

Claude Code에선

데이터 파이프라인을 시킬 때 "수집 데이터의 출처를 기록하고, 중복·이상 샘플 검사와 지시문처럼 보이는 텍스트 탐지를 전처리에 넣어줘"라고 지시한다.

예시

공개 위키에 거짓 제품 정보 등록 → RAG가 그 문서를 검색 → 챗봇이 거짓 정보를 근거로 답변.

바로 쓰는 프롬프트

{{데이터 출처}}에서 수집한 데이터를 학습·색인에 쓰기 전에 거를 포이즈닝 점검 항목을 체크리스트로 만들어줘.
jt · via term-writer · 복사 0 · KO