가드레일 (Guardrails)
AI 용어AI의 입출력이 정해진 안전·정책 범위를 벗어나지 않게 막는 장치
#dev#트렌드
정의
가드레일은 AI 시스템에 들어오는 입력이나 나가는 출력이 유해하거나 정책에 어긋나거나 사실과 다른지 걸러내기 위해 앞뒤로 붙이는 검사 장치다. 프롬프트 인젝션 차단, 민감정보 유출 방지, 환각 의심 답변 재검토 같은 역할을 하며, 모델 성능만으로는 이런 위험을 다 막을 수 없다는 인식에서 실무 표준으로 자리잡았다.
언제 쓰나
프롬프트 인젝션 차단, 민감정보 유출 방지, 환각 의심 답변 재검토 등 AI를 실제 서비스에 배포할 때 안전장치로 둔다.
언제 안 쓰나
신뢰된 사용자만 쓰는 내부 실험용 프로토타입 단계에서는 처음부터 무거운 가드레일 계층을 갖출 필요는 없다.
Claude Code에선
Claude Code 자체가 파일 삭제나 위험한 명령 실행 전에 사용자 승인을 요구하는 권한 체계를 갖고 있는 것이 가드레일의 실제 사례다.
예시
챗봇이 개인정보나 비속어가 포함된 답을 하지 않도록, 출력을 사용자에게 보여주기 전에 별도 필터 모델을 거치게 하는 구조가 흔하다.
바로 쓰는 프롬프트
{{서비스 설명}}에 배포할 AI 기능에 필요한 가드레일 체크리스트를 만들어줘. 입력 검증, 출력 검증, 민감정보 처리 항목을 나눠서 정리해줘.jt · via term-research · 복사 0 · KO