AI 용어 사전

AI 안전 (AI Safety)

AI 용어
🛡️ 안전과 신뢰

AI가 의도치 않게 해를 끼치지 않도록 연구·관리하는 분야

#concept
다운로드

정의

AI 안전은 AI 시스템이 오작동, 악용, 통제 불능 상태로 인해 사람이나 사회에 해를 끼치지 않도록 사전에 연구하고 관리 체계를 만드는 분야다. 정렬, 레드팀, 가드레일 모두 이를 실무적으로 구현하는 수단이며, 에이전트가 실제 행동 권한을 갖게 되면서 '답변 내용의 안전성'을 넘어 '행동의 안전성'까지 다루는 범위로 확장됐다.

언제 쓰나

정렬, 레드팀, 가드레일처럼 AI를 안전하게 만들기 위한 구체적인 활동들을 계획하거나 논의할 때 상위 개념으로 쓰인다.

언제 안 쓰나

단순한 모델 성능 비교나 기능 개발 논의처럼 안전성과 무관한 주제에서는 이 틀을 굳이 끌어올 필요가 없다.

Claude Code에선

Claude Code가 파일 삭제, 강제 push 같은 되돌리기 어려운 작업 전에 사용자 확인을 요구하는 설계 자체가 AI 안전을 실무 제품에 적용한 예다.

예시

에이전트가 결제나 시스템 설정 변경 같은 실제 행동 권한을 갖게 되면서, 답변 내용뿐 아니라 행동 자체의 안전성까지 점검하는 것이 AI 안전 논의의 중심으로 옮겨왔다.

이 용어를 참조하는 용어

jt · via term-research · 복사 0 · KO