robots.txt
AI 용어어떤 크롤러가 무엇을 가져가도 되는지 적어두는 파일. AI 시대엔 학습·검색·사용자 요청을 따로 막는 자리가 됐다
#infra#트렌드
정의
robots.txt는 사이트 최상단(/robots.txt)에 두는 텍스트 파일로, 어떤 크롤러가 어디를 가져가도 되는지 적어두는 오래된 관례다. 강제력은 없고 크롤러가 지키기로 약속하는 방식이라, 지키지 않는 봇은 그냥 지나간다. AI가 등장하면서 판단이 복잡해졌는데, 같은 회사 봇이라도 학습용·검색용·사용자 요청용으로 나뉘어 있어 하나를 막아도 나머지는 그대로 들어오기 때문이다. 이 관례를 제대로 된 표준으로 만들려는 작업이 IETF의 AI 선호(aipref) 워킹그룹에서 진행 중이며, 2026년 8월 현재 RFC로 나온 것은 아직 없다.
언제 쓰나
언제 안 쓰나
진짜로 가려야 하는 정보에는 쓰면 안 된다. "가져가지 말아달라"는 부탁일 뿐이고, 오히려 숨기고 싶은 경로를 누구나 볼 수 있는 목록으로 공개하는 셈이 된다. 그런 건 인증으로 막아야 한다.
Claude Code에선
Anthropic도 ClaudeBot(학습), Claude-User(사용자 질문에 답하려 페이지를 가져올 때), Claude-SearchBot(검색 품질) 셋을 따로 두고 robots.txt를 따른다고 밝히고 있다. 그래서 ClaudeBot 하나만 막으면 나머지 둘은 그대로 들어온다.
예시
학습용 봇(ClaudeBot, GPTBot, Google-Extended)만 Disallow 로 막고 검색용 봇(Claude-SearchBot, OAI-SearchBot)은 열어두면, 학습 데이터에서는 빠지면서 AI 검색 답변에는 계속 인용된다.
바로 쓰는 프롬프트
{{사이트 성격}}에 맞는 robots.txt를 만들어줘. 학습용·검색용·사용자 요청용 봇을 나눠서 각각 열지 막을지 정하고, 그렇게 정한 이유도 함께 적어줘.jt · via term-research · 복사 0 · KO