robots.txt
robots txt
뜻과 개념
웹사이트가 크롤러에 접근 가능한 경로를 안내하는 파일입니다.
어떻게 작동하나요?
크롤러는 사이트의 robots.txt에서 자신에게 해당하는 경로 규칙을 확인할 수 있습니다. User-agent로 적용 대상을 정하고, Disallow와 Allow 같은 규칙으로 수집 범위를 안내합니다. 방문자의 로그인 여부를 검사하거나 파일을 암호화하는 기능은 아닙니다.
이 파일은 사이트의 루트 주소에 있어야 합니다. 별도 서브도메인이나 프로토콜을 사용한다면 적용 범위를 혼동하지 말아야 합니다. 규칙을 수정할 때는 ‘어떤 주소의 어떤 봇에게 적용되는가’를 분리해서 확인하는 것이 좋습니다.
왜 알아야 하나요?
상품 필터 조합이나 내부 기능 때문에 주소가 계속 늘어나는 사이트에서는 크롤링 경로 관리가 필요할 수 있습니다. 하지만 작은 사이트에서 이유 없이 많은 경로를 차단하면 필요한 콘텐츠까지 읽지 못하게 만들 수 있습니다. 파일을 복잡하게 만드는 것 자체가 최적화는 아닙니다.
실무에서 적용하는 방법
먼저 실제로 차단하려는 주소와 그 이유를 적습니다. 개인정보 보호가 목적이면 접근 인증을, 검색 결과 제외가 목적이면 색인 제어를 검토해야 합니다. 크롤러의 요청 경로 관리가 목적일 때 robots.txt 규칙을 설계합니다.
수정 전후의 파일을 보관하고 대표 URL을 골라 규칙 적용을 테스트합니다. 메인 콘텐츠와 화면 이해에 필요한 CSS·JavaScript까지 막히지 않았는지 확인하세요. 서버에 파일을 올렸다는 사실과 검색엔진이 최신 파일을 읽었다는 사실은 구분해서 확인합니다.
배포 전에는 규칙이 적용될 실제 주소를 몇 개 골라 예상 결과를 적어 봅니다. 메인과 서비스 상세는 허용되는지, 관리용 경로는 의도한 대로 처리되는지, 이미지나 스타일 파일을 잘못 막지 않는지 확인하세요. 규칙을 바꾼 날짜와 이유를 남기면 나중에 수집 문제가 생겼을 때 원인을 좁히기 쉽습니다. 기존 파일 전체를 교체하기보다 필요한 경로의 변경 범위를 명확하게 유지하는 것이 좋습니다.
실무에서는 이렇게 봅니다
쇼핑몰에서 정렬 방식만 다른 URL이 많이 만들어진다고 가정해 보겠습니다. 먼저 그 주소들이 별도 검색 페이지로 필요한지, 원본과 내용이 같은지 조사합니다. 단순히 주소에 물음표가 있다는 이유로 전부 막으면 검색 가치가 있는 필터 페이지도 영향을 받을 수 있습니다. 필요한 페이지를 정한 뒤 제한 범위를 좁혀 적용하는 방식이 더 안전합니다.
운영 사이트를 복제해 만든 테스트 사이트라면 robots.txt 한 줄만 보고 외부 공개 여부를 판단하지 않습니다. 로그인 보호가 필요한 곳인지, 검색 제외가 필요한 곳인지 각각 목적을 정하고 실제 응답을 확인합니다.
주의할 점
robots.txt는 보안 장치가 아니며, 모든 크롤러가 규칙을 따르는 것도 아닙니다. 또한 차단된 웹페이지의 주소가 외부 링크 등을 통해 검색에 알려질 수 있습니다. Noindex를 읽게 하려는 페이지를 먼저 차단하면 목적과 충돌할 수 있으므로 두 설정을 함께 검토해야 합니다.
자주 묻는 질문
Disallow에 관리자 경로를 적으면 안전한가요?
경로를 적어도 사람이 직접 접근하는 것을 막지는 못합니다. 관리자는 세션 인증과 권한 검사로 보호하고 robots.txt는 수집 안내로만 생각해야 합니다.
모든 사이트에 복잡한 robots.txt가 필요한가요?
아닙니다. 명확히 관리해야 할 경로가 없다면 불필요한 차단 규칙을 늘릴 이유가 없습니다. 기존 규칙이 어떤 문제를 해결하는지 설명할 수 있어야 합니다.