robots.txt 점검
사이트의 robots.txt를 가져와 규칙과 사이트맵 선언을 점검합니다.
robots.txt 점검 도구는 입력한 사이트의 도메인에서 robots.txt 파일을 실시간으로 가져와 원문과 핵심 규칙을 한눈에 보여줍니다. 검색엔진 크롤러가 어떤 경로를 막고 있는지, 어떤 User-agent에 규칙이 걸려 있는지, 사이트맵이 제대로 선언돼 있는지를 빠르게 확인할 수 있습니다.
robots.txt는 항상 사이트 루트(/robots.txt)에 있어야 하며, 검색엔진은 크롤링 전에 이 파일을 가장 먼저 읽습니다. 실수로 중요한 페이지를 차단하면 색인에서 빠질 수 있으므로, 배포 후 이 도구로 규칙을 한 번 점검해 두는 것이 좋습니다. 도메인 또는 전체 URL을 입력하면 자동으로 루트의 robots.txt를 조회합니다.
점검 결과 읽는 법
- 원문: 서버가 응답한 robots.txt 전체 내용을 그대로 표시합니다.
- Sitemap:
Sitemap:선언으로 발견된 사이트맵 URL 목록입니다. 클릭해 바로 열어 볼 수 있습니다. - User-agent: 규칙이 적용되는 크롤러 식별자 목록입니다.
*는 모든 크롤러를 뜻합니다. - Disallow 개수: 차단 규칙(
Disallow:)이 몇 줄인지로 차단 범위를 가늠합니다.
robots.txt가 없을 때
robots.txt가 404 등으로 존재하지 않으면, 이는 표준상 전체 크롤링 허용으로 해석됩니다. 별도 차단 규칙이 없다는 뜻이므로 그 자체로 문제는 아닙니다. 다만 사이트맵 위치를 알리고 싶다면 빈 규칙이라도 파일을 두고 Sitemap: 줄을 추가하는 편이 좋습니다. 새 파일은 robots.txt 생성기로 만들고, 선언한 사이트맵이 정상인지는 사이트맵 검증기로 확인하세요.
흔한 실수
Disallow: /한 줄로 사이트 전체를 막아 색인에서 사라지는 경우.- 스테이징용 차단 규칙을 운영 배포에 그대로 올리는 경우.
- robots.txt로 막은 페이지가 색인에서 제거되리라 기대하는 경우 — 차단은 크롤링을 막을 뿐, 색인 제거는
noindex로 처리해야 합니다.
주요 지시어와 크롤러 지원 현황
robots.txt에는 여러 지시어가 있지만 검색엔진마다 인식하는 범위가 다릅니다. 점검 결과의 원문에서 다음 지시어가 보이면 의도대로 동작하는지 아래 표로 확인하세요.
| 지시어 | 의미 | Bing | |
|---|---|---|---|
User-agent | 규칙 블록이 적용될 크롤러 지정 | 지원 | 지원 |
Disallow | 해당 경로 크롤링 차단(접두사 매칭) | 지원 | 지원 |
Allow | Disallow 안에서 일부 경로만 예외 허용 | 지원 | 지원 |
Sitemap | 사이트맵 위치(절대 URL) 선언 | 지원 | 지원 |
Crawl-delay | 요청 간 대기 시간(초) | 무시 | 지원 |
Noindex | (비표준) robots.txt 내 색인 차단 시도 | 무시 | 무시 |
$ / * | 끝 고정 / 와일드카드 패턴 | 지원 | 지원 |
예시로 읽어 보기
아래 robots.txt가 점검 결과 원문에 나왔다고 가정해 봅시다.
User-agent: *Disallow: /admin/Disallow: /searchAllow: /search/helpSitemap: https://example.com/sitemap.xml
/admin/dashboard→ 차단(Disallow: /admin/에 매칭)./search?q=shoes→ 차단(/search는 접두사 매칭이라 쿼리스트링 포함 모두 막힘)./search/help→ 허용 —Disallow: /search와Allow: /search/help둘 다 매칭되지만, 구글은 더 긴(구체적인) 경로 규칙을 우선하므로 Allow가 이깁니다./about→ 허용(어떤 Disallow에도 매칭되지 않음).
흔한 실수 / 함정
- Allow와 Disallow가 동시에 매칭될 때 줄 순서로 승부가 난다고 오해하는 경우 — 구글·빙은 순서가 아니라 가장 긴(구체적인) 경로를 우선합니다.
Crawl-delay를 넣으면 구글봇 속도가 줄 거라 기대하는 경우 — 구글은 이 지시어를 무시합니다. 크롤링 속도는 Search Console에서 조정해야 합니다.Disallow: /search(슬래시 없음)와Disallow: /search/(슬래시 있음)를 같다고 보는 경우 — 전자는/searchresults까지 막지만 후자는/search/하위만 막습니다.
자주 묻는 질문
도메인만 입력해도 되나요?
robots.txt가 없다고 나옵니다. 문제인가요?
robots.txt로 페이지를 색인에서 빼려면?
입력값이 외부로 전송되나요?
관련 가이드
- robots.txt 작성법: 문법·예제·흔한 실수robots.txt의 규칙 문법과 사이트 유형별 예제, 색인을 망치는 흔한 실수를 정리했습니다.
- sitemap.xml 만들기와 제출: 색인을 앞당기는 법사이트맵 형식과 lastmod의 올바른 사용, 검색엔진별 제출 방법과 흔한 오류.