검색 로봇 로그 분석기
로컬 웹서버 접속 로그에서 검색 로봇을 자칭하는 User-Agent, 4xx/5xx 응답 경로, UTC 날짜별 요청 변화를 확인합니다. 이 분석기는 서버나 검색 엔진에 접속하지 않습니다.
주요 기능
- Googlebot·Bingbot·Yeti·NaverBot 등 User-Agent 주장을 분류하되 실제 신원은 인증하지 않음
- UA 주장과 요청 방식별 리다이렉트·4xx·5xx·오류 경로 집계
- UA 그룹 필터를 적용할 수 있는 UTC 날짜별 요청·오류 차트
- 명시된 rt=초 필드가 있는 로그에서만 평균·최근접 순위 p95 계산
- IP·리퍼러·원본 UA·쿼리 문자열을 제외한 집계 JSON과 오류 경로 CSV 저장
사용 방법
- 로그를 붙여 넣거나 파일로 선택하기 전에 개인정보와 비밀값을 제거합니다.
- Apache/nginx Common 또는 Combined 형식을 사용하고, 실제 사용자 로그 형식에 응답 시간이 있을 때만 끝에 rt=초를 붙입니다.
- 로컬 분석을 실행하고 UA 주장별 집계, UTC 날짜별 변화, 4xx/5xx 경로를 살펴봅니다.
- 그룹을 필터링하거나 집계를 저장하고, 공유 전에는 결과 경로도 다시 확인합니다.
활용 예시
- Bingbot 또는 Yeti를 자칭한 요청이 받은 404 경로 찾기
- 배포 후 새 경로에 크롤러처럼 보이는 요청이 도달했는지 확인하기
- 날짜별 서버 오류와 봇 UA 주장량 비교하기
- 사용자 지정 접속 로그에 rt=초가 기록됐을 때 응답 시간 검토하기
자주 묻는 질문
Googlebot 또는 Bingbot 표시가 진짜 검색 로봇이라는 뜻인가요?
아닙니다. 누구나 같은 User-Agent 문자열을 보낼 수 있습니다. 이 도구는 주장만 분류하며 identityVerified는 항상 false입니다. 실제 신원 확인은 Google·Bing이 안내한 별도 IP 또는 DNS 절차가 필요하며 이 브라우저 도구는 실행하지 않습니다.
응답 시간 칸이 비어 있는 이유는 무엇인가요?
표준 Common·Combined 형식에는 요청 지속 시간이 없습니다. 이 도구는 사용자 지정 로그 끝의 명시적 rt=초 값만 밀리초로 계산하며, 바이트 수나 시각 차이로 시간을 추정하지 않습니다.
어떤 로그 형식을 읽나요?
Apache/nginx Common·Combined의 엄격한 하위 형식입니다. 호스트, ident, 사용자, 숫자 시간대가 있는 대괄호 시각, 따옴표 HTTP 요청, 상태와 바이트를 읽습니다. Combined에는 따옴표 리퍼러와 UA가 더 있습니다. 끝의 rt=초는 선택 사항입니다. JSON·프록시/가상호스트 접두어·추가 필드는 먼저 변환해야 합니다. 잘못된 빈 줄 외의 행은 행 번호와 함께 전체 분석을 중단합니다.
이 결과로 빙이나 네이버 색인을 확인할 수 있나요?
아닙니다. 접속 로그는 이 서버에 도달한 요청에 대한 응답만 보여 줍니다. 로봇 신원, 모든 URL 발견, 렌더링, canonical 선택, 검색 노출이나 순위를 증명하지 않습니다. 색인 상태는 각 검색 엔진의 웹마스터 도구를 확인해야 합니다.
저장한 결과에는 어떤 정보가 남나요?
IP 주소, 리퍼러, 전체 User-Agent, 원본 행과 쿼리 문자열은 저장하지 않습니다. 오류 분석에 필요한 요청 방식과 경로는 포함하므로 경로 구간에 민감값이 있을 수 있습니다. 입력을 먼저 정리하고 다운로드 파일을 공유하기 전에 살펴보세요.
개인정보 안내
입력은 현재 브라우저 탭에만 머물며 앱 API로 전송하거나 브라우저 저장소에 기록하지 않습니다. DNS 조회나 URL 가져오기도 하지 않습니다. 사용 전 민감 정보를 제거하세요. 출력에는 오류 경로 구간이 남습니다. 저장본은 원본 행·IP·리퍼러·전체 UA·쿼리를 제외합니다.
댓글과 질문