Analiza logów serwera w SEO
Analiza logów serwera w SEO to proces badania surowych plików tekstowych generowanych przez serwer www (np. Nginx, Apache), w których rejestrowana jest każda interakcja z witryną.
W kontekście SEO kluczowym celem tej analizy jest precyzyjne śledzenie zachowania robotów wyszukiwarek (takich jak Googlebot) – sprawdzanie, jak często, które podstrony i z jakimi rezultatami są odwiedzane. W przeciwieństwie do narzędzi analitycznych (np. Google Analytics), które śledzą jedynie ruch użytkowników wykonujących kod JavaScript, logi serwera pokazują stuprocentowo czysty, nieprzetworzony obraz wizyt botów.
Czego można się dowiedzieć z logów serwera?
Każda linijka w pliku logów zawiera twarde dane: adres IP, datę i czas, kod statusu HTTP, żądany adres URL oraz identyfikator User-Agent. Przetworzenie tych informacji pozwala uzyskać odpowiedź na kluczowe pytania:
-
Zarządzanie Crawl Budgetem: Które sekcje serwisu pochłaniają najwięcej uwagi Googlebota, a które są przez niego pomijane.
-
Błędy serwera i adresów: Wykrywanie ukrytych błędów 404 (Not Found), 5xx (Server Error) oraz pętli przekierowań 301/302, na które natrafiają wyłącznie roboty.
-
Wykrywanie Orphan Pages: Identyfikacja tzw. stron sierot – adresów URL, które są indeksowane i odwiedzane przez Googlebota, ale nie posiadają linkowania wewnętrznego w serwisie.
-
Marnowanie zasobów: Śledzenie zbędnych zapytań robota o pliki graficzne, skrypty czy adresy z parametrami filtrującymi (duplikacja treści).
-
Weryfikacja prawowitości robota: Odfiltrowanie fałszywych botów (Fake Googlebot), które podszywają się pod wyszukiwarkę, generując sztuczne obciążenie serwera.
Jak przeprowadzić analizę logów w praktyce?
Ze względu na to, że pliki logów dla dużych serwisów (np. e-commerce) potrafią ważyć po kilkadziesiąt gigabajtów i zawierać miliony wierszy, ich ręczna analiza w plikach tekstowych jest niemożliwa. Process przeprowadza się według następujących kroków:
-
Pobranie plików logów: Wyeksportowanie plików surowych (
access.log) z panelu serwera (cPanel, DirectAdmin) lub zyskanie do nich dostępu przez SSH. -
Filtrowanie danych: Wyselekcjonowanie nagłówków User-Agent należących wyłącznie do robotów wyszukiwarek (np. Googlebot Smartphone).
-
Weryfikacja DNS (Reverse DNS): Sprawdzenie autentyczności adresów IP, aby odrzucić podszywające się pod Googleboty scrapery.
-
Import do narzędzia analitycznego: Wgranie przetworzonych danych do dedykowanych programów, takich jak Screaming Frog Log File Analyser, OnCrawl, Botify czy narzędzi typu ELK Stack (Elasticsearch, Logstash, Kibana).
-
Korelacja z danymi SEO: Zestawienie częstotliwości wizyt robota ze strukturą linkowania wewnętrznego, mapą strony XML oraz pozycjami w wynikach wyszukiwania.