Robots.txt
Czym jest plik robots.txt
Robots.txt to plik tekstowy umieszczany w głównym katalogu domeny, który zawiera instrukcje dla robotów wyszukiwarek. Określa on, które części serwisu mogą być skanowane, a które powinny zostać pominięte. Jest to jeden z pierwszych elementów, jakie robot sprawdza podczas odwiedzin witryny. Dzięki niemu właściciel strony może zarządzać ruchem crawlerów i chronić przed indeksacją wybrane sekcje, na przykład panele administracyjne czy strony testowe.
Jak działa i jak go skonfigurować
Plik korzysta z prostej składni opartej na dyrektywach takich jak User-agent, Disallow i Allow. Za ich pomocą można wskazać konkretnym robotom, do jakich zasobów mają dostęp. W pliku robots.txt umieszcza się również odnośnik do mapy serwisu. Ważne, aby konfigurować go ostrożnie, ponieważ błędne zablokowanie istotnych sekcji może całkowicie wykluczyć je z wyników wyszukiwania.
Najczęstsze błędy i dobre praktyki
Do typowych pomyłek należy przypadkowe zablokowanie całej witryny, blokowanie zasobów CSS i JavaScript potrzebnych do prawidłowego renderowania strony czy mylenie robots.txt z mechanizmem noindex. Warto pamiętać, że plik ten steruje skanowaniem, a nie indeksacją — zablokowany adres i tak może pojawić się w wynikach, jeśli prowadzą do niego linki. Regularna weryfikacja pliku pozwala uniknąć poważnych problemów z widocznością.