Dyrektywy Allow i Disallow w robots.txt
Dyrektywy Allow i Disallow to podstawowe komendy używane w pliku robots.txt, za pomocą których właściciele stron internetowych kontrolują dostęp robotów indeksujących (takich jak Googlebot) do poszczególnych katalogów, podstron i zasobów serwera.
Plik robots.txt stanowi pierwszą instrukcję odczytywaną przez robota podczas odwiedzin w domenie. Komendy Disallow oraz Allow pozwalają precyzyjnie wskazać, które obszary serwisu mogą być skanowane (crawlowane), a które powinny zostać zignorowane w celu ochrony zasobów serwera i optymalizacji indeksacji.
Czym różnią się dyrektywy Allow i Disallow?
Obie komendy działają na zasadzie wskazania konkretnego ścieżkowego adresu URL i są przypisywane do konkretnego robota (określonego w sekcji User-agent):
-
Disallow (Zakaz dostępu): Wskazuje robotowi adresy URL, kategorie, sekcje lub konkretne pliki, do których nie powinien wchodzić. Zablokowany zasób nie zostanie pobrany przez robota podczas procesu crawlingu.
-
Allow (Zezwolenie na dostęp): Służy do odblokowania konkretnego podkatalogu lub pliku znajdującego się wewnątrz sekcji, która wcześniej została zablokowana komendą Disallow. Jest to dyrektywa precyzująca i odwołująca zakaz dla wybranego elementu.
Wpływ dyrektyw na SEO i najważniejsze zasady
Stosowanie dyrektyw Allow i Disallow ma krytyczne znaczenie dla prawidłowej optymalizacji pod kątem wyszukiwarek:
-
Optymalizacja Crawl Budgetu: Blokowanie skanowania stron wyników wyszukiwania wewnętrznego, stron koszyka czy paneli logowania pozwala robotom skupić moc na kluczowych stronach produktowych i wpisach blogowych.
-
Ważna różnica między brakiem skanowania a brakiem indeksacji: Dyrektywa Disallow blokuje wyłącznie robotowi możliwość odwiedzenia strony (crawling). Jeśli zablokowana strona posiada silne linki zewnętrzne, Googlebot i tak może dodać jej URL do indeksu (z komunikat zablokowano w pliku robots.txt). Aby całkowicie wykluczyć stronę z indeksu, należy użyć znacznika meta robots noindex, a strona nie może być zablokowana w pliku robots.txt.
-
Ochrona zasobów graficznych i CSS: Dawniej blokowano foldery z plikami stylów i skryptów. Obecnie Googlebot musi mieć dostęp do zasobów CSS i JS (poprzez Allow), aby prawidłowo wyrenderować i ocenić wygląd oraz mobilność strony.