robots.txt: jak sprawdzić, co wolno crawlerom?
robots.txt steruje dostępem robotów do ścieżek witryny, ale łatwo przypisać mu funkcje, których nie ma. Najważniejsze jest rozdzielenie crawlowania od indeksowania.
Sprawdź swój robots.txtCo znajduje się w robots.txt?
Plik jest zwykle dostępny pod adresem /robots.txt. Zawiera grupy User-agent oraz reguły Allow i Disallow. Może też wskazywać lokalizację mapy witryny przez dyrektywę Sitemap. Sama obecność pliku nie oznacza, że jego reguły są poprawne.
Disallow nie jest noindex
Disallow mówi crawlerowi, aby nie pobierał określonej ścieżki. To nie jest równoważne z meta robots noindex. Jeżeli URL jest znany z innych źródeł, wyszukiwarka może nadal znać jego adres. Dlatego diagnoza indeksowania powinna sprawdzać robots.txt i noindex osobno.
Najgroźniejsza pomyłka
Reguła User-agent: * połączona z Disallow: / blokuje crawlowanie całej witryny dla robotów respektujących plik. Taki zapis bywa pozostawiany po środowisku testowym i potrafi odciąć wyszukiwarkę od strony produkcyjnej.
Jak sprawdzić plik poprawnie?
Trzeba zweryfikować kod HTTP pliku, jego rzeczywistą treść, grupy User-agent, reguły dla poszczególnych ścieżek oraz deklaracje Sitemap. Tester ASK WebAudit pokazuje te elementy oddzielnie i nie oznacza braku reguł jako automatycznej katastrofy.
Co dalej po wykryciu blokady?
Najpierw ustal, czy blokada jest zamierzona. Nie usuwaj reguł chroniących obszary techniczne tylko po to, aby uzyskać zielony wynik. Poprawiaj wyłącznie te reguły, które rzeczywiście blokują publiczną treść przeznaczoną do crawlowania.
