Dostępność

robots.txt

Opracowanie: Heuriso · Weryfikacja treści:

robots.txt to publiczny plik w głównym katalogu witryny, w którym określasz zasady dostępu dla robotów. Reguły mogą dotyczyć wszystkich botów albo wskazanego rodzaju robota.

Co można w nim ustawić?

Reguły Allow i Disallow opisują dozwolone i niedozwolone ścieżki. Plik może też wskazywać adres mapy witryny. Nie każdy robot musi przestrzegać tych zasad.

Dlaczego ma znaczenie dla widoczności?

Niechciana blokada publicznej części witryny może utrudniać robotom pobieranie treści. Zanim ją usuniesz, ustal, którego bota i których stron dotyczy.

robots.txt nie zabezpiecza prywatnych danych i nie jest pewnym sposobem usuwania adresów z wyników wyszukiwania. Ochrona treści wymaga właściwej kontroli dostępu.

Dlaczego trzeba sprawdzić regułę i adres razem?

Znaczenie wpisu zależy od grupy robotów oraz ścieżki, której dotyczy. Blokada technicznego katalogu może być celowa, a podobnie wyglądająca reguła obejmująca opisy usług może utrudniać ich pobieranie. Oceniaj konkretne publiczne adresy, zamiast ograniczać się do sprawdzenia, czy plik istnieje. Zwróć uwagę, czy po migracji witryny nie pozostały ustawienia używane wcześniej na środowisku testowym.

Reguły robots.txt obowiązują dla konkretnego protokołu, hosta i portu. Ustawienia jednej subdomeny nie opisują automatycznie pozostałych. Po zmianie reguł sprawdź również dostęp do podstrony: poprawne zezwolenie nie pomoże, jeżeli serwer nadal zwraca błąd lub wymaga logowania. Dostępność ma kilka niezależnych warstw, a ten plik opisuje tylko jedną z nich.

Przed publikacją zmiany zachowaj poprzednią wersję pliku i sprawdź kilka reprezentatywnych adresów. Uwzględnij zarówno publiczną ofertę, jak i katalogi celowo ograniczone. Pozwala to wykryć zbyt szeroką regułę bez zgadywania na podstawie jednego wpisu i ułatwia cofnięcie pomyłki.

Częsty błąd: używanie blokady jako zamiennika usunięcia z indeksu

Robot może znać adres z linków, nawet gdy nie wolno mu pobrać jego zawartości. Dlatego wpis Disallow nie jest równoznaczny z poleceniem niewyświetlania strony w wyszukiwarce. Nie przechowuj też sekretów pod adresem chronionym wyłącznie takim wpisem, ponieważ plik jest publiczny. Decyzję o indeksowaniu i ochronę dostępu traktuj jako osobne zadania, dobierane do przeznaczenia strony.

Przykład

Reguła „Disallow: /” zabrania wskazanemu botowi pobierania całej witryny. „Disallow: /panel/” ogranicza tylko tę część strony.

Warto zapamiętać

Sprawdzaj konkretne reguły, zamiast usuwać wszystkie ograniczenia. Część blokad może być celowa i potrzebna.

Źródła