Robots.txt (ang. Robots Exclusion Protocol) to zwykły plik tekstowy umieszczony w katalogu głównym domeny (np. https://twojadomena.pl/robots.txt), który za pomocą dyrektyw User-agent, Disallow i Allow informuje roboty wyszukiwarek oraz boty AI, których adresów URL nie powinny skanować. Dla marketera i specjalisty SEO to pierwsze narzędzie kontroli nad tym, jak Googlebot, Bingbot czy GPTBot poruszają się po serwisie – i jak wydają ograniczony crawl budget. Źle skonfigurowany robots.txt potrafi w jednej linijce odciąć cały sklep od wyszukiwarki, dlatego warto rozumieć, co robi, a czego nie robi.
Jak działa plik robots.txt?
Zanim robot zacznie skanować stronę, pobiera plik robots.txt i sprawdza, które ścieżki są dla niego zablokowane. Reguły grupuje się według nazwy bota (User-agent), a następnie podaje ścieżki zabronione (Disallow) lub wyjątki (Allow). Protokół został ustandaryzowany w dokumencie RFC 9309 i jest respektowany przez wszystkie duże wyszukiwarki, choć stosowanie się do niego jest dobrowolne – nieuczciwe boty mogą go po prostu zignorować.
Kluczowa zasada: robots.txt steruje skanowaniem (crawlingiem), a nie indeksacją. Zablokowany adres nadal może pojawić się w wynikach Google, jeśli prowadzą do niego linki z innych stron – wyświetli się wtedy bez opisu, z komunikatem w Search Console „Zindeksowano, choć plik robots.txt zablokował dostęp”. Aby usunąć stronę z indeksu, trzeba pozwolić na jej skanowanie i użyć metatagu noindex.
Jak skonfigurować robots.txt – podstawowe dyrektywy
| Dyrektywa | Przykład | Efekt |
|---|---|---|
| User-agent | User-agent: * | Reguły dotyczą wszystkich robotów |
| Disallow | Disallow: /koszyk/ | Blokuje skanowanie katalogu koszyka |
| Allow | Allow: /blog/ | Wyjątek od szerszej blokady |
| Sitemap | Sitemap: https://domena.pl/sitemap.xml | Wskazuje mapę witryny |
| Blokada bota AI | User-agent: GPTBotDisallow: / | Zakaz skanowania dla crawlera OpenAI |
Google nie obsługuje dyrektyw Crawl-delay ani Noindex w robots.txt, a plik odczytuje maksymalnie do rozmiaru 500 KiB. Szczegóły składni opisuje oficjalna dokumentacja Google Search Central.
Kiedy warto blokować, a kiedy nie?
- Warto blokować: wyniki wyszukiwania wewnętrznego, filtry generujące tysiące kombinacji parametrów, koszyk, panel logowania, środowiska testowe – to oszczędza crawl budget na dużych serwisach.
- Nie blokuj: plików CSS i JavaScript, które Google potrzebuje do renderowania strony, ani adresów, które chcesz usunąć z indeksu (użyj
noindex). - Boty AI: decyzja o zablokowaniu GPTBot, ClaudeBot czy PerplexityBot zależy od strategii – blokada chroni treści przed użyciem w trenowaniu modeli, ale może ograniczyć widoczność marki w odpowiedziach asystentów AI. Uzupełnieniem robots.txt bywa plik llms.txt, który zamiast zabraniać, podpowiada modelom językowym, które treści są najważniejsze.
Najczęstsze błędy w robots.txt
- Pozostawienie
Disallow: /po migracji ze środowiska deweloperskiego – cała witryna znika z wyszukiwarki. - Traktowanie robots.txt jako narzędzia do ukrywania danych wrażliwych – plik jest publiczny i każdy może go odczytać.
- Blokowanie zasobów CSS/JS, co psuje renderowanie i ocenę Core Web Vitals.
- Umieszczenie pliku w podkatalogu zamiast w katalogu głównym – roboty go nie znajdą.
- Brak wpisu
Sitemap, który ułatwia odkrywanie nowych adresów.
Robots.txt w praktyce ICBM
W ramach usługi pozycjonowania audyt robots.txt to jeden z pierwszych kroków technicznych. Sprawdzamy, czy plik nie odcina istotnych sekcji, testujemy reguły w Google Search Console i porównujemy je z logami serwera, aby zobaczyć, gdzie roboty faktycznie marnują czas. W sklepach z rozbudowaną nawigacją fasetową dobrze zaprojektowane reguły blokujące parametry filtrów często realnie przyspieszają skanowanie nowych produktów. Coraz częściej doradzamy też klientom, jak świadomie ustawić dostęp dla botów AI, łącząc robots.txt z llms.txt. Więcej pojęć technicznych znajdziesz w kategorii SEO w bazie wiedzy.
Najczęściej zadawane pytania
Czy robots.txt usuwa stronę z wyników Google?
Nie. Plik blokuje jedynie skanowanie, a Google może zindeksować zablokowany adres na podstawie linków zewnętrznych. Aby usunąć stronę z indeksu, odblokuj ją w robots.txt i dodaj metatag noindex lub nagłówek X-Robots-Tag.
Czym różni się robots.txt od llms.txt?
Robots.txt to standard zakazujący skanowania określonych ścieżek konkretnym botom. Llms.txt to nowsza, nieoficjalna propozycja pliku, który w formacie Markdown wskazuje modelom AI najważniejsze treści witryny i ich streszczenia – ma pomagać, a nie blokować.
Jak sprawdzić, czy mój robots.txt działa poprawnie?
Otwórz adres twojadomena.pl/robots.txt w przeglądarce i sprawdź, czy plik zwraca kod 200. Następnie użyj raportu robots.txt oraz narzędzia „Sprawdź URL” w Google Search Console, aby zobaczyć, czy konkretne adresy są dostępne dla Googlebota.
