Przejdź do treści
Baza wiedzy / SEO i pozycjonowanie

Co to jest plik robots.txt?

Robots.txt (ang. Robots Exclusion Protocol) to zwykły plik tekstowy umieszczony w katalogu głównym domeny (np. https://twojadomena.pl/robots.txt), który za pomocą dyrektyw User-agent, Disallow i Allow informuje roboty wyszukiwarek oraz boty AI, których adresów URL nie powinny skanować. Dla marketera i specjalisty SEO to pierwsze narzędzie kontroli nad tym, jak Googlebot, Bingbot czy GPTBot poruszają się po serwisie – i jak wydają ograniczony crawl budget. Źle skonfigurowany robots.txt potrafi w jednej linijce odciąć cały sklep od wyszukiwarki, dlatego warto rozumieć, co robi, a czego nie robi.

Jak działa plik robots.txt?

Zanim robot zacznie skanować stronę, pobiera plik robots.txt i sprawdza, które ścieżki są dla niego zablokowane. Reguły grupuje się według nazwy bota (User-agent), a następnie podaje ścieżki zabronione (Disallow) lub wyjątki (Allow). Protokół został ustandaryzowany w dokumencie RFC 9309 i jest respektowany przez wszystkie duże wyszukiwarki, choć stosowanie się do niego jest dobrowolne – nieuczciwe boty mogą go po prostu zignorować.

Kluczowa zasada: robots.txt steruje skanowaniem (crawlingiem), a nie indeksacją. Zablokowany adres nadal może pojawić się w wynikach Google, jeśli prowadzą do niego linki z innych stron – wyświetli się wtedy bez opisu, z komunikatem w Search Console „Zindeksowano, choć plik robots.txt zablokował dostęp”. Aby usunąć stronę z indeksu, trzeba pozwolić na jej skanowanie i użyć metatagu noindex.

Jak skonfigurować robots.txt – podstawowe dyrektywy

DyrektywaPrzykładEfekt
User-agentUser-agent: *Reguły dotyczą wszystkich robotów
DisallowDisallow: /koszyk/Blokuje skanowanie katalogu koszyka
AllowAllow: /blog/Wyjątek od szerszej blokady
SitemapSitemap: https://domena.pl/sitemap.xmlWskazuje mapę witryny
Blokada bota AIUser-agent: GPTBot
Disallow: /
Zakaz skanowania dla crawlera OpenAI

Google nie obsługuje dyrektyw Crawl-delay ani Noindex w robots.txt, a plik odczytuje maksymalnie do rozmiaru 500 KiB. Szczegóły składni opisuje oficjalna dokumentacja Google Search Central.

Kiedy warto blokować, a kiedy nie?

  • Warto blokować: wyniki wyszukiwania wewnętrznego, filtry generujące tysiące kombinacji parametrów, koszyk, panel logowania, środowiska testowe – to oszczędza crawl budget na dużych serwisach.
  • Nie blokuj: plików CSS i JavaScript, które Google potrzebuje do renderowania strony, ani adresów, które chcesz usunąć z indeksu (użyj noindex).
  • Boty AI: decyzja o zablokowaniu GPTBot, ClaudeBot czy PerplexityBot zależy od strategii – blokada chroni treści przed użyciem w trenowaniu modeli, ale może ograniczyć widoczność marki w odpowiedziach asystentów AI. Uzupełnieniem robots.txt bywa plik llms.txt, który zamiast zabraniać, podpowiada modelom językowym, które treści są najważniejsze.

Najczęstsze błędy w robots.txt

  1. Pozostawienie Disallow: / po migracji ze środowiska deweloperskiego – cała witryna znika z wyszukiwarki.
  2. Traktowanie robots.txt jako narzędzia do ukrywania danych wrażliwych – plik jest publiczny i każdy może go odczytać.
  3. Blokowanie zasobów CSS/JS, co psuje renderowanie i ocenę Core Web Vitals.
  4. Umieszczenie pliku w podkatalogu zamiast w katalogu głównym – roboty go nie znajdą.
  5. Brak wpisu Sitemap, który ułatwia odkrywanie nowych adresów.

Robots.txt w praktyce ICBM

W ramach usługi pozycjonowania audyt robots.txt to jeden z pierwszych kroków technicznych. Sprawdzamy, czy plik nie odcina istotnych sekcji, testujemy reguły w Google Search Console i porównujemy je z logami serwera, aby zobaczyć, gdzie roboty faktycznie marnują czas. W sklepach z rozbudowaną nawigacją fasetową dobrze zaprojektowane reguły blokujące parametry filtrów często realnie przyspieszają skanowanie nowych produktów. Coraz częściej doradzamy też klientom, jak świadomie ustawić dostęp dla botów AI, łącząc robots.txt z llms.txt. Więcej pojęć technicznych znajdziesz w kategorii SEO w bazie wiedzy.

Najczęściej zadawane pytania

Czy robots.txt usuwa stronę z wyników Google?

Nie. Plik blokuje jedynie skanowanie, a Google może zindeksować zablokowany adres na podstawie linków zewnętrznych. Aby usunąć stronę z indeksu, odblokuj ją w robots.txt i dodaj metatag noindex lub nagłówek X-Robots-Tag.

Czym różni się robots.txt od llms.txt?

Robots.txt to standard zakazujący skanowania określonych ścieżek konkretnym botom. Llms.txt to nowsza, nieoficjalna propozycja pliku, który w formacie Markdown wskazuje modelom AI najważniejsze treści witryny i ich streszczenia – ma pomagać, a nie blokować.

Jak sprawdzić, czy mój robots.txt działa poprawnie?

Otwórz adres twojadomena.pl/robots.txt w przeglądarce i sprawdź, czy plik zwraca kod 200. Następnie użyj raportu robots.txt oraz narzędzia „Sprawdź URL” w Google Search Console, aby zobaczyć, czy konkretne adresy są dostępne dla Googlebota.

← Wróć do kategorii SEO i pozycjonowanie

Ustawienia cookies

Wykorzystanie plików cookie

Używamy plików cookies, aby zapewnić podstawowe funkcjonalności witryny i usprawnić korzystanie z Internetu. Dla każdej kategorii możesz zdecydować się na włączenie/wyłączenie, kiedy tylko chcesz. Aby uzyskać więcej informacji na temat plików cookie i innych wrażliwych danych, przeczytaj całą politykę prywatności.

Niezbędne pliki cookie Zawsze włączone
Te pliki cookie są niezbędne do prawidłowego funkcjonowania strony internetowej. Zapewniają podstawowe funkcje, takie jak nawigacja po stronie i dostęp do bezpiecznych obszarów. Strona nie może działać poprawnie bez tych plików cookie.
Pliki cookie dotyczące wydajności i analityki
Te pliki cookie pomagają nam zrozumieć, w jaki sposób odwiedzający korzystają z naszej strony. Zbierają informacje o liczbie odwiedzających, źródłach ruchu i sposobie poruszania się po stronie. Dane te pomagają nam ulepszać działanie witryny.
Pliki cookie dotyczące reklam i targetowania
Te pliki cookie służą do wyświetlania reklam dopasowanych do Twoich zainteresowań. Mogą być używane do tworzenia profilu Twoich preferencji i wyświetlania odpowiednich reklam na innych stronach. Wykorzystywane przez Google Ads, Facebook Ads i inne platformy reklamowe.

Więcej informacji

W przypadku jakichkolwiek pytań dotyczących naszej polityki dotyczącej plików cookie i Twoich wyborów, prosimy o kontakt.