W tym artykule
Czym jest robots.txt?
robots.txt to plik tekstowy umieszczony w katalogu głównym strony internetowej, ktory informuje roboty sieciowe, ktore strony moga lub nie moga odwiedzac. Stosuje Protokół Wykluczania Robotow, standard od 1994 roku.
Gdy robot odwiedza witryne, najpierw sprawdza plik robots.txt. Plik zawiera dyrektywy okreslajace, ktore agenty moga uzyskac dostęp do jakich ścieżek. robots.txt jest doradczy — dobre roboty go respektuja, ale złośliwe boty moga go ignorowac.
Skladnia robots.txt
Plik używa prostej składni opartej na dyrektywach:
- User-agent — określa, ktorego robota dotycza reguły
- Disallow — blokuje dostęp do określonej ścieżki
- Allow — jawnie zezwala na dostęp do ścieżki
- Sitemap — określa URL mapy witryny XML
- Crawl-delay — sugeruje opóźnienie między kolejnymi żądaniami
Obsługiwane sa znaki wieloznaczne: * odpowiada dowolnej sekwencji, a $ koncowi URL.
Popularne wzorce robots.txt
Najuzyteczniejsze konfiguracje robots.txt:
- Zezwol na wszystko — pusta dyrektywa Disallow pozwala na pełne indeksowanie
- Zablokuj wszystko — Disallow: / blokuje wszystkie roboty
- Zablokuj roboty AI — celuj w konkretne boty AI z User-agent: GPTBot
- Zezwol tylko na Google — połącz bloki dla Googlebot i innych agentow
- Chron ścieżki admin — Disallow: /admin/, /api/
Wypróbuj za darmo — bez rejestracji
Wygeneruj robots.txt →Typowe zastosowania
Dobrze skonfigurowany robots.txt spełnia kilka ważnych funkcji:
- Optymalizacja SEO — zapobieganie indeksowaniu zduplikowanej treści
- Blokowanie scraperów — zniechęcanie botów do zbierania treści i szkolenia AI
- Ochrona środowisk staging — blokowanie robotow na serwerach testowych
- Zarządzanie budżetem indeksowania — blokowanie stron o niskiej wartości
robots.txt a SEO
robots.txt bezpośrednio wpływa na sposob odkrywania treści przez wyszukiwarki:
- Blokowanie nie oznacza deindeksacji — użyj meta tagu noindex
- Zawsze dolaczaj mape witryny — dodaj dyrektywe Sitemap
- Nie blokuj plikow CSS ani JavaScript — wyszukiwarki potrzebuja ich do renderowania
- Typowe błędy — przypadkowe zablokowanie całych katalogow moze zaszkodzic SEO
Często zadawane pytania
Czy robots.txt jest obowiązkowy czy doradczy?
robots.txt jest całkowicie doradczy. Dla poufnych treści użyj kontroli dostępu po stronie serwera.
Jak przetestowac plik robots.txt?
Google Search Console oferuje tester robots.txt. Można tez używać walidatorow online.
Czy Google respektuje Crawl-delay w robots.txt?
Nie, Google nie obsługuje Crawl-delay. Użyj ustawien prędkości indeksowania w Google Search Console. Bing respektuje Crawl-delay.