Generator robots.txt

Zaznaczasz, czego roboty mają nie ruszać, i dostajesz gotowy plik do wgrania na serwer. Osobno decydujesz o robotach AI, bo jedne uczą na Twoich tekstach modele, a inne szukają odpowiedzi dla kogoś, kto właśnie pyta ChatGPT.

Twój plik robots.txt

    Działa w Twojej przeglądarce. Tego, co tu wpisujesz, nigdzie nie wysyłamy ani nie zapisujemy.

    Jak z tego korzystać

    1. Wybierz, na czym stoi strona. Dla WordPressa i sklepu generator sam dopisze katalogi, których roboty nie powinny przeglądać: panel, koszyk, konto klienta, wyniki wyszukiwarki na stronie.
    2. Zdecyduj o robotach AI.
    3. Wklej adres mapy strony, czyli pliku z listą wszystkich podstron (zwykle twojastrona.pl/sitemap.xml albo sitemap_index.xml). Dzięki temu roboty szybciej trafiają na nowe wpisy.
    4. Skopiuj wynik albo pobierz plik i wgraj go do głównego katalogu strony.

    Co tak naprawdę robi ten plik

    robots.txt to pierwsza rzecz, o którą robot pyta, zanim zacznie chodzić po stronie. Każda grupa zaczyna się od User-agent, czyli nazwy robota (gwiazdka oznacza wszystkie), a pod spodem są ścieżki, do których ma nie wchodzić (Disallow) albo wyjątki (Allow).

    Na małej stronie firmowej plik ma zwykle trzy, cztery linijki i to wystarczy. Blokuje się rzeczy, które nie mają sensu w wyszukiwarce: panel, koszyk, wewnętrzną wyszukiwarkę. Nie blokuje się plików CSS i JavaScript, bo Google musi zobaczyć stronę tak jak człowiek.

    Najczęstszy błąd

    Disallow: / przy User-agent: *. Jedna kreska blokuje całą stronę. Zostaje często po budowie strony, kiedy wykonawca zablokował wersję roboczą i zapomniał zdjąć blokadę po starcie. Jeśli strona od miesięcy nie pojawia się w Google, zacznij od sprawdzenia tego pliku.

    Roboty AI: dwa rodzaje

    RobotCzyjCo robi
    GPTBotOpenAIzbiera teksty do uczenia modeli
    OAI-SearchBot, ChatGPT-UserOpenAIszuka i otwiera strony, gdy ktoś pyta ChatGPT
    ClaudeBotAnthropiczbiera teksty do uczenia modeli
    Claude-SearchBot, Claude-UserAnthropicszuka i otwiera strony, gdy ktoś pyta Claude'a
    Google-ExtendedGooglezgoda na użycie tekstów w Gemini (nie wpływa na zwykłe Google)
    PerplexityBot, Perplexity-UserPerplexitybuduje wyszukiwarkę Perplexity i otwiera strony dla pytających
    CCBotCommon Crawlpubliczne archiwum internetu, z którego uczy się wiele modeli
    Bytespider, meta-externalagent, Applebot-ExtendedByteDance, Meta, Applezbierają teksty do uczenia modeli

    Pytania

    Gdzie wgrać plik robots.txt?
    Do głównego katalogu strony, tak żeby otwierał się pod adresem twojastrona.pl/robots.txt. W innym miejscu roboty go nie znajdą. W WordPressie najprościej zrobić to wtyczką Yoast albo Rank Math (mają edytor pliku), w Webflow w ustawieniach strony w zakładce SEO.
    Czy robots.txt usunie stronę z Google?
    Nie. Ten plik mówi tylko „nie wchodź tutaj”. Jeśli do zablokowanej podstrony prowadzą linki, Google może ją nadal pokazywać, tyle że bez opisu. Żeby podstrona zniknęła z wyników, trzeba dać jej znacznik noindex i właśnie nie blokować jej w robots.txt, bo inaczej robot tego znacznika nie zobaczy.
    Czy zablokować roboty AI?
    Zależy, po co masz stronę. Jeśli żyjesz z tego, że ludzie Cię znajdują, to roboty, które szukają odpowiedzi dla użytkowników ChatGPT czy Perplexity, są Ci potrzebne tak samo jak robot Google. Zablokowanie ich oznacza, że AI nie poleci Twojej firmy, bo nie będzie wiedzieć, co oferujesz. Roboty zbierające teksty do uczenia modeli to inna sprawa i tu wybór jest Twój. Domyślne ustawienie generatora wpuszcza jedne i drugie.
    Czy roboty muszą słuchać robots.txt?
    Nie muszą. To prośba, nie zamek. Google, Bing, OpenAI, Anthropic i Perplexity deklarują, że jej przestrzegają. Spamerskie roboty ją ignorują. Niczego poufnego nie chroń tym plikiem, bo każdy może go przeczytać i zobaczyć, co próbujesz ukryć.
    Czy potrzebuję Crawl-delay?
    Raczej nie. Google tej dyrektywy nie czyta. Przy małej stronie roboty i tak nie obciążają serwera, więc generator jej nie dodaje.

    Inne darmowe narzędzia