AI crawlery 2026: kdo je kdo, co jde zablokovat v robots.txt a co ne
„Zablokujte AI boty v robots.txt" je rada, kterou dnes najdete skoro všude. Málokterý zdroj ale řekne, že polovina jmenovaných botů vůbec crawler nemá, a další polovina robots.txt klidně ignoruje. Tenhle přehled je postavený na primárních zdrojích jednotlivých firem (viz Zdroje), ne na sekundárních shrnutích, a je to tentýž seznam, jaký používá kontrola ACC-01 v naší auditní aplikaci (config/).
Kdo je kdo
| Token | Provozovatel | Účel | Respektuje robots.txt? |
|---|---|---|---|
GPTBot | OpenAI | Trénink modelů | Ano |
OAI-SearchBot | OpenAI | Indexace pro ChatGPT search | Ano |
ChatGPT-User | OpenAI | Fetch na dotaz uživatele v reálném čase | „Nemusí platit" (user- |
ClaudeBot | Anthropic | Trénink modelů | Ano |
Claude-User / Claude-SearchBot | Anthropic | Fetch na dotaz / indexace pro vyhledávání | Ano |
PerplexityBot | Perplexity | Indexace | Ano |
Perplexity-User | Perplexity | Fetch na dotaz uživatele | Ne, dokumentováno |
Google-Extended | Opt-out token z trénování | Nemá vlastní crawler | |
Applebot-Extended | Apple | Opt-out token z trénování | Nemá vlastní crawler |
CCBot | Common Crawl | Dataset používaný k trénování | Ano, i nestandardní Crawl-delay |
Bytespider | ByteDance | Trénink | Nespolehlivě |
Meta-ExternalAgent | Meta | Trénink a indexace | Ano |
Meta-ExternalFetcher | Meta | Fetch iniciovaný uživatelem (agentic AI) | Může obcházet |
DuckAssistBot | DuckDuckGo | Fetch pro DuckAssist | Ano, opt-out se projeví až po 72 h |
Kompletní seznam včetně Mistral AI trojice (MistralAI-User, MistralAI-, MistralAI-) a Amazonbot je v config/ naší aplikace, přímo ve formátu, který audit vyhodnocuje.
Dva tokeny, které nejsou crawlery
Google- a Applebot- se v seznamech objevují vedle skutečných crawlerů, ale jsou to jiná kategorie. Google to říká doslova: „Google-robots.txt token, který řídí, jestli se data nasbíraná běžným Googlebotem smí použít k tréninku Gemini. Google dodává, že Google- neovlivňuje zařazení webu ve vyhledávání ani řazení výsledků.
Applebot- funguje stejně, je to totiž sekundární token nad běžným Applebotem, který určuje jen to, jestli se už nasbíraná data smí použít k tréninku Apple Intelligence. Blokace neovlivní Siri ani Spotlight. Když popisujete tyhle dva tokeny jako „boty, kteří navštěvují váš web", je to nepřesné. Web navštěvuje Googlebot/
Co v robots.txt nejde spolehlivě vynutit
U tří botů je zápis do robots.txt slabý nebo nefunkční nástroj:
Perplexity-dokumentovaněUser robots.txtignoruje, a Perplexity to sama píše ve své dokumentaci. Cloudflare navíc v srpnu 2025 zaznamenal nedeklarované crawlery Perplexity s rotujícími user-agenty a IP adresami.Meta-je fetch iniciovaný uživatelem (na rozdíl odExternalFetcher Meta-) a Meta sama dokumentuje, že můžeExternalAgent robots.txtobcházet.Bytespider(ByteDance) nemá žádný primární zdroj, protože firma nepublikuje ani dokumentaci, ani verifikační mechanismus (IP/DNS). User-agent string je znám jen z pozorování provozu, takže shoda na UA je indicie, ne důkaz identity. Nezávislé monitoringy opakovaně zaznamenaly crawl na URL zakázaných vrobots.txt.
U Bytespideru proto samotný zápis do robots.txt nestačí, protože spolehlivé vynucení vyžaduje blokaci na úrovni serveru (rate limit, WAF, blokace podle IP rozsahu), ne jen soubor, který bot podle všeho beztak nečte.
Co Anthropic (ne)zveřejňuje
Anthropic UA stringy pro ClaudeBot, Claude-User a Claude- oficiálně nezveřejňuje. Soubor claude. je sdílený IP allowlist, který potvrdí, že požadavek pochází od Anthropicu, ale nerozliší, který konkrétní bot to je. Legacy tokeny Claude-Web a anthropic-ai v aktuálním support článku nejsou, takže na ty se nespoléhejte.
Jak zápis v robots.txt vypadá
Syntaxe je stejná jako u kteréhokoli jiného zápisu v robots.txt: blok User-agent s tokenem z tabulky výš a Disallow/Allow pod ním. Typický vzor, který blokuje trénink, ale nechá projít real-time fetch na dotaz konkrétního uživatele:
User-agent: GPTBot/Disallow: /zablokuje trénink modelů OpenAI na celém webu.User-agent: ChatGPT-User/Allow: /nechá projít fetch, který ChatGPT dělá na výslovnou žádost uživatele (typicky když se někdo zeptá na konkrétní stránku).User-agent: Bytespider/Disallow: /: zápis udělejte i tady, i když víte, že sám o sobě nestačí; je to první vrstva, ne poslední.
Blok pro Google- nebo Applebot- má stejný tvar, ale nezastaví žádnou návštěvu, jen řekne, že se data nasbíraná běžným Googlebotem/Googlebot/Applebot přímo, což ale ovlivní i klasické vyhledávání.
Jak ověřit, že požadavek je opravdu od dané firmy
User-agent string si může nastavit kdokoli, takže sám o sobě nic nedokazuje. OpenAI, Anthropic i Google publikují seznamy IP rozsahů/rDNS záznamů, proti kterým jde provoz ověřit (u Anthropicu je to claude., zmíněný výš). Než napíšete pravidlo do robots.txt jen na základě toho, co vidíte v logu jako název user-agenta, ověřte aspoň u pár requestů IP rozsah. U Bytespideru to nejde vůbec, protože ByteDance žádný takový seznam nepublikuje.
Co s tím prakticky
Rozhodnutí, které boty pustit a které blokovat, je obchodní volba (trénink vs. indexace vs. fetch na dotaz uživatele jsou tři různé věci), ne technická nutnost. Typické scénáře: e-shop, který nechce, aby jeho ceníky trénovaly cizí model, zablokuje tréninkové boty (GPTBot, ClaudeBot, Meta-), ale nechá indexační a fetch boty projít, protože chce být vidět v odpovědích. Vydavatel, který živí byznys reklamou u vlastního obsahu, může chtít zablokovat i indexaci. Dokumentační web naopak boty vítá všechny, protože jeho cílem je být citovaný co nejvíc.
Co má smysl udělat vždy, bez ohledu na zvolenou strategii: mít robots.txt aktuální a čitelný, u opt-out tokenů nečekat žádný efekt na návštěvnost a u nespolehlivých botů (Bytespider) počítat s tím, že samotný zápis nestačí.
Torumata v auditu (kontrola ACC-01) porovná váš robots.txt proti aktuálnímu seznamu a vygeneruje patch. U každého bota rovnou uvidíte, jestli je zápis vynutitelný, nebo jen deklarativní. Podrobněji o tom, co crawlery vůbec vidí, píšeme v článku JavaScript a AI crawlery.
A poslední upozornění: seznam botů se mění. Firmy přidávají nové tokeny (Mistral má dnes tři, ještě před rokem jen jeden), mění chování stávajících a příležitostně nějaký token přejmenují nebo zruší. Tenhle přehled má u každého zdroje datum poslední kontroly. Než na něm postavíte trvalé pravidlo v robots.txt, ověřte si aktuální stav přímo u zdroje, ne z paměti ani z tohoto článku za rok od publikace.
Chcete zjistit, jak je na tom váš robots.txt dnes? Spusťte bezplatný audit.
Zdroje
- OpenAI: Overview of OpenAI crawlers (ověřeno 2026-08-02)
- Anthropic Support: Does Anthropic crawl data from the web? (ověřeno 2026-08-02)
- Perplexity: Crawlers documentation (ověřeno 2026-08-02)
- Google: common crawlers and fetchers (ověřeno 2026-08-02)
- Common Crawl: CCBot (ověřeno 2026-08-02)
- Meta: web crawlers (ověřeno 2026-08-02)
- Mistral: robots (ověřeno 2026-08-02)
- Apple: Applebot-Extended (ověřeno 2026-08-02)