AI crawlery 2026: kdo je kdo, co jde zablokovat v robots.txt a co ne

„Zablokujte AI boty v robots.txt" je rada, kterou dnes najdete skoro všude. Málokterý zdroj ale řekne, že polovina jmenovaných botů vůbec crawler nemá, a další polovina robots.txt klidně ignoruje. Tenhle přehled je postavený na primárních zdrojích jednotlivých firem (viz Zdroje), ne na sekundárních shrnutích, a je to tentýž seznam, jaký používá kontrola ACC-01 v naší auditní aplikaci (config/ai-bots.json).

Kdo je kdo

TokenProvozovatelÚčelRespektuje robots.txt?
GPTBotOpenAITrénink modelůAno
OAI-SearchBotOpenAIIndexace pro ChatGPT searchAno
ChatGPT-UserOpenAIFetch na dotaz uživatele v reálném čase„Nemusí platit" (user-initiated)
ClaudeBotAnthropicTrénink modelůAno
Claude-User / Claude-SearchBotAnthropicFetch na dotaz / indexace pro vyhledáváníAno
PerplexityBotPerplexityIndexaceAno
Perplexity-UserPerplexityFetch na dotaz uživateleNe, dokumentováno
Google-ExtendedGoogleOpt-out token z trénováníNemá vlastní crawler
Applebot-ExtendedAppleOpt-out token z trénováníNemá vlastní crawler
CCBotCommon CrawlDataset používaný k trénováníAno, i nestandardní Crawl-delay
BytespiderByteDanceTréninkNespolehlivě
Meta-ExternalAgentMetaTrénink a indexaceAno
Meta-ExternalFetcherMetaFetch iniciovaný uživatelem (agentic AI)Může obcházet
DuckAssistBotDuckDuckGoFetch pro DuckAssistAno, opt-out se projeví až po 72 h

Kompletní seznam včetně Mistral AI trojice (MistralAI-User, MistralAI-Index, MistralAI-Training) a Amazonbot je v config/ai-bots.json naší aplikace, přímo ve formátu, který audit vyhodnocuje.

Dva tokeny, které nejsou crawlery

Google-Extended a Applebot-Extended se v seznamech objevují vedle skutečných crawlerů, ale jsou to jiná kategorie. Google to říká doslova: „Google-Extended doesn't have a separate HTTP request user agent string. Crawling is done with existing Google user agent strings." Je to jen robots.txt token, který řídí, jestli se data nasbíraná běžným Googlebotem smí použít k tréninku Gemini. Google dodává, že Google-Extended neovlivňuje zařazení webu ve vyhledávání ani řazení výsledků.

Applebot-Extended funguje stejně, je to totiž sekundární token nad běžným Applebotem, který určuje jen to, jestli se už nasbíraná data smí použít k tréninku Apple Intelligence. Blokace neovlivní Siri ani Spotlight. Když popisujete tyhle dva tokeny jako „boty, kteří navštěvují váš web", je to nepřesné. Web navštěvuje Googlebot/Applebot a tokeny jen mění, co se s daty smí dělat dál.

Co v robots.txt nejde spolehlivě vynutit

U tří botů je zápis do robots.txt slabý nebo nefunkční nástroj:

  • Perplexity-User dokumentovaně robots.txt ignoruje, a Perplexity to sama píše ve své dokumentaci. Cloudflare navíc v srpnu 2025 zaznamenal nedeklarované crawlery Perplexity s rotujícími user-agenty a IP adresami.
  • Meta-ExternalFetcher je fetch iniciovaný uživatelem (na rozdíl od Meta-ExternalAgent) a Meta sama dokumentuje, že může robots.txt obcházet.
  • Bytespider (ByteDance) nemá žádný primární zdroj, protože firma nepublikuje ani dokumentaci, ani verifikační mechanismus (IP/DNS). User-agent string je znám jen z pozorování provozu, takže shoda na UA je indicie, ne důkaz identity. Nezávislé monitoringy opakovaně zaznamenaly crawl na URL zakázaných v robots.txt.

U Bytespideru proto samotný zápis do robots.txt nestačí, protože spolehlivé vynucení vyžaduje blokaci na úrovni serveru (rate limit, WAF, blokace podle IP rozsahu), ne jen soubor, který bot podle všeho beztak nečte.

Co Anthropic (ne)zveřejňuje

Anthropic UA stringy pro ClaudeBot, Claude-User a Claude-SearchBot oficiálně nezveřejňuje. Soubor claude.com/crawling/bots.json je sdílený IP allowlist, který potvrdí, že požadavek pochází od Anthropicu, ale nerozliší, který konkrétní bot to je. Legacy tokeny Claude-Web a anthropic-ai v aktuálním support článku nejsou, takže na ty se nespoléhejte.

Jak zápis v robots.txt vypadá

Syntaxe je stejná jako u kteréhokoli jiného zápisu v robots.txt: blok User-agent s tokenem z tabulky výš a Disallow/Allow pod ním. Typický vzor, který blokuje trénink, ale nechá projít real-time fetch na dotaz konkrétního uživatele:

  • User-agent: GPTBot / Disallow: / zablokuje trénink modelů OpenAI na celém webu.
  • User-agent: ChatGPT-User / Allow: / nechá projít fetch, který ChatGPT dělá na výslovnou žádost uživatele (typicky když se někdo zeptá na konkrétní stránku).
  • User-agent: Bytespider / Disallow: /: zápis udělejte i tady, i když víte, že sám o sobě nestačí; je to první vrstva, ne poslední.

Blok pro Google-Extended nebo Applebot-Extended má stejný tvar, ale nezastaví žádnou návštěvu, jen řekne, že se data nasbíraná běžným Googlebotem/Applebotem nesmí použít k tréninku. Pokud chcete zastavit i samotné procházení, musíte blokovat Googlebot/Applebot přímo, což ale ovlivní i klasické vyhledávání.

Jak ověřit, že požadavek je opravdu od dané firmy

User-agent string si může nastavit kdokoli, takže sám o sobě nic nedokazuje. OpenAI, Anthropic i Google publikují seznamy IP rozsahů/rDNS záznamů, proti kterým jde provoz ověřit (u Anthropicu je to claude.com/crawling/bots.json, zmíněný výš). Než napíšete pravidlo do robots.txt jen na základě toho, co vidíte v logu jako název user-agenta, ověřte aspoň u pár requestů IP rozsah. U Bytespideru to nejde vůbec, protože ByteDance žádný takový seznam nepublikuje.

Co s tím prakticky

Rozhodnutí, které boty pustit a které blokovat, je obchodní volba (trénink vs. indexace vs. fetch na dotaz uživatele jsou tři různé věci), ne technická nutnost. Typické scénáře: e-shop, který nechce, aby jeho ceníky trénovaly cizí model, zablokuje tréninkové boty (GPTBot, ClaudeBot, Meta-ExternalAgent), ale nechá indexační a fetch boty projít, protože chce být vidět v odpovědích. Vydavatel, který živí byznys reklamou u vlastního obsahu, může chtít zablokovat i indexaci. Dokumentační web naopak boty vítá všechny, protože jeho cílem je být citovaný co nejvíc.

Co má smysl udělat vždy, bez ohledu na zvolenou strategii: mít robots.txt aktuální a čitelný, u opt-out tokenů nečekat žádný efekt na návštěvnost a u nespolehlivých botů (Bytespider) počítat s tím, že samotný zápis nestačí.

Torumata v auditu (kontrola ACC-01) porovná váš robots.txt proti aktuálnímu seznamu a vygeneruje patch. U každého bota rovnou uvidíte, jestli je zápis vynutitelný, nebo jen deklarativní. Podrobněji o tom, co crawlery vůbec vidí, píšeme v článku JavaScript a AI crawlery.

A poslední upozornění: seznam botů se mění. Firmy přidávají nové tokeny (Mistral má dnes tři, ještě před rokem jen jeden), mění chování stávajících a příležitostně nějaký token přejmenují nebo zruší. Tenhle přehled má u každého zdroje datum poslední kontroly. Než na něm postavíte trvalé pravidlo v robots.txt, ověřte si aktuální stav přímo u zdroje, ne z paměti ani z tohoto článku za rok od publikace.

Chcete zjistit, jak je na tom váš robots.txt dnes? Spusťte bezplatný audit.

Zdroje