ACC-10

robots.txt zakazuje Googlebotovi celý web

KritickéPřístup pro crawlery

Co kontrola měří

V robots.txt (v tomtéž souboru, který audit stahuje pro ACC-01) se hledá jediná věc: jestli Googlebotovi zakazuje celý web. Tedy pravidlo Disallow: / ve skupině, která na Googlebota dopadá.

User-agent: Googlebot
Disallow: /

Skupina se vybírá podle specificity user-agenta tak, jak to popisuje RFC 9309 a jak to udělá skutečný robot. To je na téhle kontrole to podstatné, takže po pořádku:

  • Má Googlebot v souboru vlastní skupinu? Pak rozhoduje výhradně ona a skupina User-agent: * se pro něj celá ignoruje, i kdyby zakazovala všechno. Soubor, který má Disallow: / pod * a níž User-agent: Googlebot s Allow: /, tedy zakázaný web NENÍ a nález z něj nevzniká.
  • Nemá vlastní skupinu? Pak pro něj platí User-agent: *. Když ta zakazuje kořen, je Googlebot zakázaný stejně účinně, jako kdyby byl jmenovaný. Report v takovém případě uvede, že rozhodlo pravidlo pro *.
  • Token se porovnává celý, ne prefixem. Googlebot-Image je jiný robot. Web, který si zakázal jen indexaci obrázků, tenhle nález nedostane.
  • Allow: / ve stejné skupině zákaz kořene ruší. Při shodné délce pravidla vyhrává Allow (RFC 9309).

Co kontrola nedělá:

  • Neposuzuje dílčí zákazy cest. Disallow: /admin/ u Googlebota je normální a nález z něj nevzniká. Jde výhradně o zákaz CELÉHO webu.
  • Neověřuje, jestli jste opravdu mimo index. To by znamenalo ptát se Googlu na váš web zvenčí; my čteme jen váš vlastní soubor. Nález říká, co v něm stojí, ne co má Google ve své databázi.
  • Netýká se ostatních vyhledávačů. Bingbot ani Applebot nesledujeme; proč, je v další sekci.
  • Nemá nic společného s AI roboty. Ty řeší ACC-01 a Googlebot mezi ně nepatří. Že jsou to dvě různé věci, je celý důvod, proč tahle kontrola má vlastní kód.

Nález je na úrovni celého webu a závažnost kritická. Seznam sledovaných tokenů není v kódu, je v config/ai-bots.json pod search_gatekeepers, odděleně od seznamu AI robotů.

Jak silný důkaz za tím stojí

Nutná podmínka

Bez tohohle se vám AI vyhledávání nemá jak zobrazit. Google to má ve vlastní dokumentaci: stránka musí být zaindexovaná a způsobilá pro zobrazení s úryvkem. Nejtvrdší třída, jakou máme.

Tohle je nejsilnější tvrzení, jaké v celém auditu máme, a jediné místo, kde nemluvíme o pravděpodobnosti, ale o podmínce. Má ji ve vlastní dokumentaci Google:

„To be eligible to be shown as a supporting link in AI Overviews or AI Mode, a page must be indexed and eligible to be shown in Google Search with a snippet. There are no additional requirements.“

Čtěte to pozorně, protože na tom celý nález stojí. Nejde jen o zaindexovanou stránku, ale o stránku způsobilou k zobrazení s úryvkem. A přesně tu způsobilost Disallow: / bere.

Častá námitka zní: „vždyť zakázaná stránka se do indexu dostat může“. Je to pravda a nic to nemění. Když na zakázanou adresu vedou odkazy odjinud, Google si ji do indexu poznamenat může, ale jen jako holou adresu bez obsahu, protože si ji nesměl stáhnout. Úryvek k ní tedy nezobrazí, a druhá polovina podmínky splněná není.

Proč jen Googlebot a ne i Bingbot. Microsoft Copilot staví na indexu Bingu, takže logicky by mělo platit totéž, a docs/externi-zavislosti.md §4c to tak i odvozuje z architektury. Jenže odvození z architektury není totéž co věta v dokumentaci, a tvrzení téhle třídy smí stát jen na primárním zdroji. Vlastní vyjádření Microsoftu doložené nemáme, takže Bingbota nesledujeme. Až se ta věta najde, přibude token do configu; nová kontrola kvůli tomu vznikat nemusí.

A poznámka, která sem patří, i když se neprodává dobře: zákaz Googlebota je docela často správné rozhodnutí. Testovací a klientské verze webu, intranet, prostředí, které se do vyhledávání dostat nemá: tam to tak být má. Nález proto není výtka, ale zjištění. Když víte proč, je odpověď „ano, tak to chci“ zcela platná a report tím pro vás končí.

Jak to opravit

Nejdřív zjistěte, jestli je to záměr. Otevřete si https://vase-domena/robots.txt v prohlížeči a podívejte se, co tam skutečně je, ne to, co máte v repozitáři nebo co si pamatujete z instalace. Nejčastější příčina nečekaného zákazu je, že web vznikal na testovací adrese a robots.txt se při spuštění zapomněl vrátit zpátky.

Pokud to záměr je, nic neopravujte. Počítejte jen s tím, že takový web se ve vyhledávání Google ani v jeho AI odpovědích neobjeví a že na tom ostatní nálezy tohoto auditu nic nezmění. Dokud platí tenhle zákaz, jsou úpravy obsahu a struktury investicí do něčeho, co nikdo neuvidí.

Pokud záměr není, máte dvě cesty:

SituaceCo udělat
Googlebot má vlastní skupinu s Disallow: /Smažte z ní ten řádek, nebo ho nahraďte Allow: /.
Zákaz jde ze skupiny User-agent: *Buď zrušte Disallow: / tam, nebo Googlebotovi založte vlastní skupinu s Allow: /.

Na co si dát pozor:

  • Vlastní skupina pro Googlebota přebíjí User-agent: * CELOU, ne jen v tom jednom řádku. To je nejčastější chyba při téhle opravě: založíte Googlebotovi skupinu s Allow: /, a tím mu zároveň zrušíte všechny dílčí zákazy, které pro něj do té doby platily přes *. Když má Disallow: /admin/ platit dál, zopakujte ho uvnitř nové skupiny.
  • Nepleťte si to s meta značkou. robots.txt říká, kam robot smí; <meta name="robots" content="noindex"> říká, co smí zaindexovat. Jsou to dvě různá místa a řeší je dvě různé kontroly (tu druhou ACC-07). Zákaz v robots.txt navíc noindex na stránce znemožní přečíst; robot se k ní nedostane.
  • Zkontrolujte i CDN. Některé hostingy a CDN skládají robots.txt samy a váš soubor z repozitáře nemusí být ten, který se návštěvníkům servíruje. Riziko z výchozího nastavení CDN popisuje ACC-09.

Po nasazení si změnu ověřte v Google Search Console: v Nastavení je přehled staženého robots.txt i s časem poslední kontroly, a Kontrola URL řekne u konkrétní adresy, jestli na ni Googlebot smí. Počítejte s tím, že opětovné projití a zaindexování trvá dny až týdny; v den nasazení se neprojeví nic a není to chyba.

Co o tom říká report

Popis nálezu

Soubor robots.txt zakazuje robotu [token] celý web; rozhoduje o tom skupina pravidel pro User-agent: [matchedAgent], která obsahuje Disallow: /. Googlebot není AI robot a nesledujeme ho jako AI robota; záleží na něm z jiného důvodu. Google ve vlastní dokumentaci uvádí, že stránka se v AI Overviews ani v AI Mode může objevit jako zdroj jedině tehdy, je-li zaindexovaná ve vyhledávání Google a způsobilá k zobrazení s úryvkem. Stránka zakázaná v robots.txt se přitom do indexu dostane nanejvýš jako holá adresa bez obsahu a úryvek k ní Google nezobrazí. Nejde tedy o zhoršené šance: podmínka, kterou si Google sám stanovil, splněná není.

Doporučení

Nejdřív si ověřte, jestli je ten zákaz záměr. U testovací nebo klientské verze webu, u intranetu a u každého prostředí, které se do vyhledávání dostat nemá, je úplný zákaz Googlebota správné nastavení a není co opravovat; jen počítejte s tím, že takový web se ve vyhledávání Google ani v jeho AI odpovědích neobjeví a že na tom ostatní nálezy tohoto auditu nic nezmění. Pokud má být web veřejně dohledatelný, zákaz z robots.txt odstraňte: buď ze skupiny, která na Googlebota dopadá, smažte řádek Disallow: /, nebo Googlebotovi založte vlastní skupinu s Allow: /. Pozor na jednu věc: vlastní skupina pro Googlebota přebíjí skupinu User-agent: * celou, ne jen v tom jednom řádku. Když ji tedy zakládáte, zopakujte v ní i dílčí zákazy (například Disallow: /admin/), které mají platit dál. Po nasazení si změnu ověřte v Google Search Console (Nastavení → robots.txt, případně Kontrola URL). Počítejte s tím, že opětovné projití a zaindexování webu trvá dny až týdny; v den nasazení se neprojeví nic.

Zdroje

Text ověřen 2026-09-14