ACC-10
robots.txt zakazuje Googlebotovi celý web
Co kontrola měří
V robots.txt (v tomtéž souboru, který audit stahuje pro ACC-01) se hledá jediná věc: jestli Googlebotovi zakazuje celý web. Tedy pravidlo Disallow: / ve skupině, která na Googlebota dopadá.
User-agent: Googlebot
Disallow: /Skupina se vybírá podle specificity user-agenta tak, jak to popisuje RFC 9309 a jak to udělá skutečný robot. To je na téhle kontrole to podstatné, takže po pořádku:
- Má Googlebot v souboru vlastní skupinu? Pak rozhoduje výhradně ona a skupina
User-agent: *se pro něj celá ignoruje, i kdyby zakazovala všechno. Soubor, který máDisallow: /pod*a nížUser-agent: GooglebotsAllow: /, tedy zakázaný web NENÍ a nález z něj nevzniká. - Nemá vlastní skupinu? Pak pro něj platí
User-agent: *. Když ta zakazuje kořen, je Googlebot zakázaný stejně účinně, jako kdyby byl jmenovaný. Report v takovém případě uvede, že rozhodlo pravidlo pro*. - Token se porovnává celý, ne prefixem.
Googlebot-je jiný robot. Web, který si zakázal jen indexaci obrázků, tenhle nález nedostane.Image Allow: /ve stejné skupině zákaz kořene ruší. Při shodné délce pravidla vyhráváAllow(RFC 9309).
Co kontrola nedělá:
- Neposuzuje dílčí zákazy cest.
Disallow: /admin/u Googlebota je normální a nález z něj nevzniká. Jde výhradně o zákaz CELÉHO webu. - Neověřuje, jestli jste opravdu mimo index. To by znamenalo ptát se Googlu na váš web zvenčí; my čteme jen váš vlastní soubor. Nález říká, co v něm stojí, ne co má Google ve své databázi.
- Netýká se ostatních vyhledávačů. Bingbot ani Applebot nesledujeme; proč, je v další sekci.
- Nemá nic společného s AI roboty. Ty řeší
ACC-01a Googlebot mezi ně nepatří. Že jsou to dvě různé věci, je celý důvod, proč tahle kontrola má vlastní kód.
Nález je na úrovni celého webu a závažnost kritická. Seznam sledovaných tokenů není v kódu, je v config/ pod search_, odděleně od seznamu AI robotů.
Jak silný důkaz za tím stojí
Bez tohohle se vám AI vyhledávání nemá jak zobrazit. Google to má ve vlastní dokumentaci: stránka musí být zaindexovaná a způsobilá pro zobrazení s úryvkem. Nejtvrdší třída, jakou máme.
Tohle je nejsilnější tvrzení, jaké v celém auditu máme, a jediné místo, kde nemluvíme o pravděpodobnosti, ale o podmínce. Má ji ve vlastní dokumentaci Google:
„To be eligible to be shown as a supporting link in AI Overviews or AI Mode, a page must be indexed and eligible to be shown in Google Search with a snippet. There are no additional requirements.“
Čtěte to pozorně, protože na tom celý nález stojí. Nejde jen o zaindexovanou stránku, ale o stránku způsobilou k zobrazení s úryvkem. A přesně tu způsobilost Disallow: / bere.
Častá námitka zní: „vždyť zakázaná stránka se do indexu dostat může“. Je to pravda a nic to nemění. Když na zakázanou adresu vedou odkazy odjinud, Google si ji do indexu poznamenat může, ale jen jako holou adresu bez obsahu, protože si ji nesměl stáhnout. Úryvek k ní tedy nezobrazí, a druhá polovina podmínky splněná není.
Proč jen Googlebot a ne i Bingbot. Microsoft Copilot staví na indexu Bingu, takže logicky by mělo platit totéž, a docs/ §4c to tak i odvozuje z architektury. Jenže odvození z architektury není totéž co věta v dokumentaci, a tvrzení téhle třídy smí stát jen na primárním zdroji. Vlastní vyjádření Microsoftu doložené nemáme, takže Bingbota nesledujeme. Až se ta věta najde, přibude token do configu; nová kontrola kvůli tomu vznikat nemusí.
A poznámka, která sem patří, i když se neprodává dobře: zákaz Googlebota je docela často správné rozhodnutí. Testovací a klientské verze webu, intranet, prostředí, které se do vyhledávání dostat nemá: tam to tak být má. Nález proto není výtka, ale zjištění. Když víte proč, je odpověď „ano, tak to chci“ zcela platná a report tím pro vás končí.
Jak to opravit
Nejdřív zjistěte, jestli je to záměr. Otevřete si https:// v prohlížeči a podívejte se, co tam skutečně je, ne to, co máte v repozitáři nebo co si pamatujete z instalace. Nejčastější příčina nečekaného zákazu je, že web vznikal na testovací adrese a robots.txt se při spuštění zapomněl vrátit zpátky.
Pokud to záměr je, nic neopravujte. Počítejte jen s tím, že takový web se ve vyhledávání Google ani v jeho AI odpovědích neobjeví a že na tom ostatní nálezy tohoto auditu nic nezmění. Dokud platí tenhle zákaz, jsou úpravy obsahu a struktury investicí do něčeho, co nikdo neuvidí.
Pokud záměr není, máte dvě cesty:
| Situace | Co udělat |
|---|---|
Googlebot má vlastní skupinu s Disallow: / | Smažte z ní ten řádek, nebo ho nahraďte Allow: /. |
Zákaz jde ze skupiny User-agent: * | Buď zrušte Disallow: / tam, nebo Googlebotovi založte vlastní skupinu s Allow: /. |
Na co si dát pozor:
- Vlastní skupina pro Googlebota přebíjí
User-agent: *CELOU, ne jen v tom jednom řádku. To je nejčastější chyba při téhle opravě: založíte Googlebotovi skupinu sAllow: /, a tím mu zároveň zrušíte všechny dílčí zákazy, které pro něj do té doby platily přes*. Když máDisallow: /admin/platit dál, zopakujte ho uvnitř nové skupiny. - Nepleťte si to s meta značkou.
robots.txtříká, kam robot smí;<meta name="robots" content=říká, co smí zaindexovat. Jsou to dvě různá místa a řeší je dvě různé kontroly (tu druhou"noindex"> ACC-07). Zákaz vrobots.txtnavícnoindexna stránce znemožní přečíst; robot se k ní nedostane. - Zkontrolujte i CDN. Některé hostingy a CDN skládají
robots.txtsamy a váš soubor z repozitáře nemusí být ten, který se návštěvníkům servíruje. Riziko z výchozího nastavení CDN popisujeACC-09.
Po nasazení si změnu ověřte v Google Search Console: v Nastavení je přehled staženého robots.txt i s časem poslední kontroly, a Kontrola URL řekne u konkrétní adresy, jestli na ni Googlebot smí. Počítejte s tím, že opětovné projití a zaindexování trvá dny až týdny; v den nasazení se neprojeví nic a není to chyba.
Co o tom říká report
Popis nálezu
Soubor robots.txt zakazuje robotu [token] celý web; rozhoduje o tom skupina pravidel pro User-agent: [matchedAgent], která obsahuje Disallow: /. Googlebot není AI robot a nesledujeme ho jako AI robota; záleží na něm z jiného důvodu. Google ve vlastní dokumentaci uvádí, že stránka se v AI Overviews ani v AI Mode může objevit jako zdroj jedině tehdy, je-li zaindexovaná ve vyhledávání Google a způsobilá k zobrazení s úryvkem. Stránka zakázaná v robots.txt se přitom do indexu dostane nanejvýš jako holá adresa bez obsahu a úryvek k ní Google nezobrazí. Nejde tedy o zhoršené šance: podmínka, kterou si Google sám stanovil, splněná není.
Doporučení
Nejdřív si ověřte, jestli je ten zákaz záměr. U testovací nebo klientské verze webu, u intranetu a u každého prostředí, které se do vyhledávání dostat nemá, je úplný zákaz Googlebota správné nastavení a není co opravovat; jen počítejte s tím, že takový web se ve vyhledávání Google ani v jeho AI odpovědích neobjeví a že na tom ostatní nálezy tohoto auditu nic nezmění. Pokud má být web veřejně dohledatelný, zákaz z robots.txt odstraňte: buď ze skupiny, která na Googlebota dopadá, smažte řádek Disallow: /, nebo Googlebotovi založte vlastní skupinu s Allow: /. Pozor na jednu věc: vlastní skupina pro Googlebota přebíjí skupinu User-agent: * celou, ne jen v tom jednom řádku. Když ji tedy zakládáte, zopakujte v ní i dílčí zákazy (například Disallow: /admin/), které mají platit dál. Po nasazení si změnu ověřte v Google Search Console (Nastavení → robots.txt, případně Kontrola URL). Počítejte s tím, že opětovné projití a zaindexování webu trvá dny až týdny; v den nasazení se neprojeví nic.
Zdroje
- Google Search Central: AI features and your website (podmínka zobrazení v AI Overviews a AI Mode) (ověřeno 2026-09-14)
- Google Search Central: Introduction to robots.txt (ověřeno 2026-09-14)
- RFC 9309: Robots Exclusion Protocol (specificita user-agenta, §2.2.1) (ověřeno 2026-09-14)
Text ověřen 2026-09-14