ACC-07

Stránka zakazuje indexaci (noindex)

KritickéPřístup pro crawlery

Co kontrola měří

Na každé živé stránce (odpověď 2xx) se čte, jestli sama sobě nezakazuje indexaci. Nález vznikne, když stránka nese noindex nebo nofollow, ať už v <meta name="robots">, v <meta name="googlebot">, přes hodnotu none (což je zkratka pro obojí naráz), nebo v HTTP hlavičce X-Robots-Tag.

nofollow se hlásí i bez noindex, a stojí za to vědět proč. Taková stránka se zaindexovat může, ale odkazy z ní nikam nevedou: obsah, na který odkazuje a na který jinudy cesta nevede, zůstane neobjevený. Je to tišší vada než noindex, ale v důsledku podobná.

Co kontrola nedělá:

  • Neposuzuje, jestli je zákaz na místě. Přihlašovací stránka, košík, děkovací stránka po odeslání formuláře nebo tisková verze noindex mít mají. Nález na nich je v pořádku a nemá se opravovat.
  • Neběží na stránkách s chybovým stavem: u 4xx a 5xx je indexovatelnost bezpředmětná, tím se zabývá ACC-04.
  • Nekontroluje noindex nastavený až JavaScriptem za běhu. Robot, který skripty nespouští, ho stejně neuvidí, ale ani my ho v HTML nenajdeme.
  • Nedívá se na robots.txt (to je ACC-01) ani na blokaci na úrovni CDN (ACC-09). Jsou to tři nezávislé cesty, jak se dostat mimo index, a každá má vlastní kód.
  • Nezjišťuje, jestli je stránka v indexu. Čteme jen direktivu, kterou stránka nese; do indexu Googlu ani Seznamu Torumata nevidí. Skutečný stav ukáže dotaz site: ve vyhledávači, Kontrola URL v Google Search Console a u českých webů Seznam Webmaster.

Nález je na úrovni stránky, závažnost kritická.

Jak silný důkaz za tím stojí

Nutná podmínka

Bez tohohle se vám AI vyhledávání nemá jak zobrazit. Google to má ve vlastní dokumentaci: stránka musí být zaindexovaná a způsobilá pro zobrazení s úryvkem. Nejtvrdší třída, jakou máme.

Spolu s ACC-01 je to nejtvrdší tvrzení celého auditu. Stránka s noindex v indexu Googlu není, a bez indexu se v AI Overviews ani v AI Mode neobjeví:

Aby stránka mohla být zobrazena jako podpůrný odkaz v AI Overviews nebo AI Mode, musí být zaindexovaná a způsobilá k zobrazení s úryvkem ve vyhledávání Google. Žádné další požadavky neexistují.Google Search Central, AI features

Na rozdíl od robots.txt, které crawlerovi zakazuje stránku stáhnout, noindex mu dovolí ji stáhnout a řekne mu, ať ji nezařazuje. Rozdíl je praktický: stránka zakázaná v robots.txt se v indexu občas objeví jako holá adresa bez obsahu (Google o ní ví z odkazů), zatímco noindex ji z indexu odstraní spolehlivě. Právě proto je noindex účinnější způsob, jak stránku skrýt, a taky nebezpečnější, když se tam dostane omylem.

A omylem se tam dostává často. Nejčastější příčinou, kterou v praxi vidíme, je přenesení nastavení z testovacího prostředí do produkce: vývojové prostředí má plošný noindex, aby se nezaindexovalo, a při nasazení se ta hodnota přenese s sebou. Web pak měsíce mizí z vyhledávání a nikdo neví proč.

Kde jsme opatrní: nofollow má slabší doklad než noindex. Že odkaz s nofollow nepředává signály, Google dokumentuje; že stránka za takovým odkazem nebude objevena vůbec, ale neplatí absolutně: najít se dá jinudy (ze sitemapy, z jiné stránky, zvenčí). Proto nofollow berte jako varování o zúžené cestě, ne jako rozsudek.

Jak to opravit

Nejdřív si u každé nahlášené stránky odpovězte na jedinou otázku: má tahle stránka být ve vyhledávání? U přihlašovací stránky, košíku, děkovací stránky nebo interního filtru je odpověď ne a nález je jen konstatování, ne chyba.

Když má být a není, hledejte zdroj zákazu. Může být na třech místech a projevit se stejně:

  1. V HTML stránky: <meta name="robots" content="noindex"> nebo content="none". Podívejte se do zdroje stránky (Ctrl+U), ne do inspektoru.
  2. V HTTP hlavičce: X-Robots-Tag: noindex. Tu ve zdroji stránky neuvidíte; ověříte ji jen zvenčí.
  3. V nastavení systému: WordPress má přepínač „Požádat vyhledávače o neindexování“, Shopify, Webflow i většina frameworků mají svou obdobu. Bývá zapnutý z doby před spuštěním.

Hlavičku i meta tag odhalíte jedním příkazem:

curl -sI https://vase-domena/stranka | grep -i x-robots-tag
curl -s  https://vase-domena/stranka | grep -i 'name="robots"'

Když stránka indexovaná být má, tag odstraňte úplně. Nenahrazujte ho content="index, follow". Indexace a následování odkazů jsou výchozí chování; Google to ve své specifikaci píše o hodnotě all (je to podle něj „výchozí hodnota, která nemá žádný efekt, když se uvede explicitně“) a index, follow je totéž jinými slovy. Explicitní povolení tedy nic nezlepší, jen zvyšuje šanci, že se v tom příště někdo splete.

Dvě věci na závěr, na kterých se to láme:

  • Zakázat stránku v robots.txt a zároveň jí dát noindex nefunguje. Crawler, který na stránku nesmí, noindex nikdy nepřečte. Chcete-li stránku z indexu dostat, nechte ji přístupnou a spolehněte se na noindex.
  • Po opravě to chvíli trvá. Odstranění tagu není totéž jako okamžitý návrat do indexu; stránku je potřeba znovu projít. Vyžádejte si indexaci v Search Console a nečekejte výsledek do druhého dne.

Co o tom říká report

Popis nálezu

Stránka obsahuje `<meta name="robots">` s direktivou `noindex` nebo `nofollow`. Vyhledávače ani jazykové modely ji tak nezařadí mezi zdroje, ze kterých odpovídají; obsah na ní je pro ně neviditelný, i když je pro návštěvníka běžně dostupný.

Doporučení

Pokud má být stránka veřejně dohledatelná, odstraňte `noindex` z `<meta name="robots">`. Zákaz nechte jen na stránkách, které se do vyhledávání dostat nemají (děkovací stránky po odeslání formuláře, interní filtry výpisů, testovací verze). Čteme jen direktivu na stránce: jestli ji Google nebo Seznam opravdu má v indexu, Torumata nezjišťuje. Skutečný stav ukáže dotaz `site:` ve vyhledávači, Kontrola URL v Google Search Console a u českých webů Seznam Webmaster.

Zdroje

Text ověřen 2026-09-12