ACC-05

Obsah pravděpodobně dostupný až po přihlášení nebo zaplacení

VarováníPřístup pro crawlery

Co kontrola měří

Kontrola hledá kombinaci dvou věcí na jedné stránce: přihlašovací formulář (v HTML je pole typu password) a málo veřejně viditelného textu. Když stránka splní obojí, vznikne nález. Text nálezu vám řekne, kolik slov jsme na té stránce napočítali, vedle prahu, se kterým jsme to porovnali.

Hranice „málo textu“ je méně než 100 slov. Je v config/thresholds.json pod rule_engine.ACC-05 jako max_words_for_short_text: 100. Je tam výslovně označená "_status": "PROPOSAL", tedy jako náš návrh k revizi na reálných datech, ne jako číslo ze zadání. Zadání produktu uvádí jen heuristiku „krátký text + přihlašovací formulář“, konkrétní práh jsme zvolili my.

Co kontrola nedělá:

  • Neoznačí samotnou přihlašovací stránku. Adresy jako /login/, /prihlaseni/, /register/, /registrace/, /password-reset/ nebo /odhlaseni/ nález nedostanou, i když heuristiku splní. Přihlašovací stránka žádný obsah neskrývá, ona tím přihlášením je. Seznam vzorů je v config/thresholds.json pod rule_engine.ACC-05. Do 19. 9. 2026 to tak nebylo a byl to nejčastější planý poplach téhle kontroly.
  • Neoznačí variantu adresy, která ukazuje canonical jinam. /clanek/?utm_source=mail nález nedostane, dostane ho /clanek/.
  • Nepozná paywall bez přihlašovacího pole. Zeď, která místo formuláře nabídne tlačítko „Předplatit“ a odkáže na platební bránu, projde bez nálezu, i když je to přesně ten případ, o kterém nález mluví.
  • Nepřihlašuje se. Nevíme a nemůžeme vědět, co je za zdí; nález mluví o tom, co je před ní.
  • Neoznačí přihlašovací okénko ze šablony. Formulář s polem pro heslo se počítá, jen když leží v hlavním obsahu stránky. Okénko v hlavičce, patičce nebo postranním sloupci, které má šablona na každé stránce webu, nález nedává - o obsahu za přihlášením nevypovídá nic. Do 20. 9. 2026 to tak nebylo a na e-shopu to udělalo devět nálezů na veřejných výpisech produktů, tehdy ještě v kritické závažnosti.
  • Neposuzuje hodnotu obsahu. Krátká stránka s přihlašovacím formulářem v obsahu dostane nález stejně jako zamčený článek.
  • Nekontroluje paywalledContent ve strukturovaných datech, kterými se dá Googlu korektně oznámit, že obsah je placený.
  • Neběží nad stránkami, které crawler nenavštívil.

Nález je na úrovni stránky, závažnost varování. Kritickou měl do 22. 9. 2026; vlastník ji snížil, protože kontrola stojí na heuristice (málo textu + formulář s heslem), a kritická je v tomhle produktu vyhrazená pro věci, které poznáme najisto.

Jak silný důkaz za tím stojí

Nutná podmínka

Bez tohohle se vám AI vyhledávání nemá jak zobrazit. Google to má ve vlastní dokumentaci: stránka musí být zaindexovaná a způsobilá pro zobrazení s úryvkem. Nejtvrdší třída, jakou máme.

Robot se nepřihlásí a nezaplatí. Co je za zdí, není v indexu, a bez indexu se stránka v odpovědích AI neobjeví. Google to má ve vlastní dokumentaci a Microsoft Copilot staví na indexu Bingu, takže platí totéž:

Aby stránka mohla být zobrazena jako podpůrný odkaz v AI Overviews nebo AI Mode, musí být zaindexovaná a způsobilá k zobrazení s úryvkem ve vyhledávání Google. Žádné další požadavky neexistují.Google Search Central, AI features

Co z toho ale neplyne: že byste měli obsah odemknout. Placený obsah je legitimní obchodní model a tenhle nález není výzva, abyste ho opustili. Je to informace o ceně: stránky za zdí pro jazykové modely neexistují, tedy ani pro odpovědi, ve kterých by vás mohly citovat.

Pevná je tu první část (co robot nevidí, neindexuje se). Druhá část, tedy že vystrčení úryvku před zeď povede k citaci, doložená není a neslibujeme ji. Víme jen, že bez toho je šance nulová.

A ještě jedna poctivost k samotné detekci: je to heuristika, ne měření. Práh 100 slov je náš odhad označený v konfiguraci jako návrh k revizi, a co je za přihlášením, náš crawler ze své podstaty nevidí - neumíme tedy odlišit stránku se skrytým obsahem od stránky, která nic neskrývá a jen má málo textu. Samotné přihlašovací a registrační stránky z nálezu vynecháváme (od 19. 9. 2026) a přihlašovací okénko ze šablony taky (od 20. 9. 2026), ale než začnete něco měnit, podívejte se, o kterou stránku vlastně jde.

Jak to opravit

Nejdřív rozhodněte, do které ze tří skupin stránka patří, každá se řeší jinak:

  1. Přihlášení do administrace nebo do zákaznické zóny. Není co opravovat. Naopak: takovou stránku dejte do robots.txt pod Disallow a označte ji <meta name="robots" content="noindex">. Nemá, co by v odpovědích nabídla.
  2. Placený obsah, který chcete prodávat dál. Nechte zeď a vystrčte před ni tolik, kolik unesete.
  3. Obsah omezený nedopatřením: sekce, která se kdysi zamkla a už není důvod. Odemkněte.

U druhé skupiny je otázka, co přesně nechat venku. Funguje na to jednoduché měřítko: venku má být tolik, aby si čtenář (a model) udělal obrázek o tom, co se uvnitř tvrdí, ale ne tolik, aby to stačilo místo předplatného.

  • Nadpis a perex: nezkrácené, ne oříznuté třemi tečkami uprostřed věty.
  • První dva až tři odstavce, tedy dost na to, aby bylo jasné, o čem to je.
  • Klíčové závěry nebo abstrakt: u odborného obsahu často stačí a je to nejčastěji citovaná část vůbec.
  • Datum, autora a zdroje: ty za zdí nemají co dělat, je to strojově čitelný kontext, který měří AUTH-02 a AUTH-03.

Technicky k tomu patří jedna věc navíc: placenému obsahu se dá korektně oznámit, že je placený. Ve strukturovaných datech se úsek označí jako isAccessibleForFree: false s odkazem na cssSelector zamčené části. Google tím říká „tady není cloaking, tady je paywall“. A to je rozdíl mezi korektním řešením a servírováním jiného obsahu robotům než lidem.

{
  "@context": "https://schema.org",
  "@type": "NewsArticle",
  "isAccessibleForFree": false,
  "hasPart": {
    "@type": "WebPageElement",
    "isAccessibleForFree": false,
    "cssSelector": ".placeny-obsah"
  }
}

Poslední varování, protože je to past, do které se dá spadnout s dobrým úmyslem: neservírujte robotům plný text a lidem zeď. Je to porušení pravidel Googlu a řeší se to právě tím označením výš, ne detekcí User-Agenta.

Co o tom říká report

Popis nálezu

Na této stránce jsme napočítali [wordCount] slov veřejně viditelného textu (práh naší heuristiky je [threshold] slov) a zároveň formulář s polem pro heslo v hlavním obsahu stránky. Ta dvojice obvykle znamená, že hlavní obsah je dostupný až po přihlášení nebo po zaplacení; AI crawleři se nepřihlašují ani neplatí, takže co zůstane za přihlášením, pro ně neexistuje. Je to heuristika, ne měření: co je za přihlášením, crawler ze své podstaty nevidí, takže neumíme odlišit stránku se skrytým obsahem od stránky, která žádný skrytý obsah nemá a jen má málo textu. Samotné přihlašovací, registrační a odhlašovací stránky ani formuláře pro obnovu hesla nález nedostávají - ty žádný obsah neskrývají, ony tím přihlášením jsou. Přihlašovací okénko, které má šablona v hlavičce, patičce nebo postranním sloupci každé stránky webu, nález nedává - o obsahu za přihlášením nevypovídá nic. Varianty téže adresy lišící se jen parametrem dávají jeden nález, ne několik.

Doporučení

Obsah, který má být dosažitelný i bez přihlášení, zveřejněte alespoň v podobě shrnutí nebo úvodní části před přihlašovacím oknem či paywallem (např. první odstavce, abstrakt, klíčové závěry) - jako běžnou veřejnou stránku, kterou si crawler stáhne bez přihlášení a bez platby. Je to nutná podmínka, ne volitelný doplněk: co zůstane za přihlášením, pro AI systémy neexistuje. Soubor `llms.txt` to nezastoupí - je to jen seznam odkazů, a když za nimi crawler narazí na přihlášení, nezíská nic (viz ACC-02).

Zdroje

Text ověřen 2026-09-20