ACC-06
Sitemapa webu (sitemap.xml)
Co kontrola měří
Sitemapu hledáme na https://, v sitemap indexu, na který ta adresa případně odkazuje, a na adresách uvedených v robots.txt - vždy jen na auditované doméně. Nad tím, co se najde, posuzujeme pět věcí v tomhle pořadí: jestli soubor existuje, jestli je to čitelná sitemapa (validní XML s kořenem <urlset>/<sitemapindex> a aspoň jedním <loc>), jestli sitemapa neuvádí adresy, na které jsme se nedostali nebo které vracejí chybu, jestli neuvádí adresy, které nám zakazuje procházet váš vlastní robots.txt, a jestli neexistují živé stránky, které v sitemapě chybí.
Nález vám vždycky řekne, která z těch pěti věcí nastala, a to už v titulku. Dřív tam stála jedna věta za všechny čtyři („chybějící nebo nevalidní sitemap.xml“) a u webu s funkční sitemapou to bylo prostě nepravdivé; opravené 19. 9. 2026.
První dvě podmínky platí vždycky. Zbylé tři se vyhodnocují jen při úplném crawlu webu, ne při vzorku. A to je záměrné rozhodnutí, které stojí za vysvětlení. Nad vzorkem několika desítek stránek by nesoulad se sitemapou vycházel prakticky pokaždé, jenže ne kvůli vašemu webu, ale kvůli nám: adresu ze sitemapy jsme prostě nestáhli. Nález, který neumí odlišit vadu webu od omezení vlastního crawlu, radši neukážeme.
Co kontrola nedělá:
- Nevaliduje proti schématu sitemap.org. Ověřuje se jen hrubý tvar:
<urlset>/<sitemapindex>a aspoň jedno<loc>. Chybný<lastmod>nebo neplatná priorita projdou. - Nečte sitemap index bez omezení. U velkého indexu přečteme jen část dílčích souborů (strop je v
config/); v takovém případě větev „stránky chybějící v sitemapě“ mlčí, protože bychom tvrdili něco o sobě, ne o vašem webu.thresholds. json - Neporovnává
<lastmod>se skutečnou změnou stránky. Sitemapa, která u všech adres tvrdí „změněno dnes“, projde, i když je to přesně ten signál, kterým se plýtvá crawl budget. - Adresy, které jsou jen zdrojem přesměrování, se do „chybí v sitemapě“ nepočítají. Stará adresa v sitemapě být nemá, svůj záznam má až cíl. A obráceně: adresa ze sitemapy, která nás přesměrovala na stránku, kterou audit prošel, se nepočítá jako „nenašli jsme ji“ - přesměrování není chyba.
- Stránkování (
/) a varianty téže adresy s parametrem se nepočítají jako chybějící v sitemapě. Do sitemapy patří kanonická adresa, ne každá její varianta; doporučovat vám jejich doplnění by sitemapu zhoršilo.rubrika/ page/ 2/ - Neověřuje, jestli vyhledávač adresy ze sitemapy opravdu zařadil. Sitemapa je pozvánka, ne záruka, a do indexu Googlu ani Seznamu Torumata nevidí. Kolik stránek je v indexu doopravdy, ukáže Google Search Console a u českých webů Seznam Webmaster.
Nález je na úrovni celého webu, závažnost varování.
Jak silný důkaz za tím stojí
Doporučujeme to, protože to neuškodí nebo to má jiný užitek, ale vliv na to, jestli vás jazykové modely budou citovat, neslibujeme. Nikdo ho zatím nedoložil.
Tady je potřeba rozlišit dvě věci, které se v GEO článcích běžně slévají do jedné.
Pro objevování stránek sitemapa funguje a Google to má ve vlastní dokumentaci: je to způsob, jak vyhledávači říct, které adresy na webu jsou a kdy se naposled změnily. Zvlášť užitečná je u velkých webů, u nových webů s málo odkazy zvenčí a u obsahu, na který se vnitřně špatně odkazuje.
Pro viditelnost v odpovědích AI ale efekt doložený nemáme, a proto je tahle kontrola v třídě „nedoložené“. Nikdo z provozovatelů jazykových modelů nedeklaruje, že by sitemapy četl, a žádné měření nám neukazuje, že by web se sitemapou byl citovaný častěji než srovnatelný web bez ní.
Dvě věci, které je při tom třeba říct rovnou, protože se o sitemapách tvrdí a nesedí:
- Sitemapa nezaručuje zaindexování. Google to píše doslova: neručí za to, že všechny položky sitemapy projdou crawlem a skončí v indexu. Je to nápověda, ne příkaz.
- Sitemapa není faktor pořadí (pokud víme). Google ji mezi řadicími systémy nikde neuvádí; netvrdíme ale ani opak, protože to bychom taky nedoložili. Doložená role sitemapy je objevování adres, ne řazení.
Proč ji tedy doporučujeme? Protože stojí skoro nic a pomáhá tam, kde na tom skutečně sejde: aby se stránka vůbec našla. Zaindexovatelnost je nutná podmínka pro zobrazení v AI (ACC-04, ACC-07), a objevení stránky je krok, který téhle podmínce předchází. To je poctivé odůvodnění. Slibovat u sitemapy víc by znamenalo tvrdit něco, co doložit neumíme.
Prakticky: část nálezu o nesouladu se skutečností je cennější než část o existenci souboru. Sitemapa, která uvádí stovky adres vracejících 404, není jen neužitečná, je to špatná nápověda, kterou crawleru posíláte vy sami.
Jak to opravit
Sitemapu negenerujte ručně. Ručně udržovaný soubor zestárne dřív, než si toho někdo všimne, a přesně tím vznikne ta horší půlka nálezu: sitemapa, která tvrdí něco, co na webu není. Ať vzniká automaticky při publikaci obsahu, ze stejného zdroje jako navigace.
Minimální platný soubor vypadá takhle:
<?xml version="1.0" encoding="UTF-8"?>
<urlset xmlns="http://www.sitemaps.org/schemas/sitemap/0.9">
<url>
<loc>https://vase-domena/</loc>
<lastmod>2026-09-12</lastmod>
</url>
<url>
<loc>https://vase-domena/clanek</loc>
<lastmod>2026-08-30</lastmod>
</url>
</urlset>A odkažte na ni z robots.txt samostatným řádkem, který nepatří do žádné skupiny User-agent:
Sitemap: https://vase-domena/sitemap.xmlCo do sitemapy patří a co ne:
- Jen kanonické adresy. Verze s parametry, tiskové varianty ani duplicity tam nemají co dělat; posíláte tím crawler na stránky, které sami označujete za nepreferované.
- Jen adresy vracející 200. Každá 404 a každé přesměrování v sitemapě je nápověda, která nesedí.
- Žádné stránky s
noindex. Sitemapa říká „indexuj mě“, meta tag říká opak. Dvě protichůdná tvrzení na jedné adrese. <lastmod>jen když ho znáte. Datum poslední skutečné změny obsahu, ne datum sestavení souboru. Když u všeho stojí dnešek, přestane to být informace.- Nad 50 000 adres nebo 50 MB rozdělte soubor a přidejte sitemap index. Limit je ze specifikace, ne od nás.
Když nález hlásí nesoulad, titulek vám řekne, kterým směrem. Adresy, které sitemapa uvádí a my se na ně nedostali, jsou obvykle staré cesty po přestavbě webu nebo stránky, na které vnitřně nic neodkazuje; druhý případ je zároveň SIT-01. Živé stránky, které v sitemapě chybí, bývají obsah generovaný mimo hlavní šablonu: štítky a archivy. U každé takové adresy se ale nejdřív rozhodněte, jestli do sitemapy opravdu patří - stránkování a filtrované výpisy tam nepatří a my vám je proto ani nehlásíme.
Co o tom říká report
Popis nálezu
Nenašli jsme použitelnou sitemapu, nebo neodpovídá skutečnosti. Hledáme ji na /sitemap.xml (včetně sitemap indexu, který odkazuje na dílčí soubory) a na adresách uvedených v robots.txt, vždy na auditované doméně. Buď se nenačetla žádná, nebo ji nešlo přečíst jako sitemapu, nebo neodpovídá stránkám skutečně nalezeným crawlem (uvádí URL, které tento audit neprošel, nebo naopak chybí URL, které crawler objevil). „Neprošli jsme ji“ přitom neznamená „na webu není“: do rozsahu jednoho auditu se nemusí vejít všechny adresy.
Doporučení
Vygenerujte validní sitemap.xml se všemi veřejně dostupnými stránkami (kanonické URL, `<lastmod>` pokud je znáte) a odkažte na něj z robots.txt (`Sitemap: https://
Zdroje
- Google Search Central: Learn about sitemaps (ověřeno 2026-09-12)
- sitemaps.org: protokol a limity (ověřeno 2026-09-12)
- Google Search Central: AI features and your website (ověřeno 2026-08-19)
Text ověřen 2026-09-19