Co se 15. září stalo s AI roboty na evropském webu
Shrnutí pro každého
Velká část webů běží přes servery firmy Cloudflare, které rozhodují o tom, kdo se na tyto weby dostane. Cloudflare vkládal na přání majitele webu do souboru robots.txt hotová pravidla, která robotům sbírajícím texty pro trénování umělé inteligence zakazovala web číst. Soubor robots.txt je místo, kde web říká robotům, co si smějí přečíst. 15. září 2026 tuto funkci Cloudflare zrušil.
Změřili jsme, co se stalo, na 22 846 nejnavštěvovanějších webech deseti evropských zemí. 14. září mělo tato pravidla vložená od Cloudflare 769 webů, 16. září už jen 39 a 4. října, tři týdny po změně, 73. Majitelé těchto webů přitom neudělali nic, pravidla zmizela bez jejich zásahu.
Neznamená to, že se weby otevřely pro umělou inteligenci. Volbu, kterou měly uloženou, převedl Cloudflare do jiného nastavení a to se projevuje přímo v jeho síti. Robota, který sbírá data pro trénování umělé inteligence, dnes tyto weby odmítají častěji než předtím. Zmizel tedy zápis Cloudflare v souboru robots.txt, ne zákaz pro roboty, které sbírají data pro trénování.
Jedna věc se ale obrátila. Asistent, který čte stránku na pokyn člověka (např. když se někdo ChatGPT zeptá na konkrétní web), dnes projde mnohem častěji než v půlce září.
Co s tím má dělat majitel webu? Měl by se podívat, co má v souboru robots.txt dnes. Pokud tam zákaz chce mít, ať si ho tam napíše sám. Pokud ho tam mít nechce, ale měl ho tam od Cloudflare, teď ho tam již nemá.
Co se stalo
15. září 2026 změnil Cloudflare nastavení, které se týká robotů umělé inteligence. Měřili jsme evropský web dva dny před tou změnou, den po ní, o týden později a naposledy 4. října, tři týdny po změně. Z měření vyplynuly tři poznatky. Z webů zmizela viditelná pravidla, v síti Cloudflare se změnilo, koho tyto weby pustí, a nové pravidlo zatím nikde napsané není.
Měřili jsme 22 846 nejnavštěvovanějších domén deseti evropských zemí podle žebříčku Tranco. Síť Cloudflare využívalo celkově 28,8 % webů, v Česku 21,4 % webů. Sítí Cloudflare myslíme servery, přes které web běží.
Pravidla v souboru robots.txt zmizela
Cloudflare uměl do souboru robots.txt vkládat hotový blok pravidel. Ten zakazoval osmi jmenovaným robotům sbírat obsah pro trénování: Amazonbot, Applebot-
Aby bylo jasné, že nejde o běžné kolísání, srovnáváme to s weby mimo Cloudflare. Proti nim je rozdíl 10,7 procentního bodu dolů, s rozpětím 10,0 až 11,5. Běžný rozptyl mezi dvěma měřeními téhož dne je přitom 0,3 procentního bodu.
V síti Cloudflare se změnilo, koho weby pustí
U webů, kterým blok pravidel zmizel, jsme posílali obyčejný požadavek na úvodní stránku. Měnili jsme jen jméno, kterým se návštěvník představí.
Program, který se představil jménem GPTBot, odmítlo 14. září 73,0 % těchto webů, 4. října 86,0 %. Pod jménem ClaudeBot to bylo nejdřív 74,1 % a potom 87,2 %. Naopak pod jménem ChatGPT-User, což je asistent, který čte stránku na pokyn uživatele, odmítlo požadavek nejdřív 69,3 % webů a po změně jen 27,3 %. Jméno Googlebot zůstalo beze změny. Před změnou ho odmítlo 21,8 % webů, po změně 22,9 %. Mezi 16. zářím a 4. říjnem se tyto hodnoty měnily jen v rámci běžného rozptylu. 4. října jsme přidali i jméno vyhledávacího robota OpenAI, OAI-SearchBot. Odmítlo ho 26,4 % těchto webů, tedy podobně jako asistenta ChatGPT-User, ne jako roboty pro trénování.
U srovnávací skupiny webů za Cloudflare, které blok pravidel nikdy neměly, neprošlo jméno GPTBot v 33,7 % případů před změnou a v 38,9 % případů 4. října. Posun u této skupiny je ale stejný u všech jmen včetně Googlebota, netýká se tedy jen robotů pro trénování, a zčásti vznikl tím, že 352 webů z této skupiny mezi 22. zářím a 4. říjnem zaniklo. Do 22. září se tato skupina nehnula (34,6 %).
Většinu odmítnutí, 510 z 624, tvořil rovnou zamítnutý požadavek. Ověřovací stránka, na které má návštěvník prokázat, že je člověk, se objevila u 104 webů.
Měříme ale program, který si jméno robota jen nastaví v hlavičce požadavku. Skuteční roboti firem OpenAI nebo Anthropic se prokazují adresou a podpisem. Jak s nimi Cloudflare zachází, se zvenčí změřit nedá. Chování sítě Cloudflare jsme ověřili i ze dvou dalších sítí jiných poskytovatelů. Výsledek se shodoval web po webu.
Zákaz dnes nikde nestojí napsaný
Cloudflare podle svého blogu nahradil zrušenou funkci novou. Jmenuje se Bot Preference Sync a přání majitele webu netrénovat na jeho obsahu má zveřejňovat v souboru robots.txt. K 4. říjnu ji tam neměl ani jeden web z posuzovaného vzorku.
Starý blok pravidel se vrací, ale pomalu. Za tři týdny přibyl u 35 webů. U všech 11 webů, kterým se vrátil, se chování sítě nezměnilo, trénovací roboty odmítaly už předtím. Zápis tedy dobíhá za skutečným nastavením, ne naopak.
Co k tomu říká Cloudflare
Podle Cloudflare, tedy podle firemního blogu z 15. září, byla funkce vkládající pravidla do souboru robots.txt zrušena ve prospěch nové. Zákazníkům, kteří měli zapnuté blokování trénování, se uložená volba převedla do nastavení s názvem Disallow AI Training. To podle téhož textu zastavuje roboty sbírající data pro trénování, vyhledávací roboty nechává projít a pro asistenty žádnou volbu zakázat zatím nenabízí. Odpovídá to našemu měření ve všech třech směrech.
Blog také říká, že zákazník nemusí dělat nic. To je z pohledu majitele webu nejdůležitější věta celé změny.
Vlastní jméno projde, cizí ne
K měření jsme přidali vlastní jméno torumata-
Odmítání tedy nemíří na to, co program dělá, ani na to, co o sobě tvrdí. Míří na konkrétní jména, která síť Cloudflare zná.
Druhé měření, nezávisle na nás
Změnu z 15. září neměřil jen náš tým. Firma SeenSure prodává hlídání toho, zda se roboti umělé inteligence dostanou na web, takže jde o nástroj konkurenční tomu, co stavíme my. 16. září zveřejnila měření 1 046 webů, z nichž 746 běží za Cloudflare. Převážně šlo o čerstvě registrované domény z logů vydaných certifikátů.
Jejich čísla ukazují týž obrazec jako naše. U webů za Cloudflare stouplo mezi 14. a 16. zářím odmítání trénovacích robotů, u jména GPTBot z 26,8 % na 31,0 %. Naopak prudce kleslo odmítání asistentů a vyhledávacích robotů firem s umělou inteligencí, u jména ChatGPT-User z 24,7 % na 3,2 % a u jména OAI-SearchBot z 24,9 % na 3,2 %. U webů mimo Cloudflare se nezměnilo nic.
Rozdíl dává smysl. My měříme weby, které blokování měly zapnuté a Cloudflare je převedl na nové nastavení. Oni měří převážně nové domény s novými výchozími hodnotami. Srovnávat se tedy dá směr, ne velikost rozdílu. Jejich odmítnutí je navíc jakákoli odpověď se stavovým kódem 400 a výš, tedy zamítnutí i ověřovací stránka dohromady. Oni také neměřili soubor robots.txt, my jsme vyhledávacího robota OpenAI změřili až 4. října, bez stavu před změnou.
Jejich stránka prošla několika opravami, které sami vyznačili a datovali. K 22. září v jednom shrnujícím odstavci označovala čísla za celý vzorek jako čísla za weby za Cloudflare. Po našem upozornění to autoři 23. září opravili. Citujeme proto tabulku s výslovným rozdělením ve znění ze snímku z 22. září. Nový snímek z 30. září je v repozitáři.
Co to znamená pro majitele webu
- Pokud jste blokování trénování zapnuli jedním kliknutím u Cloudflare, v souboru robots.txt ho dnes nejspíš nemáte. Funguje dál, ale nikdo se o něm z vašeho webu nedozví. Jestli chcete, aby vaše přání bylo vidět, napište si pravidlo do souboru sami.
- Asistenti, kteří čtou stránky na pokyn člověka, se dnes na vaše stránky dostanou podstatně častěji než v půlce září. Pokud chcete, aby vás přes ně lidé našli, je to dobrá zpráva. Pokud ne, změnilo se vám nastavení bez vašeho zásahu.
- Pokud si sami pouštíte program, který čte weby, nepředstavujte se jménem cizího robota ani výchozím jménem knihovny. Vlastní jméno projde skoro všude.
Zkontrolovat si to jde ručně za pár minut. Část z toho za vás udělá Torumata, nástroj, který jsme na to postavili. Zkontroluje soubor robots.txt a pozná, jestli web běží za sítí, jako je Cloudflare. Nastavení pro AI roboty v takové síti si pak ověříte sami ve své správě. Bránu hostingu zvenčí změřit nejde, tu prověří jen dotaz u poskytovatele.
Jak jsme měřili a co měření neumí
Měřili jsme pětkrát. 14. září dvakrát, aby bylo vidět, jak se čísla hýbou sama od sebe, pak 16. září, 22. září a 4. října. Každý web dostal stejnou sadu požadavků: prohlížeč řízený programem, program s vlastním jménem a program se jménem známého robota. Vše z domácí internetové přípojky v Česku. Chování sítě Cloudflare jsme navíc ověřili ze dvou dalších sítí jiných poskytovatelů, z datacentra a z mobilní sítě, na 1 000 webech. Výsledek se shodoval web po webu.
Před každým měřením jsme si zapsali předpověď a teprve potom měření pustili. U změny z 15. září se spletli všichni tři, kdo předpovědi psali, autora tohoto textu nevyjímaje. Nikdo nečekal, že zákazů ubude. U měření z 22. září se předpovědi potvrdily a měření ze 4. října ukázalo týž stav. Píšeme to sem proto, že jinak nemá čtenář jak poznat, které věty vznikly až po datech.
Co měření neumí? Neumí říct, jak Cloudflare zachází se skutečnými roboty firem OpenAI a Anthropic, protože ti se prokazují adresou a podpisem. Neumí odlišit, zda odmítnutí rozhodla síť Cloudflare, nebo web sám. A žebříček Tranco je žebříček návštěvnosti, ne seznam všech webů.
Vyjádření firem
Cloudflare a Anthropic jsme požádali o vyjádření 25. září s termínem 29. září. Do uzávěrky ani jedna z firem nereagovala. Pokud vyjádření přijde, doplníme ho sem v plném znění s datem. Forpsi (INTERNET CZ, a.s.) jsme požádali o stanovisko 25. září s termínem 30. září. Do uzávěrky nereagoval.
Zdroje a data
Všechna čísla v tomto článku pocházejí z měření, jejichž výstupy, předpovědi zapsané před měřením, skripty a snímky citovaných stránek jsou veřejně k dispozici v repozitáři https://