Pavúky asistentov: koho pustiť na web a ako si to overiť

Rozhodnite, ktoré AI crawlery pustiť na web a ktoré blokovať. Overenie cez reverzné DNS, robots.txt, firewall a logy krok za krokom.

Redakcia ADS BeastPublikované Aktualizované 10 min čítania

Pavúky asistentov sú automatizovaní klienti, ktorí sťahujú obsah webu pre jazykové modely a AI vyhľadávače. Pustíte ich, ak chcete byť citovaní v odpovediach ChatGPT, Perplexity alebo Google AI Overviews. Blokujete ich, ak nechcete, aby text slúžil na trénovanie bez vášho súhlasu. Rozhodnutie sa robí v robots.txt a overuje v logoch.

Krátko:

  • User-Agent v logu nestačí ako dôkaz. Meno sa dá sfalšovať, preto sa overuje reverzné DNS alebo IP rozsah prevádzkovateľa.
  • robots.txt je dohoda, nie blok. Slušní prevádzkovatelia ho čítajú, mnohí AI boti nie.
  • Tvrdý blok vyžaduje firewall alebo WAF pravidlá na úrovni IP.
  • Pustenie crawlery znamená novú návštevnosť z citácií. Blokovanie chráni autorské texty pred trénovaním.
  • Rozhodnutie nie je jednorazové. Zoznam botov a ich IP rozsahov sa mení, kontrolu treba opakovať.

Ako zistím, že ma navštívil AI crawler a nie bežný používateľ?

Pozrite sa na User-Agent v logoch servera. GPTBot, ClaudeBot, Google-Extended, PerplexityBot a Bytespider sa hlásia menom, no niektoré nástroje ho falšujú. Spoľahlivejšie je overiť reverzné DNS alebo IP rozsah, ktorý prevádzkovateľ crawlery zverejňuje.

Bežný používateľ prichádza z rezidenčnej IP adresy, s hlavičkami prehliadača a často s cookies. Crawler prichádza opakovane, bez cookies, z adries, ktoré patria cloudovému alebo dátovému rozsahu. V logoch sa to prejaví ako pravidelný vzor požiadaviek na rovnaké URL.

Falšovanie User-Agenta je bežné. Skript, ktorý sa vydáva za Googlebota, môže zbierať obsah alebo hľadať zraniteľnosti. Preto sa pri podozrení kontroluje reverzný záznam, nie hlavička.

Prečo rozlišovať typy AI crawlerov

Nie všetky AI boty robia to isté. Trénovací crawler sťahuje obsah do datasetu pre model. Vyhľadávací crawler sťahuje obsah, aby ho mohol citovať v odpovedi. Asistent na požiadanie používateľa navštívi stránku v reálnom čase.

Rozdiel je v dôsledku. Trénovací bot vám neprinesie návštevníka. Vyhľadávací bot môže priniesť klik z citácie. Asistent na požiadanie prinesie návštevníka priamo, keď niekto položí otázku, na ktorú máte odpoveď.

Preto sa politika nestavia ako „všetko povoliť" alebo „všetko zakázať". Stavia sa podľa toho, čo od webu chcete: byť citovaný, alebo byť platený za prístup.

Typ crawleryČo robíČo vám prinesieAko sa typicky rozhodnúť
TrénovacíSťahuje obsah do datasetu pre modelNič priame, len prítomnosť v modeliBlokovať, ak nemáte dohodu o licencii
VyhľadávacíIndexuje obsah pre citácie v odpovediachNávštevnosť z citácie, zmienku značkyPovoliť, ak chcete byť viditeľní
Asistent na požiadanieNačíta stránku pri konkrétnej otázkePriama návštevnosť, vysoký zámerPovoliť, ak stránka zvládne záťaž
Agregátor a scrapingZbiera obsah pre tretiu stranuObvykle nič, často odcudzenie textuBlokovať alebo obmedziť rýchlosť
Pustiť alebo blokovať AI crawlerov. Trénovací crawler: Blokovať, ak nemáte dohodu o licencii na text; Vyhľadávací crawler: Povoliť, ak chcete byť citovaný v odpovediach; Asistent na požiadanie: Povoliť, ak stránka zvládne záťaž; Agregátor a scraping: Blokovať alebo obmedziť rýchlosť
Rozhodnutie podľa typu crawlery a jeho prínosu pre web.

Ako overiť, či crawler patrí Googlu alebo OpenAI

Google zverejňuje reverzné DNS v tvare googlebot.com alebo google.com a odporúča spätné DNS overenie. OpenAI má podobný zoznam IP rozsahov pre GPTBot. Ak sa User-Agent hlási ako Googlebot, ale reverzný záznam nesedí, ide o podvrhnutie.

Postup overenia má tri kroky a dá sa spraviť bez špeciálnych nástrojov.

  1. V logu nájdite IP adresu a User-Agent konkrétnej požiadavky.
  2. Spravte reverzný DNS na tú IP adresu. Získate doménové meno.
  3. Spravte dopredný DNS na to meno a overte, že vráti pôvodnú IP adresu. Ak sa IP nezhoduje, ide o falšovanie.

Tretí krok je dôležitý a často sa vynecháva. Útočník vie nastaviť reverzný záznam na svojej IP tak, aby obsahoval googlebot.com. Dopredné overenie na oficiálnu doménu prevádzkovateľa to odhalí.

Pri OpenAI a ďalších prevádzkovateľoch sa používa rovnaká logika: overiť, že IP patrí rozsahu, ktorý firma zverejnila. Rozsahy sa menia, preto sa kontrolujú priebežne, nie raz.

Čo znamená robots.txt a stačí na blokovanie AI crawlerov?

robots.txt je len dohoda, nie technické obmedzenie. Slušní prevádzkovatelia ho rešpektujú, ale mnohí AI boti ho ignorujú alebo nemajú povinnosť ho čítať. Ak chcete tvrdý blok, musíte siahnuť po firewall pravidlách alebo WAF.

Súbor robots.txt je verejný text na koreni domény. Hovorí, ktoré cesty má ktorý bot navštevovať. Crawler, ktorý ho nerešpektuje, sa správa ako návštevník, ktorý ignoruje pokyn. Server mu obsah vydá, pretože nemá ako zistiť, že ide o bota, ktorý nemá prístup.

Pre blokovanie to znamená dve vrstvy. robots.txt nastaví pravidlá pre tých, ktorí ich čítajú. Firewall alebo WAF nastaví pravidlá pre všetkých ostatných. Bez druhej vrstvy je blok len želanie.

Do robots.txt sa zapisuje aj pravidlo pre AI crawlery menovite, napríklad pre GPTBot alebo ClaudeBot. Ak blokujete cestu pre všetkých, blokujete aj vyhľadávače, ktoré vám nosia návštevnosť. Preto sa blok nastavuje cielene, nie plošne.

Overenie AI crawlery v logoch. Nájsť IP a User-Agent: V logu servera vyberte konkrétnu požiadavku; Reverzný DNS: Z IP adresy získate doménové meno; Dopredný DNS: Overte, že meno vráti pôvodnú IP adresu; Zhoda s rozsahom: Porovnajte s rozsahom, ktorý firma zverejnila
Tri kroky, ktoré odhalia falšovaný User-Agent.

Ako nastaviť tvrdý blok cez firewall a WAF

Tvrdý blok spočíva v pravidlách na IP rozsahy prevádzkovateľa, nie na User-Agent. User-Agent sa dá zmeniť jedným riadkom v skripte. IP rozsah sa mení ťažšie, hoci ani ten sa nedá považovať za nemenný.

Postup pri nasadení:

  1. Zozbierajte z logov IP adresy, ktoré sa hlásia ako AI crawlery.
  2. Overte ich reverzným DNS a dopredným DNS proti zverejneným rozsahom.
  3. Vytvorte pravidlo vo firewalle alebo WAF na overené rozsahy.
  4. Nastavte obmedzenie rýchlosti pre ostatných botov, aby jeden klient nezahlcoval server.
  5. Po nasadení sledujte logy, či sa objavujú nové adresy.

Obmedzenie rýchlosti je praktickejšie než úplný blok pri crawleroch, ktoré chcete pustiť. Ak vyhľadávací bot prejde web príliš rýchlo, spomalenie ochráni server a pritom zachová indexáciu.

Chyba, ktorá sa opakuje: blokovanie celých cloudových rozsahov. Tým zablokujete aj legitímne služby, ktoré z tých rozsahov komunikujú s vaším webom. Blok sa viaže na konkrétne rozsahy prevádzkovateľa crawlery, nie na celý cloud.

Ako si overiť, že blok naozaj funguje

Overenie sa robí v logoch, nie v nastavení. Nastavenie hovorí, čo ste chceli. Log hovorí, čo sa deje.

Kontrolujte tri veci. Po prvé, či sa požiadavky od blokovaných rozsahov prestali objavovať. Po druhé, či sa objavujú z nových adries, ktoré patria rovnakému prevádzkovateľovi. Po tretie, či po bloku neklesla návštevnosť z vyhľadávania, čo by znamenalo, že ste blokovali aj niekoho, koho ste nechceli.

Sledovanie sa dá robiť manuálne cez logy alebo cez analytiku, ktorá rozlišuje botov od ľudí. Ak sledujete prínos z citácií, potrebujete oddeliť návštevnosť z AI odpovedí od bežného vyhľadávania. Pomôže vám pri tom okno atribúcie: prečo rovnaké obdobie ukazuje rozdielne čísla, pretože rovnaké obdobie môže v dvoch nástrojoch ukazovať rozdielne čísla.

Ak prevádzkujete weby pre klientov, nastavenie politiky pre crawlerov patrí do technického auditu. Agentúry, ktoré riešia reklamné operácie pre agentúry, potrebujú mať v poriadku aj túto vrstvu, pretože prínos z AI citácií sa meria rovnako ako iné kanály.

Koľko percent návštevnosti tvoria AI crawleri v porovnaní s ľuďmi?

Presné čísla závisia od odvetvia, no pri obsahových weboch sa boti bežne podieľajú 40 až 70 percentami na celkových požiadavkách. Z toho AI crawlery ako GPTBot či ClaudeBot tvoria menšiu, ale rastúcu časť. Pri e-shopoch je podiel nižší, zvyčajne pod 30 percent.

Podiel závisí od typu webu, od množstva stránok a od toho, ako často sa obsah mení. Web s tisíckami článkov generuje viac požiadaviek od botov než firemný web s piatimi stránkami. Pri e-shopoch sa veľká časť požiadaviek týka filtrov a katalógu, kde boti prechádzajú menej.

Z toho vyplýva, že podiel sa nedá prevziať z jedného webu na druhý. Ak chcete číslo pre svoj web, musíte ho zmerať v logoch a rozdeliť požiadavky podľa overených klientov. Odhad z cudzieho webu vám povie len to, či je téma pre vás relevantná.

Prečo by som mal niektoré AI crawlery pustiť a iné blokovať?

Pustenie crawlery znamená, že váš obsah môže skončiť v odpovediach ChatGPT, Perplexity alebo Google AI Overviews, čo prináša novú návštevnosť. Blokovanie chráni autorské texty pred trénovaním modelov bez kompenzácie. Rozhodnutie závisí od toho, či chcete byť citovaný, alebo skôr platený za prístup.

Pri obsahových weboch je citácia často to, čo chcete. Zmienka v odpovedi asistenta prináša návštevníka s vysokým zámerom, pretože prišiel s konkrétnou otázkou. Pri odborných textoch, ktoré sú samy produktom, je situácia opačná. Ak text predávate, jeho voľné použitie v modeli znižuje hodnotu.

Rozhodnutie sa dá nastaviť aj podľa cesty. Dá sa pustiť crawlery na blog a blokovať ich na časti webu, ktorú predávate alebo ktorá obsahuje citlivé údaje. Také pravidlo sa zapisuje do robots.txt pre tých, ktorí ho čítajú, a do firewallu pre ostatných.

Čo si zapamätať: politika pre pavúky asistentov nie je technický detail na konci projektu. Je to rozhodnutie o tom, kde sa váš obsah objaví a kto z neho ťaží.

Akú politiku zvoliť pri firemnom webe

Pri firemnom webe sa osvedčuje pustiť vyhľadávacie crawlery a blokovať trénovacie. Firemný web má za úlohu byť nájdený, keď niekto hľadá riešenie. Citácia v odpovedi asistenta je dnes ďalší vstup do vyhľadávania, podobne ako klasický výsledok.

Blokovanie trénovacích crawlerov dáva zmysel tam, kde je text hlavným aktívom. Ak predávate know-how, kurzy alebo odborné publikácie, voľné trénovanie znižuje hodnotu toho, čo predávate.

Súčasťou politiky je aj to, ako o firme hovoria odpovede AI. Ak asistent cituje zastarané alebo nesprávne informácie, návštevník prichádza s nesprávnym obrazom. Preto sa raz za čas kontroluje, čo o firme hovoria odpovede AI. Postup nájdete v čo o firme hovoria odpovede AI: 5 kontrolných bodov.

Ak chcete, aby asistenti čítali váš web správne, pomôže aj súbor, ktorý im to uľahčí. Ako ho pripraviť, je v llms.txt: Načo ho web potrebuje a čo doň napísať.

Čo si pripraviť pred zmenou politiky

Pred zmenou politiky si pripravte tri veci: zoznam botov, ktorých chcete pustiť, zoznam tých, ktorých chcete blokovať, a spôsob merania. Bez merania neviete, či zmena niečo priniesla.

Do merania patrí návštevnosť z vyhľadávania, návštevnosť z citácií a zaťaženie servera. Ak po pustení crawlery stúpne zaťaženie a návštevnosť nie, politika sa upraví. Ak stúpne návštevnosť z citácií, politika sa drží.

Zmena sa nasadzuje postupne. Najprv robots.txt, potom sledovanie, potom firewall. Takto sa dá zistiť, ktorá vrstva čo spôsobila.

Ďalší krok

Otvor svoj robots.txt a logy servera. Zisti, ktoré AI crawlery web navštevujú, over ich IP adresy reverzným DNS a rozhodni sa, ktoré z nich chceš pustiť. Ak potrebuješ nastaviť meranie prínosu z týchto návštev alebo to spraviť pre klientske weby, začni na reklamné operácie pre agentúry.

FAQ

Ako zistím, že ma navštívil AI crawler a nie bežný používateľ?

Pozrite sa na User-Agent v logoch servera. GPTBot, ClaudeBot, Google-Extended, PerplexityBot a Bytespider sa hlásia menom, no niektoré nástroje ho falšujú. Spoľahlivejšie je overiť reverzné DNS alebo IP rozsah, ktorý prevádzkovateľ crawlery zverejňuje. Bežný používateľ prichádza z rezidenčnej adresy a s cookies, crawler opakovane a bez nich.

Čo znamená robots.txt a stačí na blokovanie AI crawlerov?

robots.txt je len dohoda, nie technické obmedzenie. Slušní prevádzkovatelia ho rešpektujú, ale mnohí AI boti ho ignorujú alebo nemajú povinnosť ho čítať. Ak chcete tvrdý blok, musíte siahnuť po firewall pravidlách alebo WAF. robots.txt nastaví pravidlá pre tých, ktorí ich čítajú, firewall pre všetkých ostatných.

Ako overím, či daný crawler patrí Googlu alebo OpenAI?

Google zverejňuje reverzné DNS v tvare googlebot.com alebo google.com a odporúča spätné DNS overenie. OpenAI má podobný zoznam IP rozsahov pre GPTBot. Ak sa User-Agent hlási ako Googlebot, ale reverzný záznam nesedí, ide o podvrhnutie. Overenie má tri kroky: reverzný DNS, dopredný DNS a zhoda IP adresy.

Koľko percent návštevnosti tvoria AI crawleri v porovnaní s ľuďmi?

Presné čísla závisia od odvetvia, no pri obsahových weboch sa boti bežne podieľajú 40 až 70 percentami na celkových požiadavkách. Z toho AI crawlery ako GPTBot či ClaudeBot tvoria menšiu, ale rastúcu časť. Pri e-shopoch je podiel nižší, zvyčajne pod 30 percent. Podiel sa nedá prevziať z cudzieho webu, treba ho zmerať v logoch.

Prečo by som mal niektoré AI crawlery pustiť a iné blokovať?

Pustenie crawlery znamená, že váš obsah môže skončiť v odpovediach ChatGPT, Perplexity alebo Google AI Overviews, čo prináša novú návštevnosť. Blokovanie chráni autorské texty pred trénovaním modelov bez kompenzácie. Rozhodnutie závisí od toho, či chcete byť citovaný, alebo skôr platený za prístup. Politika sa dá nastaviť aj podľa cesty na webe.

Pozrite sa, ako to funguje v ADS Beast: pavúky asistentov.