Preskočiť na obsah

Ako ovládať prehľadávače AI pomocou súboru robots.txt

Blog / Zverejnené 

Pred niekoľkými rokmi boli prehľadávače, ktoré zasiahli vašu stránku, vyhľadávače a dlhý chvost škrabiek. Teraz veľká časť z nich patrí k jazykovým modelom: niektoré zhromažďujú stránky na trénovanie, niektoré načítavajú stránku naživo, pretože používateľ na ňu položil otázku, a niektorí robia oboje pod rôznymi názvami. Ovládacia plocha pre všetky z nich je rovnaký súbor, akým bol vždy — /robots.txt, obyčajný textový súbor v koreňovom adresári vašej domény – ale rozhodnutia za ním sú nové.

Školenie, vyhľadávanie a vyhľadávanie sú tri rôzne otázky

Najčastejšou chybou je, že „AI crawler“ je považovaný za jednu vec. Sú najmenej tri a väčšina predajcov prevádzkuje samostatného používateľského agenta pre každého:

  1. Tréningová zbierka. Robot, ktorý široko prehľadáva a ukladá stránky pre budúci model. Jeho zablokovanie vás dnes nič nestojí a dnes nič nezíska – ide o rozhodnutie o udelení licencie, nie o rozhodnutie o premávke.
  2. Živé vyhľadávanie. Načítanie spustené osobou v okne rozhovoru, ktorá prilepila vašu adresu URL alebo položila otázku, na ktorú odpovedá vaša stránka. Ak toto zablokujete, asistent vás nemôže čítať, nemôže vás citovať a nemôže vás prepojiť.
  3. Indexovanie odpoveďovým mechanizmom. Prehľadávač, ktorý vytvára index, z ktorého odpovedá vyhľadávací produkt AI. Zablokovaním sa odstránite z výsledkov daného produktu rovnakým spôsobom, akým by ste zablokovali vyhľadávací nástroj.

Vydavatelia bežne blokujú všetky tri vložením jedného pravidla a potom sa čudujú, prečo sa ich značka prestala zobrazovať v odpovediach asistenta. Pred napísaním riadku sa rozhodnite podľa kategórie.

kto je kto

Mená, ktoré skutočne uvidíte vo svojich protokoloch, a na čo každý z nich slúži:

Dodávatelia pravidelne pridávajú a premenovávajú agentov, takže akýkoľvek zoznam – vrátane tohto – berte ako snímku. Trvalým zvykom je čítanie vlastných prístupových denníkov: vytiahnite jednotlivé reťazce používateľského agenta z jedného dňa návštevnosti a spustite ich cez analyzátor používateľského agenta aby ste videli, ktoré roboty sú, ktoré prehliadače a ktoré sa vydávajú za prehliadače.

Písanie pravidiel

Syntax je nezmenená a neúprosná presne na jednom mieste: na každom User-agent skupina sa vzťahuje na robota, ktorý sa jej zhoduje najkonkrétnejšiea robot, ktorý sa zhoduje s jeho vlastným menom, ignoruje * skupina úplne. Takže to nerobí tak, ako to vyzerá:

Skupina pre * že nič nepovoľuje, nasleduje skupina pre GPTBot to nepovoľuje /, funguje dobre. Ale ak vložíte pravidlo oneskorenia indexového prehľadávania alebo súboru sitemap iba do * skupiny a predpokladajú, že pomenované roboty ju zdedia, nie. Opakujte všetko, na čom záleží v každej skupine, alebo ponechajte svoje pravidlá široké.

The generátor robots.txt vytvorí súbor zo začiarkavacích políčok – vyberte agentov, ktorých chcete povoliť alebo zablokovať, pridajte nepovolené cesty a vygeneruje správne zoskupený výstup s riadkom mapy webu na konci. Keď súbor existuje, vložte ho do tester súborov robots.txt s adresou URL a používateľským agentom na potvrdenie, že odpoveď je tá, ktorú ste mali na mysli. Testovanie je tu dôležitejšie ako zvyčajne, pretože zlyhanie je tiché: pravidlo, ktoré náhodne blokuje všetko, vyzerá presne ako pravidlo, ktoré funguje, až kým o mesiac neskôr nezmizne návštevnosť.

Čo nedokáže súbor robots.txt

Pred spoliehaním sa na súbor sa oplatí internalizovať tri limity:

Je to prosba, nie plot. Dobre vychovaní crawleri to ctia. Stierače, ktoré chcú váš obsah, ho ignorujú a nič v protokole ich nezastaví. Ak potrebujete presadzovanie, nachádza sa v konfigurácii vášho servera, obmedzovači rýchlosti alebo pravidle WAF – a aj tak sa zhodujete s reťazcami používateľských agentov a rozsahmi IP, ktoré môžu byť sfalšované.

Disallow nie je noindex. Nepovolená adresa URL sa stále môže zobraziť vo výsledkoch, ak na ňu odkazujú iné stránky, pretože indexovému prehľadávaču sa povie, aby stránku nenačítal, ale aby zabudol, že existuje. Ak chcete, aby bola stránka vyňatá z indexu, nechajte indexový prehľadávač, aby ju získal a poskytol a noindex meta tag alebo hlavička. Blokovanie v súbore robots.txt aktívne zabraňuje indexovému prehľadávaču vidieť túto značku.

Je to pre hostiteľa, schému a port. https://example.com/robots.txt riadi iba tento pôvod – nie www., nie fázovú subdoménu, nie názov hostiteľa CDN obsluhujúci vaše obrázky. Každý hostiteľ, ktorý odpovedá na požiadavky, potrebuje svoj vlastný súbor.

Nasmerujte prehľadávače na to, čo chcete indexovať

Druhá polovica súboru je pozvánka, nie vylúčenie. A Sitemap: riadok poskytuje každému prehľadávaču explicitný zoznam vašich kanonických adries URL a dátumov ich poslednej úpravy, čo je najlacnejší spôsob, ako objaviť nové stránky – generátor mapy stránok zmení zoznam adries URL na platné XML, ktoré môžete nahrať spolu so súborom robots. Udržujte tieto dva konzistentné: adresa URL, ktorá sa zobrazuje vo vašom súbore Sitemap a zároveň je zakázaná v súbore robots.txt, je rozpor, ktorý sa zobrazuje ako chyba v každom nástroji na vytváranie prehľadov, ktorý číta oboje.

Môžete tiež vidieť llms.txt navrhnutý ako sprievodný súbor – súhrn markdown stránky zameranej skôr na modely ako na prehľadávače. Je to konvencia, nie štandard a žiadny veľký predajca to nepovažuje za smernicu. Pridanie jedného je neškodné; spoliehať sa na to pri kontrole nie je.

Rozumný štandard

Ak zverejňujete obsah a chcete osloviť, nastavenie, na ktoré sa väčšina stránok dostane, je: povoliť vyhľadávanie naživo a prehľadávače odpovedajúcich mechanizmov, aby vás asistenti mohli nájsť a citovať, blokovať alebo povoliť prehľadávače hromadného školenia podľa toho, ako sa cítite v tomto obchode, nikdy sa nedotýkajte Googlebot alebo Bingbot pokiaľ presne neviete prečo, a ponechajte čiaru mapy webu smerujúcu na aktuálny súbor. Ak publikujete za paywall alebo predávate licencie do svojho archívu, výpočet sa obráti a zablokuje široké prehľadávače.

Či tak alebo onak, napíšte ho zámerne, otestujte ho v porovnaní so skutočnými reťazcami používateľského agenta a znova ho skontrolujte vždy, keď predajca ohlási nového robota. Generátor aj tester bežia úplne vo vašom prehliadači – váš súbor robotov, vaše adresy URL a riadky denníka nikdy neopustia stránku.

Napísal Ján Turský

Tvorca TextArray – vytváranie bezplatných nástrojov na ochranu súkromia, ktoré bežia výhradne vo vašom prehliadači.