Kako nadzorovati pajke AI z robots.txt
Pred nekaj leti so bili pajki, ki so iskali vaše spletno mesto, iskalniki in dolg rep strgal. Zdaj jih velik delež pripada jezikovnim modelom: nekateri zbirajo strani za urjenje, nekateri pridobijo stran v živo, ker je uporabnik o njej postavil vprašanje, nekateri pa oboje počnejo pod različnimi imeni. Nadzorna površina za vse je ista datoteka, kot je bila vedno - /robots.txt, datoteka z navadnim besedilom v korenu vaše domene – vendar so odločitve za njo nove.
Usposabljanje, iskanje in iskanje so tri različna vprašanja
Najpogostejša napaka je obravnavanje "pajka AI" kot ene stvari. So vsaj trije in večina prodajalcev izvaja ločen uporabniški agent za vsakega:
- Zbirka usposabljanja. Bot, ki išče na široko in shranjuje strani za prihodnji model. Če ga blokirate, vas danes nič ne stane in vam danes nič ne pridobi — gre za odločitev o licenciranju, ne o prometu.
- Pridobivanje v živo. Pridobivanje, ki ga sproži oseba v oknu za klepet, ki je prilepila vaš URL ali postavila vprašanje, na katerega vaša stran odgovarja. Če to blokirate, vas pomočnik ne more prebrati, vas ne more citirati in vas ne more povezati.
- Indeksiranje mehanizma odgovorov. Pajek, ki gradi indeks, iz katerega odgovarja iskalni izdelek AI. Če ga blokirate, vas odstrani iz rezultatov tega izdelka na enak način, kot bi blokirali iskalnik.
Založniki redno blokirajo vsa tri tako, da prilepijo eno pravilo, nato pa se sprašujejo, zakaj se njihova blagovna znamka ni več pojavljala v odgovorih pomočnika. Odločite se za kategorijo, preden napišete vrstico.
Kdo je kdo
Imena, ki jih boste dejansko videli v svojih dnevnikih, in čemu je posamezno namenjeno:
GPTBot— Širok pajek OpenAI, povezan z zbiranjem podatkov o usposabljanju.OAI-SearchBot— pajek OpenAI za rezultate v slogu iskanja; blokiranje je odločitev glede vidnosti in ne usposabljanja.ChatGPT-User— prenos v živo, opravljen, ker je vprašal uporabnik. Na drugi strani te zahteve čaka oseba.ClaudeBot— Antropikov široki pajesek.Claude-UserinClaude-SearchBotzajemajo pridobivanje, ki ga sproži uporabnik, in indeksiranje iskanja.Google-Extended— sploh ni gosenica. To je žeton, ki vam omogoča, da se odjavite od usposabljanja Gemini, medtem ko Googlebot še naprej išče iskalnik. Če ga onemogočite, to ne vpliva na vašo uvrstitev pri iskanju; zavračanjeGooglebotzelo.PerplexityBot— indeksiranje za odzivnik, ki navaja vire v vrstici.CCBot— Navadno plazenje. Ni podjetje z umetno inteligenco, vendar je njegov arhiv vložek za usposabljanje za mnoge od njih.Applebot-Extended,meta-externalagent,Amazonbot,Bytespider— isti vzorec iz Apple, Meta, Amazon in ByteDance.
Prodajalci redno dodajajo in preimenujejo agente, zato vsak seznam – vključno s tem – obravnavajte kot posnetek. Trajna navada je branje lastnih dnevnikov dostopa: potegnite ločene nize uporabniškega agenta iz dnevnega prometa in jih preglejte razčlenjevalnik uporabniškega agenta da vidite, kateri so boti, kateri brskalniki in kateri se pretvarjajo, da so brskalniki.
Pisanje pravil
Sintaksa je nespremenjena in neprizanesljiva na točno enem mestu: na vsakem User-agent skupina velja za bota, ki se ujema z njo najbolj konkretno, in bot, ki se ujema z lastnim imenom, ignorira * skupina v celoti. To torej ne deluje tako, kot je videti:
Skupina za * ki ničesar ne prepoveduje, sledi skupina za GPTBot ki onemogoča /, deluje dobro. Če pa nastavite zakasnitev pri pajku ali pravilo zemljevida spletnega mesta samo v * in domnevajo, da jo imenovani boti podedujejo, ne. V vsaki skupini ponovite vse, kar je pomembno, ali pa naj bodo vaša pravila široka.
The generator robots.txt sestavi datoteko iz potrditvenih polj — izberite agente, ki jih želite dovoliti ali blokirati, dodajte svoje nedovoljene poti in oddaja pravilno združen izpis z vrstico zemljevida spletnega mesta na koncu. Ko datoteka obstaja, jo prilepite v tester robots.txt z URL-jem in uporabniškim agentom za potrditev, da je odgovor tisti, ki ste ga mislili. Preizkušanje je tukaj pomembnejše kot običajno, ker je napaka tiha: pravilo, ki pomotoma blokira vse, je videti natanko tako kot pravilo, ki deluje, dokler promet mesec dni kasneje ne izgine.
Česa robots.txt ne zmore
Preden se zanesete na datoteko, je vredno upoštevati tri omejitve:
To je zahteva, ne ograja. Lepo vedeni pajki to spoštujejo. Strgala, ki želijo vašo vsebino, jo ignorirajo in nič v protokolu jih ne ustavi. Če potrebujete uveljavljanje, se to nahaja v konfiguraciji vašega strežnika, omejevalniku hitrosti ali pravilu WAF — in celo takrat se ujemate z nizi uporabniškega agenta in obsegi IP, ki jih je mogoče ponarediti.
Disallow ni noindex. Nedovoljeni URL se lahko še vedno prikaže v rezultatih, če se nanj povezujejo druga spletna mesta, ker je pajku naročeno, naj ne pridobi strani, ne pa naj pozabi, da obstaja. Če želite stran izločiti iz indeksa, pustite pajku, da jo pridobi in servira noindex metaoznaka ali glava. Blokiranje v datoteki robots.txt pajku aktivno prepreči, da bi videl to oznako.
Velja za gostitelja, shemo in vrata. https://example.com/robots.txt ureja samo ta izvor - ne www., ne uprizoritvena poddomena, ne ime gostitelja CDN, ki služi vašim slikam. Vsak gostitelj, ki odgovarja na zahteve, potrebuje svojo datoteko.
Pajke usmerite na tisto, kar želite indeksirati
Druga polovica datoteke je povabilo, ne izključitev. A Sitemap: vrstica daje vsakemu pajku ekspliciten seznam vaših kanoničnih URL-jev in njihove zadnje spremenjene datume, kar je najcenejši način za odkrivanje novih strani – generator zemljevidov spletnih mest pretvori seznam URL-jev v veljaven XML, ki ga lahko naložite poleg datoteke robots. Poskrbite, da bosta oba dosledna: URL, ki se pojavi na vašem zemljevidu spletnega mesta, medtem ko ni dovoljen v datoteki robots.txt, je protislovje, ki se prikaže kot napaka v vsakem orodju za poročanje, ki bere oboje.
Morda boste tudi videli llms.txt predlagano kot spremljevalno datoteko – markdown povzetek spletnega mesta, namenjenega modelom in ne pajkom. To je konvencija, ne standard, in noben večji prodajalec je ne obravnava kot direktivo. Dodajanje enega je neškodljivo; zanašanje na to za nadzor ni.
Razumen privzetek
Če objavljate vsebino in želite doseg, je nastavitev, ki jo uporablja večina spletnih mest, naslednja: dovolite iskanje v živo in pajke mehanizmov za javljanje, tako da vas pomočniki lahko najdejo in citirajo, blokirajte ali dovolite pajke za množično usposabljanje glede na to, kako se počutite o tej trgovini, nikoli se ne dotaknite Googlebot oz Bingbot razen če natančno veste, zakaj, in ohranite vrstico zemljevida spletnega mesta, ki kaže na trenutno datoteko. Če objavljate za plačilnim zidom ali prodajate licence svojemu arhivu, se izračun obrne in bistvo je blokiranje širokih pajkov.
V vsakem primeru ga napišite namerno, preizkusite glede na nize resničnega uporabniškega agenta in ga znova preverite vsakič, ko prodajalec objavi novega bota. Generator in preizkuševalec delujeta v celoti v vašem brskalniku – datoteka robotov, URL-ji in vrstice dnevnika nikoli ne zapustijo strani.
Ustvarjalec TextArray – gradnjo brezplačnih orodij, ki so na prvem mestu zasebnosti in se v celoti izvajajo v vašem brskalniku.