Preskoči na sadržaj

Kako kontrolirati AI pretraživače pomoću datoteke robots.txt

Blog / Objavljeno 

Prije nekoliko godina programi za indeksiranje koji su obilazili vašu stranicu bile su tražilice i dugi rep strugača. Sada velik dio njih pripada jezičnim modelima: neki skupljaju stranice za obuku, neki dohvaćaju stranicu uživo jer je korisnik postavio pitanje o njoj, a neki rade oboje pod različitim imenima. Kontrolna površina za sve njih ista je datoteka koja je uvijek bila — /robots.txt, obična tekstualna datoteka u korijenu vaše domene — ali odluke iza nje su nove.

Obuka, pronalaženje i pretraživanje tri su različita pitanja

Najčešća pogreška je tretiranje "AI crawlera" kao jedne stvari. Ima ih najmanje tri, a većina dobavljača pokreće zasebni korisnički agent za svaki:

  1. Zbirka treninga. Bot koji indeksira široko i pohranjuje stranice za budući model. Blokiranje vas danas ne košta ništa i ne dobivate ništa danas — to je odluka o licenciranju, a ne o prometu.
  2. Preuzimanje uživo. Dohvaćanje koje je pokrenula osoba u prozoru za chat koja je zalijepila vaš URL ili postavila pitanje na koje vaša stranica odgovara. Ako ovo blokirate, pomoćnik vas ne može čitati, citirati i povezivati.
  3. Indeksiranje mehanizma odgovora. Alat za indeksiranje koji gradi indeks iz kojeg odgovara proizvod AI pretraživanja. Njegovo blokiranje uklanja vas iz rezultata tog proizvoda na isti način kao što bi blokiranje tražilice.

Izdavači rutinski blokiraju sva tri lijepljenjem jednog pravila, a zatim se pitaju zašto se njihov brend prestao pojavljivati u odgovorima pomoćnika. Odlučite se po kategoriji prije nego što napišete redak.

Tko je tko

Imena koja ćete zapravo vidjeti u svojim zapisima i čemu svako od njih služi:

Dobavljači redovito dodaju i preimenuju agente, stoga svaki popis – uključujući ovaj – tretirajte kao snimku. Trajna navika je čitanje vlastitih zapisa pristupa: izvucite različite nizove korisničkog agenta iz dana prometa i prođite ih kroz parser korisničkog agenta da vidite koji su botovi, koji preglednici, a koji se pretvaraju da su preglednici.

Pisanje pravila

Sintaksa je nepromijenjena i neoprostiva na točno jednom mjestu: na svakom User-agent grupa primjenjuje se na bota koji joj odgovara najkonkretnije, a bot koji odgovara vlastitom imenu ignorira * grupa u cijelosti. Dakle, ovo ne radi ono što izgleda kao da radi:

Grupa za * koji ne dopušta ništa, nakon čega slijedi grupa za GPTBot koji onemogućuje /, radi dobro. Ali ako stavite odgodu indeksiranja ili pravilo karte web-lokacije samo u * grupi i pretpostavimo da je imenovani botovi nasljeđuju, oni to ne čine. Ponovite sve što je važno u svakoj grupi ili zadržite široka pravila.

The robots.txt generator gradi datoteku iz potvrdnih okvira — odaberite agente koje želite dopustiti ili blokirati, dodajte svoje nedopuštene staze i emitira ispravno grupiran izlaz s vašom linijom karte web stranice na kraju. Nakon što datoteka postoji, zalijepite je u robots.txt tester s URL-om i korisničkim agentom za potvrdu da je odgovor onaj na koji ste mislili. Testiranje je ovdje važnije nego inače jer je greška tiha: pravilo koje slučajno blokira sve izgleda točno kao pravilo koje funkcionira, sve dok promet ne nestane mjesec dana kasnije.

Što robots.txt ne može

Tri su ograničenja vrijedna internalizacije prije nego se oslonite na datoteku:

To je zahtjev, a ne ograda. Dobro odgojeni puzavci to poštuju. Strugači koji žele vaš sadržaj ga ignoriraju i ništa u protokolu ih ne zaustavlja. Ako vam je potrebna provedba, to se nalazi u konfiguraciji vašeg poslužitelja, limitatoru brzine ili WAF pravilu — čak i tada se podudarate na nizovima korisničkog agenta i IP rasponima koji se mogu lažirati.

Disallow nije noindex. Nedopušteni URL i dalje se može pojaviti u rezultatima ako druge web stranice povezuju na njega, jer je alatu za indeksiranje rečeno da ne dohvati stranicu, ali mu nije rečeno da zaboravi da postoji. Ako želite stranicu izvan indeksa, pustite alat za indeksiranje da je dohvati i posluži noindex meta oznaka ili zaglavlje. Blokiranje u robots.txt aktivno sprječava alat za indeksiranje da uopće vidi tu oznaku.

To je po hostu, shemi i portu. https://example.com/robots.txt upravlja tim porijeklom samo — ne www., a ne početnu poddomenu, ne CDN naziv hosta koji poslužuje vaše slike. Svaki host koji odgovara na zahtjeve treba vlastitu datoteku.

Usmjerite alate za indeksiranje na ono što želite indeksirati

Druga polovica datoteke je poziv, a ne isključenje. A Sitemap: daje svakom alatu za indeksiranje eksplicitni popis vaših kanonskih URL-ova i datume njihove zadnje izmjene, što je najjeftiniji način za otkrivanje novih stranica - generator karte web stranice pretvara popis URL-ova u važeći XML koji možete učitati uz datoteku robots. Održavajte to dvoje dosljednim: URL koji se pojavljuje na vašoj karti web-lokacije, a nije dopušten u robots.txt je kontradikcija koja se pojavljuje kao pogreška u svakom alatu za izvješćivanje koji čita oboje.

Možda ćete također vidjeti llms.txt predloženo kao popratna datoteka — markdown sažetak stranice usmjerene na modele, a ne na pretraživače. To je konvencija, a ne standard, i niti jedan veliki dobavljač to ne tretira kao direktivu. Dodavanje jednog je bezopasno; oslanjanje na njega za kontrolu nije.

Razuman standard

Ako objavljujete sadržaj i želite doseg, postavka na koju se većina web-mjesta oslanja je: dopustite pretraživanje uživo i alate za indeksiranje odgovora tako da vas pomoćnici mogu pronaći i citirati, blokirajte ili dopustite alate za indeksiranje skupne obuke prema tome što mislite o toj trgovini, nikad ne dirajte Googlebot ili Bingbot osim ako ne znate točno zašto, i zadržite liniju karte web stranice koja pokazuje na trenutnu datoteku. Ako objavljujete iza paywalla ili prodajete licence svojoj arhivi, izračun se obrće i poanta je blokiranje širokih alata za indeksiranje.

U svakom slučaju, napišite ga namjerno, testirajte ga u usporedbi sa stvarnim nizovima korisničkog agenta i ponovno ga provjerite kad god dobavljač najavi novog bota. I generator i tester pokreću se u potpunosti u vašem pregledniku — vaša robotska datoteka, vaši URL-ovi i redovi dnevnika nikada ne napuštaju stranicu.

Napisao Ján Turský

Tvorac TextArray — stvaranje besplatnih alata koji su na prvom mjestu privatnosti i koji se u potpunosti pokreću u vašem pregledniku.