Sări la conținut

Cum să controlezi crawlerele AI cu robots.txt

Blog / Publicat 

Cu câțiva ani în urmă, crawlerele care loveau site-ul dvs. erau motoarele de căutare și o coadă lungă de scrapers. Acum, o mare parte dintre ele aparțin modelelor de limbă: unii colectează pagini pentru a se instrui, alții preiau o pagină live pentru că un utilizator a pus o întrebare despre aceasta, iar alții fac ambele sub nume diferite. Suprafața de control pentru toate acestea este același fișier care a fost întotdeauna - /robots.txt, un fișier text simplu la rădăcina domeniului dvs. - dar deciziile din spatele acestuia sunt noi.

Antrenamentul, recuperarea și căutarea sunt trei întrebări diferite

Cea mai frecventă greșeală este tratarea „AI crawler” ca pe un singur lucru. Este cel puțin trei, iar majoritatea vânzătorilor rulează un agent utilizator separat pentru fiecare:

  1. Colecția de antrenament. Un bot care accesează cu crawlere larg și stochează pagini pentru un model viitor. Blocarea acestuia nu costă nimic astăzi și nu câștigă nimic astăzi - este o decizie de acordare a licenței, nu o decizie de trafic.
  2. Recuperare în direct. O preluare declanșată de o persoană dintr-o fereastră de chat care a lipit adresa URL sau a pus o întrebare la care răspunde pagina. Blocarea acestui lucru înseamnă că asistentul nu vă poate citi, nu vă poate cita și nu vă poate lega.
  3. Indexarea motorului de răspuns. Un crawler care creează indexul din care răspunde un produs de căutare AI. Blocarea acestuia vă elimină din rezultatele produsului respectiv, la fel cum ar face blocarea unui motor de căutare.

Editorii le blochează în mod obișnuit pe toate trei prin lipirea unei reguli, apoi se întreabă de ce marca lor a încetat să apară în răspunsurile asistenței. Decideți în funcție de categorie înainte de a scrie o linie.

Cine este cine

Numele pe care le veți vedea de fapt în jurnalele dvs. și pentru ce este fiecare:

Furnizorii adaugă și redenumesc agenți în mod regulat, așa că tratați orice listă - inclusiv aceasta - ca pe un instantaneu. Obiceiul durabil este să vă citiți propriile jurnale de acces: trageți șirurile distincte de agent de utilizator dintr-o zi de trafic și rulați-le prin parser agent utilizator pentru a vedea care sunt roboți, care sunt browsere și care se prefac a fi browsere.

Scrierea regulilor

Sintaxa este neschimbată și neiertă într-un singur loc: fiecare User-agent grupul se aplică botului care se potrivește cu acesta mai precis, iar un bot care se potrivește cu propriul său nume ignoră * grup în întregime. Deci, aceasta nu face ceea ce pare:

Un grup pentru * care nu permite nimic, urmat de un grup pentru GPTBot care interzice /, funcționează bine. Dar dacă puneți o întârziere a accesului cu crawlere sau o regulă de hartă site numai în * grup și presupun că roboții numiți îl moștenesc, ei nu. Repetați orice contează în fiecare grup sau păstrați regulile generale.

The generator robots.txt creează fișierul din casetele de selectare - alegeți agenții pe care doriți să îi permiteți sau să îi blocați, adăugați căile dvs. interzise și emite rezultate grupate corect cu linia de hartă a site-ului la sfârșit. Odată ce fișierul există, lipiți-l în fișierul tester robots.txt cu o adresă URL și un agent de utilizator pentru a confirma că răspunsul este cel la care v-ați referit. Testarea contează mai mult decât de obicei aici, deoarece eșecul este tăcut: o regulă care blochează totul accidental arată exact ca o regulă care funcționează, până când traficul dispare o lună mai târziu.

Ce nu poate face robots.txt

Trei limite merită să fie internalizate înainte de a vă baza pe fișier:

Este o cerere, nu un gard. Crawlerele bine comportate îl onorează. Scrapers care doresc conținutul dvs. îl ignoră și nimic din protocol nu îi oprește. Dacă aveți nevoie de aplicare, aceasta se află în configurația serverului dvs., un limitator de rată sau o regulă WAF - și chiar și atunci vă potriviți pe șiruri de agent de utilizator și intervale de IP care pot fi falsificate.

Disallow nu este noindex. O adresă URL nepermisă poate apărea în continuare în rezultate dacă alte site-uri trimit către aceasta, deoarece crawler-ului i se spune să nu preia pagina, dar nu i se spune să uite că există. Dacă doriți o pagină dintr-un index, lăsați crawler-ul să o preia și să difuzeze a noindex metaetichetă sau antet. Blocarea în robots.txt împiedică în mod activ crawler-ul să vadă vreodată acea etichetă.

Este pe gazdă, schemă și port. https://example.com/robots.txt guvernează numai acea origine – nu www., nu subdomeniul intermediar, nu numele de gazdă CDN care vă oferă imagini. Fiecare gazdă care răspunde solicitărilor are nevoie de propriul fișier.

Îndreptați crawlerele spre ceea ce doriți să fie indexat

Cealaltă jumătate a dosarului este invitație, nu excludere. O Sitemap: linia oferă fiecărui crawler o listă explicită a adreselor URL canonice și a ultimelor date ale acestora, care este cea mai ieftină modalitate de a obține pagini noi descoperite - generator de harti site transformă o listă de adrese URL în XML valid pe care îl puteți încărca alături de fișierul robots. Păstrați consecvența celor două: o adresă URL care apare în harta dvs. de site în timp ce este interzisă în robots.txt este o contradicție care apare ca o eroare în fiecare instrument de raportare care le citește pe ambele.

S-ar putea să vezi și tu llms.txt propus ca fișier însoțitor — un rezumat markdown al unui site destinat modelelor, mai degrabă decât crawlerelor. Este o convenție, nu un standard și niciun furnizor important nu o tratează ca pe o directivă. Adăugarea unuia este inofensivă; a te baza pe ea pentru control nu este.

O implicită rezonabilă

Dacă publicați conținut și doriți acoperire, configurația la care ajung cele mai multe site-uri este: permiteți accesarea în timp real și crawlerele cu motor de răspuns, astfel încât asistenții să vă poată găsi și să vă citeze, blocați sau permiteți formarea în bloc a crawlerelor în funcție de ceea ce vă simțiți despre acea tranzacție, nu atingeți niciodată Googlebot sau Bingbot cu excepția cazului în care știți exact de ce și păstrați o linie de hartă a site-ului îndreptată către un fișier curent. Dacă publicați în spatele unui paywall sau vindeți licențe arhivei dvs., calculul se inversează și blocarea crawlerelor largi este ideea.

Oricum, scrieți-l în mod deliberat, testați-l pe șiruri de agenți de utilizator reale și verificați-l din nou ori de câte ori un furnizor anunță un nou bot. Atât generatorul, cât și testerul rulează în întregime în browser - fișierul roboților, adresele URL și liniile de jurnal nu părăsesc niciodată pagina.

Scris de Ján Turský

Creatorul lui TextArray — creează instrumente gratuite, care au prioritate confidențialitatea, care rulează în întregime în browserul tău.