İçeriğe atla

Robots.txt ile AI tarayıcıları nasıl kontrol edilir

Blog / Yayınlandı 

Birkaç yıl önce sitenize çarpan tarayıcılar arama motorları ve uzun bir kazıyıcı kuyruğuydu. Artık bunların büyük bir kısmı dil modellerine ait: Bazıları üzerinde eğitim verilecek sayfaları topluyor, bazıları bir kullanıcı bir soru sorduğu için bir sayfayı canlı olarak getiriyor, bazıları ise her ikisini de farklı isimler altında yapıyor. Hepsinin kontrol yüzeyi her zaman olduğu gibi aynı dosyadır — /robots.txt, alan adınızın kökünde bulunan düz bir metin dosyasıdır; ancak bunun arkasındaki kararlar yenidir.

Eğitim, erişim ve arama üç farklı sorudur

En yaygın hata "AI tarayıcısını" tek bir şeymiş gibi ele almaktır. En az üç tanedir ve çoğu satıcı her biri için ayrı bir kullanıcı aracısı çalıştırır:

  1. Eğitim koleksiyonu. Geniş çapta tarama yapan ve gelecekteki bir model için sayfaları depolayan bir bot. Bunu engellemenin bugün size hiçbir maliyeti yoktur ve size hiçbir şey kazandırmaz; bu bir trafik kararı değil, bir lisans kararıdır.
  2. Canlı alma. URL'nizi yapıştıran veya sayfanızın yanıtladığı bir soruyu soran bir kişinin sohbet penceresinde tetiklediği bir getirme. Bunu engellemek, asistanın sizi okuyamayacağı, sizden alıntı yapamayacağı ve sizinle bağlantı kuramayacağı anlamına gelir.
  3. Yanıt motoru indeksleme. Bir AI arama ürününün yanıtladığı dizini oluşturan bir tarayıcı. Bunu engellemek, bir arama motorunu engellemekle aynı şekilde sizi söz konusu ürünün sonuçlarından uzaklaştırır.

Yayıncılar rutin olarak bir kural yapıştırarak üçünü de engelliyor, ardından markalarının neden asistan cevaplarında görünmeyi bıraktığını merak ediyorlar. Bir satır yazmadan önce kategoriye göre karar verin.

Kim kimdir

Günlüklerinizde göreceğiniz adlar ve her birinin ne işe yaradığı:

Satıcılar acenteleri düzenli olarak ekler ve yeniden adlandırır; bu nedenle, bu da dahil olmak üzere herhangi bir listeyi anlık görüntü olarak değerlendirin. Kalıcı alışkanlık, kendi erişim günlüklerinizi okumaktır: farklı kullanıcı aracısı dizelerini bir günlük trafikten alın ve bunları kullanıcı aracısı ayrıştırıcısı hangilerinin bot, hangilerinin tarayıcı ve hangilerinin tarayıcı gibi davrandığını görmek için.

Kuralların yazılması

Sözdizimi tam olarak tek bir yerde değişmemiştir ve affetmez: her biri User-agent grup kendisiyle eşleşen bota uygulanır en spesifik olarakve kendi adıyla eşleşen bir bot, * tamamen grup. Yani bu göründüğü gibi bir şey yapmıyor:

Bir grup * hiçbir şeye izin vermeyen, ardından bir grup gelen GPTBot bu izin vermez /, iyi çalışıyor. Ancak yalnızca bir tarama gecikmesi veya site haritası kuralı koyarsanız * gruplandırın ve adlandırılmış botların bunu devraldığını varsayın, bunu yapmazlar. Her grupta önemli olan her şeyi tekrarlayın veya kurallarınızı geniş tutun.

robots.txt oluşturucu dosyayı onay kutularından oluşturur; izin vermek veya engellemek istediğiniz aracıları seçin, izin verilmeyen yollarınızı ekleyin ve sonunda site haritası satırınızla birlikte doğru şekilde gruplandırılmış çıktılar verir. Dosya mevcut olduğunda, onu yapıştırın robots.txt test aracı Cevabın kastettiğin cevap olduğunu onaylamak için bir URL ve bir kullanıcı aracısı ile. Burada test yapmak normalden daha önemlidir çünkü hata sessizdir: Kazara her şeyi engelleyen bir kural, trafik bir ay sonra kaybolana kadar tam olarak işe yarayan bir kural gibi görünür.

robots.txt'nin yapamayacağı şeyler

Dosyaya güvenmeden önce üç sınırı içselleştirmeye değer:

Bu bir ricadır, bir çit değil. İyi huylu tarayıcılar bunu onurlandırır. İçeriğinizi isteyen kazıyıcılar bunu görmezden gelir ve protokoldeki hiçbir şey onları durduramaz. Sunucu yapılandırmanızda, bir hız sınırlayıcıda veya bir WAF kuralında bulunan yaptırıma ihtiyacınız varsa ve o zaman bile sahte olabilecek kullanıcı aracısı dizeleri ve IP aralıkları üzerinde eşleştirme yapmış olursunuz.

İzin vermeme noindex değildir. İzin verilmeyen bir URL, başka siteler ona bağlantı verdiğinde sonuçlarda görünmeye devam edebilir, çünkü tarayıcıya sayfayı getirmemesi söylenir ancak var olduğunu unutması söylenmez. Bir dizinden bir sayfa istiyorsanız, tarayıcının onu getirmesine ve sunmasına izin verin. noindex meta etiketi veya başlığı. robots.txt dosyasında engelleme, tarayıcının bu etiketi görmesini aktif olarak engeller.

Ana bilgisayar, şema ve bağlantı noktası başınadır. https://example.com/robots.txt yalnızca bu kökeni yönetir - değil www., hazırlama alt alanı değil, resimlerinizi sunan CDN ana bilgisayar adı değil. İstekleri yanıtlayan her ana bilgisayarın kendi dosyasına ihtiyacı vardır.

Tarayıcıları dizine eklenmesini istediğiniz şeye yönlendirin

Dosyanın diğer yarısı ise dışlama değil, davettir. A Sitemap: satırı, her tarayıcıya standart URL'lerinizin ve bunların son değiştirilme tarihlerinin açık bir listesini verir; bu, yeni sayfaların keşfedilmesini sağlamanın en ucuz yoludur; site haritası oluşturucu URL'lerin listesini robots dosyasının yanına yükleyebileceğiniz geçerli XML'e dönüştürür. İkisini tutarlı tutun: robots.txt dosyasında izin verilmeyen ancak site haritanızda görünen bir URL, her ikisini de okuyan her raporlama aracında hata olarak görünen bir çelişkidir.

Şunları da görebilirsiniz: llms.txt tamamlayıcı dosya olarak önerildi - tarayıcılardan ziyade modelleri hedefleyen bir sitenin markdown özeti. Bu bir standart değil, bir sözleşmedir ve hiçbir büyük satıcı bunu bir direktif olarak ele almaz. Bir tane eklemek zararsızdır; Kontrol için ona güvenmek doğru değil.

Makul bir varsayılan

İçerik yayınlıyorsanız ve erişim istiyorsanız, çoğu sitenin başvurduğu kurulum şudur: asistanların sizi bulup alıntı yapabilmesi için canlı erişime ve cevap motoru tarayıcılarına izin verin, bu ticaretle ilgili ne hissettiğinize göre toplu eğitim tarayıcılarını engelleyin veya izin verin, asla dokunmayın Googlebot veya Bingbot Tam olarak nedenini bilmiyorsanız ve site haritası satırını geçerli bir dosyayı işaret edecek şekilde tutun. Bir ödeme duvarı arkasında yayınlarsanız veya arşivinize lisans satarsanız, hesaplama tersine döner ve önemli olan geniş tarayıcıların engellenmesidir.

Her iki durumda da, bunu bilinçli bir şekilde yazın, gerçek kullanıcı aracısı dizeleriyle test edin ve bir satıcı yeni bir bot duyurduğunda yeniden kontrol edin. Hem oluşturucu hem de test cihazı tamamen tarayıcınızda çalışır; robot dosyanız, URL'leriniz ve günlük satırlarınız asla sayfadan ayrılmaz.

TextArray'in yaratıcısı — tamamen tarayıcınızda çalışan ücretsiz, gizliliğe öncelik veren araçlar geliştiriyor.