Як керувати сканерами AI за допомогою robots.txt
Кілька років тому сканери, які відвідували ваш сайт, були пошуковими системами та довгим хвостом скребків. Тепер значна частина з них відноситься до мовних моделей: деякі збирають сторінки для навчання, деякі завантажують сторінку в режимі реального часу, тому що користувач поставив про неї запитання, а деякі роблять і те, і інше під різними іменами. Поверхнею керування для всіх них є той самий файл, яким він завжди був — /robots.txt, звичайний текстовий файл у корені вашого домену, але рішення, що стоять за ним, нові.
Навчання, пошук і пошук – це три різні питання
Найпоширенішою помилкою є сприйняття "сканера AI" як одного. Їх принаймні три, і більшість постачальників запускають окремий агент користувача для кожного:
- Навчальний збірник. Бот, який сканує широко і зберігає сторінки для майбутньої моделі. Його блокування сьогодні вам нічого не коштує та нічого не приносить вам сьогодні — це рішення про ліцензування, а не про трафік.
- Живий пошук. Отримання, ініційоване людиною у вікні чату, яка вставила вашу URL-адресу або поставила запитання, на яке відповідає ваша сторінка. Якщо це заблокувати, помічник не зможе прочитати вас, не зможе цитувати вас і не зможе посилати вас.
- Індексація механізму відповідей. Веб-сканер, який створює індекс, з якого відповідає пошуковий продукт ШІ. Його блокування видаляє вас із результатів цього продукту так само, як блокування пошукової системи.
Видавці регулярно блокують усі три, вставляючи одне правило, а потім дивуються, чому їхній бренд перестав з’являтися у відповідях помічника. Перш ніж писати рядок, виберіть категорію.
Хто є хто
Назви, які ви побачите у своїх журналах, і для чого кожне з них:
GPTBot— Широкий сканер OpenAI, пов’язаний зі збором навчальних даних.OAI-SearchBot— сканер OpenAI для результатів у стилі пошуку; його блокування – це рішення щодо видимості, а не навчання.ChatGPT-User— вибірка в реальному часі, зроблена через запит користувача. На іншому кінці цього запиту чекає людина.ClaudeBot— повзун Антропіка.Claude-UserіClaude-SearchBotохоплюють вибірку, ініційовану користувачем, і індексацію пошуку.Google-Extended— зовсім не гусеничний. Це маркер, який дозволяє вам відмовитися від навчання Gemini, поки Googlebot продовжує сканувати пошук. Його заборона не впливає на ваш пошуковий рейтинг; заборонаGooglebotдуже багато.PerplexityBot— індексація для механізму відповідей, який посилається на джерела.CCBot— Звичайний кроль. Це не компанія штучного інтелекту, але її архів є матеріалом для навчання для багатьох із них.Applebot-Extended,meta-externalagent,Amazonbot,Bytespider— однаковий шаблон від Apple, Meta, Amazon і ByteDance.
Постачальники регулярно додають і перейменовують агентів, тому сприймайте будь-який список, включаючи цей, як знімок. Стійкою звичкою є читання власних журналів доступу: витягніть окремі рядки агента користувача з денного трафіку та проведіть їх через аналізатор агента користувача щоб побачити, які є ботами, які є браузерами, а які прикидаються браузерами.
Написання правил
Синтаксис незмінний і невблаганний лише в одному місці: у кожному User-agent група застосовується до бота, який їй відповідає найбільш конкретно, а бот, який відповідає своєму імені, ігнорує * група цілком. Отже, це не так, як виглядає:
Група для * що нічого не забороняє, а потім група для GPTBot що забороняє /, працює добре. Але якщо ви розміщуєте затримку сканування або правило карти сайту лише в * групу та припустити, що названі боти успадковують її, вони цього не роблять. Повторюйте все, що має значення в кожній групі, або дотримуйтеся широких правил.
The генератор robots.txt будує файл із прапорців — виберіть агентів, яких ви хочете дозволити чи заблокувати, додайте свої заборонені шляхи, і він видає правильно згрупований вихід із вашим рядком карти сайту в кінці. Коли файл існує, вставте його в Тестер robots.txt з URL-адресою та агентом користувача, щоб підтвердити, що відповідь саме ту, яку ви мали на увазі. Тестування має тут більше значення, ніж зазвичай, тому що помилка мовчить: правило, яке випадково блокує все, виглядає точно так само, як правило, яке працює, доки трафік не зникне через місяць.
Що не може зробити robots.txt
Перш ніж покладатися на файл, варто враховувати три обмеження:
Це прохання, а не паркан. Добре виховані повзуни шанують це. Скребки, яким потрібен ваш вміст, ігнорують його, і ніщо в протоколі їх не зупиняє. Якщо вам потрібен примусовий контроль, який міститься в конфігурації вашого сервера, обмежувачі швидкості чи правилі WAF — і навіть тоді ви зіставляєте рядки агента користувача та діапазони IP-адрес, які можна підробити.
Disallow не є noindex. Заборонена URL-адреса все ще може з’являтися в результатах, якщо на неї посилаються інші сайти, оскільки веб-сканеру наказано не завантажувати сторінку, але не забувати про її існування. Якщо ви хочете, щоб сторінка вийшла з індексу, дозвольте сканеру отримати її та обслуговувати noindex мета-тег або заголовок. Блокування в robots.txt активно запобігає сканеру від перегляду цього тегу.
Це для хосту, схеми та порту. https://example.com/robots.txt керує лише цим походженням — ні www., а не проміжний субдомен, а не ім’я хосту CDN, що обслуговує ваші зображення. Кожному хосту, який відповідає на запити, потрібен власний файл.
Спрямуйте сканери на те, що ви хочете проіндексувати
Інша половина файлу є запрошенням, а не виключенням. А Sitemap: рядок надає кожному веб-сканеру чіткий список ваших канонічних URL-адрес і дати їх останньої зміни, що є найдешевшим способом виявлення нових сторінок — генератор карти сайту перетворює список URL-адрес на дійсний XML, який можна завантажити разом із файлом robots. Дотримуйтеся узгодженості між цими двома параметрами: URL-адреса, яка відображається у вашій карті сайту, але заборонена в robots.txt, є суперечністю, яка відображається як помилка в кожному інструменті звітування, який читає обидва.
Ви також можете побачити llms.txt пропонується як супровідний файл — короткий опис сайту markdown, орієнтований на моделі, а не на сканери. Це конвенція, а не стандарт, і жоден великий постачальник не розглядає це як директиву. Додавання одного нешкідливо; покладатися на нього для контролю не можна.
Розумний дефолт
Якщо ви публікуєте вміст і бажаєте отримати охоплення, більшість сайтів використовують такі налаштування: дозвольте пошукові роботи в режимі реального часу та роботу систем відповідей, щоб помічники могли знайти вас і цитувати вас, заблокуйте або дозволіть сканерів для масового навчання відповідно до ваших уявлень про цю торгівлю, ніколи не чіпайте Googlebot або Bingbot якщо ви точно не знаєте, чому, і збережіть рядок карти сайту, що вказує на поточний файл. Якщо ви публікуєте за платним екраном або продаєте ліцензії на свій архів, розрахунок інвертується, і головне блокування широких сканерів.
У будь-якому випадку, пишіть його навмисно, перевіряйте на реальних рядках агента користувача та перевіряйте його щоразу, коли постачальник оголошує про нового бота. І генератор, і тестер повністю працюють у вашому браузері — ваш файл robots, ваші URL-адреси та рядки журналу ніколи не залишають сторінку.
Творець TextArray — створення безкоштовних інструментів, націлених на конфіденційність, які повністю працюють у вашому браузері.