Не всі AI-краулери однакові: що саме ви вимикаєте одним рядком у robots.txt

Не всі AI-краулери однакові: що саме ви вимикаєте одним рядком у robots.txt

Коротка відповідь: агент не один, а три. Один збирає дані для навчання моделі. Другий будує пошуковий індекс, з якого потім беруться цитати. Третій іде на сторінку тоді, коли жива людина щось спитала асистента. Закрити їх усі однією директивою це поширене рішення, і коштує воно саме цитувань: навчання ви заднім числом не зупините, а з відповідей зникнете.

Окремо про Google, бо там найпоширеніша помилка. Закриття Google-Extended не прибирає сайт з AI Overviews, і це прямо випливає з документації.

Три ролі, які плутають в одну

Логіка однакова майже у всіх вендорів.

Навчання. Агент збирає тексти, які можуть потрапити в наступні версії моделі. Закриття діє на майбутнє й не витягує назад те, що вже зібрано.

Пошуковий індекс. Агент будує базу, з якої система дістає кандидатів, коли будує відповідь. Це і є та поверхня, де живуть цитати.

Запит користувача. Агент іде на конкретну сторінку тоді, коли людина попросила асистента подивитись посилання або відповісти по свіжих даних.

У логах усі три виглядають однаково: якийсь бот від OpenAI. Наслідки закриття протилежні.

Хто є хто

Агент Роль Що ви втрачаєте, закривши
GPTBot навчання моделей OpenAI контент не потрапить у майбутні навчальні набори; на цитування прямо не впливає
OAI-SearchBot індекс для ChatGPT Search видимість і цитати в ChatGPT
ChatGPT-User перехід за запитом людини ChatGPT не зможе відкрити вашу сторінку, коли користувач попросить
ClaudeBot навчання моделей Anthropic контент не потрапить у навчальні набори
Claude-SearchBot індекс для пошуку Claude видимість і точність у відповідях Claude
Claude-User перехід за запитом людини Claude не процитує сторінку в живій відповіді
PerplexityBot індекс Perplexity присутність у результатах Perplexity
Perplexity-User перехід за запитом людини сторінка недоступна для живого запиту
Google-Extended навчання й grounding Gemini нічого в пошуку й нічого в AI Overviews
Googlebot індекс Google Search увесь пошук Google разом з AI Overviews

За документацією Perplexity, жоден з їхніх двох агентів не використовується для навчання базових моделей, тому вибір там зводиться до одного питання. Ви присутні або ні.

Що саме ви втрачаєте, закривши кожного з агентів у robots.txt.

Що саме ви втрачаєте, закривши кожного з агентів у robots.txt.

Найдорожча помилка: Google-Extended

Цей рядок ставлять про всяк випадок частіше за всі інші, і майже завжди помилково.

Google документує Google-Extended як перемикач рівно для одного: чи можна брати ваш контент для навчання й grounding моделей Gemini. І там же прямо сказано, що він не впливає на включення сайту в пошук Google і не є сигналом ранжування. Це формулювання з їхньої документації, не наша інтерпретація.

AI Overviews при цьому є частиною пошуку й працюють на звичайному пошуковому індексі. Складіть дві посилки докупи. Закриття Google-Extended не прибирає вас з AI Overviews і взагалі нічого не змінює у видачі. Прибрати може лише закриття Googlebot, а це означає зникнути з пошуку Google цілком, разом з рештою трафіку.

Отже рядок з Google-Extended робить рівно одне: не пускає ваш контент у навчання Gemini. Якщо ви ставили його, щоб не потрапляти в ШІ-відповіді, він цієї задачі не вирішує взагалі.

Як ухвалювати рішення

Питання по суті одне. Ви продаєте через видимість чи захищаєте контент як актив.

Якщо ви хочете лідів з ШІ-відповідей, пошукові агенти й агенти живих запитів мають бути відкриті. Це OAI-SearchBot, Claude-SearchBot, PerplexityBot і всі три користувацькі. Закривати їх означає добровільно вийти з поверхні, на яку зараз переїжджає частина попиту.

Якщо для вас критично не годувати навчання, закривайте саме навчальні агенти: GPTBot, ClaudeBot, Google-Extended. Ціна відкладена й погано вимірюється. Зате по поточних цитуваннях таке рішення не б'є.

Якщо у вас платний контент або закрита база, логіка інша: там питання не в маркетингу, а в тому, що саме ви вважаєте товаром. І тоді закривати варто все, свідомо й з розумінням, що видимості в ШІ не буде.

Чого не варто робити взагалі, так це закривати все підряд одним правилом для всіх агентів, у назві яких є ШІ. Виглядає обережно. Насправді прибирає вас з відповідей і не захищає нічого, бо зібране вже зібрано.

Що ще варто перевірити після зміни robots.txt

Директива це декларація, а не гарантія.

Відфільтруйте логи за назвами агентів і подивіться коди відповідей. Буває, що robots.txt відкритий, а агент отримує 403 від файрвола чи від захисту хостингу. Такі речі живуть непоміченими місяцями.

Перевірте CDN і антибот-систему. Це найчастіша причина розриву між написаним у robots.txt і тим, що відбувається насправді, і помітити її з боку неможливо.

І перевірте, що ви не закрили агента на рівні мета-тегів або заголовків, поки шукали налаштування в robots.txt.

Чого ми не стверджуємо

Перелік агентів змінюється. Вендори додають нові токени й переназивають старі, тому таблицю вище варто звіряти з документацією перед тим, як класти зміни в продакшн, а не після.

Дотримання robots.txt добровільне. Великі вендори його декларують, але файл нікого не змушує. Потрібне справжнє обмеження доступу, робіть його на рівні сервера.

І ми не знаємо, як саме кожна система зважує сторінку після того, як дістала її. Відкритий доступ це умова участі, а не обіцянка цитати.

Часті питання

Чи прибере закриття Google-Extended мій сайт з AI Overviews?

Ні. Він керує лише використанням контенту для навчання й grounding Gemini й не впливає на включення в пошук.

Чи можна закрити навчання, але лишитись у відповідях?

Так, саме для цього агентів і розділили. Закриваєте навчальні, лишаєте пошукові й користувацькі.

Чи повертає закриття GPTBot дані, які вже зібрані?

Ні. Директива діє на майбутні звернення.

Чи використовує Perplexity свої агенти для навчання моделей?

За їхньою документацією ні. Обидва потрібні для пошуку й для переходів за запитом користувача.

Ми закрили все ще торік, це можна відкотити?

Можна, але видимість не повертається миттєво: пошуковим агентам треба заново обійти сайт і перебудувати індекс.

Підсумок

У кожного вендора три різні агенти з різними наслідками закриття. Навчальні впливають на майбутні моделі, пошукові на цитати, користувацькі на живі відповіді. Одна директива на всіх забирає видимість і не захищає нічого.

Окремо варто запам'ятати рядок про Google-Extended. Він керує лише навчанням Gemini, не є сигналом ранжування й не прибирає сайт з AI Overviews, бо ті працюють на звичайному пошуковому індексі.

І остання порада. Після будь-яких змін дивіться логи: реальні коди відповідей розходяться з написаним у robots.txt частіше, ніж здається.


Матеріал підготували Євгеній Чиж, засновник Chyzh Agency, і Дмитро Попрядухін, Head of SEO.

Поділитися
У пошуках підрядника з SEO?
Заходьте до нашого online каталогу SEO агентств та вибирайте партнера за рядом критеріїв: бал, портфоліо, відгуки, кейси та статті. Або організуйте тендер в даному каталозі, вибравши компанії, що вам сподобалися.
Більше не потрібно шукати та обдзвонювати діджитал-агентства!
Створіть тендер та отримайте пропозиції від найкращих веб-студій України.
У каталозі 1700+ діджитал-агентств, які готові допомогти в реалізації ваших завдань. Вибирайте та економте до 30% свого часу та бюджету! Це безкоштовно та займе менше 3-х хвилин.
Створити тендер
Bug