Не всі AI-краулери однакові: що саме ви вимикаєте одним рядком у robots.txt
Коротка відповідь: агент не один, а три. Один збирає дані для навчання моделі. Другий будує пошуковий індекс, з якого потім беруться цитати. Третій іде на сторінку тоді, коли жива людина щось спитала асистента. Закрити їх усі однією директивою це поширене рішення, і коштує воно саме цитувань: навчання ви заднім числом не зупините, а з відповідей зникнете.
Окремо про Google, бо там найпоширеніша помилка. Закриття Google-Extended не прибирає сайт з AI Overviews, і це прямо випливає з документації.
Три ролі, які плутають в одну
Логіка однакова майже у всіх вендорів.
Навчання. Агент збирає тексти, які можуть потрапити в наступні версії моделі. Закриття діє на майбутнє й не витягує назад те, що вже зібрано.
Пошуковий індекс. Агент будує базу, з якої система дістає кандидатів, коли будує відповідь. Це і є та поверхня, де живуть цитати.
Запит користувача. Агент іде на конкретну сторінку тоді, коли людина попросила асистента подивитись посилання або відповісти по свіжих даних.
У логах усі три виглядають однаково: якийсь бот від OpenAI. Наслідки закриття протилежні.
Хто є хто
| Агент | Роль | Що ви втрачаєте, закривши |
|---|---|---|
| GPTBot | навчання моделей OpenAI | контент не потрапить у майбутні навчальні набори; на цитування прямо не впливає |
| OAI-SearchBot | індекс для ChatGPT Search | видимість і цитати в ChatGPT |
| ChatGPT-User | перехід за запитом людини | ChatGPT не зможе відкрити вашу сторінку, коли користувач попросить |
| ClaudeBot | навчання моделей Anthropic | контент не потрапить у навчальні набори |
| Claude-SearchBot | індекс для пошуку Claude | видимість і точність у відповідях Claude |
| Claude-User | перехід за запитом людини | Claude не процитує сторінку в живій відповіді |
| PerplexityBot | індекс Perplexity | присутність у результатах Perplexity |
| Perplexity-User | перехід за запитом людини | сторінка недоступна для живого запиту |
| Google-Extended | навчання й grounding Gemini | нічого в пошуку й нічого в AI Overviews |
| Googlebot | індекс Google Search | увесь пошук Google разом з AI Overviews |
За документацією Perplexity, жоден з їхніх двох агентів не використовується для навчання базових моделей, тому вибір там зводиться до одного питання. Ви присутні або ні.

Що саме ви втрачаєте, закривши кожного з агентів у robots.txt.
Найдорожча помилка: Google-Extended
Цей рядок ставлять про всяк випадок частіше за всі інші, і майже завжди помилково.
Google документує Google-Extended як перемикач рівно для одного: чи можна брати ваш контент для навчання й grounding моделей Gemini. І там же прямо сказано, що він не впливає на включення сайту в пошук Google і не є сигналом ранжування. Це формулювання з їхньої документації, не наша інтерпретація.
AI Overviews при цьому є частиною пошуку й працюють на звичайному пошуковому індексі. Складіть дві посилки докупи. Закриття Google-Extended не прибирає вас з AI Overviews і взагалі нічого не змінює у видачі. Прибрати може лише закриття Googlebot, а це означає зникнути з пошуку Google цілком, разом з рештою трафіку.
Отже рядок з Google-Extended робить рівно одне: не пускає ваш контент у навчання Gemini. Якщо ви ставили його, щоб не потрапляти в ШІ-відповіді, він цієї задачі не вирішує взагалі.
Як ухвалювати рішення
Питання по суті одне. Ви продаєте через видимість чи захищаєте контент як актив.
Якщо ви хочете лідів з ШІ-відповідей, пошукові агенти й агенти живих запитів мають бути відкриті. Це OAI-SearchBot, Claude-SearchBot, PerplexityBot і всі три користувацькі. Закривати їх означає добровільно вийти з поверхні, на яку зараз переїжджає частина попиту.
Якщо для вас критично не годувати навчання, закривайте саме навчальні агенти: GPTBot, ClaudeBot, Google-Extended. Ціна відкладена й погано вимірюється. Зате по поточних цитуваннях таке рішення не б'є.
Якщо у вас платний контент або закрита база, логіка інша: там питання не в маркетингу, а в тому, що саме ви вважаєте товаром. І тоді закривати варто все, свідомо й з розумінням, що видимості в ШІ не буде.
Чого не варто робити взагалі, так це закривати все підряд одним правилом для всіх агентів, у назві яких є ШІ. Виглядає обережно. Насправді прибирає вас з відповідей і не захищає нічого, бо зібране вже зібрано.
Що ще варто перевірити після зміни robots.txt
Директива це декларація, а не гарантія.
Відфільтруйте логи за назвами агентів і подивіться коди відповідей. Буває, що robots.txt відкритий, а агент отримує 403 від файрвола чи від захисту хостингу. Такі речі живуть непоміченими місяцями.
Перевірте CDN і антибот-систему. Це найчастіша причина розриву між написаним у robots.txt і тим, що відбувається насправді, і помітити її з боку неможливо.
І перевірте, що ви не закрили агента на рівні мета-тегів або заголовків, поки шукали налаштування в robots.txt.
Чого ми не стверджуємо
Перелік агентів змінюється. Вендори додають нові токени й переназивають старі, тому таблицю вище варто звіряти з документацією перед тим, як класти зміни в продакшн, а не після.
Дотримання robots.txt добровільне. Великі вендори його декларують, але файл нікого не змушує. Потрібне справжнє обмеження доступу, робіть його на рівні сервера.
І ми не знаємо, як саме кожна система зважує сторінку після того, як дістала її. Відкритий доступ це умова участі, а не обіцянка цитати.
Часті питання
Чи прибере закриття Google-Extended мій сайт з AI Overviews?
Ні. Він керує лише використанням контенту для навчання й grounding Gemini й не впливає на включення в пошук.
Чи можна закрити навчання, але лишитись у відповідях?
Так, саме для цього агентів і розділили. Закриваєте навчальні, лишаєте пошукові й користувацькі.
Чи повертає закриття GPTBot дані, які вже зібрані?
Ні. Директива діє на майбутні звернення.
Чи використовує Perplexity свої агенти для навчання моделей?
За їхньою документацією ні. Обидва потрібні для пошуку й для переходів за запитом користувача.
Ми закрили все ще торік, це можна відкотити?
Можна, але видимість не повертається миттєво: пошуковим агентам треба заново обійти сайт і перебудувати індекс.
Підсумок
У кожного вендора три різні агенти з різними наслідками закриття. Навчальні впливають на майбутні моделі, пошукові на цитати, користувацькі на живі відповіді. Одна директива на всіх забирає видимість і не захищає нічого.
Окремо варто запам'ятати рядок про Google-Extended. Він керує лише навчанням Gemini, не є сигналом ранжування й не прибирає сайт з AI Overviews, бо ті працюють на звичайному пошуковому індексі.
І остання порада. Після будь-яких змін дивіться логи: реальні коди відповідей розходяться з написаним у robots.txt частіше, ніж здається.
Матеріал підготували Євгеній Чиж, засновник Chyzh Agency, і Дмитро Попрядухін, Head of SEO.
У каталозі 1700+ діджитал-агентств, які готові допомогти в реалізації ваших завдань. Вибирайте та економте до 30% свого часу та бюджету! Це безкоштовно та займе менше 3-х хвилин.