Коротко · SEO
Яких ШІ-ботів варто пускати на сайт?
Кожна велика ШІ-компанія надсилає кілька ботів, і щонайбільше один із них збирає сторінки для навчання. Правило, яким я користуюся, перевірка 16 ботів на власних сайтах і сайт клієнта, який щонайменше шість тижнів не пускав пошук ChatGPT.
У вересні ми переглянули місяць серверних логів happymonday.ua — української кар’єрної платформи. Пошуковий краулер OpenAI, OAI-SearchBot, раз по раз запитував сторінки. Усі його запити відхиляли. Ми звірили адреси зі списком, який публікує OpenAI: це був справжній бот, а не хтось, хто назвався його ім’ям.
Коли ми перевірили robots.txt, він дозволяв доступ. Але правило на сервері блокувало бота за іменем. Водночас сторінки нормально відкривалися, коли людина запитувала про них у ChatGPT. Це інший бот — ChatGPT-User. Тож люди могли переходити на сайт із ChatGPT, але краулер, який наповнює пошук ChatGPT, не міг прочитати жодної сторінки. Пошукового краулера Apple, Applebot, блокували так само.
Логи охоплювали період із 9 серпня до 8 вересня, а перевірки наживо показували те саме блокування аж до виправлення — щонайменше шість тижнів. Розробник клієнта прибрав правило 23 вересня. 26 вересня ми перевірили ще раз: обидва боти отримують сторінку. Коли це стало видно в логах, команда сприйняла ситуацію як помилку, а не свідомий вибір. У цьому й суть цієї нотатки: на сайті може діяти рішення щодо ШІ-ботів, якого ніхто не ухвалював. На моєму теж таке було.
Я ще не можу показати, що дало виправлення. Порівняти переходи з ChatGPT плануємо через місяць після нього.
Схоже, дедалі більше людей стикаються з цими назвами. У США Ahrefs не показує пошуків за запитом «what is gptbot?» до січня 2026 року. Із червня він отримує близько 500 пошуків на місяць.
Пошуків на місяць у США: «gptbot» і «what is gptbot?»
«gptbot» два роки тримається між 282 і 690 пошуками на місяць. «what is gptbot?» до січня 2026-го не шукали зовсім, а з червня — 480–566 разів на місяць.
Три завдання, а не три компанії
OpenAI та Anthropic надсилають по три боти, Perplexity — два. OpenAI має й четвертого — OAI-AdsBot, але він відвідує лише сторінки, подані як реклама в ChatGPT. Правило, яке блокує «OpenAI», разом із навчальним ботом відсікає й пошукового. Тому я поділяю ботів за тим, що вони роблять зі сторінкою.
1 · Пошук
Створює індекс для відповідей із посиланнями на вас. OAI-SearchBot, Claude-SearchBot, PerplexityBot, DuckAssistBot і класичні пошукові краулери: Googlebot, Bingbot, Applebot. Дозволяйте їм доступ. Так вас цитують.
2 · Запит людини
Відкриває вашу сторінку, бо хтось запитав про неї в чаті. ChatGPT-User, Claude-User, Perplexity-User, MistralAI-User. Дозволяйте їм доступ. По той бік — читач.
3 · Навчання
Збирає сторінки для навчання майбутніх моделей. GPTBot, ClaudeBot, CCBot, Meta-ExternalAgent, Amazonbot. А ще дві назви, які ніколи не відвідують сайт і існують лише в robots.txt: Google-Extended та Applebot-Extended. Вирішувати вам. Від цього не залежить, чи з’являєтеся ви в пошуку.
Справжній вибір є лише щодо третьої групи. За документацією самих компаній, її блокування нічого не коштує в пошуку. Google зазначає, що Google-Extended «не впливає на присутність сайту в Google Search». Apple зазначає, що сторінки, які блокують Applebot-Extended, однаково з’являються в Siri, Spotlight і Safari. AI Overview — частина Google Search і використовує сторінки, які проіндексував Googlebot, а не окремий ШІ-краулер.
Є один нюанс: Google-Extended стосується не лише навчання. Google також використовує його, щоб вирішити, чи може застосунок Gemini додавати ваші сторінки у свої відповіді. Заблокувавши його, ви залишитеся в Google Search, але можете зникнути із застосунку Gemini.
Усі 16 ботів по черзі
Що, за словами кожної компанії, робить її бот і що означає його блокування. Звірено з їхньою документацією 4 жовтня 2026 року.
| Бот | Компанія | Завдання | Якщо заблокувати |
|---|---|---|---|
| OAI-SearchBot | OpenAI | Пошук | Ви не з’являтиметеся у відповідях пошуку ChatGPT. |
| ChatGPT-User | OpenAI | Запит людини | ChatGPT не зможе відкрити вашу сторінку для користувача. OpenAI зазначає, що robots.txt може не стосуватися цього бота. |
| GPTBot | OpenAI | Навчання | Ваші сторінки не використають для навчання. На пошук це не вплине. |
| Claude-SearchBot | Anthropic | Пошук | Ви можете рідше з’являтися у видачі Claude. |
| Claude-User | Anthropic | Запит людини | Claude не зможе завантажити вашу сторінку на запит користувача. |
| ClaudeBot | Anthropic | Навчання | Ваші майбутні сторінки не використають для навчання. |
| PerplexityBot | Perplexity | Пошук, не використовують для навчання | Ваші сторінки можуть не з’являтися у видачі Perplexity. |
| Perplexity-User | Perplexity | Запит людини | Perplexity зазначає, що цей бот зазвичай ігнорує robots.txt. |
| Googlebot | Пошук, зокрема AI Overview | Ви зникнете з Google Search. | |
| Bingbot | Microsoft | Пошук | Ви зникнете з Bing. |
| Applebot | Apple | Пошук у Siri, Spotlight і Safari | Ви зникнете з пошуку Apple. Для навчання є окрема назва — Applebot-Extended. |
| DuckAssistBot | DuckDuckGo | ШІ-відповіді з джерелами, не використовують для навчання | Ви не будете джерелом для цих відповідей. Ваші позиції в DuckDuckGo не зміняться. |
| MistralAI-User | Mistral | Запит людини | Асистент Mistral не зможе відкрити вашу сторінку для користувача. |
| Meta-ExternalAgent | Meta | Навчання та продукти Meta | Ваші сторінки не використають для навчання Meta. |
| Amazonbot | Amazon | Продукти Amazon; може навчати її моделі | Цей бот виконує кілька завдань. Тепер Amazon має окремого Amzn-SearchBot для пошуку. |
| CCBot | Common Crawl | Відкритий вебархів, на якому навчають багато моделей | У майбутніх знімках вас не буде. Старі залишаться. |
Сім пошукових ботів, чотири боти для запитів і п’ять навчальних. Справжній вибір є лише щодо останніх п’яти.
Що відповідають мої два сайти
4 жовтня я надіслав усіх 16 ботів на два свої сайти, mxkeey.com і plants.place: на головну сторінку та одну статтю кожного. Разом 64 запити, і я прогнав увесь набір двічі. Кожен запит позичає ім’я бота, тобто його ідентифікатор (user agent), і запитує сторінку:
$ curl -s -o /dev/null -w "%{http_code} %{size_download}\n" \
-A "Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko); compatible; GPTBot/1.4; +https://openai.com/gptbot" \
https://plants.place/wiki/monstera
200 123909
| Перевірка | mxkeey.com | plants.place |
|---|---|---|
| У robots.txt згадано хоч одного ШІ-бота | Ні | Ні |
| 16 ботів × 2 сторінки | 32 із 32 отримали 200 | 32 із 32 отримали 200 |
| Та сама сторінка, що й у браузері | Так, крім ідентифікатора запиту, який Cloudflare додає на кожну сторінку | Так, байт у байт |
| Хто відповів | Сайт через Cloudflare | Сайт через Cloudflare |
| Чи когось зупинив Cloudflare | Ні | Ні |
Отже, я дозволяю доступ усім, зокрема навчальним ботам. У моїх файлах robots.txt не згадано жодного ШІ-бота. На mxkeey.com у коментарі до файлу зазначено, що сайт навмисно відкритий для пошуковиків і ШІ-асистентів, але про навчання немає згадки на жодному із сайтів. Cloudflare пропустив усі 128 запитів. Щодо навчання вибір за мене зробили типові налаштування.
Типові налаштування залежать від того, коли ви приєдналися. З 15 вересня 2026 року для нових доменів у Cloudflare вони інші: на сторінках із рекламою блокують навчальних ботів і ботів, які діють від імені користувача, а пошукових пропускають. Мої домени додано раніше, і на них немає реклами, тому це їх не стосується. Якщо ваш сайт нещодавно додано до Cloudflare і він показує рекламу, перевірте це налаштування. Можливо, воно вже блокує ботів, які завантажують сторінки для ваших читачів.
Чого ця перевірка не показує. Запити надходять із мого ноутбука й лише позичають імена ботів. Цього достатньо для правил, які перевіряють лише ім’я, як серверне правило у клієнта. За документацією Cloudflare, його засоби керування ШІ на безплатному тарифі теж орієнтуються на ім’я. Цей тест узагалі не враховує robots.txt. Чемний бот читає robots.txt і сам не заходить, хоча сервер однаково відповів би кодом 200. Також перевірка нічого не каже про те, чи приходять справжні боти. Я ще не знаю, як часто вони відвідують мої сайти.
Три місця, де можуть відмовити
1 · robots.txt
Вказівка, яку бот читає перед відвідуванням. Чемний бот її виконує. Сама вона нічого не блокує.
2 · Cloudflare
Відповідає раніше за ваш сайт, якщо сайт працює через нього. Може блокувати за іменем або на основі власної перевірки бота.
3 · Ваш сервер
Відповідає останнім. Правило тут може заблокувати бота за іменем незалежно від того, що вказано в robots.txt.
У клієнта robots.txt дозволяв доступ, а сервер — ні. На моїх сайтах усі три дозволяють, бо ніде не згадано жодного ШІ-бота. Для нового домену Cloudflare з рекламою другий рівень може сам заблокувати доступ. Якби ми перевірили лише robots.txt, то не помітили б проблеми клієнта: з файлом усе було гаразд.
Ім’я бота — лише заява
У логах за той самий місяць було чимало запитів від імені GPTBot, PerplexityBot і Google-Extended. Жоден не надійшов з адрес, які публікують ці компанії. 100% були підробками.
Google-Extended сам себе викриває. Google зазначає, що Google-Extended не має власного ідентифікатора: Google сканує сайти звичайними ботами, а Google-Extended існує лише як рядок у robots.txt. Запит, який називається Google-Extended, за визначенням підробний.
Тож не оцінюйте ШІ-ботів за стовпцем з іменем у логах. Перевіряйте адресу. OpenAI, Anthropic, Perplexity, Google та Apple публікують адреси, з яких приходять їхні боти.
Як перевірити свій сайт
- Відкрийте robots.txt і знайдіть усі назви ШІ-ботів. Пам’ятайте, що Google-Extended та Applebot-Extended не відвідують сайти. Вони лише повідомляють Google і Apple, як ті можуть використовувати дані, зібрані пошуковими ботами.
- Запитайте головну сторінку й одну статтю з ідентифікатором кожного бота, а потім ще раз — зі звичайним ідентифікатором браузера. Порівняйте коди й розміри. Код 403 або значно менша сторінка означають, що бота десь заблокували.
- Якщо бота заблокували, з’ясуйте де. Сторінка помилки зазвичай усе видає: сторінка блокування Cloudflare зовсім не схожа на сторінку помилки вашого сервера.
- Один раз вирішіть, що робити з навчальними ботами, запишіть це в robots.txt і налаштуйте Cloudflare та сервер так само. Обережно з Cloudflare: він зазначає, що з 15 вересня блокування навчальних ботів також зупиняє краулерів, які одночасно виконують пошук і збирають дані для навчання. Серед них названо Googlebot, Bingbot та Applebot.
- У логах перевіряйте адреси, а не імена.
Якщо ви хочете дозволити пошук і доступ читачам, але заборонити навчання, у robots.txt потрібна одна група:
# Training bots: keep out. Search and request bots need no lines:
# they follow the rules for everyone below.
User-agent: GPTBot
User-agent: ClaudeBot
User-agent: CCBot
User-agent: Google-Extended
User-agent: Applebot-Extended
User-agent: meta-externalagent
User-agent: Amazonbot
Disallow: /
User-agent: *
Disallow: /admin
Рядок Google-Extended також не дасть використовувати ваші сторінки у відповідях застосунку Gemini. Приберіть його, якщо хочете бути там джерелом.
Є одна пастка: не створюйте окрему групу для пошукових ботів «про всяк випадок». Бот, який знаходить власне ім’я в robots.txt, виконує правила лише цієї групи й ігнорує правила для всіх. Ваші рядки Disallow перестануть на нього діяти.
На моїх сайтах навчальні боти мають доступ через типові налаштування, а не через свідоме рішення. Це єдиний вибір, який мені ще треба зробити навмисно.