Перейти до змісту
Нотатки

Коротко · SEO

Яких ШІ-ботів варто пускати на сайт?

Кожна велика ШІ-компанія надсилає кілька ботів, і щонайбільше один із них збирає сторінки для навчання. Правило, яким я користуюся, перевірка 16 ботів на власних сайтах і сайт клієнта, який щонайменше шість тижнів не пускав пошук ChatGPT.

Макс Кірієнко
Tech Lead SEO та маркетингу · 7 хв читання

Read in English

У вересні ми переглянули місяць серверних логів happymonday.ua — української кар’єрної платформи. Пошуковий краулер OpenAI, OAI-SearchBot, раз по раз запитував сторінки. Усі його запити відхиляли. Ми звірили адреси зі списком, який публікує OpenAI: це був справжній бот, а не хтось, хто назвався його ім’ям.

Коли ми перевірили robots.txt, він дозволяв доступ. Але правило на сервері блокувало бота за іменем. Водночас сторінки нормально відкривалися, коли людина запитувала про них у ChatGPT. Це інший бот — ChatGPT-User. Тож люди могли переходити на сайт із ChatGPT, але краулер, який наповнює пошук ChatGPT, не міг прочитати жодної сторінки. Пошукового краулера Apple, Applebot, блокували так само.

Логи охоплювали період із 9 серпня до 8 вересня, а перевірки наживо показували те саме блокування аж до виправлення — щонайменше шість тижнів. Розробник клієнта прибрав правило 23 вересня. 26 вересня ми перевірили ще раз: обидва боти отримують сторінку. Коли це стало видно в логах, команда сприйняла ситуацію як помилку, а не свідомий вибір. У цьому й суть цієї нотатки: на сайті може діяти рішення щодо ШІ-ботів, якого ніхто не ухвалював. На моєму теж таке було.

Я ще не можу показати, що дало виправлення. Порівняти переходи з ChatGPT плануємо через місяць після нього.

Схоже, дедалі більше людей стикаються з цими назвами. У США Ahrefs не показує пошуків за запитом «what is gptbot?» до січня 2026 року. Із червня він отримує близько 500 пошуків на місяць.

Пошуків на місяць у США: «gptbot» і «what is gptbot?»

«gptbot» два роки тримається між 282 і 690 пошуками на місяць. «what is gptbot?» до січня 2026-го не шукали зовсім, а з червня — 480–566 разів на місяць.

Оцінки Ahrefs. Запит, що з'являється нізвідки, частково можуть шукати ШІ-інструменти замість людей; вивантаження цього не розрізняє. Джерело: вивантаження Ahrefs, США, жовтень 2026

Три завдання, а не три компанії

OpenAI та Anthropic надсилають по три боти, Perplexity — два. OpenAI має й четвертого — OAI-AdsBot, але він відвідує лише сторінки, подані як реклама в ChatGPT. Правило, яке блокує «OpenAI», разом із навчальним ботом відсікає й пошукового. Тому я поділяю ботів за тим, що вони роблять зі сторінкою.

1 · Пошук

Створює індекс для відповідей із посиланнями на вас. OAI-SearchBot, Claude-SearchBot, PerplexityBot, DuckAssistBot і класичні пошукові краулери: Googlebot, Bingbot, Applebot. Дозволяйте їм доступ. Так вас цитують.

2 · Запит людини

Відкриває вашу сторінку, бо хтось запитав про неї в чаті. ChatGPT-User, Claude-User, Perplexity-User, MistralAI-User. Дозволяйте їм доступ. По той бік — читач.

3 · Навчання

Збирає сторінки для навчання майбутніх моделей. GPTBot, ClaudeBot, CCBot, Meta-ExternalAgent, Amazonbot. А ще дві назви, які ніколи не відвідують сайт і існують лише в robots.txt: Google-Extended та Applebot-Extended. Вирішувати вам. Від цього не залежить, чи з’являєтеся ви в пошуку.

OpenAI, Anthropic, Google та Apple окремо описують навчання й пошук. OpenAI прямо зазначає, що можна дозволити OAI-SearchBot і заблокувати GPTBot.

Справжній вибір є лише щодо третьої групи. За документацією самих компаній, її блокування нічого не коштує в пошуку. Google зазначає, що Google-Extended «не впливає на присутність сайту в Google Search». Apple зазначає, що сторінки, які блокують Applebot-Extended, однаково з’являються в Siri, Spotlight і Safari. AI Overview — частина Google Search і використовує сторінки, які проіндексував Googlebot, а не окремий ШІ-краулер.

Є один нюанс: Google-Extended стосується не лише навчання. Google також використовує його, щоб вирішити, чи може застосунок Gemini додавати ваші сторінки у свої відповіді. Заблокувавши його, ви залишитеся в Google Search, але можете зникнути із застосунку Gemini.

Усі 16 ботів по черзі

Що, за словами кожної компанії, робить її бот і що означає його блокування. Звірено з їхньою документацією 4 жовтня 2026 року.

БотКомпаніяЗавданняЯкщо заблокувати
OAI-SearchBotOpenAIПошукВи не з’являтиметеся у відповідях пошуку ChatGPT.
ChatGPT-UserOpenAIЗапит людиниChatGPT не зможе відкрити вашу сторінку для користувача. OpenAI зазначає, що robots.txt може не стосуватися цього бота.
GPTBotOpenAIНавчанняВаші сторінки не використають для навчання. На пошук це не вплине.
Claude-SearchBotAnthropicПошукВи можете рідше з’являтися у видачі Claude.
Claude-UserAnthropicЗапит людиниClaude не зможе завантажити вашу сторінку на запит користувача.
ClaudeBotAnthropicНавчанняВаші майбутні сторінки не використають для навчання.
PerplexityBotPerplexityПошук, не використовують для навчанняВаші сторінки можуть не з’являтися у видачі Perplexity.
Perplexity-UserPerplexityЗапит людиниPerplexity зазначає, що цей бот зазвичай ігнорує robots.txt.
GooglebotGoogleПошук, зокрема AI OverviewВи зникнете з Google Search.
BingbotMicrosoftПошукВи зникнете з Bing.
ApplebotAppleПошук у Siri, Spotlight і SafariВи зникнете з пошуку Apple. Для навчання є окрема назва — Applebot-Extended.
DuckAssistBotDuckDuckGoШІ-відповіді з джерелами, не використовують для навчанняВи не будете джерелом для цих відповідей. Ваші позиції в DuckDuckGo не зміняться.
MistralAI-UserMistralЗапит людиниАсистент Mistral не зможе відкрити вашу сторінку для користувача.
Meta-ExternalAgentMetaНавчання та продукти MetaВаші сторінки не використають для навчання Meta.
AmazonbotAmazonПродукти Amazon; може навчати її моделіЦей бот виконує кілька завдань. Тепер Amazon має окремого Amzn-SearchBot для пошуку.
CCBotCommon CrawlВідкритий вебархів, на якому навчають багато моделейУ майбутніх знімках вас не буде. Старі залишаться.

Сім пошукових ботів, чотири боти для запитів і п’ять навчальних. Справжній вибір є лише щодо останніх п’яти.

Що відповідають мої два сайти

4 жовтня я надіслав усіх 16 ботів на два свої сайти, mxkeey.com і plants.place: на головну сторінку та одну статтю кожного. Разом 64 запити, і я прогнав увесь набір двічі. Кожен запит позичає ім’я бота, тобто його ідентифікатор (user agent), і запитує сторінку:

$ curl -s -o /dev/null -w "%{http_code} %{size_download}\n" \
    -A "Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko); compatible; GPTBot/1.4; +https://openai.com/gptbot" \
    https://plants.place/wiki/monstera
200 123909
Перевіркаmxkeey.complants.place
У robots.txt згадано хоч одного ШІ-ботаНіНі
16 ботів × 2 сторінки32 із 32 отримали 20032 із 32 отримали 200
Та сама сторінка, що й у браузеріТак, крім ідентифікатора запиту, який Cloudflare додає на кожну сторінкуТак, байт у байт
Хто відповівСайт через CloudflareСайт через Cloudflare
Чи когось зупинив CloudflareНіНі

Отже, я дозволяю доступ усім, зокрема навчальним ботам. У моїх файлах robots.txt не згадано жодного ШІ-бота. На mxkeey.com у коментарі до файлу зазначено, що сайт навмисно відкритий для пошуковиків і ШІ-асистентів, але про навчання немає згадки на жодному із сайтів. Cloudflare пропустив усі 128 запитів. Щодо навчання вибір за мене зробили типові налаштування.

Типові налаштування залежать від того, коли ви приєдналися. З 15 вересня 2026 року для нових доменів у Cloudflare вони інші: на сторінках із рекламою блокують навчальних ботів і ботів, які діють від імені користувача, а пошукових пропускають. Мої домени додано раніше, і на них немає реклами, тому це їх не стосується. Якщо ваш сайт нещодавно додано до Cloudflare і він показує рекламу, перевірте це налаштування. Можливо, воно вже блокує ботів, які завантажують сторінки для ваших читачів.

Чого ця перевірка не показує. Запити надходять із мого ноутбука й лише позичають імена ботів. Цього достатньо для правил, які перевіряють лише ім’я, як серверне правило у клієнта. За документацією Cloudflare, його засоби керування ШІ на безплатному тарифі теж орієнтуються на ім’я. Цей тест узагалі не враховує robots.txt. Чемний бот читає robots.txt і сам не заходить, хоча сервер однаково відповів би кодом 200. Також перевірка нічого не каже про те, чи приходять справжні боти. Я ще не знаю, як часто вони відвідують мої сайти.

Три місця, де можуть відмовити

1 · robots.txt

Вказівка, яку бот читає перед відвідуванням. Чемний бот її виконує. Сама вона нічого не блокує.

2 · Cloudflare

Відповідає раніше за ваш сайт, якщо сайт працює через нього. Може блокувати за іменем або на основі власної перевірки бота.

3 · Ваш сервер

Відповідає останнім. Правило тут може заблокувати бота за іменем незалежно від того, що вказано в robots.txt.

Бот отримує сторінку, лише якщо всі три дозволяють доступ. Кожне налаштовують окремо — часто різні люди в різні роки.

У клієнта robots.txt дозволяв доступ, а сервер — ні. На моїх сайтах усі три дозволяють, бо ніде не згадано жодного ШІ-бота. Для нового домену Cloudflare з рекламою другий рівень може сам заблокувати доступ. Якби ми перевірили лише robots.txt, то не помітили б проблеми клієнта: з файлом усе було гаразд.

Ім’я бота — лише заява

У логах за той самий місяць було чимало запитів від імені GPTBot, PerplexityBot і Google-Extended. Жоден не надійшов з адрес, які публікують ці компанії. 100% були підробками.

Google-Extended сам себе викриває. Google зазначає, що Google-Extended не має власного ідентифікатора: Google сканує сайти звичайними ботами, а Google-Extended існує лише як рядок у robots.txt. Запит, який називається Google-Extended, за визначенням підробний.

Тож не оцінюйте ШІ-ботів за стовпцем з іменем у логах. Перевіряйте адресу. OpenAI, Anthropic, Perplexity, Google та Apple публікують адреси, з яких приходять їхні боти.

Як перевірити свій сайт

  1. Відкрийте robots.txt і знайдіть усі назви ШІ-ботів. Пам’ятайте, що Google-Extended та Applebot-Extended не відвідують сайти. Вони лише повідомляють Google і Apple, як ті можуть використовувати дані, зібрані пошуковими ботами.
  2. Запитайте головну сторінку й одну статтю з ідентифікатором кожного бота, а потім ще раз — зі звичайним ідентифікатором браузера. Порівняйте коди й розміри. Код 403 або значно менша сторінка означають, що бота десь заблокували.
  3. Якщо бота заблокували, з’ясуйте де. Сторінка помилки зазвичай усе видає: сторінка блокування Cloudflare зовсім не схожа на сторінку помилки вашого сервера.
  4. Один раз вирішіть, що робити з навчальними ботами, запишіть це в robots.txt і налаштуйте Cloudflare та сервер так само. Обережно з Cloudflare: він зазначає, що з 15 вересня блокування навчальних ботів також зупиняє краулерів, які одночасно виконують пошук і збирають дані для навчання. Серед них названо Googlebot, Bingbot та Applebot.
  5. У логах перевіряйте адреси, а не імена.

Якщо ви хочете дозволити пошук і доступ читачам, але заборонити навчання, у robots.txt потрібна одна група:

# Training bots: keep out. Search and request bots need no lines:
# they follow the rules for everyone below.
User-agent: GPTBot
User-agent: ClaudeBot
User-agent: CCBot
User-agent: Google-Extended
User-agent: Applebot-Extended
User-agent: meta-externalagent
User-agent: Amazonbot
Disallow: /

User-agent: *
Disallow: /admin

Рядок Google-Extended також не дасть використовувати ваші сторінки у відповідях застосунку Gemini. Приберіть його, якщо хочете бути там джерелом.

Є одна пастка: не створюйте окрему групу для пошукових ботів «про всяк випадок». Бот, який знаходить власне ім’я в robots.txt, виконує правила лише цієї групи й ігнорує правила для всіх. Ваші рядки Disallow перестануть на нього діяти.

На моїх сайтах навчальні боти мають доступ через типові налаштування, а не через свідоме рішення. Це єдиний вибір, який мені ще треба зробити навмисно.