Питання «чи пускати ШІ-ботів» звучить як етичне, а насправді воно цілком грошове. Заблокували - вас не цитують у відповідях ChatGPT і Perplexity, і канал закритий. Пустили всіх підряд - ваш контент іде в навчання чужих моделей, а сервер гріється. Правильна відповідь посередині, і вона залежить від того, що саме ви продаєте: послуги чи сам контент.
Розбираю, хто є хто серед ботів, чому звичне блокування часто не дає того, чого від нього чекають, і як виглядає робоче налаштування.
Два різні файли, дві різні задачі
Їх постійно плутають, тому одразу.
robots.txt керує доступом. Це правила про те, кому і куди можна ходити. Файл лежить у корені сайту і працює вже тридцять років.
llms.txt керує навігацією. Це markdown-файл із коротким описом проєкту і списком важливих сторінок - підказка для мовної моделі, куди дивитися. Формат новий, офіційної підтримки з боку пошуковиків немає, доведеного впливу на ранжування теж. Але коштує він пів години і не заважає: у мене такий файл лежить на цьому сайті.
Порядок правильний: спочатку розібратися з доступом, потім з навігацією. Акуратний llms.txt при закритому robots.txt марний.
Хто ходить по вашому сайту
Ключовий момент, через який більшість помиляється: у кожної компанії не один бот, а кілька, і в них різні задачі.
OpenAI. GPTBot збирає дані для навчання моделей. OAI-SearchBot будує індекс для пошуку всередині ChatGPT - саме він відповідає за те, чи потрапите ви у відповідь із посиланням. ChatGPT-User заходить на сторінку, коли конкретний користувач попросив відкрити посилання.
Google. Googlebot - звичайний пошуковий робот, він же забезпечує потрапляння в AI Overviews. Google-Extended - окремий перемикач, що відповідає за використання контенту в Gemini. Важлива деталь: блокування Google-Extended не прибирає вас із ШІ-відповідей у пошуку, бо вони живляться звичайним індексом. Багато хто блокує його, думаючи, що «вимикає ШІ», і просто втрачає присутність у Gemini.
Anthropic. ClaudeBot для навчання, окремі агенти для пошуку і для запитів, ініційованих користувачем.
Perplexity. PerplexityBot - індексація для відповідей із посиланнями.
Meta. Meta-ExternalAgent - один із найактивніших краулерів 2026 року, близько 17% усього ШІ-трафіку ботів. Користі для цитування від нього мало, навантаження помітне.
Інші. Bytespider, Amazonbot, Applebot-Extended і десятки менш відомих.
Проста логіка рішення
Відповідайте на одне питання: чи є ваш контент продуктом?
Ви продаєте послуги або товари. Контент - це маркетинг, його задача приводити клієнтів. Пускайте пошукових агентів обов'язково: кожна згадка у відповіді - це безкоштовна рекомендація. Навчальних ботів можна пускати або ні, різниці для бізнесу майже немає. Це випадок більшості сайтів, і мого зокрема.
Ви продаєте контент. Медіа, платні матеріали, база знань за підпискою, унікальні дослідження. Логіка зворотна: закривайте навчальних ботів, залишайте пошукових, щоб отримувати переходи, і стежте, щоб платна частина була за авторизацією, а не просто «прихована» на фронті.
Змішаний випадок. Відкрити публічну частину, закрити особистий кабінет, кошик, результати пошуку по сайту, службові розділи - там боту робити нічого, а навантаження він створює.
Робочий robots.txt для комерційного сайту
Що я зазвичай ставлю клієнтам, які продають послуги або товари:
User-agent: *
Allow: /
Disallow: /api/
Disallow: /cart
Disallow: /checkout
Disallow: /account
Disallow: /*?s=
# Пошукові агенти ШІ - дозволені явно
User-agent: OAI-SearchBot
Allow: /
User-agent: ChatGPT-User
Allow: /
User-agent: PerplexityBot
Allow: /
User-agent: Google-Extended
Allow: /
# Важкі краулери без користі для цитування
User-agent: Meta-ExternalAgent
Disallow: /
User-agent: Bytespider
Disallow: /
Sitemap: https://example.com/sitemap.xml
Логіка: усе, що приводить людей і цитування, відкрито; усе, що лише вантажить сервер, закрито; службові розділи закриті для всіх.
Найчастіша помилка: блокування не в robots.txt
Половина випадків «нас не цитують» пов'язана взагалі не з цим файлом.
Cloudflare і хостинги останні два роки вмикають блокування ШІ-ботів за замовчуванням для нових доменів. Власник про це не знає: robots.txt відкритий, а бот отримує 403 на рівні захисту. Перевіряти треба в панелі Cloudflare, розділ про ботів і AI Crawl Control.
WAF і антибот-модулі ріжуть запити за підозрілими патернами, і краулери туди потрапляють.
Cookie-банер, що закриває контент до згоди: бот бачить заглушку замість сторінки.
Рендер лише у браузері - формально доступ є, фактично бот отримує порожній каркас.
Перевіряється все це просто: подивіться логи сервера за назвами агентів за останній місяць. Якщо OAI-SearchBot чи PerplexityBot там не з'являються, справа не в контенті.
Про дотримання правил
Реалістичний погляд: частина ботів правила ігнорує. За дослідженнями 2025-2026 років значна частка ШІ-краулерів порушує robots.txt, і на середній сайт припадають сотні таких запитів за кілька тижнів. Звідси практичний висновок: robots.txt - це заява про наміри, а не захист. Якщо контент справді треба закрити, він має бути за авторизацією або за реальним блокуванням на рівні сервера, а не за рядком Disallow.
Як зробити llms.txt
Файл /llms.txt у корені, звичайний markdown. Усередину - те, що ви хотіли б, щоб модель знала про вас без домислів:
- Хто ви і чим займаєтеся, у двох реченнях.
- Послуги або категорії товарів із цінами від.
- Географія роботи і мови.
- Контакти.
- Посилання на ключові сторінки з короткими описами.
Тримайте його коротким і фактичним. Це не місце для маркетингових формулювань: модель шукає дані, а не емоції. Оновлюйте разом із прайсом.
Що далі
Доступ - лише перша половина роботи. Далі потрібно, щоб зі сторінки було що процитувати: прямі відповіді, цифри, мікророзмітка, серверний рендер. Про це докладно в матеріалі про GEO і в розборі Schema.org.
Я закладаю все це в сайти за замовчуванням: коректний robots, sitemap, llms.txt, розмітка, серверний рендер і перевірка того, що боти реально доходять. Якщо у вас є підозра, що вас просто не пускають, напишіть - перевірю за кілька годин.
FAQ
Що таке llms.txt і чи обов'язковий він? Це markdown-файл у корені сайту з коротким описом проєкту і списком важливих сторінок, задуманий як навігаційна підказка для мовних моделей. Обов'язковим він не є, офіційної підтримки з боку пошукових систем у нього немає і підтвердженого впливу на ранжування теж. Робити його варто тому, що це пів години роботи і він дає моделям коректний набір фактів про вас. Але пріоритет завжди за доступом у robots.txt і структурою контенту.
Чи блокувати GPTBot? Якщо ви продаєте послуги або товари, а контент використовуєте як маркетинг - блокувати немає сенсу, різниці для бізнесу майже жодної. Якщо контент сам по собі є продуктом, GPTBot як навчальний краулер логічно закрити, залишивши пошукових агентів на кшталт OAI-SearchBot, які дають переходи і цитування. Головне не переплутати ці дві ролі: закривши пошукових, ви зникаєте з відповідей.
Чи прибере блокування Google-Extended мій сайт з AI Overviews? Ні. Google-Extended керує використанням контенту в Gemini, а ШІ-відповіді в пошуку працюють на звичайному пошуковому індексі, який збирає Googlebot. Тобто блокування Google-Extended позбавляє вас присутності в Gemini, але не прибирає з AI Overviews. Єдиний спосіб повністю вийти з пошукових ШІ-відповідей - закрити сайт від Googlebot, що означає зникнення з пошуку взагалі.
Чому ШІ-боти не заходять, хоча robots.txt відкритий? Найчастіше блокування стоїть рівнем вище: Cloudflare і багато хостингів вмикають фільтрацію ШІ-краулерів за замовчуванням, і бот отримує відмову до того, як добереться до robots.txt. Інші часті причини - антибот-правила у WAF, cookie-банер, що закриває контент до згоди, і сторінки, які рендеряться лише у браузері. Перевіряється за логами сервера: шукайте назви агентів за останній місяць.
Чи захищає robots.txt контент від копіювання? Ні. Це рекомендація, а не технічний захист, і частина краулерів її ігнорує - дослідження 2026 року фіксують масові порушення. Якщо матеріал справді не можна віддавати, він має бути закритий авторизацією, платним доступом або блокуванням на рівні сервера. Файл robots.txt розумно використовувати для керування навантаженням і для явного дозволу тих ботів, від яких ви хочете цитування.




