Вопрос «пускать ли ИИ-ботов» звучит как этический, а на деле он вполне денежный. Заблокировали - вас не цитируют в ответах ChatGPT и Perplexity, и канал закрыт. Пустили всех подряд - ваш контент уходит в обучение чужих моделей, а сервер греется. Правильный ответ посередине, и он зависит от того, что именно вы продаёте: услуги или сам контент.
Разбираю, кто есть кто среди ботов, почему привычная блокировка часто не даёт того, чего от неё ждут, и как выглядит рабочая настройка.
Два разных файла, две разные задачи
Их постоянно путают, поэтому сразу.
robots.txt управляет доступом. Это правила о том, кому и куда можно ходить. Файл лежит в корне сайта и работает уже тридцать лет.
llms.txt управляет навигацией. Это markdown-файл с кратким описанием проекта и списком важных страниц - подсказка для языковой модели, куда смотреть. Формат новый, официальной поддержки со стороны поисковиков нет, доказанного влияния на ранжирование тоже. Но стоит он полчаса и не мешает: у меня такой файл лежит на этом сайте.
Порядок правильный: сначала разобраться с доступом, потом с навигацией. Аккуратный llms.txt при закрытом robots.txt бесполезен.
Кто ходит по вашему сайту
Ключевой момент, из-за которого большинство ошибается: у каждой компании не один бот, а несколько, и у них разные задачи.
OpenAI. GPTBot собирает данные для обучения моделей. OAI-SearchBot строит индекс для поиска внутри ChatGPT - именно он отвечает за то, попадёте ли вы в ответ со ссылкой. ChatGPT-User заходит на страницу, когда конкретный пользователь попросил открыть ссылку.
Google. Googlebot - обычный поисковый робот, он же обеспечивает попадание в AI Overviews. Google-Extended - отдельный переключатель, отвечающий за использование контента в Gemini. Важная деталь: блокировка Google-Extended не убирает вас из ИИ-ответов в поиске, потому что они питаются обычным индексом. Многие блокируют его, думая, что «отключают ИИ», и просто теряют присутствие в Gemini.
Anthropic. ClaudeBot для обучения, отдельные агенты для поиска и для запросов, инициированных пользователем.
Perplexity. PerplexityBot - индексация для ответов со ссылками.
Meta. Meta-ExternalAgent - один из самых активных краулеров 2026 года, около 17% всего ИИ-трафика ботов. Полезности для цитирования от него мало, нагрузка заметная.
Прочие. Bytespider, Amazonbot, Applebot-Extended и десятки менее известных.
Простая логика решения
Отвечайте на один вопрос: является ли ваш контент продуктом?
Вы продаёте услуги или товары. Контент - это маркетинг, его задача приводить клиентов. Пускайте поисковых агентов обязательно: каждое упоминание в ответе - это бесплатная рекомендация. Обучающих ботов можно пускать или нет, разницы для бизнеса почти нет. Это случай большинства сайтов, и мой в том числе.
Вы продаёте контент. Медиа, платные материалы, база знаний по подписке, уникальные исследования. Логика обратная: закрывайте обучающих ботов, оставляйте поисковых, чтобы получать переходы, и следите, чтобы платная часть была за авторизацией, а не просто «скрыта» на фронте.
Смешанный случай. Открыть публичную часть, закрыть личный кабинет, корзину, результаты поиска по сайту, служебные разделы - там боту делать нечего, а нагрузку он создаёт.
Рабочий robots.txt для коммерческого сайта
Что я обычно ставлю клиентам, продающим услуги или товары:
User-agent: *
Allow: /
Disallow: /api/
Disallow: /cart
Disallow: /checkout
Disallow: /account
Disallow: /*?s=
# Поисковые агенты ИИ - разрешены явно
User-agent: OAI-SearchBot
Allow: /
User-agent: ChatGPT-User
Allow: /
User-agent: PerplexityBot
Allow: /
User-agent: Google-Extended
Allow: /
# Тяжёлые краулеры без пользы для цитирования
User-agent: Meta-ExternalAgent
Disallow: /
User-agent: Bytespider
Disallow: /
Sitemap: https://example.com/sitemap.xml
Логика: всё, что приводит людей и цитирования, открыто; всё, что только грузит сервер, закрыто; служебные разделы закрыты для всех.
Самая частая ошибка: блокировка не в robots.txt
Половина случаев «нас не цитируют» связана вообще не с этим файлом.
Cloudflare и хостинги в последние два года включают блокировку ИИ-ботов по умолчанию для новых доменов. Владелец об этом не знает: robots.txt открыт, а бот получает 403 на уровне защиты. Проверять надо в панели Cloudflare, раздел про ботов и AI Crawl Control.
WAF и антибот-модули режут запросы по подозрительным паттернам, и краулеры туда попадают.
Cookie-баннер, закрывающий контент до согласия: бот видит заглушку вместо страницы.
Рендер только в браузере - формально доступ есть, фактически бот получает пустой каркас.
Проверяется всё это просто: посмотрите логи сервера по названиям агентов за последний месяц. Если OAI-SearchBot или PerplexityBot там не появляются, дело не в контенте.
Про соблюдение правил
Реалистичный взгляд: часть ботов правила игнорирует. По исследованиям 2025-2026 годов значительная доля ИИ-краулеров нарушает robots.txt, и на средний сайт приходятся сотни таких запросов за несколько недель. Отсюда практический вывод: robots.txt - это заявление о намерениях, а не защита. Если контент действительно надо закрыть, он должен быть за авторизацией или за реальной блокировкой на уровне сервера, а не за строчкой Disallow.
Как сделать llms.txt
Файл /llms.txt в корне, обычный markdown. Внутрь - то, что вы хотели бы, чтобы модель знала о вас без домыслов:
- Кто вы и чем занимаетесь, в двух предложениях.
- Услуги или категории товаров с ценами от.
- География работы и языки.
- Контакты.
- Ссылки на ключевые страницы с короткими описаниями.
Держите его коротким и фактическим. Это не место для маркетинговых формулировок: модель ищет данные, а не эмоции. Обновляйте вместе с прайсом.
Что дальше
Доступ - только первая половина работы. Дальше нужно, чтобы со страницы было что процитировать: прямые ответы, цифры, микроразметка, серверный рендер. Про это подробно в материале про GEO и в разборе Schema.org.
Я закладываю всё это в сайты по умолчанию: корректный robots, sitemap, llms.txt, разметка, серверный рендер и проверка того, что боты реально доходят. Если у вас есть подозрение, что вас просто не пускают, напишите - проверю за пару часов.
FAQ
Что такое llms.txt и обязателен ли он? Это markdown-файл в корне сайта с кратким описанием проекта и списком важных страниц, задуманный как навигационная подсказка для языковых моделей. Обязательным он не является, официальной поддержки со стороны поисковых систем у него нет и подтверждённого влияния на ранжирование тоже. Делать его стоит потому, что это полчаса работы и он даёт моделям корректный набор фактов о вас. Но приоритет всегда за доступом в robots.txt и структурой контента.
Блокировать ли GPTBot? Если вы продаёте услуги или товары, а контент используете как маркетинг - блокировать нет смысла, разницы для бизнеса почти никакой. Если контент сам по себе является продуктом, GPTBot как обучающий краулер логично закрыть, оставив поисковых агентов вроде OAI-SearchBot, которые дают переходы и цитирование. Главное не перепутать эти две роли: закрыв поисковых, вы исчезаете из ответов.
Уберёт ли блокировка Google-Extended мой сайт из AI Overviews? Нет. Google-Extended управляет использованием контента в Gemini, а ИИ-ответы в поиске работают на обычном поисковом индексе, который собирает Googlebot. То есть блокировка Google-Extended лишает вас присутствия в Gemini, но не убирает из AI Overviews. Единственный способ полностью выйти из поисковых ИИ-ответов - закрыть сайт от Googlebot, что означает уход из поиска вообще.
Почему ИИ-боты не заходят, хотя robots.txt открыт? Чаще всего блокировка стоит уровнем выше: Cloudflare и многие хостинги включают фильтрацию ИИ-краулеров по умолчанию, и бот получает отказ до того, как доберётся до robots.txt. Другие частые причины - антибот-правила в WAF, cookie-баннер, закрывающий контент до согласия, и страницы, которые рендерятся только в браузере. Проверяется по логам сервера: ищите названия агентов за последний месяц.
Защищает ли robots.txt контент от копирования? Нет. Это рекомендация, а не техническая защита, и часть краулеров её игнорирует - исследования 2026 года фиксируют массовые нарушения. Если материал действительно нельзя отдавать, он должен быть закрыт авторизацией, платным доступом или блокировкой на уровне сервера. Файл robots.txt разумно использовать для управления нагрузкой и для явного разрешения тех ботов, от которых вы хотите цитирования.




