Все статьи

robots.txt для AI-ботов: как открыть сайт для нейропоиска и не навредить SEO

Разбираемся, какие роботы отвечают за поиск, ответы нейросетей и обучение моделей — и даём готовую конфигурацию для российского бизнеса.

robots.txt для AI-ботов: как открыть сайт для нейропоиска и не навредить SEO

Запрос «robots.txt для ИИ ботов» звучит как задача про один файл, но у владельца сайта сегодня нет единого выбора «пускать нейросети или не пускать». У одной компании могут быть разные роботы для поиска, обучения моделей и открытия страницы по прямой просьбе пользователя. Если запретить их все одной строкой, можно одновременно отказаться и от использования текстов для обучения, и от переходов из ответов ChatGPT или Алисы. Для большинства российских компаний это слишком грубое решение.

Ниже — рабочая настройка robots.txt для ИИ-ботов: с отдельными правилами для Яндекса, OpenAI, Perplexity и Anthropic. Она подходит публичному сайту, который хочет появляться в обычном и генеративном поиске, но не готов безусловно отдавать весь контент для обучения моделей.

Короткая рекомендация: оставьте доступ поисковым роботам и ботам, которые формируют ответы со ссылками; решение об обучающих ботах примите отдельно. Закрытые кабинеты, корзину, результаты внутреннего поиска и технические разделы защищайте авторизацией, а не только robots.txt.

Почему нельзя написать одно правило для всех AI-ботов

Роботы отличаются не названием компании, а задачей.

Робот Для чего приходит Что обычно делать публичному бизнес-сайту
YandexBot Индексирует страницы для поиска Яндекса Разрешить публичные страницы
YandexAdditionalBot Управляет использованием контента в ответах Алисы AI Разрешить, если нужна видимость в нейроответах
OAI-SearchBot Находит страницы для поиска ChatGPT Разрешить
GPTBot Собирает данные, которые могут использоваться для обучения моделей OpenAI Решить отдельно
ChatGPT-User Открывает страницу по запросу пользователя ChatGPT Обычно не блокировать
PerplexityBot Индексирует материалы для ответов Perplexity со ссылками Разрешить
Perplexity-User Получает страницу по действию пользователя Обычно не блокировать
Claude-SearchBot Ищет страницы для поисковых функций Claude Разрешить, если эта аудитория важна
ClaudeBot Может собирать данные для обучения моделей Anthropic Решить отдельно
Claude-User Открывает страницу по запросу пользователя Claude Обычно не блокировать

Из таблицы видно главное: OAI-SearchBot и GPTBot — не два имени одного процесса. OpenAI прямо указывает, что управление поисковой видимостью и возможным обучением разделено. Запрет GPTBot сам по себе не должен закрывать страницу от поиска ChatGPT, если OAI-SearchBot разрешён.

У Anthropic похожая логика, но три отдельных агента: Claude-SearchBot, ClaudeBot и Claude-User. У Perplexity поисковый обход выполняет PerplexityBot, а Perplexity-User обслуживает запрос пользователя. Яндекс для участия контента в ответах Алисы описывает YandexAdditionalBot; при этом обычная поисковая индексация по-прежнему зависит от правил для роботов Яндекса.

Список неизбежно будет меняться. Поэтому хорошая настройка — не самый длинный перечень user-agent, а понятная политика: какие цели доступа компания поддерживает и кто раз в квартал сверяет имена роботов с официальной документацией.

Что на самом деле умеет robots.txt

robots.txt — публичный файл с рекомендациями для роботов. Он должен находиться в корне хоста, например https://example.ru/robots.txt, и возвращать код 200. Правила для www.example.ru не распространяются автоматически на shop.example.ru: каждому поддомену нужен свой файл.

Файл управляет обходом URL, но не является системой безопасности. Если адрес уже известен поисковику из внешних ссылок, один запрет на сканирование не гарантирует мгновенного исчезновения URL из выдачи. Для удаления страницы используют доступные поисковой системе директивы индексации, инструменты вебмастера или код ответа — в зависимости от ситуации. Если же на странице находятся персональные данные, внутренние документы или сведения о клиентах, нужна авторизация. Публиковать путь в Disallow и считать его секретным опасно: содержимое robots.txt видит любой человек.

Есть ещё один слой. Даже при разрешении в файле запрос может остановить CDN, WAF, защита от ботов или лимит частоты. В результате команда видит правильный robots.txt, а робот получает 403 или бесконечную проверку браузера. Поэтому настройку проверяют не только глазами: нужны ответы сервера и журналы запросов.

Вариант для большинства российских сайтов

Базовая стратегия для SaaS, агентства, интернет-магазина, образовательного проекта или B2B-компании выглядит так:

  • обычный поиск Яндекса открыт;
  • участие в ответах Алисы открыто;
  • поисковые роботы ChatGPT, Claude и Perplexity открыты;
  • обучающие роботы OpenAI и Anthropic закрыты до отдельного решения;
  • служебные разделы одинаково закрыты для всех корректных роботов.

Пример:

User-agent: *
Disallow: /admin/
Disallow: /account/
Disallow: /checkout/
Disallow: /search/
Allow: /

User-agent: YandexAdditionalBot
Allow: /

User-agent: OAI-SearchBot
Allow: /

User-agent: GPTBot
Disallow: /

User-agent: PerplexityBot
Allow: /

User-agent: Claude-SearchBot
Allow: /

User-agent: ClaudeBot
Disallow: /

Sitemap: https://example.ru/sitemap.xml

Это пример, а не файл для слепого копирования. Пути /account/ или /search/ могут называться иначе. Кроме того, конкретный робот применяет наиболее подходящую для него группу правил, поэтому порядок и дублирование директив нужно проверять в инструментах поисковых систем и на реальных URL.

Для Яндекса есть важная развилка. Если запретить YandexAdditionalBot, сайт может сохранить обычную поисковую видимость, но ограничить использование содержания в ответах Алисы AI. По данным справки Яндекса, изменение проявляется после повторного обхода и может занять от двух до четырнадцати дней. Поэтому не стоит оценивать эффект на следующий час после публикации файла.

Для OpenAI изменение правил поискового обхода также применяется не мгновенно: в документации указан ориентир около суток. При аудите фиксируйте не только содержимое файла, но и время его изменения.

Если компания разрешает и поиск, и обучение

Некоторые бренды заинтересованы в максимальном распространении публичных знаний: например, открытые проекты, документация продукта или исследовательские центры. Тогда отдельные запреты для GPTBot и ClaudeBot можно не добавлять:

User-agent: *
Disallow: /admin/
Disallow: /account/
Allow: /

Sitemap: https://example.ru/sitemap.xml

Такой выбор должен быть осознанным. Он касается не SEO-настройки как таковой, а политики использования контента. Если на сайте есть платные исследования, лицензионные иллюстрации, материалы партнёров или тексты с особыми договорными условиями, решение лучше согласовать с юристом и владельцем контента. Маркетолог не должен молча принимать его за всю компанию.

Если доступ нужно существенно ограничить

Бывает обратная ситуация: закрытый продукт, тестовый домен, архив для партнёров. Тогда уместен общий запрет:

User-agent: *
Disallow: /

Но это не защита. Тестовый стенд должен быть закрыт паролем или сетевым доступом, а не только строкой в robots.txt. Для временной страницы с конфиденциальными данными даже идеально соблюдающий правила робот — не главная угроза.

На рабочем публичном сайте общий запрет чаще всего оказывается аварией. Он закрывает обход не только AI-ботам, но и обычным поисковым роботам, если для них не заданы более точные правила. Перед выпуском всегда проверяйте главную страницу, несколько посадочных, карточку товара или услуги, статью, файл CSS/JS и один намеренно закрытый URL.

ChatGPT-User и Perplexity-User: особый случай

User-agent с окончанием -User обычно связан не с массовым индексированием, а с действием конкретного человека. Пользователь вставляет ссылку или просит систему прочитать страницу, после чего сервис обращается к сайту.

OpenAI сообщает, что ChatGPT-User используется для пользовательских действий, а правила robots.txt могут к таким запросам не применяться. Perplexity аналогично пишет, что Perplexity-User предназначен для запросов пользователей и обычно игнорирует файл. Это не причина считать правила бессмысленными; это причина не путать поисковый краулер с инструментом открытия ссылки.

Anthropic, напротив, заявляет, что его перечисленные агенты соблюдают robots.txt. Политики компаний различаются, и универсального предположения здесь нет. Сверять нужно первоисточник каждого провайдера.

Если требуется гарантированно запретить получение страницы, ограничьте сам доступ: авторизацией, правами, одноразовыми ссылками или сетевыми правилами. Фильтрация только по строке user-agent легко обходится и не предназначена для защиты данных.

Как не сломать сайт при настройке

Ошибка 1. Закрыть всё через User-agent:

Команда хотела запретить обучение одной модели, но добавила общий Disallow: /. Через некоторое время страницы начинают выпадать из обхода обычного поиска. Для обучающего робота используйте отдельную группу с его точным именем.

Ошибка 2. Запретить CSS, JavaScript и изображения

Поисковику может понадобиться отрисовать страницу, чтобы понять её содержание и мобильную версию. Не закрывайте каталоги со статикой по привычке. Сначала проверьте, нет ли там действительно приватных файлов; публичные ресурсы страницы обычно должны быть доступны.

Ошибка 3. Пытаться удалить страницу из поиска

Запрет обхода мешает роботу увидеть изменения на странице. Если задача — убрать URL из индекса, способ зависит от причины и поисковой системы. В Яндексе проверьте рекомендации по запрету индексирования и инструменты Вебмастера. Не смешивайте «не обходить» и «не показывать».

Ошибка 4. Скопировать список ботов из старой статьи

Названия и назначения меняются. В интернете до сих пор встречаются конфигурации, где один агент объявлен ответственным сразу за обучение, поиск и пользовательские запросы. В 2026 году это уже неверная модель. Ссылки на официальные страницы должны храниться рядом с внутренним решением компании.

Ошибка 5. Забыть про поддомены и защиту от ботов

У docs.example.ru, shop.example.ru и example.ru разные корни и потенциально разные правила. После публикации проверьте каждый хост. Если используется Cloudflare, Qrator, собственный WAF или антибот-провайдер, посмотрите реальные коды ответа. Perplexity, например, публикует сведения о своих роботах и рекомендует корректно настраивать сетевое разрешение, если защита мешает обходу.

Ошибка 6. Менять robots.txt вместе с десятью другими SEO-настройками

Если одновременно обновить canonical, sitemap, редиректы и правила роботов, источник проблемы будет трудно найти. Изменение robots.txt лучше выпускать отдельно, сохранить предыдущую версию и заранее подготовить откат.

Проверка перед публикацией

Начните с реальных типов страниц, а не с абстрактного «сайт доступен». Для корпоративного сайта это могут быть главная, услуга, кейс, статья, контакты и закрытый кабинет. Для магазина — категория, карточка товара, фильтр, поиск, корзина и заказ.

Для каждого URL ответьте на четыре вопроса:

  1. Должен ли он попадать в обычный поиск?
  2. Хотим ли мы, чтобы его содержание использовалось в генеративном ответе со ссылкой?
  3. Допускаем ли мы сбор содержания для обучения?
  4. Нет ли ограничения на уровне сервера, CDN или WAF?

Затем проверьте файл в анализаторе robots.txt Яндекс Вебмастера и откройте его по публичному адресу без авторизации. Убедитесь, что сервер отдаёт текстовый файл с кодом 200, директива Sitemap ведёт на актуальную карту, а правила относятся к нужному хосту.

После выпуска:

  • проверьте журналы сервера на обращения выбранных user-agent;
  • следите за ошибками обхода в Яндекс Вебмастере;
  • повторите проверку важных URL;
  • дайте системам время на повторный обход;
  • зафиксируйте дату следующей сверки официальных списков.

Сам факт обращения бота не означает, что страница попадёт в ответ. Доступ — только входное условие. Дальше важны качество текста, однозначные факты, авторство, внутренняя структура и внешние подтверждения. Это подробнее разобрано в материалах о Schema.org для поиска и нейросетей, мониторинге упоминаний бренда в ответах и GEO-продвижении.

Как это автоматизировать в Системе

В Системе такую задачу удобно разделить между агентами. SEO-агент собирает текущие правила, sitemap и доступность важных URL, а GEO-анализ показывает, какие страницы и факты бренда подготовлены для генеративного поиска. Агент разработки может составить точечное изменение файла и проверить его вместе с остальными настройками проекта.

«Система» полезна здесь как рабочий контур: сохраняет исходное состояние, связывает техническую проверку с контентом и напоминает о повторном аудите. Она не должна самостоятельно решать, разрешать ли обучение на материалах компании. Это бизнес- и юридическое решение, которое подтверждает владелец. После подтверждения агент выполняет согласованную политику и показывает результат проверки по каждому важному URL.

Так интеграция не превращается в рекламную вставку. Читатель получает конкретный следующий шаг: загрузить сайт в Систему, запустить SEO- и GEO-проверку, получить проект правил и перед публикацией подтвердить спорные группы роботов.

Итоговая политика без лишней сложности

Для большинства публичных российских сайтов разумная отправная точка такова: не блокировать обычный поиск, YandexAdditionalBot, OAI-SearchBot, PerplexityBot и Claude-SearchBot; отдельно решить вопрос с GPTBot и ClaudeBot; не считать robots.txt защитой приватных данных.

Главный риск — не в том, что команда забудет редкого робота. Опаснее случайно закрыть весь сайт, перепутать поиск с обучением или оставить правильный файл за стеной антибот-защиты. Проверка нескольких реальных URL и серверных ответов полезнее огромного списка user-agent, происхождение которого никто не помнит.

Источники