Как проверить, что сайт доступен для ИИ-ботов

Чтобы ИИ-сервисы могли цитировать ваш сайт, их роботы должны иметь доступ к страницам. Управляется это в robots.txt по названию робота. Важно, что у многих компаний боты разделены по задачам: один собирает данные для обучения моделей, другой работает для поиска, третий заходит по запросу конкретного пользователя. Их можно разрешать и запрещать независимо.

Основные роботы

РоботКомпанияДля чего
GPTBotOpenAIСбор данных, которые могут использоваться для обучения моделей
OAI-SearchBotOpenAIПоиск в ChatGPT: показ сайтов в результатах поиска
ChatGPT-UserOpenAIЗаход на страницу по запросу пользователя ChatGPT
ClaudeBotAnthropicСбор веб-контента, который может использоваться для обучения
Claude-SearchBotAnthropicУлучшение качества поисковых ответов Claude
Claude-UserAnthropicЗаход на сайт по запросу пользователя Claude
PerplexityBotPerplexityИндексация для поиска Perplexity
Google-ExtendedGoogleУправление использованием контента в генеративных продуктах Google (Gemini); на обычный поиск не влияет
YandexAdditional, YandexAdditionalBotЯндексОтветы Алисы AI и другие нейросетевые функции Яндекса

Назначение каждого бота мы взяли из документации его оператора, ссылки в конце статьи. Списки роботов меняются, поэтому перед правкой файла сверяйтесь с актуальной справкой.

Что значит «открыт» и «закрыт»

  • Если в robots.txt нет запретов для бота, он вправе обходить сайт.
  • Запрет для обучающих ботов (например, GPTBot, ClaudeBot) означает, что вы не хотите, чтобы контент использовался для обучения. На показ в поиске это не влияет: у OpenAI, например, настройки GPTBot и OAI-SearchBot независимы.
  • Запрет для поисковых ботов (OAI-SearchBot, Claude-SearchBot, PerplexityBot) уменьшает шанс появиться в ответах этих сервисов.
  • Запрет для YandexAdditional или YandexAdditionalBot отключает показ вашего контента в Поиске с Алисой. По справке Яндекса, изменение учитывается в течение 2–14 дней.

Примеры robots.txt

Разрешить всех (по умолчанию так и есть, если нет запретов):

User-agent: *
Allow: /

Не отдавать контент для обучения, но остаться в поиске ИИ-сервисов:

User-agent: GPTBot
Disallow: /

User-agent: ClaudeBot
Disallow: /

User-agent: Google-Extended
Disallow: /

User-agent: OAI-SearchBot
Allow: /

User-agent: Claude-SearchBot
Allow: /

User-agent: PerplexityBot
Allow: /

Закрыть показ контента в ответах Алисы AI:

User-agent: YandexAdditionalBot
Disallow: /

Для каждого робота лучше писать отдельный блок User-agent и проверять итоговый файл целиком: пропущенная пустая строка или лишний Disallow: / под User-agent: * закроют весь сайт.

Как проверить доступность

  1. Откройте https://ваш-сайт.ru/robots.txt и прочитайте файл глазами. Ищите Disallow: / для User-agent: * и для нужных ботов.
  2. Если сайт на CMS, проверьте, что плагин или хостинг не подмешивает свои правила. Некоторые платформы и CDN включают блокировку ИИ-ботов отдельной настройкой, а это работает на уровне сервера и в robots.txt не видно.
  3. Посмотрите логи сервера и найдите обращения роботов по имени в User-Agent: в записях будет, например, GPTBot или ClaudeBot. Ответы 403 или 429 на их запросы означают, что они блокируются.
  4. Проверьте, что нужные страницы открываются без входа и без обязательного JavaScript. Роботы часто не выполняют скрипты.
  5. Автоматически: бесплатный экспресс-аудит СЕОБелки проверяет, не закрыты ли в robots.txt ИИ-роботы.

Важные ограничения

  • robots.txt — просьба, а не защита. Добросовестные роботы её соблюдают, недобросовестные могут игнорировать. Чтобы закрыть доступ жёстко, используют настройки сервера или CDN.
  • Подделывают User-Agent часто. Чтобы убедиться, что бот настоящий, сверяйте его IP по спискам адресов, которые публикуют операторы (например, OpenAI публикует адреса своих ботов).
  • Разрешение в robots.txt не гарантирует, что сайт появится в ответах нейросетей: это лишь допуск.

Частые вопросы

Если закрыть GPTBot, исчезну ли я из ChatGPT?

Не обязательно. По документации OpenAI, настройки GPTBot и OAI-SearchBot независимы: можно закрыть обучение и остаться в поиске.

Влияет ли Google-Extended на обычный поиск Google?

Нет. Он управляет использованием контента в генеративных продуктах Google, а не обычной индексацией Googlebot.

Нужно ли что-то добавлять в robots.txt, чтобы меня цитировали?

Нет, если запретов нет. Достаточно не закрывать нужных роботов и чтобы страницы были доступны.

Где посмотреть, что бот приходил?

В логах сервера. Для Яндекса есть отдельная справка о проверке роботов, а у OpenAI и Anthropic публикуются названия агентов и адреса.

Источники

Проверьте свой сайт бесплатно

Экспресс-аудит по домену покажет, что мешает сайту попадать в поиск и в ответы ИИ, и подскажет, что исправить.

Проверить сайт

Читайте также