Как проверить, что сайт доступен для ИИ-ботов
Чтобы ИИ-сервисы могли цитировать ваш сайт, их роботы должны иметь доступ к страницам. Управляется это в robots.txt по названию робота. Важно, что у многих компаний боты разделены по задачам: один собирает данные для обучения моделей, другой работает для поиска, третий заходит по запросу конкретного пользователя. Их можно разрешать и запрещать независимо.
Основные роботы
| Робот | Компания | Для чего |
|---|---|---|
| GPTBot | OpenAI | Сбор данных, которые могут использоваться для обучения моделей |
| OAI-SearchBot | OpenAI | Поиск в ChatGPT: показ сайтов в результатах поиска |
| ChatGPT-User | OpenAI | Заход на страницу по запросу пользователя ChatGPT |
| ClaudeBot | Anthropic | Сбор веб-контента, который может использоваться для обучения |
| Claude-SearchBot | Anthropic | Улучшение качества поисковых ответов Claude |
| Claude-User | Anthropic | Заход на сайт по запросу пользователя Claude |
| PerplexityBot | Perplexity | Индексация для поиска Perplexity |
| Google-Extended | Управление использованием контента в генеративных продуктах Google (Gemini); на обычный поиск не влияет | |
| YandexAdditional, YandexAdditionalBot | Яндекс | Ответы Алисы AI и другие нейросетевые функции Яндекса |
Назначение каждого бота мы взяли из документации его оператора, ссылки в конце статьи. Списки роботов меняются, поэтому перед правкой файла сверяйтесь с актуальной справкой.
Что значит «открыт» и «закрыт»
- Если в
robots.txtнет запретов для бота, он вправе обходить сайт. - Запрет для обучающих ботов (например, GPTBot, ClaudeBot) означает, что вы не хотите, чтобы контент использовался для обучения. На показ в поиске это не влияет: у OpenAI, например, настройки GPTBot и OAI-SearchBot независимы.
- Запрет для поисковых ботов (OAI-SearchBot, Claude-SearchBot, PerplexityBot) уменьшает шанс появиться в ответах этих сервисов.
- Запрет для YandexAdditional или YandexAdditionalBot отключает показ вашего контента в Поиске с Алисой. По справке Яндекса, изменение учитывается в течение 2–14 дней.
Примеры robots.txt
Разрешить всех (по умолчанию так и есть, если нет запретов):
User-agent: *
Allow: /Не отдавать контент для обучения, но остаться в поиске ИИ-сервисов:
User-agent: GPTBot
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: Google-Extended
Disallow: /
User-agent: OAI-SearchBot
Allow: /
User-agent: Claude-SearchBot
Allow: /
User-agent: PerplexityBot
Allow: /Закрыть показ контента в ответах Алисы AI:
User-agent: YandexAdditionalBot
Disallow: /Для каждого робота лучше писать отдельный блок User-agent и проверять итоговый файл целиком: пропущенная пустая строка или лишний Disallow: / под User-agent: * закроют весь сайт.
Как проверить доступность
- Откройте
https://ваш-сайт.ru/robots.txtи прочитайте файл глазами. ИщитеDisallow: /дляUser-agent: *и для нужных ботов. - Если сайт на CMS, проверьте, что плагин или хостинг не подмешивает свои правила. Некоторые платформы и CDN включают блокировку ИИ-ботов отдельной настройкой, а это работает на уровне сервера и в robots.txt не видно.
- Посмотрите логи сервера и найдите обращения роботов по имени в
User-Agent: в записях будет, например,GPTBotилиClaudeBot. Ответы 403 или 429 на их запросы означают, что они блокируются. - Проверьте, что нужные страницы открываются без входа и без обязательного JavaScript. Роботы часто не выполняют скрипты.
- Автоматически: бесплатный экспресс-аудит СЕОБелки проверяет, не закрыты ли в robots.txt ИИ-роботы.
Важные ограничения
robots.txt— просьба, а не защита. Добросовестные роботы её соблюдают, недобросовестные могут игнорировать. Чтобы закрыть доступ жёстко, используют настройки сервера или CDN.- Подделывают
User-Agentчасто. Чтобы убедиться, что бот настоящий, сверяйте его IP по спискам адресов, которые публикуют операторы (например, OpenAI публикует адреса своих ботов). - Разрешение в
robots.txtне гарантирует, что сайт появится в ответах нейросетей: это лишь допуск.
Частые вопросы
Если закрыть GPTBot, исчезну ли я из ChatGPT?
Не обязательно. По документации OpenAI, настройки GPTBot и OAI-SearchBot независимы: можно закрыть обучение и остаться в поиске.
Влияет ли Google-Extended на обычный поиск Google?
Нет. Он управляет использованием контента в генеративных продуктах Google, а не обычной индексацией Googlebot.
Нужно ли что-то добавлять в robots.txt, чтобы меня цитировали?
Нет, если запретов нет. Достаточно не закрывать нужных роботов и чтобы страницы были доступны.
Где посмотреть, что бот приходил?
В логах сервера. Для Яндекса есть отдельная справка о проверке роботов, а у OpenAI и Anthropic публикуются названия агентов и адреса.
Источники
- OpenAI, обзор краулеров: https://developers.openai.com/api/docs/bots
- Anthropic, краулеры и как их ограничить: https://support.anthropic.com/en/articles/8896518-does-anthropic-crawl-data-from-the-web-and-how-can-site-owners-block-the-crawler
- Perplexity, как соблюдается robots.txt: https://www.perplexity.ai/help-center/en/articles/10354969-how-does-perplexity-follow-robots-txt
- Google, обзор поисковых роботов: https://developers.google.com/search/docs/crawling-indexing/overview-google-crawlers
- Яндекс Вебмастер, Поиск с Алисой и запрет показа: https://yandex.ru/support/webmaster/ru/alice
- Яндекс Вебмастер, как проверить, что робот принадлежит Яндексу: https://yandex.ru/support/webmaster/ru/robot-workings/check-yandex-robots
Проверьте свой сайт бесплатно
Экспресс-аудит по домену покажет, что мешает сайту попадать в поиск и в ответы ИИ, и подскажет, что исправить.
Проверить сайтЧитайте также
- Что такое llms.txt и как его создать для сайта 5 октября 2026
- Экспресс-аудит сайта за 5 минут: чек-лист из 15 пунктов 5 октября 2026