Продвижение 6 мин чтения
Robots.txt для AI-ботов: почему нейросети не видят сайт
Robots.txt для AI-ботов — самая частая техническая причина, по которой сайт не попадает в ответы нейросетей: краулеры моделей просто не могут его прочитать. Даём чек-лист из 10 пунктов, который проверяется за полчаса без программиста, и объясняем, что чинить в каждом случае.
Содержание
В предыдущей статье мы делали замер: прогоняли вопросы через нейросети и смотрели, кого они называют. Частый итог такого замера — по всем вопросам ноль упоминаний, хотя позиции в обычном поиске приличные. Прежде чем переписывать контент и чинить справочники, проверьте банальное: а могут ли боты нейросетей вообще зайти на сайт?
Случай из разряда типовых для отрасли: в robots.txt стоит запрет для всех ботов, кроме Яндекса и Google. SEO-панели зелёные, Вебмастер доволен, а GPTBot и PerplexityBot получают отказ на первом же запросе — и для половины AI-поиска сайта не существует. Владелец узнаёт об этом последним, потому что ни одна привычная панель этого не показывает.
Почему боты нейросетей — отдельная история
Привычная логика «сайт индексируется — значит, всё в порядке» здесь не работает. У нейросетей свои краулеры, и стандартный SEO-чеклист их не покрывает.
Кто ходит на сайт в 2026 году, помимо классических поисковиков:
OAI-SearchBot — краулер поискового режима ChatGPT, приходит в момент ответа пользователю;
GPTBot — бот OpenAI для сбора данных на обучение моделей;
ChatGPT-User — заходит, когда пользователь прямо в диалоге просит открыть страницу;
PerplexityBot — краулер Perplexity, тоже реальное время;
ClaudeBot — бот Anthropic;
Google-Extended — отдельная директива Google для Gemini и AI-обзоров, не путать с обычным Googlebot;
YandexBot — классический индексатор Яндекса, фундамент для Алисы и AI-ответов; рядом с ним у Яндекса появился отдельный бот YandexAI;
GigaChat — краулер одноимённой нейросети Сбера.
Про двух российских игроков — отдельно, потому что с ними всё не как у всех. GigaChat своего бота имеет, но во многом опирается на данные из поиска, поэтому управлять его доступом через один только robots.txt в полной мере не получится. DeepSeek публичных правил для своего краулера не публикует вовсе — рычаг влияния тот же, что и для Алисы: позиции в обычном поиске и общая доступность сайта.
Хорошая новость для рунета: если с индексацией в Яндексе порядок, для Алисы отдельных разрешений обычно не требуется. Плохая: западные и независимые модели ходят своими ботами, и именно их чаще всего режут — иногда сознательно, иногда случайно.
Проверка robots.txt: три типовые ошибки
Откройте файл — он лежит по адресу «ваш-домен/robots.txt», логин не нужен. Смотреть надо на три вещи.
Запрет для всех, разрешение для избранных. Конструкция, где для всех ботов стоит директива Disallow со слэшем, а разрешения выданы только Яндексу и Google, — классика. Её ставят от парсеров и спамботов, а под раздачу попадают краулеры нейросетей. Решение — либо явно разрешить нужных AI-ботов отдельными блоками, либо смягчить общий запрет.
Перепутанные директивы. Disallow без значения означает «разрешено всё», Disallow со слэшем — «запрещено всё». Разница в один символ, а последствия противоположные. Проверьте, что в файле стоит именно то, что вы имели в виду.
Опечатки в именах ботов. Имена чувствительны к написанию: GPTBot, а не GptBot. Бот с неузнанным именем попадает под общее правило — со всеми вытекающими.
Отдельная развилка — обучение против поиска. Часть владельцев сознательно закрывает GPTBot, чтобы контент не шёл в обучение моделей, но оставляет открытым OAI-SearchBot, отвечающий за поисковый режим. Это легитимная стратегия: защищаете тексты и при этом остаётесь в ответах. Главное — понимать, что закрыли и зачем, а не копировать чужой robots.txt целиком.
Robots.txt в порядке, а сайта в ответах нет
Файл — только первая дверь. Дальше три этажа, на каждом из которых бот может застрять.
Защита от ботов и CDN. Файрволы, антибот-сервисы и CDN — сети доставки контента, через которые часто проходит весь трафик сайта, — нередко отдают краулерам нейросетей код 403, «доступ запрещён», даже когда robots.txt всё разрешает. Проверяется по логам сервера: ищите запросы с именами ботов из списка выше и смотрите коды ответов. Если сплошные 403 — идите в настройки защиты и добавляйте AI-ботов в исключения.
JS-рендеринг. Если контент сайта собирается скриптами в браузере, бот может получить пустую страницу: красивый каркас без текста. Быстрая проверка без инструментов — откройте страницу и посмотрите её исходный код (правая кнопка, «Просмотр кода страницы»). Ваши тексты там есть? Отлично. Только теги и скрипты — у ботов та же картина, и это уже разговор с разработчиком о серверном рендеринге.
Скорость и стабильность. Краулеры реального времени приходят в момент ответа пользователю и ждать не будут. Страница открывается по 8–10 секунд или сервер периодически лежит — бот уйдёт к конкуренту, у которого открывается за две.
Чек-лист: 10 проверок за полчаса
Файл robots.txt открывается по своему адресу и это текст, а не страница ошибки.
В нём нет общего запрета, под который попадают все незнакомые боты.
OAI-SearchBot, PerplexityBot и ClaudeBot не запрещены — явно или общим правилом.
Google-Extended: решено осознанно — открыт или закрыт, и вы знаете почему.
Имена ботов написаны без опечаток.
Сайт индексируется в Яндексе — это фундамент для Алисы и AI-ответов.
В исходном коде страниц виден текст, а не только скрипты.
Главные страницы открываются быстрее трёх секунд.
В логах сервера боты нейросетей получают код 200 («всё в порядке»), а не 403 («запрещено») или 429 («слишком много запросов»).
Антибот-защита и CDN не режут AI-краулеров — проверено в настройках или по тем же логам.
Пункты 1–8 проверяются вообще без доступа к серверу. Для 9–10 нужны логи — если своего админа нет, это вопрос одного письма хостеру.
Что это даст и чего не даст
Скажем честно: открытый доступ — условие необходимое, но не достаточное. Если боты сайт читают, а в ответах вас по-прежнему нет, причина в другом — в позициях, в источниках или в контенте, из которого нечего процитировать. Чинить доступ стоит первым просто потому, что это самая дешёвая проверка: полчаса времени против месяцев работы с контентом.
И обратная сторона: если доступ был закрыт, после открытия не ждите мгновенного эффекта. Краулерам нужно время, чтобы переобойти сайт, — счёт идёт на недели.
Дальше по плану серии — контент: как перестроить тексты страниц, чтобы модель могла вытащить из них цитату. Именно там решается, кого из открытых для ботов сайтов нейросеть назовёт в ответе. А если хочется, чтобы техническую часть посмотрели со стороны, — доступность для AI-краулеров мы проверяем в рамках бесплатного аудита сайта вместе с SEO и скоростью.
Частые вопросы
Как проверить, что сайт закрыт от нейросетей?
Откройте файл robots.txt по адресу «ваш-домен/robots.txt» и посмотрите, нет ли запретов для ботов GPTBot, OAI-SearchBot, PerplexityBot, ClaudeBot или общего запрета для всех ботов. Затем проверьте логи сервера: если AI-боты получают код 403, их режет защита от ботов или CDN.
Нужно ли отдельно открывать сайт для Алисы, GigaChat и DeepSeek?
Обычно нет. Алиса и AI-ответы Яндекса опираются на страницы из поиска Яндекса, GigaChat тоже во многом берёт данные из поиска, а DeepSeek публичных правил для краулера не публикует. Для этой тройки главное — нормальная индексация в обычном поиске. Отдельные разрешения в robots.txt критичны для ChatGPT, Perplexity, Claude и Gemini.
Можно ли закрыть контент от обучения нейросетей, но остаться в их ответах?
Да, у крупных провайдеров это разные боты. Например, у OpenAI за обучение отвечает GPTBot, а за поисковый режим — OAI-SearchBot: первого можно запретить, второго разрешить. Учтите, что robots.txt — это просьба, а не замок: недобросовестные парсеры его игнорируют.
Через сколько сайт появится в ответах после открытия доступа?
Краулерам нужно время на переобход — обычно счёт идёт на недели. Открытый доступ сам по себе попадания в ответы не гарантирует: дальше всё решают позиции в поиске, источники информации о компании и цитируемость контента.
Что делать, если сайт на JavaScript и боты видят пустую страницу?
Обсудить с разработчиком серверный рендеринг или пререндеринг: страницы должны отдаваться ботам с готовым текстом, а не собираться скриптами в браузере. Проверить проблему просто — откройте исходный код страницы и поищите в нём свои тексты.