Robots.txt управляет доступом робота к обходу URL, а meta robots и X-Robots-Tag — обработкой уже полученного документа, включая запрет показа в поиске. Из-за этой разницы сочетание Disallow и noindex часто не удаляет страницу: робот не может открыть URL и увидеть запрет индексации. Сначала определите задачу — снизить лишний обход, исключить документ из поиска или ограничить сниппет — и только затем выбирайте директиву.
Если нужна системная работа с поисковым спросом, технической базой и контентом, изучите услугу комплексного SEO-продвижения.

Три уровня управления роботами
Смежная задача разобрана отдельно: Meta robots и X-Robots-Tag: как применять noindex и nofollow.
Что делает robots.txt
Файл по адресу `/robots.txt` задает правила обхода путей для user-agent. В англоязычных отчетах этап обхода называют crawl. `Disallow` просит робота не загружать совпадающие URL; `Allow` уточняет исключение внутри запрета, если конкретный робот поддерживает правило.
Robots.txt не является надежным способом скрыть URL из поиска. Он помогает управлять лишним обходом и краулинговым бюджетом, но адрес, закрытый от обхода, может быть известен по ссылкам и появиться без содержательного сниппета. Для удаления из индекса роботу нужно разрешить загрузить страницу и увидеть noindex.
Что делает meta robots
В HTML страницы размещают `<meta name="robots" content="noindex, follow">` или правила для конкретного робота. Noindex просит не включать документ в результаты; ограничения сниппета управляют представлением содержимого.
Meta robots работает только когда робот получает HTML и способен прочитать head. Директива в JavaScript, который не выполняется, или после поврежденной разметки может не сработать ожидаемо.
Когда нужен X-Robots-Tag
HTTP-заголовок `X-Robots-Tag` применяет правила к ответу сервера и подходит для PDF, изображений и других файлов без HTML head. Его также используют для централизованного управления группой документов на сервере.
Проверяйте итоговые заголовки после CDN и прокси: правило может добавляться на одном уровне и дублироваться на другом. При конфликте поисковик обычно применяет более ограничивающее условие.
Nofollow не равен запрету обхода
Nofollow просит не переходить по ссылкам на странице или не учитывать конкретную ссылку обычным образом. Это не гарантирует, что целевой URL не будет найден через другие страницы, Sitemap или внешние ссылки.
Для внутренних URL не стройте управление архитектурой на массовом nofollow. Удалите бесполезные ссылки, нормализуйте параметры и настройте правила обхода; важные страницы должны иметь обычные доступные ссылки.
Практические сценарии
Смежная задача разобрана отдельно: Мобильная версия сайта для SEO: как адаптировать и проверить.
Служебные разделы и личный кабинет
Корзина, оформление заказа, результаты внутреннего поиска и личные данные не должны зависеть только от robots.txt. Закройте доступ авторизацией там, где информация приватна; для публично доступных служебных страниц используйте noindex.
Robots-директивы не являются механизмом безопасности. Любой пользователь может открыть разрешенный URL, а содержание robots.txt публично показывает закрытые пути.
Фильтры и параметры
Сначала решите, какие комбинации имеют спрос и будут отдельными посадочными. Для остальных уменьшите генерацию ссылок, нормализуйте параметры и при необходимости ограничьте обход шаблонов.
Не блокируйте критические CSS и JavaScript, необходимые для рендеринга индексируемой страницы. Если робот видит неполный интерфейс или контент, диагностика качества и мобильности становится ненадежной.
Тестовый стенд
Надежная защита staging — авторизация или сетевое ограничение. Один `Disallow: /` не защищает данные и может быть случайно перенесен на боевой домен.
Перед релизом включите отдельный пункт приемки: проверить robots.txt, meta robots, HTTP-заголовки и настройки CMS на рабочем домене. Это предотвращает массовый noindex после миграции.
Удаление уже проиндексированной страницы
Если URL должен исчезнуть, но оставаться доступным пользователю, верните 200 с noindex и разрешите обход. Если страница удалена без замены, отдавайте корректный 404 или 410; если есть точный преемник — постоянный редирект.
Инструмент временного удаления в поисковой консоли ускоряет скрытие, но не заменяет постоянное состояние сервера. По окончании срока URL может вернуться, если причина не устранена.
Sitemap в robots.txt
В файл можно добавить строку с абсолютным адресом XML Sitemap. Это помогает обнаружению карты, но ее все равно полезно отправить и контролировать в поисковых консолях.
Sitemap должен содержать канонические индексируемые URL. Наличие страницы одновременно в Sitemap и под noindex или Disallow создает противоречивые сигналы и засоряет отчеты.
Синтаксис, тестирование и контроль
Структура файла robots.txt
Правила группируются под `User-agent`. Путь начинается с корня; звездочка используется как шаблон, знак `$` — как окончание адреса у роботов, которые его поддерживают. Даже лишний символ меняет область совпадения.
Не копируйте файл конкурента: пути CMS, параметры и необходимые ресурсы различаются. Начинайте с минимальных доказуемых запретов и документируйте назначение каждой группы.
Почему порядок и специфика правила важны
Поисковые роботы могут выбирать наиболее специфичное совпадение, а не просто последнюю строку. Точное поведение проверяйте по документации конкретного поисковика и его инструменту тестирования.
Проверяйте не один пример, а матрицу: URL, который должен быть разрешен; соседний, который должен быть запрещен; параметр; ресурс; альтернативный регистр и слеш. Так обнаруживаются слишком широкие шаблоны.
Как провести массовый аудит
Соберите URL из обхода, Sitemap, консолей, логов и CMS. Для каждой строки сопоставьте robots-доступность, meta robots, X-Robots-Tag, код ответа, canonical и наличие во внутренних ссылках.
Сегментируйте по шаблонам. Если тысячи карточек получили noindex, исправляйте условие шаблона. Если один PDF открыт для индексации, корректируйте заголовок конкретного типа файла.
Типовые опасные сочетания
Disallow плюс noindex на одной странице опасен, потому что noindex может остаться невидимым. Noindex плюс canonical на другую страницу смешивает просьбу исключить URL и сигнал консолидации. Sitemap плюс запрет создает очередь заведомо проблемных адресов.
Выберите одно понятное состояние для каждого типа URL и согласуйте остальные сигналы. Исключения допустимы только с задокументированной причиной и проверкой в поисковых консолях.
Контроль после изменения
После публикации скачайте robots.txt как внешний пользователь, проверьте заголовок Content-Type и ответы сервера. Просканируйте контрольный набор как минимум под нужными user-agent и сравните с ожидаемой матрицей.
Изменение проявляется после повторного обхода. Следите за статистикой сканирования, исключенными страницами, количеством URL в Sitemap и логами роботов; не делайте вывод через несколько минут после релиза.
Как настроить правила без риска закрыть сайт
Работайте от перечня типов URL. Правило без списка примеров и ожидаемого результата нельзя безопасно принять.
Порядок действий
- Выгрузите типы URL из CMS, краулера, Sitemap, логов и поисковых консолей.
- Для каждого типа задайте два отдельных статуса: можно ли обходить и можно ли индексировать.
- Выберите механизм: авторизация, код ответа, robots.txt, meta robots, X-Robots-Tag, canonical или удаление ссылок.
- Составьте минимальный robots.txt и отдельные шаблоны meta/X-Robots; не дублируйте одну задачу несколькими конфликтующими способами.
- Подготовьте позитивные и негативные тестовые URL для каждого правила.
- Проверьте боевые HTTP-ответы, исходный HTML и рендеринг после CDN и кэша.
- Просканируйте сайт, найдите сочетания Disallow+noindex, noindex+Sitemap и запрещенные ресурсы рендеринга.
- После внедрения контролируйте повторный обход и меняйте правило только по фактическому шаблону ошибок.
Контрольный чек-лист
- Robots.txt доступен с кодом 200
- Нет случайного Disallow: / на боевом сайте
- Noindex не спрятан за Disallow
- Приватные данные защищены авторизацией
- CSS и JS для рендеринга доступны
- В Sitemap нет запрещенных URL
- PDF управляются через X-Robots-Tag
- У правил есть контрольные примеры
- CMS и CDN не добавляют конфликтующие заголовки
- После релиза проверены логи и консоли
Таблица решений
| Задача | Неподходящий способ | Рабочий способ |
|---|---|---|
| Скрыть приватный кабинет | Только robots.txt | Авторизация и корректные ответы |
| Удалить HTML из индекса | Disallow + noindex | Разрешить обход и отдать noindex |
| Не индексировать PDF | Meta robots внутри HTML | X-Robots-Tag в ответе PDF |
| Сократить обход фильтров | Nofollow на всех ссылках | Управление генерацией URL и правилами обхода |
| Удалить страницу навсегда | Временное скрытие в консоли | 404/410 или точный постоянный редирект |
Получите бесплатный аудит и стратегию роста
Изучим сайт, покажем точки роста и подготовим прогноз до квалифицированных лидов и оборота из SEO/GEO.


