Статья

Индексация сайта: как проверить и исправить исключенные страницы

Сергей Торкунов

Чтобы страница появилась в поиске, робот должен узнать URL, получить корректный ответ, обработать содержимое и решить включить документ в индекс. Отправка на переобход помогает только после устранения причины. Диагностику начинают с конкретного URL и статуса в поисковой консоли, затем проверяют доступность, директивы, canonical, дубли, внутренние ссылки и самостоятельную ценность страницы.

Если нужна системная работа с поисковым спросом, технической базой и контентом, изучите услугу комплексного SEO-продвижения.

Индексация сайта: как проверить и исправить исключенные страницы — логика работы и проверки.
Схема. Индексация сайта: как проверить и исправить исключенные страницы — логика работы и проверки.

Как устроен путь в индекс

Смежная задача разобрана отдельно: Ошибка 404: что это значит и как исправить на сайте.

Обнаружение, обход и индексирование — разные этапы

Поисковик узнает адрес из внутренних и внешних ссылок, Sitemap, фидов и ранее известных URL. Затем планирует обход и сканирование, загружает ответ, рендерит при необходимости и оценивает документ. Только после этого возможна индексация.

Поэтому «URL есть в Sitemap» не означает «URL проиндексирован». Карта помогает обнаружению, но страница все равно должна быть доступной, канонической и достаточно полезной.

Индексируемость не гарантирует показ

Положительный live test подтверждает, что явного технического препятствия не найдено, но не проверяет все сигналы качества, канонический выбор и окончательное решение индекса. Страница может быть доступна роботу и все же не появиться в результатах.

Разделяйте три вопроса: может ли робот получить страницу, выбрана ли она для индекса и ранжируется ли по нужному запросу. У каждого этапа свои причины и действия.

Какие страницы должны быть в индексе

Индексируйте канонические страницы с самостоятельной задачей: услуги, категории, товары в продаже, содержательные статьи, полезные фильтры. Технические сортировки, поиск, пустые подборки и личные кабинеты обычно не нужны.

Цель аудита — не максимальное число проиндексированных URL, а совпадение индекса с полезной архитектурой. Сокращение мусорных страниц может быть улучшением, а не падением.

Где проверять страницы в Яндексе и Google

В Яндекс Вебмастере используйте разделы «Индексирование → Проверка страницы», «Страницы в поиске», «Статистика обхода» и «Структура сайта». Для JavaScript-страниц дополнительно сравните версию с выполнением и без выполнения скриптов в инструменте рендеринга.

В Google Search Console инструмент проверки URL показывает проиндексированную версию, live test, обнаружение, обход и выбранный canonical. Массовые причины смотрят в отчете индексирования страниц. Данные двух систем не обязаны совпадать: у них отдельные роботы, базы и сроки обработки.

Диагностика конкретного URL

Смежная задача разобрана отдельно: Ошибка 502 Bad Gateway: что означает и как исправить.

Проверьте код ответа и цепочку

Целевая индексируемая страница должна стабильно отвечать 200. 3xx переносит на другой адрес, 4xx сообщает об отсутствии, 5xx — о сбое. Soft 404 может вернуть 200, но показывать пустую или ошибочную страницу.

Проверяйте ответ как внешний пользователь и робот, на мобильном и без авторизации. CDN, геоблокировка и защита от ботов могут отдавать разные результаты.

Проверьте robots и noindex

Убедитесь, что URL и необходимые ресурсы не закрыты robots.txt, а в HTML и HTTP-заголовках нет noindex. Помните: если робот не может обойти страницу, он не увидит noindex.

После миграции проверьте настройки CMS и шаблоны: один глобальный флажок способен закрыть весь раздел. При массовой проблеме ищите общее условие, а не отправляйте адреса по одному.

Проверьте canonical

Сравните заявленный canonical с тем, который выбрала поисковая система. Если URL признан дублем, в индекс попадет предпочтительная версия, а проверяемая страница может отсутствовать — это нормально при корректной канонизации.

Если выбран неправильный адрес, согласуйте сигналы: self-canonical, внутренние ссылки, Sitemap, редиректы и отличающееся содержание. Не пытайтесь силой индексировать дубль.

Проверьте рендеринг и основной контент

Откройте обработанный HTML или скриншот в инструменте проверки URL. Убедитесь, что видны H1, основной текст, товары, цены и ссылки, а API не возвращает пустой ответ роботу.

Для JavaScript-сайта сравните исходный HTML и отрендеренную версию. Если смысл появляется только после клика, авторизации или ошибки выполнения скрипта, робот может получить пустой шаблон.

Проверьте внутренние ссылки и глубину

Важный URL должен быть достижим обычными `<a href>` ссылками из категории, меню, хлебных крошек или тематических материалов. Страница, доступная только через внутренний поиск, остается слабым кандидатом для регулярного обхода.

Найдите сиротские страницы сравнением краула, Sitemap, аналитики и базы CMS. Добавляйте ссылки только там, где переход полезен пользователю; сетка механических ссылок не заменяет архитектуру.

Разбор статусов и массовых проблем

«Обнаружена, но не проиндексирована»

Поисковик знает URL, но еще не просканировал его или откладывает обход. Проверьте перегруженность шаблонов параметрами, скорость и стабильность сервера, внутренние ссылки, Sitemap и количество малополезных адресов.

Не отправляйте тысячи URL вручную. Устраните ловушки обхода, сократите мусор, укрепите архитектуру и обновите корректный Sitemap. Для нескольких важных новых страниц допустим запрос индексации.

«Просканирована, но не проиндексирована»

Робот получил документ, но пока не включил его в индекс. Причиной может быть слабая самостоятельная ценность, близкий дубль, пустая карточка, шаблонный контент или несоответствие ожидаемому типу страницы.

Сравните URL с уже индексируемыми конкурентами и соседними страницами: чем он полезен сам по себе? Добавьте недостающую фактуру, ассортимент, характеристики, экспертную инструкцию или объедините с более сильной страницей. Повторная отправка без изменения редко решает проблему.

Дубли и выбранный другой canonical

Если система нашла дубли, проверьте, должен ли проверяемый URL быть отдельным. Для технической версии ничего исправлять не нужно; для самостоятельной страницы требуется отличающийся интент, содержание и согласованные сигналы.

Не создавайте уникальный текст ради уникальности на каждой сортировке. Уникальной должна быть пользовательская задача и полезность документа.

Страницы с ошибками сервера

Разберите 5xx по времени, шаблону и user-agent. Сопоставьте логи роботов с логами приложения, таймаутами базы, лимитами CDN и релизами. Единичная ошибка и систематический сбой требуют разных приоритетов.

После исправления убедитесь, что URL стабильно отвечает 200 и отдает полный контент. Временный 200 при пустом API-ответе может создать soft 404 вместо восстановления.

Массовый аудит индексации

Сформируйте эталонный список URL, которые должны индексироваться, из CMS и утвержденной архитектуры. Сопоставьте его с Sitemap, краулом, консолями и органическими посадочными.

Сегментируйте отклонения по типу страницы и причине. Метрика «доля индексируемых целевых URL в индексе» полезнее общего числа страниц, потому что отделяет продуктовые категории от технического шума.

От исправления к контролю

Когда запрашивать переобход

Для нескольких новых или исправленных URL используйте инструмент проверки и запрос индексации. Для массовых изменений обновите внутренние ссылки и Sitemap с корректным lastmod. Запрос не гарантирует включение и имеет лимиты.

Сначала проведите live test и убедитесь, что причина устранена. Иначе вы лишь ускорите повторное получение той же ошибки.

Как измерять результат

Зафиксируйте до релиза список URL, статус, дату последнего обхода, canonical и органические показы. После повторного обхода сравните долю целевых страниц в индексе и появление показов, а не только изменение общего счетчика.

Индексация не равна высокому ранжированию. Если URL в индексе, но без показов, переходите к интенту, качеству контента, внутренним и внешним сигналам, а не продолжайте «лечить индексацию».

Как избежать повторения проблемы

Добавьте автоматические проверки в релиз: код ответа, robots, noindex, canonical, наличие в Sitemap, H1 и основной контент. Для каталогов проверяйте несколько URL каждого шаблона.

Настройте мониторинг роста 3xx/4xx/5xx, исключенных URL и расхождения Sitemap с краулом. Любая массовая генерация нового типа параметров должна проходить SEO-приемку до открытия ссылок роботу.

Диагностический маршрут для страницы вне индекса

Проверяйте причины в фиксированном порядке: от доступности к качеству. Это исключает бессмысленную доработку текста на странице, которая отвечает 404 или закрыта noindex.

Порядок действий

  1. Уточните, должен ли URL индексироваться и какой запрос или задача ему назначены.
  2. Проверьте актуальный статус в Яндекс Вебмастере или Google Search Console, затем выполните live test.
  3. Проверьте конечный код ответа, цепочки редиректов, мобильную доступность и отсутствие блокировки защитой от ботов.
  4. Сопоставьте robots.txt, meta robots, X-Robots-Tag и наличие URL в XML Sitemap.
  5. Проверьте user-declared и выбранный поисковиком canonical, а также дубли по содержанию.
  6. Откройте отрендеренный документ и убедитесь, что основной контент и ссылки реально доступны роботу.
  7. Оцените внутренние ссылки, глубину и самостоятельную ценность страницы относительно соседних URL и результатов поиска.
  8. Исправьте первопричину, запросите переобход для контрольных URL и отслеживайте изменение статуса после нового crawl.

Контрольный чек-лист

  • URL действительно нужен в индексе
  • Ответ стабильно 200
  • Нет soft 404
  • Обход разрешен
  • Noindex отсутствует
  • Canonical выбран правильно
  • Контент виден после рендеринга
  • Есть обычные внутренние ссылки
  • Sitemap содержит канонический URL
  • После исправления зафиксирован новый обход

Таблица решений

Статус или симптомСначала проверитьСледующее действие
URL неизвестен поисковикуСсылки и SitemapДобавить обнаружимый путь и отправить карту
Обнаружена, не проиндексированаЛовушки обхода, сервер, значимостьСократить шум и усилить архитектуру
Просканирована, не проиндексированаДубли и самостоятельную ценностьДоработать, объединить или исключить
Выбран другой canonicalСогласованность сигналовПоддержать нужную версию ссылками и содержанием
URL в индексе без показовИнтент, релевантность, конкуренциюПерейти от индексации к SEO страницы

Получите бесплатный аудит и стратегию роста

Изучим сайт, покажем точки роста и подготовим прогноз до квалифицированных лидов и оборота из SEO/GEO.