Статья

Как найти и устранить дубли страниц сайта

Сергей Торкунов

Дубли — это не просто страницы с одинаковым текстом. Один документ может открываться по нескольким протоколам, хостам, параметрам, путям и вариантам регистра; разные страницы могут также конкурировать за один интент. Исправление выбирают по причине: постоянный перенос, canonical, исключение служебного состояния, объединение контента или разведение задач. Массовое правило без классификации может закрыть полезные страницы.

Поиск дублей — логика работы и проверки.
Схема. Поиск дублей — логика работы и проверки.

Когда применять это решение

Сначала соберите группы URL и определите отношение между ними. Полные технические дубли обычно сводятся к одному адресу. Почти одинаковые страницы могут быть оправданы регионом, языком или ассортиментом. Интентные дубли требуют редакционного решения, а не только тега. Robots.txt не является инструментом канонизации и может скрыть от робота сигналы страницы.

Что нужно зафиксировать до изменений

crawl всех внутренних ссылок и параметров;

серверные логи и URL из поисковых консолей;

HTTP-коды, canonical, robots и содержимое;

карта интентов и назначение шаблонов;

источник генерации ссылок и параметров.

Диагностическая таблица состояний

Сопоставьте назначение URL, фактический HTTP/HTML-результат и ожидаемое поведение. Не выбирайте действие только по названию ошибки в отчёте.

СитуацияЧто проверитьНормальный результатСледующее действие
Старый URL навсегда заменёнРелевантность новой страницыОдин постоянный редиректОбновить ссылки и Sitemap
Технический параметр дублирует страницуКонтент и назначениеCanonical на чистый URLИсправить генератор параметров
Служебная страница не нужна в поискеДоступ и полезностьСостояние исключено осознанноПрименить подходящую директиву
Две статьи отвечают на один вопросИнтенты, трафик, содержаниеОдна основная страница или разведённые задачиСогласовать объединение
Региональные страницы похожиЛокальные отличия и сигналыКаждая версия имеет ценностьДоработать или сократить набор

Порядок диагностики и исправления

Сохраняйте исходную выборку и меняйте одно правило за итерацию, чтобы увидеть причину и безопасно откатиться.

1. Соберите полный набор вариантов

Объедините crawl, логи, Sitemap и отчёты поиска. Нормализуйте представление URL, но сохраняйте исходный адрес и источник обнаружения.

2. Сгруппируйте по причине

Разделите хосты, протоколы, параметры, пагинацию, печатные версии, локали и контентные пересечения. Разные причины требуют разных исправлений.

3. Назначьте целевое состояние

Для каждой группы укажите основной URL, действие с дублем и причину. Не ставьте canonical между страницами, которые решают разные задачи.

4. Исправьте источник дубля

Помимо редиректа или тега, обновите генератор ссылок, маршрутизацию, Sitemap и шаблоны. Иначе новые дубли продолжат появляться.

5. Повторите crawl и сравните группы

Проверьте сокращение вариантов, прямые внутренние ссылки и выбранные канонические URL. Отдельно контролируйте 404, цепочки и потерянные страницы.

Проверка до и после релиза

Контроль выполняется на каждом затронутом шаблоне и на пограничных URL.

для каждой группы есть причина и основной URL;

редиректы ведут напрямую на релевантную цель;

canonical не конфликтует с noindex и Sitemap;

генератор больше не создаёт нежелательные варианты;

контентные объединения выполняются только после согласования.

Типичные ошибки внедрения

Технически корректная директива может дать неверный результат, если она не соответствует назначению страницы или конфликтует с другими сигналами.

канонизация всех страниц пагинации на первую;

редирект разных товаров или статей на нерелевантную категорию;

закрытие robots.txt до того, как робот увидит canonical/noindex;

массовое объединение по похожему Title без чтения контента;

сохранение ссылок на редиректы и дубли внутри сайта.

Критерии технической приёмки

Исправление готово, когда наблюдение воспроизводится, причина устранена и соседние шаблоны не пострадали.

кластеры дублей воспроизводимы из данных;

выбранное действие соответствует отношению страниц;

основные URL доступны и получают прямые ссылки;

нет цепочек, циклов и конфликтующих сигналов;

повторный crawl не показывает повторное появление причины.

Итог

Устранение дублей начинается с классификации, а заканчивается исправлением генератора. Выберите 301, canonical, исключение или редакционное разведение по отношению страниц и проверьте всю группу после релиза.

Получите бесплатный аудит и стратегию роста

Изучим сайт, покажем точки роста и подготовим прогноз до квалифицированных лидов и оборота из SEO/GEO.