Статья

Как строить сегменты страниц и проверять SEO-гипотезы

Сергей Торкунов

Сегментация помогает увидеть, какие группы URL ведут себя по-разному, но не доказывает причину. Если страницы с отзывами получают больше поисковых переходов, из этого ещё не следует, что рост вызвали отзывы: группы могут отличаться спросом, возрастом, ассортиментом, ценой, ссылками или шаблоном.

Рабочая схема такая: определить единицу анализа и метрику, проверить качество выгрузки, заранее описать гипотезу и контрольные факторы, сравнить сопоставимые когорты, а затем отделить SEO-результат от UX- и бизнес-результата. Универсального порога «до 20 отзывов» здесь нет.

Сегментация страниц — логика работы и проверки.
Схема. Сегментация страниц — логика работы и проверки.

Какие сегменты имеет смысл собирать

В проектах я использую признаки, которые можно однозначно извлечь и связать с URL:

наличие и длина текстового блока;

наличие описания товара и заполненность характеристик;

число опубликованных отзывов;

число товаров в категории или листинге;

наличие ссылок на теги и фильтры;

видео и фотографии;

тип текста или шаблона страницы;

статус наличия, цена и возраст URL;

версия шаблона и дата релиза.

Список не нужно копировать целиком в каждый отчёт. Признак включается только тогда, когда по нему есть вопрос и возможное действие. Сегмент «есть видео» бесполезен, если команда не знает, что будет делать при отличии.

Словарь анализа до выгрузки

ПолеЧто зафиксировать
Единица анализаКанонический URL, шаблон, товар или категория; правило нормализации параметров и слэша
Зависимая метрикаОдин основной SEO-показатель: клики, показы, CTR или позиция; отдельно — конверсия/выручка
ПериодДаты, часовой пояс, окно до/после, дни недели, сезонный период для сравнения
СегментФормальное условие включения, источник поля, допустимы ли пересечения сегментов
Размер группыФактическое число URL и доля URL с полными данными; минимальный размер определяется дисперсией проекта, а не универсальным порогом
ИзменениеДата релиза, список затронутых URL, что именно изменилось и какие параллельные релизы были
Критерий выводаКакое отличие считается сигналом для проверки, что опровергает гипотезу и когда решение откатывается

Не смешивайте разные сущности в одной строке. Если единица анализа — канонический URL, параметры и дубли сначала нормализуются. Если вопрос относится к товару, а данные Search Console собраны по URL категории, причинный вывод невозможен без дополнительной связки.

Как собрать признаки страниц

Практический рабочий процесс из исходной статьи сохраняется:

Сканируем сайт в Screaming Frog и через Custom Extraction извлекаем признаки из HTML: XPath, CSSPath или regex выбираются под шаблон. Официальная документация инструмента показывает, как получать данные как из сырого, так и из отрендеренного HTML: Custom Extraction.

Нормализуем URL и выгружаем по тому же ключу поисковые метрики. Для Google фиксируем фильтры и измерения отчёта Performance; в документации Search Console важно учитывать группировку, фильтры и ограничения данных. Для Яндекса отдельно сверяем статус и дату последнего обхода в разделе «Страницы в поиске», не смешивая его определения с Google.

Для поведенческих и бизнес-метрик используем GA4 или внутреннюю аналитику, но не называем их поисковыми. В GA4 фиксируем часовой пояс ресурса и задержку обработки данных по официальной документации.

В SEOWORK, BI или таблице объединяем наборы по проверенному ключу, а не по отображаемому заголовку страницы.

Сохраняем версию выгрузки, дату и правила сегмента. Без этого следующий отчёт нельзя воспроизвести.

Семь QA-проверок перед выводом

Что сверитьЭталон / допускТипичная причина расхожденияДействие
1. Ключ URLОдин канонический ключ на страницу; неожиданные дубли не допускаютсяСлэш, протокол, параметры, редирект, иной canonicalНормализовать, вывести список нестыковок, повторить join
2. Период и часовой поясОдинаковые даты и зона во всех источниках; сдвиг суток не допускаетсяGA4 и Search Console используют разные настройки времениПересобрать окна и подписать зону в отчёте
3. Определение метрикиНазвание, формула и источник совпадают со словарёмСессии названы кликами; средняя позиция трактуется как ранг одного URLПереименовать поле, разделить источники, пересчитать вывод
4. Полнота выгрузкиИтоги интерфейса, API/экспорта и набора URL согласованы в пределах документированного ограничения источникаЛимит строк, анонимизированные запросы, фильтр или пропущенная пагинацияСверить totals, выгрузить по URL/дате, описать потерю данных
5. Покрытие краулаДля целевого сегмента известна доля URL с успешным ответом и извлечёнными признакамиОшибка рендера, авторизация, 5xx, шаблон изменил XPathИсправить извлечение и повторно просканировать выборку
6. Логика сегментовВзаимоисключение или пересечение заранее задано и провереноОдин URL попал и в test, и в control; пустое значение принято за нольВвести приоритет правил, выделить unknown, пересчитать группы
7. Релизы и внешний спросНа временной шкале отмечены релизы, сезонность и изменение спросаАпдейт шаблона, распродажа или сезон совпали с исследуемой датойДобавить контрольную когорту/период или отложить причинный вывод

Допуски по расхождению агрегатов задаются после оценки ограничений конкретного источника. Нельзя объявить универсальные «5% допустимо»: для ключей URL и смены суток нормальный допуск может быть нулевым, а для отчётов с ограниченными строками сначала нужно понять механизм потери.

Как отличить корреляцию от эффекта изменения

Для каждой гипотезы заполните дизайн до того, как смотреть итоговый график.

ЭлементЧто указать
ГипотезаКакое изменение, для каких URL и на какой основной метрике ожидается
TestURL, где изменение действительно опубликовано и проверено
Control / matched cohortСопоставимые URL без изменения
Контрольные признакиКак минимум спрос, возраст URL, ассортимент/наличие, цена, внутренние/внешние ссылки, шаблон; при необходимости регион и устройство
ПериодОкна до/после, задержка данных, сезонный аналог и исключённые аномальные дни
Проверка внедренияCrawl/рендер, дата релиза, доля URL с фактическим изменением
Правило решенияЧто подтверждает, ослабляет или опровергает гипотезу; следующее действие и условие отката

Сравнение «страницы с отзывами против страниц без отзывов» почти всегда смещено: популярные товары одновременно имеют больше спроса, продаж, ссылок и отзывов. Сначала подберите сопоставимую когорту, затем проверьте, что группы отличаются именно исследуемым изменением.

Один график — разные действия

Это не кейс и не подстановка вымышленных цифр, а схема чтения реального графика владельца.

Если спад кликов совпал со спадом показов во всём спросе и в контрольной группе, сначала проверяем сезонность и спрос. Переписывать шаблон рано.

Если показы стабильны, а средняя позиция и CTR изменились только в test после подтверждённого релиза, проверяем сниппет, интент и корректность внедрения.

Если изменение есть только в одном источнике или начинается ровно на границе выгрузки, сначала исправляем сбор данных. SEO-действие до QA не назначаем.

Чтобы превратить этот блок в полностью заполненный пример, нужны обезличенные URL test/control, даты релиза, экспорт Search Console, признаки страниц и временная шкала спроса. Без этих данных нельзя честно выбрать одну из веток и назвать эффект.

Отзывы: отдельно SEO, отдельно UX

Число отзывов — признак, а не универсальный норматив. Нельзя по сегментной корреляции сделать правило «оставить до 20 отзывов» и скрыть остальные через JavaScript ради индексации.

Для SEO проверяем полноту видимого содержимого, доступность ссылок/пагинации, дубли и соответствие разметки видимой странице. Для UX отдельно измеряем скорость, читаемость, использование сортировки, конверсию и вопросы покупателей. Если список длинный, можно применить доступную пагинацию или «показать ещё», но полезные отзывы не следует прятать от робота как метод оптимизации.

Что считать нормальным результатом

Нормальный результат сегментации — не красивый график, а воспроизводимое решение: понятен состав группы, источники согласованы, гипотеза отличена от наблюдения, назначен следующий тест и известно условие остановки. Польза метода — быстрее отсекать слабые гипотезы и не тратить разработку на выводы из грязных данных. Обещания ускорения «в 5 раз» и экономии «до 70%» удалены: в опубликованной версии нет исходную точку, выборки и формулы для этих чисел.

Для большой распределённой системы полезен отдельный пример BI для SEO на 800+ поддоменов. Настройку событий и отчётов не следует смешивать с методологией сегментации; она разобрана в материале Google Analytics 4: как настроить и использовать аналитику.

Получите бесплатный аудит и стратегию роста

Изучим сайт, покажем точки роста и подготовим прогноз до квалифицированных лидов и оборота из SEO/GEO.