Custom Extraction в Screaming Frog помогает собрать со списка URL цену, артикул, наличие, характеристики, хлебные крошки или другой элемент страницы. Главная ошибка — скопировать длинный абсолютный XPath из инспектора браузера и сразу запустить полный обход. Такой селектор легко ломается при изменении контейнера и может незаметно вернуть пустые или дублированные значения.
Надёжный процесс состоит из трёх частей: выбрать устойчивый селектор, проверить его на разных типах страниц и только после этого запускать массовую выгрузку.

Сначала определите результат
До настройки краулера запишите:
какие URL входят в обход;
какое поле нужно получить;
ожидается одно значение, несколько значений или отсутствие элемента;
нужен текст, HTML-фрагмент или значение атрибута;
где будет использоваться итоговый файл.
Это позволяет отличить техническую ошибку от нормального отсутствия данных. Например, цена обязательна для карточки товара, но может отсутствовать на категории.
Выберите устойчивый XPath или CSSPath
Предпочитайте признаки, которые отражают смысл элемента: стабильный класс компонента, атрибут itemprop, data-* или связку контейнера с названием поля. Не привязывайтесь к порядковому номеру блока, если порядок может измениться.
Пример XPath для текста цены:
//*[@itemprop='price']/@contentПример CSSPath:
[itemprop="price"]Это шаблоны, а не готовые селекторы для любого сайта. Перед запуском проверьте фактический DOM и убедитесь, что выбранный атрибут стабилен на всех нужных шаблонах.
В Screaming Frog откройте Configuration → Custom → Custom Extraction, добавьте экстрактор и выберите XPath или CSSPath. Для текстового значения используйте извлечение текста; для цены из content — значение атрибута.
Учтите JavaScript-рендеринг
Сначала сравните исходный HTML и отрендеренный DOM. Если нужного элемента нет в исходном ответе сервера и он появляется только после JavaScript, включите JavaScript Rendering в настройках Spider. Это увеличит время обхода, поэтому режим нужно выбирать по фактической архитектуре страницы, а не включать автоматически.
Проверьте один и тот же URL в двух режимах:
HTML Text Only;
JavaScript Rendering.
Если значение появляется только во втором режиме, зафиксируйте это в настройках проекта и в названии выгрузки.
Проверьте селектор на выборке из 20 URL
Соберите тестовую выборку, в которой есть:
типовая карточка;
карточка без значения;
карточка с несколькими значениями;
категория или другой шаблон;
страница с ошибкой или редиректом;
мобильный или региональный вариант, если DOM различается.
Для каждого селектора проверьте три исхода: 0, 1 и N совпадений. Ноль может означать нормальное отсутствие элемента или ошибку селектора; несколько совпадений — допустимый список или нежелательный дубль.
Семь проверок качества
| Проверка | С чем сравнить | Норма / допуск | Возможная причина | Действие |
|---|---|---|---|---|
| Доля пустых значений | С обязательностью поля по шаблону | 0% для обязательного поля | Селектор сломан, JS не отрендерен | Проверить DOM и режим рендеринга |
| Число совпадений | С ожидаемыми 0/1/N | Одно для одиночного поля | Дубли блока или слишком широкий селектор | Сузить контейнер |
| Формат значения | С целевым типом данных | Цена — число, URL — абсолютный адрес | Извлечён текст с валютой или лишний атрибут | Очистить правило извлечения |
| Покрытие шаблонов | С картой типов страниц | Все нужные типы представлены | Выборка однородна | Добавить граничные URL |
| Расхождение HTML/JS | С двумя режимами обхода | Объяснимо архитектурой | Контент загружается клиентом | Зафиксировать JS Rendering |
| Повторяемость | С повторным тестом тех же URL | Значения стабильны | Персонализация, регион, эксперимент | Зафиксировать условия и сегмент |
| Ручная сверка | С видимой страницей | 10 из 10 строк совпадают | Ошибка селектора или преобразования | Исправить и повторить выборку |
Как интерпретировать расхождение
Если доля пустых цен изменилась, сначала разделите URL по шаблонам. Отсутствие цены может быть нормой для страницы без товарного предложения и ошибкой для типовой карточки. Одно наблюдение приводит к разным действиям в зависимости от назначения страницы и обязательности поля.
Экспортируйте не только значение
В итоговой таблице оставьте минимум четыре колонки:
URL;
извлечённое значение;
тип страницы или сегмент;
ошибка или причина пустого результата.
Перед массовым использованием вручную откройте десять строк и сравните выгрузку с видимой страницей. Только после этого отдавайте файл в аналитику, генерацию или импорт.
Короткий чек-лист перед запуском
Цель и ожидаемый формат записаны.
Селектор основан на устойчивом семантическом признаке.
Проверены 0, 1 и N совпадений.
Сравнены исходный HTML и JavaScript-рендеринг.
Тестовая выборка включает 20 разных URL.
Экспорт содержит URL, значение и признак ошибки.
Десять строк сверены вручную.
Получите бесплатный аудит и стратегию роста
Изучим сайт, покажем точки роста и подготовим прогноз до квалифицированных лидов и оборота из SEO/GEO.


