Индексация5 мин

Дубли страниц: как фильтры каталога съедают позиции

Каждая сортировка и каждый фильтр создают новый адрес с тем же содержимым. Для поисковика это отдельные страницы, которые конкурируют между собой: сигналы делятся, и вперёд не выходит ни одна.

Редакция SeoMarket

Откуда в каталоге берутся дубли

Дубль — это два адреса и больше, которые отдают одинаковое или почти одинаковое содержимое. Владелец сайта их обычно не видит: в меню всё выглядит правильно, а лишние адреса порождает сам движок или внешние ссылки. Для робота же каждый адрес — отдельная страница.

  • Сортировки и вид отображения: ?sort=price, ?view=list, ?limit=48.
  • Фильтры по свойствам, если под них не задуманы отдельные посадочные страницы: ?color=white&size=m.
  • Метки рекламы и рассылок: utm_source, yclid, gclid, from.
  • Технические варианты адреса: с www и без, http и https, со слешем на конце и без, index.php и index.html.
  • Один товар в нескольких категориях: /divany/milan и /novinki/milan.
  • Версии для печати, сессионные параметры, старые адреса после смены структуры, оставшиеся без редиректа.

Отдельный случай — страницы пагинации. Это не дубли: на второй странице категории другие товары. Ошибкой было бы как раз склеивать их с первой, об этом ниже.

Чем дубли вредят

Поисковик не наказывает сайт за дубли как за нарушение, но они мешают сразу в трёх местах. Во-первых, сигналы — внешние и внутренние ссылки, поведение — делятся между несколькими адресами, и ни один не набирает достаточно, чтобы выйти вперёд. Во-вторых, робот тратит время обхода на копии вместо новых и изменённых страниц. В-третьих, поисковик сам выбирает, какой адрес считать основным, и выбор не всегда совпадает с вашим: в выдаче может оказаться адрес с сортировкой или меткой.

В Яндекс Вебмастере такие адреса видны в разделе исключённых страниц со статусом «Дубль», в Google Search Console — в отчёте об индексировании со статусами вида «Страница является копией» и указанием, какой адрес Google выбрал каноническим.

Как найти дубли на своём сайте

Где искать и что там смотреть

Где смотретьЧто искать
Яндекс Вебмастер → Индексирование → Страницы в поискеИсключённые адреса со статусом «Дубль» и параметрами в адресе
Google Search Console → Индексирование страницКопии без выбранного канонического адреса и случаи, где Google выбрал не ваш
Поиск по сайту в Яндексе и GoogleСколько страниц найдено по сравнению с числом товаров и категорий
Исходный код страницы категории с фильтромТег <link rel="canonical"> и адрес, на который он указывает
КраулерСовпадающие title и description у разных адресов, адреса с параметрами

Наш аудит проверяет у каждой обойдённой страницы, есть ли canonical и указывает ли он на саму страницу. Отметка «canonical ведёт на другой адрес» — не всегда ошибка: на странице с сортировкой так и должно быть. Поэтому в отчёте важен сам адрес — по нему видно, намеренная это склейка или сломанный шаблон.

Чем склеивать: пять инструментов

Инструменты борьбы с дублями и их ограничения

ИнструментКогда применятьОграничения
Редирект 301Технические варианты адреса: www, http, слеш, старая структураСтраница-копия перестаёт открываться — для сортировок не подходит
rel="canonical"Сортировки, метки, товар в нескольких категорияхЭто подсказка, а не команда: при противоречивых сигналах поисковик может выбрать другой адрес
Clean-param в robots.txtПараметры, не меняющие содержимое: метки, сессии, сортировкаДирективу понимает только Яндекс
Мета-тег noindexСлужебные страницы, которые должны открываться, но не искатьсяРобот должен видеть страницу — её нельзя одновременно закрывать в robots.txt
Disallow в robots.txtБесконечные комбинации фильтров, которые съедают обходЗапрещает обход, но не гарантирует удаление из индекса Google; canonical на закрытой странице робот не прочитает

Отдельного инструмента для параметров в Google больше нет: соответствующий отчёт в Search Console отключён в 2022 году, поэтому для Google остаются canonical, редиректы и аккуратная внутренняя ссылочная структура.

Если под фильтр есть спрос — «белые диваны», «кровати 160×200», — это не дубль, а будущая посадочная страница. Ей нужен свой понятный адрес без параметров, собственные title, H1 и текст. Тогда canonical такой страницы указывает на неё саму.

Ошибки при склейке

  • Canonical указывает на страницу, которая отдаёт 404, редирект или закрыта noindex. Поисковик получает противоречие и игнорирует подсказку. Как найти такие адреса — в статье о битых ссылках и редиректах.
  • Все страницы пагинации ссылаются canonical на первую. Товары со второй страницы и дальше теряют путь в индекс; у каждой страницы пагинации canonical должен вести на неё саму.
  • Страница одновременно закрыта в robots.txt и размечена canonical — робот не может прочитать тег.
  • На странице два тега canonical: один ставит тема, другой — SEO-плагин. Поисковик вправе проигнорировать оба тега.
  • Во внутренних ссылках, меню и карте сайта используются адреса с параметрами, а canonical указывает на чистые. Сайт сам себе противоречит.

Что проверить после правок

Откройте исходный код трёх вариантов одной категории — чистый адрес, с сортировкой и с меткой — и убедитесь, что canonical у всех трёх одинаковый и ведёт на чистый адрес, который отвечает кодом 200.

Проверьте свой сайт

Аудит обходит сайт и показывает ошибки с адресами страниц: мета-теги, canonical, коды ответа, переадресации, время ответа сервера. Проверка бесплатная, смету по найденному вы увидите до любой оплаты.

Частые вопросы

Накладывают ли поисковики фильтр за дубли?

Отдельного наказания за технические дубли нет. Потери косвенные: сигналы делятся между копиями, обход тратится впустую, а в выдачу может попасть не тот адрес.

Что лучше для сортировок — canonical или Clean-param?

Лучше оба: Clean-param понимает только Яндекс и экономит его обход, а canonical работает и для Google. Если на страницы с сортировкой нет внутренних ссылок в индексируемом виде, проблема и вовсе почти исчезает.

Как быстро дубли уйдут из индекса?

Только после переобхода этих адресов. Для небольшого сайта это недели, для крупного каталога — дольше. Ускорить помогает актуальная карта сайта без дублей.

Нужен ли canonical на странице без дублей?

Желателен: ссылка на саму себя защищает от копий, которые появятся позже, — например, от рекламных меток во внешних ссылках.

Читать дальше

Индексация4 минRobots.txt и sitemap: две ошибки, закрывающие сайт от поискаПоисковик, получивший противоречивые указания — адрес и приглашён в карте, и запрещён в robots.txt, — решает сам, и не обязательно в вашу пользу.
Контент5 минПлотность ключей: сколько вхождений безопасноСчитать повторы нужно по всему тексту страницы, включая меню, фильтры и подвал: именно там ключи чаще всего дублируются незаметно для автора.
Структура5 минПерелинковка в магазине: пять ссылок, которые работаютАнкор берётся из того, что ищут на целевой странице, а не «читать здесь»: ссылка должна говорить, что находится по адресу.
Скорость6 минУскорение сайта: что на самом деле тормозит каталогLCP, INP и CLS на шаблоне листинга. Сначала изображения первого экрана, потом шрифты, и только после этого скрипты и серверный кэш.
Контент5 минТексты категорий: как писать, чтобы это не выглядело спамомМинимального числа слов у поисковиков нет. Есть малоценные страницы — и чаще всего это категории, где текст повторяет то, что уже написано на соседних.
Техническое SEO5 минБитые ссылки и редиректы: где теряется вес страницЛечение — редирект 301 на ближайшую живую категорию или код 410, а не перенаправление всего подряд на главную: такой редирект поисковик может счесть мягкой 404.

Читайте также

Все статьи →