Дубли страниц: как фильтры каталога съедают позиции
Каждая сортировка и каждый фильтр создают новый адрес с тем же содержимым. Для поисковика это отдельные страницы, которые конкурируют между собой: сигналы делятся, и вперёд не выходит ни одна.
Откуда в каталоге берутся дубли
Дубль — это два адреса и больше, которые отдают одинаковое или почти одинаковое содержимое. Владелец сайта их обычно не видит: в меню всё выглядит правильно, а лишние адреса порождает сам движок или внешние ссылки. Для робота же каждый адрес — отдельная страница.
- Сортировки и вид отображения:
?sort=price,?view=list,?limit=48. - Фильтры по свойствам, если под них не задуманы отдельные посадочные страницы:
?color=white&size=m. - Метки рекламы и рассылок:
utm_source,yclid,gclid,from. - Технические варианты адреса: с
wwwи без,httpиhttps, со слешем на конце и без,index.phpиindex.html. - Один товар в нескольких категориях:
/divany/milanи/novinki/milan. - Версии для печати, сессионные параметры, старые адреса после смены структуры, оставшиеся без редиректа.
Отдельный случай — страницы пагинации. Это не дубли: на второй странице категории другие товары. Ошибкой было бы как раз склеивать их с первой, об этом ниже.
Чем дубли вредят
Поисковик не наказывает сайт за дубли как за нарушение, но они мешают сразу в трёх местах. Во-первых, сигналы — внешние и внутренние ссылки, поведение — делятся между несколькими адресами, и ни один не набирает достаточно, чтобы выйти вперёд. Во-вторых, робот тратит время обхода на копии вместо новых и изменённых страниц. В-третьих, поисковик сам выбирает, какой адрес считать основным, и выбор не всегда совпадает с вашим: в выдаче может оказаться адрес с сортировкой или меткой.
В Яндекс Вебмастере такие адреса видны в разделе исключённых страниц со статусом «Дубль», в Google Search Console — в отчёте об индексировании со статусами вида «Страница является копией» и указанием, какой адрес Google выбрал каноническим.
Как найти дубли на своём сайте
Где искать и что там смотреть
| Где смотреть | Что искать |
|---|---|
| Яндекс Вебмастер → Индексирование → Страницы в поиске | Исключённые адреса со статусом «Дубль» и параметрами в адресе |
| Google Search Console → Индексирование страниц | Копии без выбранного канонического адреса и случаи, где Google выбрал не ваш |
| Поиск по сайту в Яндексе и Google | Сколько страниц найдено по сравнению с числом товаров и категорий |
| Исходный код страницы категории с фильтром | Тег <link rel="canonical"> и адрес, на который он указывает |
| Краулер | Совпадающие title и description у разных адресов, адреса с параметрами |
Наш аудит проверяет у каждой обойдённой страницы, есть ли canonical и указывает ли он на саму страницу. Отметка «canonical ведёт на другой адрес» — не всегда ошибка: на странице с сортировкой так и должно быть. Поэтому в отчёте важен сам адрес — по нему видно, намеренная это склейка или сломанный шаблон.
Чем склеивать: пять инструментов
Инструменты борьбы с дублями и их ограничения
| Инструмент | Когда применять | Ограничения |
|---|---|---|
| Редирект 301 | Технические варианты адреса: www, http, слеш, старая структура | Страница-копия перестаёт открываться — для сортировок не подходит |
rel="canonical" | Сортировки, метки, товар в нескольких категориях | Это подсказка, а не команда: при противоречивых сигналах поисковик может выбрать другой адрес |
Clean-param в robots.txt | Параметры, не меняющие содержимое: метки, сессии, сортировка | Директиву понимает только Яндекс |
Мета-тег noindex | Служебные страницы, которые должны открываться, но не искаться | Робот должен видеть страницу — её нельзя одновременно закрывать в robots.txt |
Disallow в robots.txt | Бесконечные комбинации фильтров, которые съедают обход | Запрещает обход, но не гарантирует удаление из индекса Google; canonical на закрытой странице робот не прочитает |
Отдельного инструмента для параметров в Google больше нет: соответствующий отчёт в Search Console отключён в 2022 году, поэтому для Google остаются canonical, редиректы и аккуратная внутренняя ссылочная структура.
Если под фильтр есть спрос — «белые диваны», «кровати 160×200», — это не дубль, а будущая посадочная страница. Ей нужен свой понятный адрес без параметров, собственные title, H1 и текст. Тогда canonical такой страницы указывает на неё саму.
Ошибки при склейке
- Canonical указывает на страницу, которая отдаёт 404, редирект или закрыта
noindex. Поисковик получает противоречие и игнорирует подсказку. Как найти такие адреса — в статье о битых ссылках и редиректах. - Все страницы пагинации ссылаются canonical на первую. Товары со второй страницы и дальше теряют путь в индекс; у каждой страницы пагинации canonical должен вести на неё саму.
- Страница одновременно закрыта в robots.txt и размечена canonical — робот не может прочитать тег.
- На странице два тега canonical: один ставит тема, другой — SEO-плагин. Поисковик вправе проигнорировать оба тега.
- Во внутренних ссылках, меню и карте сайта используются адреса с параметрами, а canonical указывает на чистые. Сайт сам себе противоречит.
Что проверить после правок
Откройте исходный код трёх вариантов одной категории — чистый адрес, с сортировкой и с меткой — и убедитесь, что canonical у всех трёх одинаковый и ведёт на чистый адрес, который отвечает кодом 200.
Проверьте свой сайт
Аудит обходит сайт и показывает ошибки с адресами страниц: мета-теги, canonical, коды ответа, переадресации, время ответа сервера. Проверка бесплатная, смету по найденному вы увидите до любой оплаты.
Частые вопросы
Накладывают ли поисковики фильтр за дубли?
Отдельного наказания за технические дубли нет. Потери косвенные: сигналы делятся между копиями, обход тратится впустую, а в выдачу может попасть не тот адрес.
Что лучше для сортировок — canonical или Clean-param?
Лучше оба: Clean-param понимает только Яндекс и экономит его обход, а canonical работает и для Google. Если на страницы с сортировкой нет внутренних ссылок в индексируемом виде, проблема и вовсе почти исчезает.
Как быстро дубли уйдут из индекса?
Только после переобхода этих адресов. Для небольшого сайта это недели, для крупного каталога — дольше. Ускорить помогает актуальная карта сайта без дублей.
Нужен ли canonical на странице без дублей?
Желателен: ссылка на саму себя защищает от копий, которые появятся позже, — например, от рекламных меток во внешних ссылках.