Индексация4 мин

Robots.txt и sitemap: две ошибки, закрывающие сайт от поиска

Первая ошибка — строка Disallow: /, оставшаяся с этапа разработки. Вторая — карта сайта, которая месяцами не обновляется или отдаёт закрытые адреса. Обе проверяются за несколько минут.

Редакция SeoMarket

Ошибка первая: Disallow: / после разработки

Пока сайт разрабатывают, его закрывают от поиска — правильно. Проблема возникает при запуске: строку Disallow: / забывают удалить, и сайт остаётся полностью закрытым от обхода. Никакие тексты и мета-теги не помогут: робот их не увидит.

Похожий эффект даёт галочка «закрыть сайт от индексации» в настройках CMS, мета-тег noindex в общем шаблоне или заголовок X-Robots-Tag на сервере. Проверяется всё это за несколько минут — ниже инструкция.

Как устроен robots.txt

Основные директивы и кто их понимает
ДирективаЧто делаетКто учитывает
User-agentДля какого робота правила ниже: * — для всехВсе
DisallowЗапрещает обход адресов, начинающихся с указанного путиВсе
AllowРазрешает обход внутри запрещённого разделаЯндекс и Google
SitemapПолный адрес карты сайтаЯндекс и Google
Clean-paramПараметры адреса, которые не меняют содержимоеТолько Яндекс
Crawl-delayПауза между запросами роботаGoogle не учитывает; Яндекс перестал учитывать в 2018 году
HostГлавное зеркало сайтаУстарела: Яндекс отказался от неё в 2018 году в пользу 301-редиректа

Главное, что стоит помнить: Disallow запрещает обход, а не индексацию. Google может показать в поиске адрес, закрытый в robots.txt, если на него много ссылок, — просто без описания. Чтобы убрать страницу из поиска, нужен мета-тег noindex, а страница при этом должна оставаться открытой для обхода, иначе робот тег не прочитает.

Пример robots.txt для интернет-магазина

Универсального файла не бывает: пути зависят от CMS. Но логика у магазинов общая — закрыть служебные разделы и мусорные параметры, не трогая каталог, и указать карту сайта. Адреса ниже условные.

Условный robots.txt
User-agent: *
Disallow: /cart/
Disallow: /checkout/
Disallow: /personal/
Disallow: /search/
Disallow: /*?sort=
Disallow: /*&sort=

# Директиву понимает только Яндекс: склеивает адреса с метками
Clean-param: utm_source&utm_medium&utm_campaign&yclid

Sitemap: https://example.ru/sitemap.xml
  • Символ * означает любую последовательность символов — его понимают и Яндекс, и Google. Правило /*?sort= закрывает сортировку на любой странице.
  • Закрывать /search/ стоит, только если страницы поиска по сайту не задуманы как посадочные.
  • Не закрывайте папки со стилями, скриптами и изображениями: без них робот видит страницу не такой, какой её видит посетитель.
  • После правки файла проверьте несколько важных адресов инструментом анализа robots.txt — одна лишняя строка может закрыть весь каталог.

Ошибка вторая: карта сайта против robots.txt

Карта сайта приглашает робота на адреса, robots.txt и мета-теги запрещают. Когда одни и те же адреса есть и там, и там, поисковик получает противоречивые указания и решает сам — а в панелях вебмастера появляются предупреждения.

  • В карте адреса, закрытые в robots.txt или мета-тегом noindex.
  • В карте адреса с редиректами и ошибками 404 — остались после смены структуры. Как их найти — в статье о битых ссылках и редиректах.
  • Карту сгенерировал плагин при запуске, и с тех пор она не обновлялась: новых разделов в ней нет.
  • Адреса в карте с другим протоколом или доменом: http вместо https, с www при основном зеркале без него.
  • В карте страницы с параметрами — фильтры, сортировки, метки.

Правильная карта — это список канонических страниц, отвечающих кодом 200, открытых для индексации, с настоящими датами изменения. Подробнее о датах — в статье об ускорении переобхода.

Проверка за несколько минут

  1. Открыть /robots.txt и найти строки Disallow для User-agent: *, Yandex и Googlebot. Убедиться, что закрыты только служебные разделы: корзина, личный кабинет, поиск по сайту.
  2. Проверить файл в Яндекс Вебмастере инструментом анализа robots.txt: туда можно вставить адреса и увидеть, разрешены ли они. В Google Search Console аналогичный отчёт о robots.txt находится в настройках.
  3. Открыть /sitemap.xml: файл открывается, адреса в нём на вашем основном домене, даты изменения не все одинаковые.
  4. Открыть пять-десять адресов из карты и убедиться, что они отвечают, не перенаправляют и не закрыты от индексации.
  5. Проверить, что строка Sitemap: в robots.txt указывает на эту карту.

Наш аудит читает sitemap.xml как источник адресов для обхода и отмечает страницы, закрытые мета-тегом noindex. Сам файл robots.txt аудит сейчас не разбирает, поэтому первые два шага списка стоит сделать вручную. Полный список — 27 проверок аудита с порогами.

Проверьте свой сайт

Аудит обходит сайт и показывает ошибки с адресами страниц: мета-теги, canonical, коды ответа, переадресации, время ответа сервера. Проверка бесплатная, смету по найденному вы увидите до любой оплаты.

Частые вопросы

Нужно ли закрывать в robots.txt корзину и личный кабинет?

Да, это разумно: в поиске этим страницам делать нечего, а обход на них тратится. Главное — не закрывать заодно разделы каталога или файлы стилей и скриптов, без которых робот не может отрисовать страницу.

Как убрать страницу из поиска?

Мета-тегом noindex или кодом ответа 404 или 410. Запрет в robots.txt для этого не подходит: он прекращает обход, но не всегда убирает адрес из индекса.

Нужна ли карта сайта маленькому сайту?

Если на все страницы ведут ссылки, робот найдёт их и без карты. Но карта ничего не стоит и помогает быстрее узнать о новых страницах, поэтому держать её стоит на сайте любого размера.

Читать дальше

Индексация5 минДубли страниц: как фильтры каталога съедают позицииЛечится canonical, директивой Clean-param для Яндекса и аккуратной работой с параметрами — при условии, что canonical ведёт на открытую для индексации страницу.
Контент5 минПлотность ключей: сколько вхождений безопасноСчитать повторы нужно по всему тексту страницы, включая меню, фильтры и подвал: именно там ключи чаще всего дублируются незаметно для автора.
Структура5 минПерелинковка в магазине: пять ссылок, которые работаютАнкор берётся из того, что ищут на целевой странице, а не «читать здесь»: ссылка должна говорить, что находится по адресу.
Скорость6 минУскорение сайта: что на самом деле тормозит каталогLCP, INP и CLS на шаблоне листинга. Сначала изображения первого экрана, потом шрифты, и только после этого скрипты и серверный кэш.
Контент5 минТексты категорий: как писать, чтобы это не выглядело спамомМинимального числа слов у поисковиков нет. Есть малоценные страницы — и чаще всего это категории, где текст повторяет то, что уже написано на соседних.
Техническое SEO5 минБитые ссылки и редиректы: где теряется вес страницЛечение — редирект 301 на ближайшую живую категорию или код 410, а не перенаправление всего подряд на главную: такой редирект поисковик может счесть мягкой 404.

Читайте также

Все статьи →