Главная/Блог/SEO и продвижение/Индексация сайта: robots.txt, sitemap и частые проблемы

Индексация сайта: robots.txt, sitemap и частые проблемы

SEO и продвижение9 июля 20266 мин чтенияРедакция студии «Санмедиа»
Индексация сайта: robots.txt, sitemap и частые проблемы

Страница, которой нет в индексе, не может получить ни одного посетителя из поиска. Объясняем, как управлять индексацией через robots.txt, sitemap и метатеги и какие проблемы мы чаще всего находим на сайтах клиентов.

Как поисковик находит и добавляет страницы

Путь страницы в выдачу состоит из трёх шагов. Сначала робот должен узнать о существовании адреса — по ссылке с другой страницы, из карты сайта или из внешнего источника. Затем он загружает страницу — это называется обходом, или сканированием. И наконец, система решает, добавлять ли страницу в индекс — базу, из которой формируется выдача. На каждом шаге что-то может пойти не так.

Важно понимать: поисковик не обязан индексировать всё, что нашёл. Если страница похожа на уже известную, почти пустая или низкого качества, её могут обойти, но не включить в поиск. Поэтому задача владельца сайта — не просто «открыть всё», а сделать так, чтобы в индексе были все нужные страницы и не было мусора, который размывает оценку сайта.

У робота также есть ограниченный ресурс обхода на каждый сайт. Для корпоративного сайта в 100 страниц это не проблема. Для каталога на 50 000 товаров, где фильтры порождают ещё миллион адресов, — очень серьёзная: робот тратит время на мусорные страницы, а новые товары попадают в поиск через недели.

robots.txt: что он умеет и чего не умеет

Файл robots.txt лежит в корне сайта и сообщает роботам, какие разделы сканировать не нужно. Это первый файл, который поисковик запрашивает при визите.

Что в нём обычно закрывают

  • Служебные разделы: админку, личный кабинет, корзину, оформление заказа.
  • Результаты внутреннего поиска по сайту.
  • Параметры сортировки, вида отображения, сессий и рекламных меток.
  • Комбинации фильтров, которые не являются посадочными страницами.
  • Технические дубли: версии для печати, страницы сравнения.

Важное ограничение

Запрет в robots.txt запрещает сканирование, но не гарантирует, что страница не окажется в индексе. Если на закрытый адрес много ссылок, поисковик может показать его в выдаче без описания. Для надёжного исключения страницы из индекса нужен метатег noindex — но тогда страница, наоборот, должна быть доступна для сканирования, иначе робот этот тег просто не увидит. Это частая путаница: одновременно закрывают страницу в robots.txt и ставят noindex, и тег не срабатывает.

И ещё одна классика: после переноса сайта с тестового сервера забывают удалить строку, запрещающую индексацию всего сайта. Мы видели случаи, когда новый сайт производителя упаковки два месяца после запуска не получал ни одного визита из поиска — ровно по этой причине. Проверка robots.txt входит в наш обязательный чек-лист запуска.

Карта сайта sitemap.xml

Карта сайта — это список адресов, которые вы хотите видеть в индексе. Она не заставляет поисковик индексировать страницы, но помогает быстрее их найти, особенно новые и глубоко расположенные.

  • В карту включаются только канонические страницы с кодом ответа 200, открытые для индексации.
  • Не включаются редиректы, страницы с ошибками, закрытые noindex и дубли.
  • Для больших сайтов — несколько файлов по типам: категории, товары, статьи, и общий индексный файл.
  • Один файл — не более 50 000 адресов.
  • Дата последнего изменения должна быть реальной, а не текущей датой для всех страниц.
  • Карта генерируется автоматически и обновляется при изменениях на сайте.
  • Адрес карты указывается в robots.txt и добавляется в панели вебмастеров.

Частая ошибка — карта, которую сгенерировали один раз при запуске и больше не обновляли. Через год в ней половина удалённых страниц и нет ни одного нового товара. Поисковик перестаёт ей доверять.

Метатеги и канонические адреса

Если robots.txt управляет сканированием на уровне разделов, то метатеги и заголовки ответа сервера управляют индексацией конкретных страниц.

ИнструментЧто делаетКогда использовать
robots.txt DisallowЗапрещает сканированиеСлужебные разделы, параметры, мусорные комбинации
meta robots noindexЗапрещает индексацию страницыСтраницы, нужные пользователю, но не нужные в поиске
rel="canonical"Указывает основную версию из нескольких похожихДубли товара в разных категориях, страницы с параметрами
Редирект 301Постоянно перенаправляет на новый адресПереезд, смена структуры, склейка зеркал
Код 404 или 410Сообщает, что страницы нетУдалённые страницы без аналога

Канонический адрес — это подсказка, а не команда. Если страницы по содержанию сильно различаются, поисковик может проигнорировать указание. Поэтому канонизация работает для настоящих дублей, а не как способ «спрятать» разные страницы.

Совет студии: у каждой страницы сайта должен быть один понятный статус — «в индексе» или «не в индексе» — и один способ его задать. Когда на одной странице одновременно стоят запрет в robots.txt, noindex и канонический адрес на другую страницу, поисковик получает противоречивые сигналы и принимает решение сам, не всегда в вашу пользу.

Частые проблемы с индексацией

Вот что мы находим на большинстве сайтов, которые приходят к нам на аудит или на поддержку.

  1. Зеркала не склеены. Сайт доступен с www и без, по http и https, со слэшем на конце и без. Для поисковика это разные страницы-дубли.
  2. Мягкие ошибки 404. Несуществующая страница отдаёт код 200 и текст «страница не найдена». Робот индексирует тысячи таких «страниц».
  3. Контент подгружается только скриптом. Робот видит пустой шаблон, а товары и тексты появляются только в браузере после выполнения кода.
  4. Бесконечные адреса. Календари, фильтры и сортировки создают неограниченное количество комбинаций.
  5. Важные страницы без внутренних ссылок. Их нет в меню, на них не ссылаются из разделов, они доступны только из карты сайта.
  6. Слишком медленный ответ сервера. Робот сокращает интенсивность обхода, если сайт отвечает долго или с ошибками.
  7. Дублированный контент. Одинаковые описания у сотен товаров, одинаковые тексты на страницах городов.

Как проверить состояние индексации

Базовая диагностика занимает час-два и не требует специальных знаний.

  • Сравните количество страниц в карте сайта с количеством страниц в индексе по данным панелей вебмастеров. Большой разрыв в любую сторону — повод разбираться.
  • Посмотрите отчёт об исключённых страницах: там видно, почему поисковик не стал индексировать адреса — дубли, редиректы, низкое качество, запрет.
  • Проверьте несколько ключевых страниц инструментом проверки адреса в панели вебмастера: как робот видит страницу, есть ли на ней контент.
  • Просканируйте сайт краулером и сравните список найденных страниц с картой сайта.
  • Проверьте, как быстро новые страницы появляются в поиске: для нормально настроенного сайта это дни, а не недели.

Если новые страницы попадают в индекс медленно, помогает связка из нескольких мер: ссылка на новую страницу с главной или из раздела с высокой посещаемостью, свежая дата в карте сайта и ручная отправка адреса на переобход через панель вебмастера. Последний инструмент имеет дневные лимиты, поэтому его стоит приберечь для важных страниц — новой услуги, акции, ключевой категории. Для массовых обновлений каталога надёжнее работает правильно настроенная карта сайта и стабильная скорость ответа сервера.

Чек-лист индексации

  • robots.txt не закрывает важные разделы и содержит ссылку на карту сайта.
  • Служебные разделы, параметры и мусорные фильтры закрыты от сканирования.
  • Карта сайта генерируется автоматически и содержит только канонические страницы с кодом 200.
  • Все зеркала склеены 301-редиректом на одну основную версию.
  • Несуществующие адреса отдают код 404, а не 200.
  • Дубли закрыты каноническими адресами или noindex, без противоречий.
  • Контент доступен роботу в HTML без выполнения скриптов.
  • На каждую важную страницу ведут внутренние ссылки.
  • Сервер отвечает быстро и стабильно.
  • Отчёты панелей вебмастеров просматриваются хотя бы раз в месяц.

Индексация — фундамент, на котором строится всё остальное SEO. Тексты, ссылки и дизайн не помогут странице, которую поисковик не видит или считает дублем.

Расскажите о задаче —посчитаем проект

Опишите в двух словах, какой сайт нужен и к какому сроку. Мы изучим задачу, зададим уточняющие вопросы и в течение двух рабочих дней пришлём оценку сроков и бюджета. Можно написать и напрямую: [email protected].

Ответим в течение рабочего дня · Без навязчивых звонков · NDA по запросу

Нажимая кнопку, вы соглашаетесь с политикой конфиденциальности и использованием cookies.

Спасибо, заявка отправлена.
Менеджер ответит в течение рабочего дня на указанный контакт.