Страница, которой нет в индексе, не может получить ни одного посетителя из поиска. Объясняем, как управлять индексацией через robots.txt, sitemap и метатеги и какие проблемы мы чаще всего находим на сайтах клиентов.
Как поисковик находит и добавляет страницы
Путь страницы в выдачу состоит из трёх шагов. Сначала робот должен узнать о существовании адреса — по ссылке с другой страницы, из карты сайта или из внешнего источника. Затем он загружает страницу — это называется обходом, или сканированием. И наконец, система решает, добавлять ли страницу в индекс — базу, из которой формируется выдача. На каждом шаге что-то может пойти не так.
Важно понимать: поисковик не обязан индексировать всё, что нашёл. Если страница похожа на уже известную, почти пустая или низкого качества, её могут обойти, но не включить в поиск. Поэтому задача владельца сайта — не просто «открыть всё», а сделать так, чтобы в индексе были все нужные страницы и не было мусора, который размывает оценку сайта.
У робота также есть ограниченный ресурс обхода на каждый сайт. Для корпоративного сайта в 100 страниц это не проблема. Для каталога на 50 000 товаров, где фильтры порождают ещё миллион адресов, — очень серьёзная: робот тратит время на мусорные страницы, а новые товары попадают в поиск через недели.
robots.txt: что он умеет и чего не умеет
Файл robots.txt лежит в корне сайта и сообщает роботам, какие разделы сканировать не нужно. Это первый файл, который поисковик запрашивает при визите.
Что в нём обычно закрывают
- Служебные разделы: админку, личный кабинет, корзину, оформление заказа.
- Результаты внутреннего поиска по сайту.
- Параметры сортировки, вида отображения, сессий и рекламных меток.
- Комбинации фильтров, которые не являются посадочными страницами.
- Технические дубли: версии для печати, страницы сравнения.
Важное ограничение
Запрет в robots.txt запрещает сканирование, но не гарантирует, что страница не окажется в индексе. Если на закрытый адрес много ссылок, поисковик может показать его в выдаче без описания. Для надёжного исключения страницы из индекса нужен метатег noindex — но тогда страница, наоборот, должна быть доступна для сканирования, иначе робот этот тег просто не увидит. Это частая путаница: одновременно закрывают страницу в robots.txt и ставят noindex, и тег не срабатывает.
И ещё одна классика: после переноса сайта с тестового сервера забывают удалить строку, запрещающую индексацию всего сайта. Мы видели случаи, когда новый сайт производителя упаковки два месяца после запуска не получал ни одного визита из поиска — ровно по этой причине. Проверка robots.txt входит в наш обязательный чек-лист запуска.
Карта сайта sitemap.xml
Карта сайта — это список адресов, которые вы хотите видеть в индексе. Она не заставляет поисковик индексировать страницы, но помогает быстрее их найти, особенно новые и глубоко расположенные.
- В карту включаются только канонические страницы с кодом ответа 200, открытые для индексации.
- Не включаются редиректы, страницы с ошибками, закрытые noindex и дубли.
- Для больших сайтов — несколько файлов по типам: категории, товары, статьи, и общий индексный файл.
- Один файл — не более 50 000 адресов.
- Дата последнего изменения должна быть реальной, а не текущей датой для всех страниц.
- Карта генерируется автоматически и обновляется при изменениях на сайте.
- Адрес карты указывается в robots.txt и добавляется в панели вебмастеров.
Частая ошибка — карта, которую сгенерировали один раз при запуске и больше не обновляли. Через год в ней половина удалённых страниц и нет ни одного нового товара. Поисковик перестаёт ей доверять.
Метатеги и канонические адреса
Если robots.txt управляет сканированием на уровне разделов, то метатеги и заголовки ответа сервера управляют индексацией конкретных страниц.
| Инструмент | Что делает | Когда использовать |
|---|---|---|
| robots.txt Disallow | Запрещает сканирование | Служебные разделы, параметры, мусорные комбинации |
| meta robots noindex | Запрещает индексацию страницы | Страницы, нужные пользователю, но не нужные в поиске |
| rel="canonical" | Указывает основную версию из нескольких похожих | Дубли товара в разных категориях, страницы с параметрами |
| Редирект 301 | Постоянно перенаправляет на новый адрес | Переезд, смена структуры, склейка зеркал |
| Код 404 или 410 | Сообщает, что страницы нет | Удалённые страницы без аналога |
Канонический адрес — это подсказка, а не команда. Если страницы по содержанию сильно различаются, поисковик может проигнорировать указание. Поэтому канонизация работает для настоящих дублей, а не как способ «спрятать» разные страницы.
Совет студии: у каждой страницы сайта должен быть один понятный статус — «в индексе» или «не в индексе» — и один способ его задать. Когда на одной странице одновременно стоят запрет в robots.txt, noindex и канонический адрес на другую страницу, поисковик получает противоречивые сигналы и принимает решение сам, не всегда в вашу пользу.
Частые проблемы с индексацией
Вот что мы находим на большинстве сайтов, которые приходят к нам на аудит или на поддержку.
- Зеркала не склеены. Сайт доступен с www и без, по http и https, со слэшем на конце и без. Для поисковика это разные страницы-дубли.
- Мягкие ошибки 404. Несуществующая страница отдаёт код 200 и текст «страница не найдена». Робот индексирует тысячи таких «страниц».
- Контент подгружается только скриптом. Робот видит пустой шаблон, а товары и тексты появляются только в браузере после выполнения кода.
- Бесконечные адреса. Календари, фильтры и сортировки создают неограниченное количество комбинаций.
- Важные страницы без внутренних ссылок. Их нет в меню, на них не ссылаются из разделов, они доступны только из карты сайта.
- Слишком медленный ответ сервера. Робот сокращает интенсивность обхода, если сайт отвечает долго или с ошибками.
- Дублированный контент. Одинаковые описания у сотен товаров, одинаковые тексты на страницах городов.
Как проверить состояние индексации
Базовая диагностика занимает час-два и не требует специальных знаний.
- Сравните количество страниц в карте сайта с количеством страниц в индексе по данным панелей вебмастеров. Большой разрыв в любую сторону — повод разбираться.
- Посмотрите отчёт об исключённых страницах: там видно, почему поисковик не стал индексировать адреса — дубли, редиректы, низкое качество, запрет.
- Проверьте несколько ключевых страниц инструментом проверки адреса в панели вебмастера: как робот видит страницу, есть ли на ней контент.
- Просканируйте сайт краулером и сравните список найденных страниц с картой сайта.
- Проверьте, как быстро новые страницы появляются в поиске: для нормально настроенного сайта это дни, а не недели.
Если новые страницы попадают в индекс медленно, помогает связка из нескольких мер: ссылка на новую страницу с главной или из раздела с высокой посещаемостью, свежая дата в карте сайта и ручная отправка адреса на переобход через панель вебмастера. Последний инструмент имеет дневные лимиты, поэтому его стоит приберечь для важных страниц — новой услуги, акции, ключевой категории. Для массовых обновлений каталога надёжнее работает правильно настроенная карта сайта и стабильная скорость ответа сервера.
Чек-лист индексации
- robots.txt не закрывает важные разделы и содержит ссылку на карту сайта.
- Служебные разделы, параметры и мусорные фильтры закрыты от сканирования.
- Карта сайта генерируется автоматически и содержит только канонические страницы с кодом 200.
- Все зеркала склеены 301-редиректом на одну основную версию.
- Несуществующие адреса отдают код 404, а не 200.
- Дубли закрыты каноническими адресами или noindex, без противоречий.
- Контент доступен роботу в HTML без выполнения скриптов.
- На каждую важную страницу ведут внутренние ссылки.
- Сервер отвечает быстро и стабильно.
- Отчёты панелей вебмастеров просматриваются хотя бы раз в месяц.
Индексация — фундамент, на котором строится всё остальное SEO. Тексты, ссылки и дизайн не помогут странице, которую поисковик не видит или считает дублем.