Карта сайта и robots.txt: ошибки, которые режут трафик
Robots.txt занимает двадцать строк, sitemap.xml генерируется автоматически — казалось бы, что тут может пойти не так. На практике это два самых частых источника катастроф: одна лишняя строка способна убрать из поиска весь сайт, и такое случается регулярно после релизов.
Что robots.txt на самом деле делает
Он управляет обходом, а не индексацией. Закрытая в robots страница может попасть в поиск, если на неё ведут внешние ссылки — робот просто не увидит её содержимого и покажет пустой сниппет. Чтобы страницы точно не было в индексе, нужен мета-тег noindex, а сама страница должна оставаться открытой для обхода — иначе робот не прочитает этот тег. Эта логика подробно описана в документации Google по robots.txt.
Частые ошибки в robots.txt
- Disallow: / в проде — остался с тестового сервера, убирает сайт из поиска за несколько дней
- Закрытие /wp-content/ или /assets/ целиком: робот не грузит CSS и JS и видит сломанную страницу
- Закрытие страниц, которые нужно вывести из индекса, — вместо noindex; они так и висят в выдаче
- Отсутствие директивы Sitemap — робот дольше находит новые страницы
- Разные правила для User-agent: Yandex и Googlebot, о которых никто не помнит через год
- Файл отдаёт 404 или 500 — часть роботов трактует это как запрет на обход всего сайта
Что должно быть в sitemap.xml
Только канонические URL, отдающие код 200 и открытые к индексации. Никаких редиректов, страниц с noindex, дублей с параметрами. Дата lastmod должна быть настоящей: если она обновляется у всех страниц при каждой сборке сайта, робот перестаёт ей верить. Лимит — 50 000 URL и 50 МБ на файл; для крупных проектов делают индексный файл со ссылками на отдельные карты по разделам.
Как разбивать карту, чтобы она приносила пользу
Отдельные файлы под категории, товары, статьи и статические страницы дают диагностику: в Вебмастере видно, какая группа индексируется плохо. Если из 4 000 товаров в индексе 1 200, а из 40 категорий — 39, вы сразу знаете, где искать проблему. Без разбивки эта информация теряется. Что делать с найденным разрывом, разобрано в статье про индексацию.
Приоритет и частота обновления
Теги priority и changefreq поисковые системы фактически игнорируют — тратить время на их настройку не нужно. Единственный элемент, который действительно учитывается, — lastmod, и то при условии, что он честный. Гораздо важнее, чтобы карта генерировалась автоматически при публикации новой страницы, а не собиралась контент-менеджером вручную раз в квартал.
Проверка после каждого релиза
- Открыть /robots.txt в браузере и прочитать глазами — 30 секунд, которые спасают месяцы
- Проверить файл в инструменте анализа robots.txt в Вебмастере на нескольких важных URL
- Убедиться, что sitemap доступен, валиден и содержит актуальное число страниц
- Сверить число URL в карте с числом страниц в индексе — расхождение больше 20% требует разбора
Кто за это отвечает
Практика показывает: если у файлов нет владельца, они ломаются при первом же деплое. Правильный подход — включить проверку robots.txt и sitemap в чек-лист релиза наравне с проверкой форм и счётчиков. Полный список таких проверок мы собрали в техническом аудите, а на проектах сопровождения это входит в регулярные работы по поддержке.
Два текстовых файла стоят дешевле любой другой работы по сайту и при этом определяют, увидит ли поиск ваш контент вообще. Проверьте их сегодня — а если нужен взгляд со стороны на весь технический слой, посмотрите наш подход к SEO и разработке.
