01

Сначала поймите главное

Robots.txt сообщает ботам, какие пути разрешено обходить.

Sitemap перечисляет URL, которые владелец считает важными и каноническими.

Для исключения страницы из поиска используют noindex или авторизацию, а не одну директиву Disallow.

02

Как это устроено на практике

Техническое SEO отвечает на простой вопрос: может ли поисковая система без помех получить правильную страницу и понять её основной материал.

На пути мешают ошибки сервера, запреты, дубли, тяжёлый JavaScript и противоречивые сигналы.

Проверять нужно по порядку: доступна ли страница, виден ли основной текст, выбрана ли правильная версия, есть ли внутренние ссылки и только потом — попала ли она в поиск.

03

Зачем это менять

Заблокированный URL может оставаться известным поисковику без прочитанного содержимого, а sitemap с ошибками создаёт противоречивые сигналы.

04

Что поменять на сайте

  • Разрешить ресурсы, необходимые для чтения страницы.
  • Не закрывать robots.txt URL, на котором поисковик должен увидеть noindex.
  • Включать в sitemap только 200, indexable и canonical URL.
  • Указывать реальный lastmod только при содержательном обновлении.
  • Отправить файл в панели вебмастеров и следить за ошибками.
05

Как понять, что стало лучше

  • Robots.txt доступен по корню домена.
  • В sitemap нет редиректов, 404 и дублей.
  • Правила для поисковых и AI-ботов приняты осознанно.
06

Пример без теории

Запрет `/private/` в robots.txt не защищает данные.

Чувствительный раздел должен требовать авторизацию.

07

Где можно ошибиться

Разные боты поддерживают свои документированные правила.

Нельзя копировать случайный список user-agent без проверки первоисточника.

08

Порядок внедрения

Не меняйте весь сайт за один раз.

Начните с шага «Разрешить ресурсы, необходимые для чтения страницы».

Затем выполните «Не закрывать robots.txt URL, на котором поисковик должен увидеть noindex» и только после этого переходите к шагу «Включать в sitemap только 200, indexable и canonical URL».

Такой порядок помогает увидеть причину результата и не смешать несколько гипотез.

Перед началом сохраните исходные данные и дату правки.

Первый критерий результата: Robots.txt доступен по корню домена.

В sitemap нет редиректов, 404 и дублей.

Если показатель не изменился, проверьте, успела ли поисковая система заново обработать страницу, и только затем пересматривайте решение.

ИСТОЧНИКИ

На чём основан материал

Здесь перечислены документы, исследования и публикации, на которые мы опирались. Факты из источников отделены от наших практических выводов и рекомендаций.