Сначала поймите главное
Robots.txt сообщает ботам, какие пути разрешено обходить.
Sitemap перечисляет URL, которые владелец считает важными и каноническими.
Для исключения страницы из поиска используют noindex или авторизацию, а не одну директиву Disallow.
Как это устроено на практике
Техническое SEO отвечает на простой вопрос: может ли поисковая система без помех получить правильную страницу и понять её основной материал.
На пути мешают ошибки сервера, запреты, дубли, тяжёлый JavaScript и противоречивые сигналы.
Проверять нужно по порядку: доступна ли страница, виден ли основной текст, выбрана ли правильная версия, есть ли внутренние ссылки и только потом — попала ли она в поиск.
Зачем это менять
Заблокированный URL может оставаться известным поисковику без прочитанного содержимого, а sitemap с ошибками создаёт противоречивые сигналы.
Что поменять на сайте
- Разрешить ресурсы, необходимые для чтения страницы.
- Не закрывать robots.txt URL, на котором поисковик должен увидеть noindex.
- Включать в sitemap только 200, indexable и canonical URL.
- Указывать реальный lastmod только при содержательном обновлении.
- Отправить файл в панели вебмастеров и следить за ошибками.
Как понять, что стало лучше
- Robots.txt доступен по корню домена.
- В sitemap нет редиректов, 404 и дублей.
- Правила для поисковых и AI-ботов приняты осознанно.
Пример без теории
Запрет `/private/` в robots.txt не защищает данные.
Чувствительный раздел должен требовать авторизацию.
Где можно ошибиться
Разные боты поддерживают свои документированные правила.
Нельзя копировать случайный список user-agent без проверки первоисточника.
Порядок внедрения
Не меняйте весь сайт за один раз.
Начните с шага «Разрешить ресурсы, необходимые для чтения страницы».
Затем выполните «Не закрывать robots.txt URL, на котором поисковик должен увидеть noindex» и только после этого переходите к шагу «Включать в sitemap только 200, indexable и canonical URL».
Такой порядок помогает увидеть причину результата и не смешать несколько гипотез.
Перед началом сохраните исходные данные и дату правки.
Первый критерий результата: Robots.txt доступен по корню домена.
В sitemap нет редиректов, 404 и дублей.
Если показатель не изменился, проверьте, успела ли поисковая система заново обработать страницу, и только затем пересматривайте решение.
На чём основан материал
- Google: robots.txtОфициальный источник
- Google: файлы SitemapОфициальный источник
- OpenAI: поисковые и обучающие ботыОфициальный источник
Здесь перечислены документы, исследования и публикации, на которые мы опирались. Факты из источников отделены от наших практических выводов и рекомендаций.