Первое, что читает робот

Представьте, что вы заходите в огромный торговый центр. Первое, что вы видите — это схема этажей с указателями. Но у поискового робота, заходящего на ваш сайт, нет такой карты. У него есть только файл robots.txt — та самая «схема», в которой вы, как администратор, указываете: «Сюда можно заходить, а сюда — ни в коем случае».

Этот крошечный текстовый файл в корне сайта обладает колоссальной властью. Одна ошибка в нём может полностью скрыть ваш сайт от поисковиков, привести к падению трафика до нуля и оставить вас в недоумении. В этой лекции мы разберём, как работает robots.txt и как использовать его во благо SEO.

Почему robots.txt критически важен

  1. Экономия краулингового бюджета. Робот не тратит время на сканирование служебных страниц, корзины, личного кабинета, результатов поиска.
  2. Предотвращение попадания в индекс «мусорных» страниц. Дубли, фильтры, пагинация — всё это может быть закрыто.
  3. Защита конфиденциальных разделов (условно). Нельзя полагаться на robots.txt как на защиту паролем, но для поисковиков это сигнал.

Синтаксис robots.txt

Файл состоит из простых директив:

  • User-agent: Указывает, к какому роботу относятся правила. * — все роботы.
  • Disallow: Запрещает сканирование раздела или страницы.
  • Allow: Разрешает сканирование конкретной страницы внутри запрещённого раздела.
  • Sitemap: Указывает путь к sitemap.xml.

Пример базового robots.txt:

text

User-agent: *Disallow: /admin/Disallow: /personal/Disallow: /cart/Disallow: /search/Disallow: /*?sort=Allow: /personal/login/Sitemap: https://site.ru/sitemap.xml

Типичные ошибки в robots.txt

Ошибка 1. Закрытие всего сайта от индексации.

text

User-agent: *Disallow: /

Это полностью запрещает роботу сканировать сайт. Часто остаётся после разработки на тестовом сервере и забывается при переносе на боевой. Результат — сайт выпадает из поиска.

Ошибка 2. Закрытие CSS и JS файлов.
Если робот не может загрузить стили и скрипты, он видит страницу «сломанной» и может понизить её в выдаче. Убедитесь, что в Disallow нет папок /css/ и /js/.

Ошибка 3. Использование robots.txt для сокрытия секретных данных.
robots.txt — публичный файл. Любой может его прочитать и узнать, какие разделы вы пытаетесь скрыть. Для реальной защиты используйте пароли и аутентификацию.

Почему robots.txt критически важен

Как проверить robots.txt

  • Google Search Console → Проверка robots.txt.
  • Яндекс.Вебмастер → Анализ robots.txt.

Глава 5. Robots.txt и noindex: в чём разница

  • robots.txt запрещает сканирование страницы, но она всё равно может попасть в индекс, если на неё ссылаются другие сайты (но будет без описания).
  • Мета-тег noindex запрещает индексацию, но страница может быть просканирована.

Для надёжного исключения страницы из поиска используйте оба метода: закройте её в robots.txt (чтобы экономить бюджет) и поставьте noindex (чтобы гарантировать исключение из индекса).

robots.txt — это простой, но мощный файл. Раз в месяц проверяйте его содержимое, чтобы случайно не закрыть от роботов свои лучшие страницы.