Как robots.txt управляет индексацией
Первое, что читает робот
Представьте, что вы заходите в огромный торговый центр. Первое, что вы видите — это схема этажей с указателями. Но у поискового робота, заходящего на ваш сайт, нет такой карты. У него есть только файл robots.txt — та самая «схема», в которой вы, как администратор, указываете: «Сюда можно заходить, а сюда — ни в коем случае».
Этот крошечный текстовый файл в корне сайта обладает колоссальной властью. Одна ошибка в нём может полностью скрыть ваш сайт от поисковиков, привести к падению трафика до нуля и оставить вас в недоумении. В этой лекции мы разберём, как работает robots.txt и как использовать его во благо SEO.
Почему robots.txt критически важен
- Экономия краулингового бюджета. Робот не тратит время на сканирование служебных страниц, корзины, личного кабинета, результатов поиска.
- Предотвращение попадания в индекс «мусорных» страниц. Дубли, фильтры, пагинация — всё это может быть закрыто.
- Защита конфиденциальных разделов (условно). Нельзя полагаться на robots.txt как на защиту паролем, но для поисковиков это сигнал.
Синтаксис robots.txt
Файл состоит из простых директив:
- User-agent: Указывает, к какому роботу относятся правила. * — все роботы.
- Disallow: Запрещает сканирование раздела или страницы.
- Allow: Разрешает сканирование конкретной страницы внутри запрещённого раздела.
- Sitemap: Указывает путь к sitemap.xml.
Пример базового robots.txt:
text
User-agent: *Disallow: /admin/Disallow: /personal/Disallow: /cart/Disallow: /search/Disallow: /*?sort=Allow: /personal/login/Sitemap: https://site.ru/sitemap.xml
Типичные ошибки в robots.txt
Ошибка 1. Закрытие всего сайта от индексации.
text
User-agent: *Disallow: /
Это полностью запрещает роботу сканировать сайт. Часто остаётся после разработки на тестовом сервере и забывается при переносе на боевой. Результат — сайт выпадает из поиска.
Ошибка 2. Закрытие CSS и JS файлов.
Если робот не может загрузить стили и скрипты, он видит страницу «сломанной» и может понизить её в выдаче. Убедитесь, что в Disallow нет папок /css/ и /js/.
Ошибка 3. Использование robots.txt для сокрытия секретных данных.
robots.txt — публичный файл. Любой может его прочитать и узнать, какие разделы вы пытаетесь скрыть. Для реальной защиты используйте пароли и аутентификацию.

Как проверить robots.txt
- Google Search Console → Проверка robots.txt.
- Яндекс.Вебмастер → Анализ robots.txt.
Глава 5. Robots.txt и noindex: в чём разница
- robots.txt запрещает сканирование страницы, но она всё равно может попасть в индекс, если на неё ссылаются другие сайты (но будет без описания).
- Мета-тег noindex запрещает индексацию, но страница может быть просканирована.
Для надёжного исключения страницы из поиска используйте оба метода: закройте её в robots.txt (чтобы экономить бюджет) и поставьте noindex (чтобы гарантировать исключение из индекса).
robots.txt — это простой, но мощный файл. Раз в месяц проверяйте его содержимое, чтобы случайно не закрыть от роботов свои лучшие страницы.