Файлы robots.txt и sitemap.xml: полное руководство
В мире SEO есть два небольших текстовых файла, которые оказывают колоссальное влияние на то, как поисковые системы видят и индексируют ваш сайт. Это robots.txt и sitemap.xml. Первый говорит роботам: «Сюда не ходи, это служебное». Второй показывает: «Вот самое важное, обязательно посмотри».
Несмотря на кажущуюся простоту, ошибки в этих файлах — одни из самых частых и критичных в SEO. Одна неверная строчка в robots.txt может полностью закрыть сайт от индексации. Забытый sitemap.xml — затянуть попадание новых страниц в поиск на недели.
В этой статье мы детально разберём оба файла: их синтаксис, лучшие практики настройки, типичные ошибки и способы проверки. Это полное руководство, которое должно быть в закладках у каждого SEO-специалиста.
robots.txt: страж вашего сайта
Что такое robots.txt и зачем он нужен
Определение:
robots.txt — это текстовый файл в корне сайта, который содержит инструкции для поисковых роботов о том, какие разделы сайта можно сканировать, а какие — нет.
Где находится robots.txt:
Файл должен быть доступен по адресу:
https://site.ru/robots.txt
Поисковые роботы автоматически запрашивают этот файл перед началом сканирования сайта.
Важно понимать:
- robots.txt управляет сканированием (crawling), а не индексацией. Страница, закрытая в robots.txt, не будет просканирована, но может попасть в индекс, если на неё ссылаются другие сайты.
- Robots.txt — это рекомендация, а не приказ. Добросовестные поисковики (Google, Яндекс) соблюдают правила. Вредоносные боты — игнорируют.
- Robots.txt публичен. Любой может посмотреть его, введя site.ru/robots.txt. Не храните там секретную информацию.
Синтаксис robots.txt
Основные директивы:
| Директива | Назначение | Пример |
| User-agent | Указывает, к какому роботу применяются правила | User-agent: Googlebot или User-agent: * (все роботы) |
| Disallow | Запрещает сканирование указанного пути | Disallow: /admin/ |
| Allow | Разрешает сканирование подпути, даже если родительский путь запрещён | Allow: /admin/login.php |
| Sitemap | Указывает путь к файлу sitemap.xml | Sitemap: https://site.ru/sitemap.xml |
| Crawl-delay | Задержка между запросами в секундах (поддерживается Яндексом, Bing; Google игнорирует) | Crawl-delay: 5 |
| Host | Указывает главное зеркало сайта (исторически для Яндекса, сейчас не требуется) | Host: site.ru |
| Clean-param | Указывает параметры URL, которые можно игнорировать (только Яндекс) | Clean-param: utm_source / |
Пример базового robots.txt:
text
User-agent: *Disallow: /admin/Disallow: /personal/Disallow: /cart/Disallow: /search/Disallow: /*?*Allow: /search/advanced/User-agent: Googlebot-ImageAllow: /images/Allow: /uploads/User-agent: YandexCrawl-delay: 3Sitemap: https://site.ru/sitemap.xml
Разбор примера:
- Все роботы (*) не должны сканировать /admin/, /personal/, /cart/, /search/ и любые URL с параметрами (/*?*).
- Для /search/ сделано исключение: /search/advanced/ разрешён.
- Googlebot-Image разрешено сканировать папки с изображениями.
- Для Яндекса установлена задержка 3 секунды между запросами.
- Указан путь к sitemap.xml.
Правила написания robots.txt
Правило 1. Один User-agent — один блок правил
text
User-agent: GooglebotDisallow: /private/User-agent: YandexDisallow: /secret/
Правило 2. Правила применяются по порядку сверху вниз
Google и Яндекс читают файл сверху вниз и применяют первое подходящее правило.
text
User-agent: *Allow: /publicDisallow: /public/private
Здесь /public/private будет запрещён, так как правило Disallow идёт после Allow и переопределяет его для этого подпути.
Правило 3. Учитывается регистр
Disallow: /Admin/ и Disallow: /admin/ — разные пути. Лучше использовать нижний регистр.
Правило 4. Не используйте пробелы в начале строки
Disallow: /admin/ — правильно.
Disallow: /admin/ — может не сработать.
Правило 5. Пустой Disallow означает «всё разрешено»
text
User-agent: *Disallow:
Такой файл разрешает сканирование всего сайта.
Типичные ошибки в robots.txt
Ошибка 1. Закрытие всего сайта
text
User-agent: *Disallow: /
Это полностью запрещает сканирование всего сайта. Часто остаётся после разработки и забывается. Результат — полное выпадение из поиска.
Ошибка 2. Использование robots.txt для защиты конфиденциальных данных
robots.txt публичен. Любой может увидеть, что вы закрыли /admin/, и попытаться зайти туда напрямую. Для защиты используйте пароли и аутентификацию.
Ошибка 3. Блокировка CSS и JS файлов
text
Disallow: /wp-content/
Если закрыть папку с CSS и JS, Googlebot не сможет отрендерить страницу и может понизить её в выдаче.
Ошибка 4. Конфликт правил
text
User-agent: *Disallow: /blog/Allow: /blog/important/
Здесь /blog/important/ будет разрешён, так как правило Allow идёт после Disallow. Если поменять местами — будет запрещён.
Ошибка 5. Неверный синтаксис пути
- Disallow: admin — запретит все URL, начинающиеся с admin, включая /administration/.
- Disallow: /admin/ — запретит только /admin/.
- Disallow: /admin — запретит и /admin, и /administration (нет слеша в конце).
Ошибка 6. Отсутствие sitemap
Многие забывают добавить директиву Sitemap:, лишая робота удобной карты сайта.
Ошибка 7. Использование нестандартных директив без необходимости
Crawl-delay, Clean-param полезны, но только если вы понимаете, зачем они нужны.
Как проверить robots.txt
Инструменты проверки:
| Инструмент | Как использовать |
| Google Search Console | «Настройки» → «Сканирование» → «Проверка файла robots.txt» |
| Яндекс.Вебмастер | «Инструменты» → «Анализ robots.txt» |
| Онлайн-валидаторы | technicalseo.com/tools/robots-txt/ |
| Браузер | Просто откройте https://site.ru/robots.txt |
Проверка конкретного URL:
В Google Search Console есть инструмент «Проверка URL», который показывает, разрешён ли URL для сканирования.
Часть 2. sitemap.xml: карта вашего сайта
Что такое sitemap.xml и зачем он нужен
Определение:
sitemap.xml — это XML-файл, который содержит список всех важных страниц сайта, а также метаданные о них: дату последнего обновления, частоту изменений, приоритет.
Зачем нужен sitemap.xml:
- Ускоряет обнаружение новых страниц. Робот узнаёт о них из sitemap, не дожидаясь, пока найдёт по ссылкам.
- Помогает индексировать глубокие страницы. Страницы, до которых трудно добраться по внутренним ссылкам.
- Сообщает о приоритетах. Вы можете указать, какие страницы важнее.
- Помогает при проблемах с индексацией. Если робот плохо сканирует сайт, sitemap — запасной канал.
Формат sitemap.xml
Базовый формат:
xml
<?xml version=»1.0″ encoding=»UTF-8″?><urlset xmlns=»http://www.sitemaps.org/schemas/sitemap/0.9″> <url> <loc>https://site.ru/</loc> <lastmod>2026-04-22</lastmod> <changefreq>daily</changefreq> <priority>1.0</priority> </url> <url> <loc>https://site.ru/uslugi/registratsiya-ip/</loc> <lastmod>2026-04-15</lastmod> <changefreq>monthly</changefreq> <priority>0.8</priority> </url></urlset>
Обязательные и опциональные теги:
| Тег | Обязательный | Описание |
| <loc> | Да | Полный URL страницы |
| <lastmod> | Нет | Дата последнего изменения (YYYY-MM-DD) |
| <changefreq> | Нет | Частота изменений: always, hourly, daily, weekly, monthly, yearly, never |
| <priority> | Нет | Приоритет от 0.0 до 1.0 (1.0 — максимальный) |
Важно: <priority> и <changefreq> — рекомендации. Google их учитывает, но не гарантирует следование.
Типы sitemap
- Стандартный XML Sitemap
Содержит URL страниц сайта. Самый распространённый тип.
- Image Sitemap
Содержит информацию об изображениях. Помогает в визуальном поиске.
xml
<url> <loc>https://site.ru/product/</loc> <image:image> <image:loc>https://site.ru/images/product.jpg</image:loc> <image:title>Красные кроссовки Nike</image:title> </image:image></url>
- Video Sitemap
Содержит информацию о видео. Помогает в видео-поиске.
- News Sitemap
Для новостных сайтов. Требует аккредитации в Google News.
- Sitemap Index
Для крупных сайтов. Один файл, который ссылается на несколько sitemap.
xml
<?xml version=»1.0″ encoding=»UTF-8″?><sitemapindex xmlns=»http://www.sitemaps.org/schemas/sitemap/0.9″> <sitemap> <loc>https://site.ru/sitemap-products-1.xml</loc> <lastmod>2026-04-22</lastmod> </sitemap> <sitemap> <loc>https://site.ru/sitemap-products-2.xml</loc> <lastmod>2026-04-22</lastmod> </sitemap></sitemapindex>
Ограничения sitemap.xml
| Параметр | Ограничение |
| Максимальный размер файла | 50 МБ (несжатый) |
| Максимальное количество URL | 50 000 |
| Формат даты | YYYY-MM-DD |
| Кодировка | UTF-8 |
Для сайтов с более чем 50 000 URL используйте Sitemap Index.
Лучшие практики для sitemap.xml
- Включайте только индексируемые страницы
Не включайте в sitemap:
- Страницы с noindex.
- Страницы, закрытые в robots.txt.
- Страницы с ошибками (404, 500).
- Канонические дубли.
- Используйте абсолютные URL
https://site.ru/page/, а не /page/.
- Обновляйте sitemap регулярно
- Для часто обновляемых сайтов — автоматическая генерация при каждом изменении.
- Для статичных — раз в месяц.
- Указывайте sitemap в robots.txt
text
Sitemap: https://site.ru/sitemap.xml
- Отправляйте sitemap в инструменты вебмастера
- Google Search Console → «Файлы Sitemap».
- Яндекс.Вебмастер → «Индексирование» → «Файлы Sitemap».
- Разбивайте крупные sitemap
Для сайтов с миллионами страниц используйте Sitemap Index и разбивайте по категориям.
Типичные ошибки в sitemap.xml
Ошибка 1. Несоответствие протокола
В sitemap указаны http:// URL, а сайт работает на https://. Это вызывает редиректы и путаницу.
Ошибка 2. Битые URL
В sitemap включены страницы, которые уже удалены или отдают 404.
Ошибка 3. Включение noindex страниц
Страница говорит «не индексируй меня», а sitemap говорит «проиндексируй». Противоречивый сигнал.
Ошибка 4. Неверный формат даты
Используйте строго YYYY-MM-DD. 22.04.2026 — неверно.
Ошибка 5. Превышение лимитов
Более 50 000 URL или более 50 МБ в одном файле.
Ошибка 6. Неправильное указание приоритета
Все страницы с priority=1.0 — приоритет обесценивается.
Как создать sitemap.xml
Способы создания:
| Способ | Для кого |
| CMS (WordPress, 1С-Битрикс) | Встроенные или плагинные генераторы |
| Онлайн-генераторы | Маленькие сайты (до 500 страниц) |
| Программы-краулеры | Screaming Frog, Netpeak Spider |
| Скрипты | Индивидуальная разработка для крупных сайтов |
WordPress: Плагины Yoast SEO, Rank Math, All in One SEO автоматически создают и обновляют sitemap.
1С-Битрикс: Встроенный модуль «Карта сайта» в настройках SEO.
Screaming Frog: Mode → Spider, после сканирования → Sitemaps → Create XML Sitemap.
Динамический sitemap для крупных сайтов
Для интернет-магазинов с миллионами товаров статический sitemap не подходит.
Решение: динамическая генерация
Сервер генерирует sitemap «на лету» при запросе:
- /sitemap-index.xml — индексный файл.
- /sitemap-products-1.xml — товары 1-50000.
- /sitemap-products-2.xml — товары 50001-100000.
Преимущества:
- Всегда актуально.
- Не нужно хранить огромные файлы.
- Легко масштабируется.
Часть 3. Взаимодействие robots.txt и sitemap.xml
Как они работают вместе:
- Робот заходит на сайт, первым делом читает robots.txt.
- Видит, какие разделы запрещены, какие разрешены.
- Видит ссылку на sitemap.xml.
- Идёт по sitemap и сканирует указанные страницы, если они не запрещены в robots.txt.
Важное правило:
Страница, закрытая в robots.txt, не будет просканирована, даже если она указана в sitemap.xml. Поэтому убедитесь, что важные страницы разрешены.
Заключение
robots.txt и sitemap.xml — это фундамент технического SEO. Небольшие текстовые файлы, которые управляют тем, как поисковые системы видят ваш сайт.
Чек-лист для robots.txt:
- Файл доступен по адресу https://site.ru/robots.txt
- Важные страницы не закрыты
- CSS и JS файлы разрешены для сканирования
- Служебные разделы (/admin/, /cart/) закрыты
- Указана директива Sitemap:
- Нет синтаксических ошибок
- Проверен в Google Search Console и Яндекс.Вебмастер
Чек-лист для sitemap.xml:
- Содержит только индексируемые страницы
- Не превышает 50 000 URL и 50 МБ
- Использует абсолютные HTTPS URL
- Обновляется автоматически или регулярно
- Отправлен в Google Search Console и Яндекс.Вебмастер
- Указан в robots.txt
- Не содержит битых URL и редиректов
Следуя этим правилам, вы обеспечите поисковым роботам идеальные условия для сканирования и индексации вашего сайта.