В мире SEO есть два небольших текстовых файла, которые оказывают колоссальное влияние на то, как поисковые системы видят и индексируют ваш сайт. Это robots.txt и sitemap.xml. Первый говорит роботам: «Сюда не ходи, это служебное». Второй показывает: «Вот самое важное, обязательно посмотри».

Несмотря на кажущуюся простоту, ошибки в этих файлах — одни из самых частых и критичных в SEO. Одна неверная строчка в robots.txt может полностью закрыть сайт от индексации. Забытый sitemap.xml — затянуть попадание новых страниц в поиск на недели.

В этой статье мы детально разберём оба файла: их синтаксис, лучшие практики настройки, типичные ошибки и способы проверки. Это полное руководство, которое должно быть в закладках у каждого SEO-специалиста.

robots.txt: страж вашего сайта

Что такое robots.txt и зачем он нужен

Определение:

robots.txt — это текстовый файл в корне сайта, который содержит инструкции для поисковых роботов о том, какие разделы сайта можно сканировать, а какие — нет.

Где находится robots.txt:

Файл должен быть доступен по адресу:
https://site.ru/robots.txt

Поисковые роботы автоматически запрашивают этот файл перед началом сканирования сайта.

Важно понимать:

  • robots.txt управляет сканированием (crawling), а не индексацией. Страница, закрытая в robots.txt, не будет просканирована, но может попасть в индекс, если на неё ссылаются другие сайты.
  • Robots.txt — это рекомендация, а не приказ. Добросовестные поисковики (Google, Яндекс) соблюдают правила. Вредоносные боты — игнорируют.
  • Robots.txt публичен. Любой может посмотреть его, введя site.ru/robots.txt. Не храните там секретную информацию.

Синтаксис robots.txt

Основные директивы:

Директива Назначение Пример
User-agent Указывает, к какому роботу применяются правила User-agent: Googlebot или User-agent: * (все роботы)
Disallow Запрещает сканирование указанного пути Disallow: /admin/
Allow Разрешает сканирование подпути, даже если родительский путь запрещён Allow: /admin/login.php
Sitemap Указывает путь к файлу sitemap.xml Sitemap: https://site.ru/sitemap.xml
Crawl-delay Задержка между запросами в секундах (поддерживается Яндексом, Bing; Google игнорирует) Crawl-delay: 5
Host Указывает главное зеркало сайта (исторически для Яндекса, сейчас не требуется) Host: site.ru
Clean-param Указывает параметры URL, которые можно игнорировать (только Яндекс) Clean-param: utm_source /

Пример базового robots.txt:

text

User-agent: *Disallow: /admin/Disallow: /personal/Disallow: /cart/Disallow: /search/Disallow: /*?*Allow: /search/advanced/User-agent: Googlebot-ImageAllow: /images/Allow: /uploads/User-agent: YandexCrawl-delay: 3Sitemap: https://site.ru/sitemap.xml

Разбор примера:

  • Все роботы (*) не должны сканировать /admin/, /personal/, /cart/, /search/ и любые URL с параметрами (/*?*).
  • Для /search/ сделано исключение: /search/advanced/ разрешён.
  • Googlebot-Image разрешено сканировать папки с изображениями.
  • Для Яндекса установлена задержка 3 секунды между запросами.
  • Указан путь к sitemap.xml.

Правила написания robots.txt

Правило 1. Один User-agent — один блок правил

text

User-agent: GooglebotDisallow: /private/User-agent: YandexDisallow: /secret/

Правило 2. Правила применяются по порядку сверху вниз

Google и Яндекс читают файл сверху вниз и применяют первое подходящее правило.

text

User-agent: *Allow: /publicDisallow: /public/private

Здесь /public/private будет запрещён, так как правило Disallow идёт после Allow и переопределяет его для этого подпути.

Правило 3. Учитывается регистр

Disallow: /Admin/ и Disallow: /admin/ — разные пути. Лучше использовать нижний регистр.

Правило 4. Не используйте пробелы в начале строки

Disallow: /admin/ — правильно.
Disallow: /admin/ — может не сработать.

Правило 5. Пустой Disallow означает «всё разрешено»

text

User-agent: *Disallow:

Такой файл разрешает сканирование всего сайта.

Типичные ошибки в robots.txt

Ошибка 1. Закрытие всего сайта

text

User-agent: *Disallow: /

Это полностью запрещает сканирование всего сайта. Часто остаётся после разработки и забывается. Результат — полное выпадение из поиска.

Ошибка 2. Использование robots.txt для защиты конфиденциальных данных

robots.txt публичен. Любой может увидеть, что вы закрыли /admin/, и попытаться зайти туда напрямую. Для защиты используйте пароли и аутентификацию.

Ошибка 3. Блокировка CSS и JS файлов

text

Disallow: /wp-content/

Если закрыть папку с CSS и JS, Googlebot не сможет отрендерить страницу и может понизить её в выдаче.

Ошибка 4. Конфликт правил

text

User-agent: *Disallow: /blog/Allow: /blog/important/

Здесь /blog/important/ будет разрешён, так как правило Allow идёт после Disallow. Если поменять местами — будет запрещён.

Ошибка 5. Неверный синтаксис пути

  • Disallow: admin — запретит все URL, начинающиеся с admin, включая /administration/.
  • Disallow: /admin/ — запретит только /admin/.
  • Disallow: /admin — запретит и /admin, и /administration (нет слеша в конце).

Ошибка 6. Отсутствие sitemap

Многие забывают добавить директиву Sitemap:, лишая робота удобной карты сайта.

Ошибка 7. Использование нестандартных директив без необходимости

Crawl-delay, Clean-param полезны, но только если вы понимаете, зачем они нужны.

Как проверить robots.txt

Инструменты проверки:

Инструмент Как использовать
Google Search Console «Настройки» → «Сканирование» → «Проверка файла robots.txt»
Яндекс.Вебмастер «Инструменты» → «Анализ robots.txt»
Онлайн-валидаторы technicalseo.com/tools/robots-txt/
Браузер Просто откройте https://site.ru/robots.txt

Проверка конкретного URL:

В Google Search Console есть инструмент «Проверка URL», который показывает, разрешён ли URL для сканирования.

Часть 2. sitemap.xml: карта вашего сайта

Что такое sitemap.xml и зачем он нужен

Определение:

sitemap.xml — это XML-файл, который содержит список всех важных страниц сайта, а также метаданные о них: дату последнего обновления, частоту изменений, приоритет.

Зачем нужен sitemap.xml:

  1. Ускоряет обнаружение новых страниц. Робот узнаёт о них из sitemap, не дожидаясь, пока найдёт по ссылкам.
  2. Помогает индексировать глубокие страницы. Страницы, до которых трудно добраться по внутренним ссылкам.
  3. Сообщает о приоритетах. Вы можете указать, какие страницы важнее.
  4. Помогает при проблемах с индексацией. Если робот плохо сканирует сайт, sitemap — запасной канал.

Формат sitemap.xml

Базовый формат:

xml

<?xml version=»1.0″ encoding=»UTF-8″?><urlset xmlns=»http://www.sitemaps.org/schemas/sitemap/0.9″>  <url>    <loc>https://site.ru/</loc>    <lastmod>2026-04-22</lastmod>    <changefreq>daily</changefreq>    <priority>1.0</priority>  </url>  <url>    <loc>https://site.ru/uslugi/registratsiya-ip/</loc>    <lastmod>2026-04-15</lastmod>    <changefreq>monthly</changefreq>    <priority>0.8</priority>  </url></urlset>

Обязательные и опциональные теги:

Тег Обязательный Описание
<loc> Да Полный URL страницы
<lastmod> Нет Дата последнего изменения (YYYY-MM-DD)
<changefreq> Нет Частота изменений: always, hourly, daily, weekly, monthly, yearly, never
<priority> Нет Приоритет от 0.0 до 1.0 (1.0 — максимальный)

Важно: <priority> и <changefreq> — рекомендации. Google их учитывает, но не гарантирует следование.

Типы sitemap

  1. Стандартный XML Sitemap

Содержит URL страниц сайта. Самый распространённый тип.

  1. Image Sitemap

Содержит информацию об изображениях. Помогает в визуальном поиске.

xml

<url>  <loc>https://site.ru/product/</loc>  <image:image>    <image:loc>https://site.ru/images/product.jpg</image:loc>    <image:title>Красные кроссовки Nike</image:title>  </image:image></url>

  1. Video Sitemap

Содержит информацию о видео. Помогает в видео-поиске.

  1. News Sitemap

Для новостных сайтов. Требует аккредитации в Google News.

  1. Sitemap Index

Для крупных сайтов. Один файл, который ссылается на несколько sitemap.

xml

<?xml version=»1.0″ encoding=»UTF-8″?><sitemapindex xmlns=»http://www.sitemaps.org/schemas/sitemap/0.9″>  <sitemap>    <loc>https://site.ru/sitemap-products-1.xml</loc>    <lastmod>2026-04-22</lastmod>  </sitemap>  <sitemap>    <loc>https://site.ru/sitemap-products-2.xml</loc>    <lastmod>2026-04-22</lastmod>  </sitemap></sitemapindex>

Ограничения sitemap.xml

Параметр Ограничение
Максимальный размер файла 50 МБ (несжатый)
Максимальное количество URL 50 000
Формат даты YYYY-MM-DD
Кодировка UTF-8

Для сайтов с более чем 50 000 URL используйте Sitemap Index.

Лучшие практики для sitemap.xml

  1. Включайте только индексируемые страницы

Не включайте в sitemap:

  • Страницы с noindex.
  • Страницы, закрытые в robots.txt.
  • Страницы с ошибками (404, 500).
  • Канонические дубли.
  1. Используйте абсолютные URL

https://site.ru/page/, а не /page/.

  1. Обновляйте sitemap регулярно
  • Для часто обновляемых сайтов — автоматическая генерация при каждом изменении.
  • Для статичных — раз в месяц.
  1. Указывайте sitemap в robots.txt

text

Sitemap: https://site.ru/sitemap.xml

  1. Отправляйте sitemap в инструменты вебмастера
  • Google Search Console → «Файлы Sitemap».
  • Яндекс.Вебмастер → «Индексирование» → «Файлы Sitemap».
  1. Разбивайте крупные sitemap

Для сайтов с миллионами страниц используйте Sitemap Index и разбивайте по категориям.

Типичные ошибки в sitemap.xml

Ошибка 1. Несоответствие протокола

В sitemap указаны http:// URL, а сайт работает на https://. Это вызывает редиректы и путаницу.

Ошибка 2. Битые URL

В sitemap включены страницы, которые уже удалены или отдают 404.

Ошибка 3. Включение noindex страниц

Страница говорит «не индексируй меня», а sitemap говорит «проиндексируй». Противоречивый сигнал.

Ошибка 4. Неверный формат даты

Используйте строго YYYY-MM-DD. 22.04.2026 — неверно.

Ошибка 5. Превышение лимитов

Более 50 000 URL или более 50 МБ в одном файле.

Ошибка 6. Неправильное указание приоритета

Все страницы с priority=1.0 — приоритет обесценивается.

Как создать sitemap.xml

Способы создания:

Способ Для кого
CMS (WordPress, 1С-Битрикс) Встроенные или плагинные генераторы
Онлайн-генераторы Маленькие сайты (до 500 страниц)
Программы-краулеры Screaming Frog, Netpeak Spider
Скрипты Индивидуальная разработка для крупных сайтов

WordPress: Плагины Yoast SEO, Rank Math, All in One SEO автоматически создают и обновляют sitemap.

1С-Битрикс: Встроенный модуль «Карта сайта» в настройках SEO.

Screaming Frog: Mode → Spider, после сканирования → Sitemaps → Create XML Sitemap.

Динамический sitemap для крупных сайтов

Для интернет-магазинов с миллионами товаров статический sitemap не подходит.

Решение: динамическая генерация

Сервер генерирует sitemap «на лету» при запросе:

  • /sitemap-index.xml — индексный файл.
  • /sitemap-products-1.xml — товары 1-50000.
  • /sitemap-products-2.xml — товары 50001-100000.

Преимущества:

  • Всегда актуально.
  • Не нужно хранить огромные файлы.
  • Легко масштабируется.

Часть 3. Взаимодействие robots.txt и sitemap.xml

Как они работают вместе:

  1. Робот заходит на сайт, первым делом читает robots.txt.
  2. Видит, какие разделы запрещены, какие разрешены.
  3. Видит ссылку на sitemap.xml.
  4. Идёт по sitemap и сканирует указанные страницы, если они не запрещены в robots.txt.

Важное правило:

Страница, закрытая в robots.txt, не будет просканирована, даже если она указана в sitemap.xml. Поэтому убедитесь, что важные страницы разрешены.

Заключение

robots.txt и sitemap.xml — это фундамент технического SEO. Небольшие текстовые файлы, которые управляют тем, как поисковые системы видят ваш сайт.

Чек-лист для robots.txt:

  • Файл доступен по адресу https://site.ru/robots.txt
  • Важные страницы не закрыты
  • CSS и JS файлы разрешены для сканирования
  • Служебные разделы (/admin/, /cart/) закрыты
  • Указана директива Sitemap:
  • Нет синтаксических ошибок
  • Проверен в Google Search Console и Яндекс.Вебмастер

Чек-лист для sitemap.xml:

  • Содержит только индексируемые страницы
  • Не превышает 50 000 URL и 50 МБ
  • Использует абсолютные HTTPS URL
  • Обновляется автоматически или регулярно
  • Отправлен в Google Search Console и Яндекс.Вебмастер
  • Указан в robots.txt
  • Не содержит битых URL и редиректов

Следуя этим правилам, вы обеспечите поисковым роботам идеальные условия для сканирования и индексации вашего сайта.