Что такое краулинговый бюджет и как его не потратить впустую
У поискового робота Googlebot есть одна неприятная особенность: он не может сканировать ваш сайт бесконечно. Каждый день, в зависимости от авторитетности и размера сайта, Google выделяет ему определённый лимит на количество просматриваемых страниц. Это и есть краулинговый бюджет.
Если ваш сайт расходует этот бюджет на дубли, мусорные страницы с фильтрами или бесконечные календари — действительно важные страницы могут остаться непросканированными неделями или даже месяцами. Новые товары не попадают в индекс, обновлённые статьи не ранжируются.
В этой статье мы разберём, как устроен краулинговый бюджет, какие ошибки его съедают и как настроить сайт так, чтобы робот тратил драгоценное время только на ценные страницы.
Что такое краулинговый бюджет и из чего он состоит
Краулинговый бюджет (crawl budget) — это количество URL на вашем сайте, которые Googlebot готов просканировать за определённый промежуток времени (обычно сутки).
Google определяет краулинговый бюджет для каждого сайта индивидуально на основе двух ключевых параметров:
- Crawl Rate Limit (ограничение частоты сканирования)
Это техническое ограничение, которое Google устанавливает, чтобы не перегрузить ваш сервер. Если сервер отвечает быстро и стабильно, лимит повышается. Если робот видит много ошибок 5xx или медленные ответы — лимит снижается.
- Crawl Demand (спрос на сканирование)
Google сканирует чаще те страницы, которые считает важными и популярными. Факторы, повышающие Crawl Demand:
- Высокий авторитет сайта (PageRank / Domain Authority).
- Частота обновления контента.
- Количество и качество внешних ссылок.
- Популярность страниц (трафик, запросы пользователей).
Важно: Для небольших сайтов (до 10 000 страниц) краулинговый бюджет редко является проблемой — Googlebot успевает обойти всё. Но для средних и крупных проектов, особенно интернет-магазинов и агрегаторов, управление краулинговым бюджетом становится критически важным.
Как узнать свой краулинговый бюджет
В Google Search Console есть специальный отчёт, показывающий статистику сканирования.
Путь: Google Search Console → «Настройки» → «Статистика сканирования».
Что смотреть:
- Всего запросов на сканирование. Сколько страниц в день сканирует Googlebot.
- Время ответа. Если оно растёт — Google может снизить частоту.
- Размер загруженных данных. Косвенно показывает, сканирует ли робот тяжёлые страницы.
Важно: Сам по себе график не покажет, на что тратится бюджет. Для этого нужен анализ логов сервера.
Главные пожиратели краулингового бюджета
3.1. Дубли страниц
Одна и та же страница доступна по разным URL:
- http:// и https://
- c параметрами сортировки:?sort=price&order=asc`
- с UTM-метками:?utm_source=newsletter`
Робот тратит бюджет на сканирование копий, не получая нового контента.
Решение: Канонические URL (rel=»canonical»), настройка параметров в GSC, 301-редиректы.
3.2. Бесконечные пространства (Infinite Spaces)
Автоматически генерируемые страницы, которые создают «бесконечные» URL:
- Календари на сайтах бронирования (бесконечные даты).
- Фильтры товаров, создающие миллионы комбинаций (?color=red&size=42&brand=nike…).
- Внутренний поиск с бесконечным количеством вариантов запросов.
Решение: Закрыть такие разделы в robots.txt или управлять параметрами в Google Search Console.
3.3. Страницы с noindex, но доступные для сканирования
Робот тратит время на сканирование страницы, видит meta name=»robots» content=»noindex» и уходит ни с чем. Бюджет потрачен, а пользы ноль.
Решение: Если страница не нужна ни для индексации, ни для навигации робота — закройте её в robots.txt.
3.4. Страницы пагинации (глубокие)
Googlebot может уйти в бесконечное сканирование страниц пагинации (?page=100), в то время как новые товары на 5-й странице ждут своей очереди.
Решение: Правильная настройка пагинации, rel=»prev/next», создание View All страницы.
3.5. Медленная загрузка страниц
Если сервер отвечает медленно (более 500 мс), Googlebot снижает Crawl Rate Limit, чтобы не создавать нагрузку. Медленный сайт = меньший бюджет.
3.6. Ошибки сервера (5xx)
Каждая ошибка 500 — это сигнал для Googlebot: «Сервер не справляется, нужно сканировать реже». Регулярные 5xx ошибки могут сократить бюджет в несколько раз.
3.7. Битые ссылки (404)
Робот переходит по внутренней ссылке, попадает на 404, уходит. Бюджет потрачен впустую.
Стратегия «Экономия краулингового бюджета»
Шаг 1. Проведите аудит
Используйте краулер вроде Screaming Frog или Sitebulb, чтобы найти:
- Все дубли страниц.
- URL с параметрами.
- Битые ссылки.
- Страницы с noindex.
- Глубокие страницы пагинации.
Шаг 2. Настройте robots.txt
Закройте от сканирования разделы, которые не должны индексироваться и не нужны для перелинковки:
text
User-agent: GooglebotDisallow: /search/Disallow: /cart/Disallow: /wishlist/Disallow: /*?*
Шаг 3. Используйте канонические URL
Для страниц с параметрами укажите каноникал на чистый URL без параметров:
html
<link rel=»canonical» href=»https://site.ru/catalog/»>
Шаг 4. Настройте параметры URL в Google Search Console
В GSC (устаревший раздел «Параметры URL») можно указать, какие параметры не меняют содержимое страницы. Google будет игнорировать их при сканировании.
Шаг 5. Оптимизируйте пагинацию
- Используйте View All страницу как каноническую.
- Настройте rel=»prev» и rel=»next».
- Для очень глубоких страниц пагинации (>50) добавьте noindex.
Шаг 6. Ускорьте сайт
- Время ответа сервера < 200 мс.
- Используйте кэширование и CDN.
- Оптимизируйте изображения.
- Включите сжатие Gzip/Brotli.
Шаг 7. Устраните ошибки 5xx и 404
Регулярно проверяйте Google Search Console → «Покрытие» на наличие ошибок сервера. Оперативно их исправляйте.
Особенности для крупных интернет-магазинов
Для магазинов с сотнями тысяч товаров краулинговый бюджет — критический ресурс.
Стратегия приоритизации:
- Категории и подкатегории — должны сканироваться часто.
- Хиты продаж и новинки — должны индексироваться в первую очередь.
- Старые и непопулярные товары — можно сканировать реже.
Технические решения:
- Динамический sitemap с приоритизацией (<priority>).
- Логи сервера — анализируйте, какие страницы Googlebot сканирует чаще всего.
- Управление через внутреннюю перелинковку — самые важные товары должны быть в 1-2 кликах от главной.
Краулинговый бюджет для Яндекса
Яндекс использует схожую концепцию, но с особенностями:
- ИКС влияет на бюджет. Чем выше ИКС, тем больше страниц Яндекс готов сканировать.
- Региональность. Для сайтов с чёткой региональной привязкой бюджет может быть выше в соответствующем регионе.
- Турбо-страницы. Использование Турбо-страниц увеличивает скорость и частоту сканирования.
- Чистые URL. Яндекс особенно негативно относится к мусорным параметрам.
Как не потратить бюджет впустую: чек-лист
Технический минимум:
- Robots.txt закрывает служебные разделы и параметры.
- Канонические URL настроены на всех страницах.
- Пагинация оптимизирована (самоканоникал + prev/next).
- Время ответа сервера < 200 мс.
- Нет ошибок 5xx и массовых 404.
Продвинутый уровень:
- Настроены параметры URL в GSC.
- Проведён анализ логов сервера.
- Внутренняя перелинковка приоритизирует важные страницы.
- Динамический sitemap с приоритетами.
- Для крупных сайтов внедрён Indexing API.
Типичные мифы о краулинговом бюджете
Миф 1: «Краулинговый бюджет не важен для маленьких сайтов»
Реальность: Если у вас 5000 страниц и они не индексируются неделями — бюджет важен независимо от размера.
Миф 2: «Можно попросить Google увеличить бюджет»
Реальность: Нельзя просто отправить запрос. Можно улучшить факторы, влияющие на бюджет (скорость, авторитет, качество).
Миф 3: «Чем больше страниц в sitemap, тем лучше»
Реальность: Включайте только ценные страницы. Мусор в sitemap вводит робота в заблуждение и тратит бюджет.
Миф 4: «Robots.txt с Disallow: / увеличит бюджет для других страниц»
Реальность: Если страница нужна для перелинковки, не закрывайте её полностью. Используйте noindex в мета-тегах.
Заключение
Краулинговый бюджет — это ограниченный ресурс, который требует осознанного управления. Особенно это критично для крупных сайтов, где неэффективное использование бюджета может привести к тому, что ценные страницы месяцами не попадают в индекс.
Главное правило: Googlebot должен тратить время на сканирование ваших лучших страниц, а не блуждать по техническим закоулкам сайта. Регулярный аудит, настройка robots.txt и каноникалов, ускорение сайта — это инвестиции, которые окупаются быстрой индексацией и ростом трафика.