Как поисковики понимают естественный язык: NLP и BERT
«Зацени новые кроссы Найк Эир Макс, которые как у того парня из клипа». Десять лет назад поисковик, услышав такой запрос, впал бы в ступор. Он искал бы страницы, содержащие слова «зацени», «кроссы», «Найк», «Эир», «Макс», «парень», «клип» — и, скорее всего, не нашёл бы ничего полезного.
Сегодня Google и Яндекс не просто ищут слова. Они понимают запрос. Они знают, что «кроссы» — это кроссовки, «Найк Эир Макс» — конкретная модель, «как у того парня из клипа» — отсылка к визуальному образу. И они могут найти релевантный товар, даже если точных слов из запроса на странице нет.
Это стало возможным благодаря технологиям NLP (Natural Language Processing) и нейросетям на архитектуре трансформеров, таким как BERT и YATI. В этой статье мы разберём, как поисковики научились понимать человеческий язык и что это значит для современного SEO.
Как поиск работал до NLP: эра ключевых слов
Чтобы оценить масштаб революции, нужно понять, как всё работало раньше.
Поиск по ключевым словам (1998-2015):
Алгоритмы того времени воспринимали запрос как мешок слов (bag of words). Порядок слов не имел значения, связи между ними игнорировались. Запрос «как ухаживать за котом» и «кот ухаживает за как» для алгоритма были почти одинаковы.
Проблемы ключевого подхода:
- Омонимия. «Ключ» — это инструмент, родник или код? Алгоритм не понимал контекст.
- Синонимия. «Автомобиль», «машина», «авто», «тачка» — для алгоритма это разные слова.
- Порядок слов. «Москва-Питер поезд» и «Питер-Москва поезд» — разные направления.
- Длинные запросы. Чем длиннее запрос, тем меньше шансов найти точное совпадение слов.
- Разговорные формулировки. Запросы вроде «где тут рядом вкусно и недорого поесть» были обречены.
SEO-специалисты адаптировались: вставляли в тексты точные ключевые слова, использовали все возможные синонимы отдельно, создавали отдельные страницы под каждую формулировку.
Что такое NLP и как оно изменило поиск
NLP (Natural Language Processing) — обработка естественного языка — это область искусственного интеллекта, которая учит компьютеры понимать человеческий язык.
Ключевые задачи NLP в поиске:
| Задача | Что делает | Пример |
| Токенизация | Разбивает текст на значимые единицы (токены) | «Я люблю SEO» → [Я, люблю, SEO] |
| Лемматизация | Приводит слова к начальной форме | «кроссами» → «кроссовка» |
| Морфологический анализ | Определяет части речи, падежи, числа | «красивому» → прилагательное, дательный падеж |
| Синтаксический анализ | Строит дерево зависимостей между словами | «Маша ест кашу» → подлежащее (Маша), сказуемое (ест), дополнение (кашу) |
| Семантический анализ | Извлекает смысл, определяет сущности и отношения | «купить билет в Сочи» → действие: покупка, объект: билет, место: Сочи |
| Анализ тональности | Определяет эмоциональную окраску | «Ужасный сервис!!!» → негатив |
| Распознавание именованных сущностей (NER) | Выделяет имена, организации, даты, места | «Путин встретился с Си Цзиньпином 15 мая в Пекине» → персоны, дата, город |
Как NLP изменило поиск:
- Понимание синонимов. «Машина» и «автомобиль» теперь воспринимаются как одно понятие.
- Учёт морфологии. «Купить кроссовки» и «покупка кроссовок» — разные формулировки одного интента.
- Анализ контекста. Слова больше не рассматриваются изолированно.
- Понимание длинных запросов. Алгоритмы могут обработать развёрнутый вопрос.
- Распознавание сущностей. Поисковик знает, что «Найк» — это бренд, а «Эир Макс» — модель кроссовок.
Революция трансформеров: BERT и его влияние
В 2017 году исследователи Google опубликовали статью «Attention Is All You Need», в которой представили архитектуру трансформер (Transformer). Это стало поворотным моментом в истории NLP.
Что такое трансформер:
Трансформер — это нейросетевая архитектура, которая обрабатывает текст параллельно, а не последовательно, и использует механизм внимания (attention) для выявления связей между словами.
Ключевое отличие от предыдущих моделей:
- RNN/LSTM (старые модели). Читают текст слева направо, как человек. Контекст левой части влияет на правую, но не наоборот.
- Трансформер. Анализирует все слова одновременно, учитывая связи каждого слова со всеми остальными в обоих направлениях.
BERT (Bidirectional Encoder Representations from Transformers):
В 2019 году Google внедрил BERT в поиск. BERT — это модель на архитектуре трансформер, обученная на колоссальных объёмах текста.
Что BERT изменил в поиске:
- Понимание предлогов и частиц. Раньше поисковик мог игнорировать предлоги. BERT понимает, что «билет из Москвы в Сочи» и «билет из Сочи в Москву» — это разные запросы.
- Учёт порядка слов. «Можно ли взять кредит без справки о доходах» и «можно ли взять справку о доходах без кредита» — совершенно разные интенты.
- Контекстное значение слов. BERT понимает, что «ключ» в запросе «как сделать ключ от домофона» и в запросе «ключ к успеху» — разные понятия.
- Длинные и сложные запросы. BERT отлично справляется с развёрнутыми вопросами, которые раньше ставили поисковик в тупик.
Пример работы BERT:
Запрос: «можно ли парковаться на тротуаре если нет знака»
До BERT: поисковик искал страницы со словами «парковаться», «тротуар», «знак». Результат мог быть противоречивым.
После BERT: модель понимает, что пользователь спрашивает о законности парковки на тротуаре при отсутствии запрещающего знака, и ищет страницы, которые отвечают именно на этот юридический вопрос.
YATI: российский ответ BERT
Яндекс не остался в стороне от революции трансформеров. В 2020 году компания представила YATI (Yet Another Transformer Implementation) — собственную нейросеть для понимания естественного языка.
Особенности YATI:
- Обучена на русскоязычном корпусе. YATI лучше понимает специфику русского языка: падежи, склонения, синонимию.
- Учёт морфологии. В русском языке одно слово может иметь десятки форм. YATI отлично с этим справляется.
- Интеграция с другими сервисами Яндекса. Данные из Почты, Такси, Карт помогают лучше понимать контекст.
- Акцент на коммерческие запросы. YATI особенно силён в понимании запросов, связанных с покупками и услугами.
Влияние YATI на SEO в Рунете:
- Длинные, разговорные запросы стали ранжироваться лучше.
- Точные вхождения ключевых слов стали менее важны.
- Качество контента (глубина раскрытия темы, экспертность) вышло на первый план.
- Структура текста (заголовки, списки, FAQ) помогает YATI понять логику.
MUM: следующий шаг после BERT
В 2021 году Google анонсировал MUM (Multitask Unified Model) — мультимодальную модель, которая в 1000 раз мощнее BERT.
Что умеет MUM:
- Понимает текст, изображения, видео, аудио. Может ответить на вопрос, проанализировав информацию из разных форматов.
- Работает с 75 языками одновременно. Может найти ответ на японском форуме и представить его на русском.
- Отвечает на сложные, составные вопросы. «Я прошёл Эверест, хочу теперь пройти Килиманджаро. Что мне нужно знать для подготовки, учитывая мой опыт?»
- Анализирует множество источников. MUM может «прочитать» десятки статей и синтезировать единый ответ.
Влияние MUM на SEO:
- Экспертность контента. MUM сравнивает информацию из разных источников. Неглубокие, поверхностные статьи проигрывают экспертным.
- Мультимедийность. Изображения и видео становятся полноценными источниками информации.
- Кросс-языковая конкуренция. Ваш сайт может конкурировать с англоязычными ресурсами, если они содержат более качественную информацию.
- Генеративные ответы. MUM может сам синтезировать ответ, не отправляя пользователя на сайт.
Как NLP и трансформеры изменили SEO
Понимание того, как работают NLP и нейросети, меняет подход к оптимизации.
Что больше не работает (или работает хуже):
- Переспам ключевых слов. Нейросети легко распознают искусственные тексты.
- Погоня за точными вхождениями. Можно ранжироваться по запросу, даже если точных слов в тексте нет.
- Поверхностные статьи. BERT и YATI оценивают глубину раскрытия темы.
- Копирование контента конкурентов. Нейросети ищут оригинальность и экспертность.
Что работает сейчас:
- Семантическое ядро вместо ключевых слов. Группируйте запросы по смыслу, создавайте страницы под тематические кластеры.
- Глубокий, экспертный контент. Одна подробная статья лучше десяти поверхностных.
- Естественный язык. Пишите для людей, а не для роботов. Используйте синонимы, разнообразные формулировки.
- Структурирование контента. Заголовки H2-H3, списки, таблицы, FAQ-блоки помогают нейросетям понять логику текста.
- Ответы на вопросы. BERT и YATI особенно хорошо работают с вопросительными запросами.
- Микроразметка. Schema.org помогает поисковикам точно понять, что за информация на странице.
- E-E-A-T сигналы. Указывайте авторов, источники, даты публикации. Нейросети оценивают экспертность.
Практические приёмы оптимизации под NLP
Приём 1. Используйте вопросительные заголовки
Структурируйте статью вокруг вопросов, которые задают пользователи.
html
<h2>Как зарегистрировать ИП самостоятельно?</h2><p>Пошаговая инструкция…</p><h2>Какие документы нужны для регистрации ИП?</h2><ul> <li>Паспорт</li> <li>ИНН</li> <li>Заявление Р21001</li></ul><h2>Сколько стоит открыть ИП в 2026 году?</h2><p>Госпошлина составляет 800 рублей…</p>
Приём 2. Добавляйте определения и пояснения
Нейросети ценят чёткие определения ключевых понятий.
html
<p><strong>ИП (индивидуальный предприниматель)</strong> — это физическое лицо, зарегистрированное в установленном законом порядке и осуществляющее предпринимательскую деятельность без образования юридического лица.</p>
Приём 3. Используйте синонимы и связанные понятия
Не зацикливайтесь на одном ключевом слове. Используйте весь семантический спектр.
Вместо 10 раз «регистрация ИП»:
- «открыть ИП»
- «оформить предпринимателя»
- «зарегистрироваться как ИП»
- «получить статус индивидуального предпринимателя»
Приём 4. Создавайте контент, который отвечает на смежные вопросы
Пользователь, интересующийся регистрацией ИП, вероятно, также хочет знать:
- Как выбрать систему налогообложения?
- Нужен ли расчётный счёт?
- Какие отчёты сдавать?
Осветите эти вопросы в одной статье — и нейросеть оценит полноту ответа.
Приём 5. Используйте списки и таблицы
Структурированная информация легче воспринимается и нейросетями, и людьми.
Будущее NLP в поиске
- Генеративный поиск. Вместо списка ссылок — уникальный ответ, сгенерированный AI на основе множества источников.
- Понимание эмоций и тональности. Поисковик будет учитывать настроение запроса и подбирать соответствующий тон ответа.
- Диалоговый поиск. Пользователь сможет уточнять запрос в диалоге, и поисковик будет помнить контекст.
- Персонализация на основе языкового профиля. Поисковик будет адаптировать выдачу под языковые предпочтения пользователя.
- Мультиязычный поиск без границ. Запрос на русском — ответ из англоязычных источников в переводе.
Заключение
NLP и нейросети-трансформеры совершили революцию в поиске, сопоставимую с появлением PageRank. Поисковики перестали быть просто «счётчиками ключевых слов» и превратились в системы, понимающие смысл.
Для SEO-специалиста это означает, что старые, манипулятивные подходы больше не работают. Побеждает тот, кто создаёт действительно полезный, глубокий, экспертный контент, отвечающий на реальные вопросы людей. В каком-то смысле NLP сделало SEO честнее — теперь хороший контент действительно побеждает.