Здравствуйте! Делюсь материалом, который мне и моим коллегам очень помогает в работе.


Показаны сообщения с ярлыком алгоритмы яндекса. Показать все сообщения
Показаны сообщения с ярлыком алгоритмы яндекса. Показать все сообщения

вторник

Яндекс YATI: о новом алгоритме ранжирования простыми словами

На конференции YaC 2020 Яндекс представил свой новый алгоритм – YATI. Аббревиатура расшифровывается, как Yet Another Transformer with Improvements, что в переводе на русский означает «Ещё один трансформер с улучшениями».

робот трансформе

Яндекс презентует данное нововведение, как «самое значимое изменение поиска за последние 10 лет». В нашей статье мы разберём, что из себя представляет новый алгоритм, какова его задача в поиске и как он повлияет alt="р" на ранжирование сайтов в Яндекс.

Алгоритм Yati : что нового и для чего трансформер?

YATI призван анализировать тексты поисковых запросов и сайтов, которые по этим запросам показываются, причём должен делать это эффективнее своих предшественников – Палеха и Королёва. Подробнее окунуться в историю алгоритмов Яндекса вы можете в нашей статьее .

В данной статье мы лишь кратко пройдёмся по ним, чтобы понимать, что изменилось с появлением трансформера.

Сначала был Палехх

Палех был создан для сравнения текстов поисковых запросов пользователей и заголовков страниц, обучение происходило на положительных и отрицательных примерах, которые брались из ранее накопленной статистики.

Так как алгоритмы поисковых систем не умеют читать тексты, то определение соответствия запросов и заголовков происходило путём сравнения чисел.

обработка запроса нейросетью яндекса

Как происходило определение соответствия? Если объяснять простыми словами: каждой странице соответствовала группа из 2-х чисел, где каждое число означало определённую координату на одной из 2-х осей, а каждая страница соответствовала точке на координатной плоскости.

Точно так же происходил перевод поискового запроса – он размещался в том же пространстве координат вместе со страницей и чем ближе они были расположены друг к другу, тем больше страница соответствовала запросу.

Именно такой способ обработки запросов и страниц назвали семантическим вектором. Плюсом данного способа являлось то, что он мог установить соответствие запроса странице, даже если у них не было ни одного общего слова.

Данный алгоритм был относительно тяжёлым, поэтому применялся только на самых поздних стадиях ранжирования, примерно к 150 лучшим страницам из отфильтрованного множества.

А затем пришёл Королёв

Он работал по той же архитектуре, что и Палех, однако с его появлением семантический вектор страниц начал вычисляться заранее, в офлайне, что позволило применять алгоритм к большему количеству страниц.

Работает это так:

  • алгоритм в офлайн-режиме вычисляет вектор страниц и сохраняет в индексную базу,

  • пользователь вводит запрос в поиске,

  • алгоритм переводит запрос в вектор,

  • перемножает с уже готовыми векторами страниц, вычисляя релевантность.

Если бы вектора страниц не вычислялись заранее, то не было бы возможности применять нейронные сети к большему количеству страниц без ущерба времени выдачи результатов по запросу пользователя.

Помимо сравнения векторов запроса и страниц, Королёв начал сравнивать вектора только что введенных запросов с другими запросами, для которых заранее был известен лучший ответ. Если вектора оказывались достаточно близкими, то и результаты выдачи должны были быть похожими.

Зачем тогда понадобились трансформеры?

Предыдущие алгоритмы несмотря на то, что улучшили процесс ранжирования, всё же справлялись с этим неидеально. К основным недочётам можно отнести:

  • отсутствие полного учёта порядка слов,

  • весь смысл страницы описывался одним вектором с ограниченным размером.

В трансформере же каждый элемент текста переводится в отдельный вектор с сохранением положения в тексте.

алгоритм yandex yati 2020

Обучается данный трансформер по принципу transfer learning, то есть сначала решается одна задача, в рамках которой накапливается информация, позволяющая алгоритму решить эту конкретную задачу, после чего эта же информация используется повторно, но уже для решения других задач. Первоначально трансформеру «скармливают» множество простой и не всегда достоверной информации, полученной от пользователей Яндекс.Толоки, на этой информации он предобучается. После этого этапа трансформер получает уже более экспертную информацию, но в меньших объёмах – от специально обученных асессоров Яндекса.

Одним из дополнительных отличий трансформера стало предсказывание клика пользователя – это дополнительная метрика, которая будет учитываться при ранжировании.

обучение алгоритма yati

YATI и его влияние на поисковое продвижение

Исходя из того, что данный алгоритм направлен на более глубокий анализ текста, понимание его сути, можно сделать резонный вывод, что смысловая нагрузка текстового контента будет иметь более весомую роль в ранжировании. А значит, экспертные тексты, дающие полный и качественный ответ на запрос пользователя, будут всё больше и чаще показываться в топах выдачи.

Кстати, именно такие тексты мы уже давно начали внедрять на проектах наших клиентов и не раз писали о том, как улучшить контент на своём сайте. Про полезный контент рекомендую прочитать эту статью .

YATI и BERT: в чём разница?

Ещё в прошлом году Google анонсировал подключение к алгоритмам ранжирования своего трансформера – BERT. Данная нейронная сеть решает задачу анализа поисковых запросов и их контекста, а не отдельный анализ ключевых запросов. То есть BERT анализирует предложение целиком. Подробнее об этом с наглядными примерами уже рассказывали здесь .

Исходя из описаний YATI и BERT становится очевидно, что и тот, и другой – трансформеры, и направлены на лучшее понимание смысла запроса пользователей. Однако YATI в данном случае смотрится выигрышнее, так как помимо анализа текста запросов пользователей, он анализирует ещё и тексты документов, учится предсказывать клики. Поэтому можно сделать вывод, что YATI более весомое обновление, нежели BERT.

обучение yati на клик

Как подготовить сайт к ранжированию по YATI?

Означает ли появление Яндекс YATI, что старые методы оптимизации больше не будут работать?

Нет, ни в коем случае появление данного алгоритма не означает, что, например, та же оптимизация заголовков H и тегов title и description не играет роли. Необходимо понимать, что новый алгоритм Яндекс не отменяет факторы ранжирования, которые были выведены ранее, YATI лишь дополняет их более качественным анализом текстов.

А это означает, что техническую оптимизацию, привлечение естественных ссылок и улучшение поведенческих факторов (на поиске и на сайте) забрасывать нельзя. Как и раньше, эффективные результаты принесёт лишь работа над сайтом в комплексе.

Общие рекомендации по улучшению текстов:

  • Структурировать текст заголовками с использованием ключей.

  • Проработать title и description для улучшения CTR сниппета.

  • Использовать LSI-фразы. Подробнее про LSI-копирайтинг»

  • Собирать максимально полную семантику для страниц.

Заключение

Подводя итоги разбора, новый алгоритм YATI однозначно приведёт к изменениям в поисковой выдаче Яндекса, однако так как система обучающаяся, то на это всё равно уйдёт время, поэтому даже если на вашем сайте используются SEO-тексты, ещё есть время доработать их под современные стандарты поисковых систем.

Андрей Тимашев Digital-стратег Сервиса 1PS.RU

воскресенье

Алгоритм Яндекс Палех VS Google RankBrain

Сегодня речь пойдет о двух поисковых алгоритмах разных поисковых систем, но направленных на одну цель (главную цель всех поисковых систем) – понять, что именно ищет человек, задав тот или иной поисковый запрос, и предоставить релевантный исчерпывающий ответ, который удовлетворит потребности ищущего.

Представьте ситуацию – вы что-то ищете, но не знаете как точно это называется и вбиваете в поисковую строку всё, что хоть как-то может описать объект поиска.

Чаще всего в этом случае вводятся longtale-запросы (или «длиннохвостые», низкочастотные запросы, состоящие из более 3-4 слов):

Раньше поисковики выводили в результатах ответы, в которых было больше всего вхождений из запроса пользователя.

Но часто случалось, что такие результаты совсем не отвечали на запрос пользователя:

Поисковикам нужно было как-то научиться понимать, что конкретно ищет человек, вбивая ту или иную фразу в поиск, самую суть запроса. Помочь в этом поисковым системам может искусственный интеллект, или как его еще называют – машинный интеллект.

Google RankBrain

Для начала оглянемся назад в 2013 год и обратим своё внимание на блог компании Google, а именно, на новость от 14 августа: https://opensource.googleblog.com/2013/08/learning-meaning-behind-words.html

Новость с загадочным заголовком Learning the meaning behind words – «Понять смысл слов».

В двух словах: данная статья рассказывает о прогрессе в области машинного обучения и технологиях распознавания речи.

Приводится интересный эксперимент recognize cats (and many other objects) по распознаванию кошек и других объектов. Эксперимент закончился успехом – просмотрев более миллиона случайных скриншотов из YouTube алгоритм с использованием нейронных сетей смог распознать и построить лица людей и морды кошки. При том, что первоначальных параметров о том, как выглядят объекты, алгоритм не имел:

Но нас больше интересует вторая часть данной статьи, в которой рассказывается про технологию машинного обучения и обработку текстовой информации Word2Vec.

Данная технология занимается поиском связей между словами. Word2vec разбирает текст таким образом, чтобы найти сходства между понятиями.

Например, он понимает, что Париж и Франция связаны так же, как Берлин и Германия (столица и страна). На диаграмме ниже показано, насколько хорошо данная технология может разобрать города по странам, просто прочитав множество новостных статей – без участия человека.

У многих сейчас возникает вопрос, каким образом это все относится к RankBrain?

Дело в том, что RankBrain – это название системы искусственного интеллекта, созданной на базе алгоритмов машинного обучения. Своим действием RankBrain очень похож на Word2Vec.

RankBrain помогает обрабатывать результаты поиска. Смысл работы алгоритма следующий: так же, как Word2Vec, RankBrain ищет связи понятий, которые поисковый робот может распознать. Когда алгоритм встречает незнакомые для себя слова или фразы, он начинает искать и разбирать подсказки.

Таким образом, он пытается осознать, какие синонимы имеются по данному запросу. Найденные аналогии и ложатся в основу при фильтрации результатов.

Затем алгоритм сопоставляет поведенческие факторы пользователей по предложенным им результатам. И сортирует результаты, убирая неподходящие.

Возможно, это покажется непонятным и замысловатым, но чуть ниже покажем на конкретных примерах, и все встанет на свои места. А пока пару слов скажем о Яндексе.

Яндекс «Палех»

2 ноября 2016 компания Яндекс анонсировала свой новый алгоритм «Палех»:

Более подробно об Алгоритме «Палех» можете прочитать в нашей статье или в блоге Яндекса. Суть работы нового алгоритма очень схожа с RankBrain.


Чтобы не уходить в дебри теории, рассмотрим на примерах работу данных алгоритмов и оценим, кто из поисковых систем ответит лучше на наши запросы. Итак, раунд первый. Вбиваем запрос: «Кто является самым высоким млекопитающим». Видим следующие результаты выдачи:

  1. Google
  1. В выдаче видим общую информацию о крупных млекопитающих, в первом источнике видно, что это Жираф.

  2. Яндекс

    Яндекс только на 4-м месте предоставляет верный интересующий нас ответ и то только по прямому вхождению.

Безусловно, в самом источнике, который Яндекс показывает на первом месте в результате выдачи, говорится о том, что это Жираф, но в сниппете информация об этом не отражена. Плюсуем Гуглу.

Раунд второй. Запрос: «Вид спорта при котором штанга поднимается с груди спортсмена».

  1. Google
  1. На первом месте четкий ответ – тяжелая атлетика. Браво! Смотрим, что в Яндексе:

  2. Яндекс

    Выдача очень похожа. Ставим «плюс» как Яндексу, так и Google. Ответ на запрос есть на 1-м месте результатов выдачи.

Раунд третий. Усложним игру. Возьмем запрос «Жена Трампа»:

  1. Google
  1. Яндекс

Что Яндекс, что Google дали нам ответ. В выдаче Яндекса у нас отработал колдунщик, а в Гугле – быстрые ответы. Но в выдаче Гугла видим, что в сниппете на первом месте у нас выделено именно то, что мы ищем.

Теперь немного изменим запрос – следом поищем: «жена Дональда Трампа».

  1. Google
  1. Ответ был расширен, теперь мы знаем что у Американского президента было 3 жены. Чем парирует Яндекс?

  2. Яндекс

    А в Яндексе все без особых изменений. В третьем раунде получаем вновь превосходство Гугла.

Поможем Яндексу, проведем 4-й раунд, возьмем запрос, который сам Яндекс анонсировал при запуске Палеха: «Фильм про человека который выращивал картошку на другой планете». Что на этот запрос ответит Гугл?

  1. Google
  1. Ответ четкий и однозначный – Марсианин. Что насчет Яндекса?

  2. Яндекс

    Как мы видим, выдача Яндекса в данном случае «забита» новостями об алгоритме, хотя информация о фильме и представлена в блоке справа.

Раунд 5. Последний запрос возьмем коммерческий. Прикинемся блондинкой, вобьем запрос: «купить инструмент для проделывания дырок в бетоне небольшого размера»:) Итак, что скажет Гугл?

  1. Google
  1. Google на первом месте показывает статью о видах инструментов для сверления отверстий в бетоне, в общем-то – неплохо. Хотя ответ не совсем релевантен: мы всё-таки хотели купить, а не почитать о нём.

  2. Яндекс

    А в Яндексе почему-то релевантнее оказалась статья про дыроколы для кожи... Полный разгром и победа за google.

Выводы:

Хотя в нашей битве алгоритм Палех и проигрывает RankBrain, но не стоит забывать, что эти алгоритмы являются самообучающимися, а алгоритм Яндекса по времени был запущен намного позже алгоритма Google.

Возможно, в скором времени ситуация изменится.

Что с SEO?

Также хочется отметить, что запуск данных алгоритмов открывает новые реалии в области SEO. Во-первых, RankBrain является третьим по важности сигналом ранжирования.

Во-вторых, Палех и RankBrain наконец-то дают возможность владельцам сайтов писать тексты именно для людей, а не для поисковых машин, и быть в ТОПе.

Рекомендации для вебмастеров от Gary Illyes, о том как оптимизировать свой сайт под RankBrain, можно озвучить следующим образом:

«Если вы писали тексты для людей, используя язык, который вы обычно используйте при общении, то будьте уверены – ваш ресурс уже оптимизирован под RankBrain».

О том, что надо писать для людей и создавать сайты именно для них, поисковые системы говорят уже более 15 лет. Надеемся, что скоро это станет повсеместной реальностью.

Автор Дмитрий Кудинов - Руководитель отдела Технического SEO