SEOFAQ Telegram, маркетинг и SEO Канал SEOFAQT в мессенджере Telegram

Все чатыКогда кто-то набирает в поиске "neeva", как мы узнаем...

 1351  


Когда кто-то набирает в поиске "neeva", как мы узнаем, что он имеет в виду "neeva.com", а не "neevaneevaneeva.com"? Ведь во втором случае "neeva" в 3 раза больше!

Поисковик Neeva рассказал, как можно добиться гораздо большего, чем обычный TF-IDF для текстовой релевантности!

1) Текстовая релевантность - это только одна часть ранжирования документов (наряду с такими сигналами, как центральность, качество страницы и клик рейт).

Но это одна из самых важных частей, и именно ее мы рассмотрим в сегодняшней теме.

2) Наиболее популярным способом ранжирования документов относительно запросов является использование векторного отображения TF-IDF.

По сути, это означает, что чем чаще термин встречается на странице (TF) и чем реже он встречается на других страницах (IDF), тем больше вероятность того, что этот термин релевантен странице.

3) Например, слово "is" часто встречается на большинстве страниц, поэтому, несмотря на то, что TF высок, IDF низок, что дает ему низкий общий балл. Слово "koala" встречается относительно редко, поэтому если оно встречается несколько раз в документе, то, скорее всего, является важной частью документа.

4) Оценка документа по отношению к запросу может быть просто точечным произведением двух векторов (документа и запроса). Это поднимает важный вопрос - нормализовать или нет?

5) Нормализация векторов помогает более коротким документам - хотя документ "Neeva neeva neeva neeva" будет иметь более высокую частоту терминов, чем документ "neeva", продвигать его будет неправильно, потому что он также в три раза длиннее.

6) Однако можно возразить, что в более длинных документах чаще обсуждается несколько тем, поэтому нормализация векторов несправедливо наказывает их.

Чтобы справедливо сбалансировать эти крайности, мы используем идеи из статьи "Нормализация длины сводного документа (DLN)".

7) Мы настраиваем опорную точку нормализации длины таким образом, чтобы «вероятность поиска документов заданной длины была очень близка к вероятности обнаружения соответствующего документа такой длины».

8) Это помогает предотвратить "несправедливое" наказание длинных документов, показывая при этом релевантные короткие документы.

Однако это не решает проблему, как показать neeva.com вместо neevaneevaneeva.com - даже после нормализации длины они оба одинаково релевантны.

9) Один из столпов алгоритмов ранжирования веб-поиска гласит: "То, что вы думаете о себе, гораздо менее важно, чем то, что о вас думают другие".

В Интернете легко лгать, но трудно убедить в своей лжи множество других сайтов (и людей).

10) Чтобы применить эту логику, ограничьте вклад содержимого самой страницы (например, title, url, body) в итоговый результат, сплющив их с помощью сигмоиды.

Вместо этого, больший вклад дает анкорный текст - текст на "других" веб-страницах, которые ссылаются на вашу страницу.

11) Например, на страницу "neeva.com" ссылается множество страниц с текстом типа "смотрите домашнюю страницу neeva здесь:". В то же время, на "neevaneevaneeva.com" никто не ссылается.

12) Далее мы по-разному оцениваем анкоры в зависимости от того, пришли ли они из авторитетного (например, с высоким pagerank) или менее авторитетного источника.

13) Наиболее важной частью скоринга, которой невозможно манипулировать, являются данные о кликах. Для каждого клика по URL мы связываем поисковые запросы с этим URL.

Вклад этих условий клика снижается (сглаживается) до гораздо более высокого значения.

14) Проще говоря: A: используйте поворотный DLN для справедливой оценки документов любой длины, и B: применяйте сглаживание на основе важности каждого раздела.

15) Как уже упоминалось, текстовая релевантность - это лишь один из многих факторов, которые влияют на решение о том, какие результаты отображать по поисковому запросу.

@MikeBlazerX

Ссылки из поста:
– https://twitter.com/Neeva/status/15343051210305126...
– https://ecommons.cornell.edu/bitstream/handle/1813...
– https://t.me/MikeBlazerX

Источник новости https://t.me/mikeblazerx/249...