SEOFAQ Telegram, маркетинг и SEO Канал SEOFAQT в мессенджере Telegram

Все чаты​Инсайты из антимонопольного суда: Google не использует...

 208  


​Инсайты из антимонопольного суда: Google не использует косинусное сходство для определения семантической близости между запросами и документами!👇

Для определения семантической близости можно использовать различные методы измерения расстояния между векторами в семантическом пространстве.

Вот самые популярные из них:

1. Косинусное сходство (Cosine Similarity): Самый распространенный метод для определения семантической близости.

Измеряет косинус угла между двумя векторами.

2. Евклидово расстояние (Euclidean Distance): Измеряет прямое (геометрическое) расстояние между двумя векторами.

3. Скалярное произведение (Dot Product / Inner Product): Часто используется в нейросетях и механизмах внимания.

Измеряет одновременно и направление, и величину (магнитуду) векторов.

Rankembed — это система Google, которая определяет семантическое соответствие между запросами и документами для коротких запросов.

Многие сеошники используют косинусное сходство между поисковыми запросами и документами в качестве аналитического подхода.

Согласно информации из антимонопольного суда, для этого юзкейса Google использует dot.product, а не косинусное сходство.

Поэтому, похоже, что ориентироваться на косинусное сходство при работе с короткими запросами — не лучший подход.

-

BERT использует косинусное сходство.

И BERT применяется в системах ранжирования и для определения сходства.

Но если вы хотите ранжировать результаты не только по семантическому сходству, но и по степени уверенности, силе сигнала или силе совпадения.

Тогда лучше подходит скалярное произведение.

Если же вам нужно чистое семантическое сходство, независимо от того, насколько "длинный" или "сильный" документ.

Тогда лучше подходит косинусное сходство.

@MikeBlazerX

Ссылки из поста:
https://www.linkedin.com/feed/update/urn:li:activi...
https://t.me/MikeBlazerX

Источник новости https://t.me/mikeblazerx/5210...