SEOFAQ Telegram, маркетинг и SEO Канал SEOFAQT в мессенджере Telegram

Все чатыОптимизация под эмбеддинги — по своей сути противоречивая идея

 69  


Оптимизация под эмбеддинги — по своей сути противоречивая идея.

Итак, во-первых, давайте вспомним, что такое эмбеддинги.

AI-провайдеры прокраулили весь интернет + все, что нашли на левых файлообменниках, а затем смоделировали, какие слова обычно встречаются вместе.

Когда мы говорим о "косинусном сходстве эмбеддингов", на самом деле, по-простому, мы имеем в виду, какие слова статистически чаще всего встречаются рядом друг с другом в их наборе данных.

Таким образом, "улучшая" ваше "сходство", вы воспроизводите самые распространенные из возможных пар.

В математическом смысле вы пытаетесь создать максимально вторичный, донельзя усредненный контент.

Что является... интересным?... подходом к маркетинговому копирайтингу, особенно если вы утверждаете, что возможности ИИ лежат в плоскости брендового маркетинга.

Это же полная противоположность тому, что значит создавать бренд?

В случае с веб-поиском вы также работаете вразрез со всеми алгоритмами, которые пытаются отфильтровать усредненный, вторичный контент — подозреваю, используя те же самые расстояния между эмбеддингами, чтобы определить, где тексты просто повторяют одно и то же снова и снова.

Вы используете те же механизмы, которые Google применяет для отсеивания такого контента, и тем самым сами лезете под его прицел!

Хотя, надо признать, в этом есть определенная ценность.

В RAG-системах или внутреннем поиске для улучшения полноты ответа (recall) распространенный подход — создавать две версии каждой страницы: одну с пресным, усредненным контентом без какой-либо индивидуальности, по которой можно прогонять запрос, и другую, видимую пользователю, с долей настоящей индивидуальности.

Если речь идет о внутренних системах, рекомендательных движках и т.д., это вполне рабочий подход!

Но для веб-поиска сейчас это не особо применимо — воспроизведение такого метода будет означать прямой клоакинг.

Может, это и сработает, если ограничить юзер-агентов для OpenAI, Anthropic и им подобных, но даже в этом случае это ничего не даст для всех запросов, которые обрабатываются через веб-поиск.

Короче говоря, не стоит относиться к косинусному сходству контента как к некоему "скору", который должен быть "хорошим".

Это ценный инструмент с массой интересных применений, но в некоторых уголках SEO-тусовки почему-то вбили себе в голову, что это некий показатель, под который нужно оптимизироваться.

И если ваша цель — не создание самого математически пресного дерьма за всю историю человечества, то это не тот случай.

@MikeBlazerX

Ссылки из поста:
https://www.linkedin.com/feed/update/urn:li:activi...
https://t.me/MikeBlazerX

Источник новости https://t.me/mikeblazerx/5373...