SEOFAQ Telegram, маркетинг и SEO Канал SEOFAQT в мессенджере Telegram

Все чатыНовое определение спама для поиска на базе генеративного ИИ

 252  


Новое определение спама для поиска на базе генеративного ИИ

В поиске на базе GenAI "спам" — это контент, считающийся недостойным для извлечения.

В отличие от традиционного поиска с явными санкциями, системы GenAI фильтруют контент молча, без предупреждений.

Контент может ранжироваться в обычном поиске, но оставаться невидимым для ИИ, если ему не хватает семантической ценности для извлечения.

Как работает извлечение данных в GenAI

Поисковые системы на базе GenAI (Perplexity, You.com) используют технологию RAG:

1. Контент разбивается на "чанки" (фрагменты).

2. Чанки преобразуются в числовые "эмбеддинги", представляющие их смысл.

3. Система извлекает чанки с эмбеддингами, наиболее близкими к запросу.

4. ИИ генерирует ответ из извлеченных чанков.

Контент, не извлеченный на третьем шаге, фактически не существует для данного запроса.

Эта фильтрация по принципу полезности и есть новое определение спама.

Характеристики контента, фильтруемого GenAI

Системы оценивают контент на возможность извлечения, основываясь на интенте пользователя, а не на намерениях создателя.

Фильтрации подвергается контент со следующими характеристиками:

— Семантический мусор: Расплывчатый, перегруженный контент с длинными вступлениями не соответствует конкретным векторам запросов и игнорируется.

— Коллизии эмбеддингов: Контент, семантически слишком похожий на существующие материалы, особенно с более авторитетных доменов, отфильтровывается как почти полный дубль. Это затрагивает статьи, сгенерированные LLM с незначительными правками.

— Слабая атрибуция: Контент без структурированных данных (микроразметка Person/Organization), четких сигналов об авторе-сущности или заслуживающих доверия цитат имеет меньше шансов быть извлеченным.

— Вредоносный контент: Злоумышленники манипулируют извлечением, внедряя промпты в контент, как показано в статье на EMNLP 2024. Это растущая угроза; в отчете Barracuda Networks отмечается, что более 50% почтового спама генерируется ИИ с использованием схожих тактик семантической мимикрии.

Как оптимизировать контент для видимости в GenAI

1. Создавайте контент, удобный для разбивки на чанки

Оптимизируйте самодостаточные разделы для изолированного извлечения.

— Используйте четкие заголовки и структурированную разметку.

— Включайте конкретный контекст (названия продуктов, местоположения, бренды).

— Избегайте раздутых вступлений; переходите сразу к сути.

2. Разрабатывайте уникальную подачу

Предлагайте новые идеи, а не пересказ существующей информации.

— Делитесь оригинальными инсайтами и конкретными примерами, релевантными для вашей сферы.

— Придерживайтесь четкой точки зрения, как в экспертном анализе в RedMonk Conversation от 12 августа 2024 года.

3. Мониторьте выдачу GenAI

Активно проверяйте эффективность контента в таких инструментах, как Perplexity, You.com и Brave Search.

— Проверяйте цитаты, перефразирование и пропуски информации, касающейся вашего бренда и тем.

— Следите за резким ростом конкурентов, который может указывать на манипуляции.

4. Встраивайте брендовый контекст в чанки

Предоставляйте конкретную, насыщенную сущностями информацию.

— Вместо: "Мы предоставляем логистические решения".

— Пишите: "AcmeLogix — американский поставщик решений для автоматизации логистики, который помогает средним транспортным компаниям сокращать расходы на складирование с помощью программного обеспечения для предиктивной маршрутизации".

Видимость в поиске теперь зависит от полезности, определяемой машиной.

Если отдельный чанк контента не обладает самостоятельной ясностью и достоверностью, он не будет извлечен.

https://duaneforresterdecodes.substack.com/p/redefining-spam-from-spam-teams-to

@MikeBlazerX

Ссылки из поста:
https://t.me/MikeBlazerX

Источник новости https://t.me/mikeblazerx/5439...