Новое определение спама для поиска на базе генеративного ИИ
252
Новое определение спама для поиска на базе генеративного ИИ
В поиске на базе GenAI "спам" — это контент, считающийся недостойным для извлечения.
В отличие от традиционного поиска с явными санкциями, системы GenAI фильтруют контент молча, без предупреждений.
Контент может ранжироваться в обычном поиске, но оставаться невидимым для ИИ, если ему не хватает семантической ценности для извлечения.
Как работает извлечение данных в GenAI
Поисковые системы на базе GenAI (Perplexity, You.com) используют технологию RAG:
1. Контент разбивается на "чанки" (фрагменты).
2. Чанки преобразуются в числовые "эмбеддинги", представляющие их смысл.
3. Система извлекает чанки с эмбеддингами, наиболее близкими к запросу.
4. ИИ генерирует ответ из извлеченных чанков.
Контент, не извлеченный на третьем шаге, фактически не существует для данного запроса.
Эта фильтрация по принципу полезности и есть новое определение спама.
Характеристики контента, фильтруемого GenAI
Системы оценивают контент на возможность извлечения, основываясь на интенте пользователя, а не на намерениях создателя.
Фильтрации подвергается контент со следующими характеристиками:
— Семантический мусор: Расплывчатый, перегруженный контент с длинными вступлениями не соответствует конкретным векторам запросов и игнорируется.
— Коллизии эмбеддингов: Контент, семантически слишком похожий на существующие материалы, особенно с более авторитетных доменов, отфильтровывается как почти полный дубль. Это затрагивает статьи, сгенерированные LLM с незначительными правками.
— Слабая атрибуция: Контент без структурированных данных (микроразметка Person/Organization), четких сигналов об авторе-сущности или заслуживающих доверия цитат имеет меньше шансов быть извлеченным.
— Вредоносный контент: Злоумышленники манипулируют извлечением, внедряя промпты в контент, как показано в статье на EMNLP 2024. Это растущая угроза; в отчете Barracuda Networks отмечается, что более 50% почтового спама генерируется ИИ с использованием схожих тактик семантической мимикрии.
Как оптимизировать контент для видимости в GenAI
1. Создавайте контент, удобный для разбивки на чанки
Оптимизируйте самодостаточные разделы для изолированного извлечения.
— Используйте четкие заголовки и структурированную разметку.
— Включайте конкретный контекст (названия продуктов, местоположения, бренды).
— Избегайте раздутых вступлений; переходите сразу к сути.
2. Разрабатывайте уникальную подачу
Предлагайте новые идеи, а не пересказ существующей информации.
— Делитесь оригинальными инсайтами и конкретными примерами, релевантными для вашей сферы.
— Придерживайтесь четкой точки зрения, как в экспертном анализе в RedMonk Conversation от 12 августа 2024 года.
3. Мониторьте выдачу GenAI
Активно проверяйте эффективность контента в таких инструментах, как Perplexity, You.com и Brave Search.
— Проверяйте цитаты, перефразирование и пропуски информации, касающейся вашего бренда и тем.
— Следите за резким ростом конкурентов, который может указывать на манипуляции.
4. Встраивайте брендовый контекст в чанки
Предоставляйте конкретную, насыщенную сущностями информацию.
— Вместо: "Мы предоставляем логистические решения".
— Пишите: "AcmeLogix — американский поставщик решений для автоматизации логистики, который помогает средним транспортным компаниям сокращать расходы на складирование с помощью программного обеспечения для предиктивной маршрутизации".
Видимость в поиске теперь зависит от полезности, определяемой машиной.
Если отдельный чанк контента не обладает самостоятельной ясностью и достоверностью, он не будет извлечен.
https://duaneforresterdecodes.substack.com/p/redefining-spam-from-spam-teams-to
@MikeBlazerX
Ссылки из поста:– https://t.me/MikeBlazerX
Источник новости https://t.me/mikeblazerx/5439...

