Буквальные описания товаров перевешивают промо-тексты в...
24
Буквальные описания товаров перевешивают промо-тексты в мультимодальном поиске Google — алгоритм матчит текст с картинкой
AI-поиск все чаще ранжирует товар, сравнивая смысл его изображения со смыслом его текста внутри единого общего пространства эмбеддингов.
Мультимодальная модель эмбеддингов Google помещает их в одно векторное пространство и оценивает, насколько близко они лежат — чем ближе две точки, тем сильнее совпадение при извлечении.
Когда тайтлы, альты и описания отклоняются от того, что фактически показывает фото, эта оценка согласованности падает, а согласованность — это сигнал для извлечения.
Конкретика бьет креатив.
Буквальные, визуальные формулировки, называющие ровно то, что находится в кадре — "Emerald green athletic shoe with three white stripes, white heel tab, mesh panels, and a brown gum sole" — набрали намного более высокий балл, чем любая абстракция или промо.
Списки ключей через запятую сработали хуже, чем простые предложения.
Маркетинговые прилагательные, которые картинка не может подтвердить, тянут оценку вниз, а не поднимают ее.
Данные тестов прямолинейны.
Стартовая подпись "Green shoe" набрала 47%.
Указание резиновой подошвы, полосок, сетки и язычка на пятке в простом предложении подняло результат до 94%, а затем до 100%, как только описание жестко совпало с фото.
Каждый прирост происходил от добавления конкретного визуального атрибута, фактически присутствующего на изображении, а не от более богатого продающего текста.
Один товар на ровном фоне, описанный с высокой точностью, выдал самую сильную зафиксированную согласованность — идеальный кейс продуктового снимка для eCommerce, с которым модель справляется лучше всего.
Сильные совпадения выходят на плато, но резкое фото плюс буквальная подпись пробили верхнюю границу шкалы.
Тайтлы товаров, альты, подписи к картинкам и атрибуты фидов — это теперь текстовая половина мультимодального сравнения, которое AI-поиск прогоняет по вашим изображениям, а не просто поля для совпадения по ключам для людей.
Текст, описывающий то, что реально находится в кадре, извлекается лучше, чем текст, который пытается использовать прилагательные, не поддерживаемые самим изображением.
https://dejan.ai/blog/ecommerce-optimization-engine/
@MikeBlazerX
⚠️ Закрытый канал: @MikeBlazerPRO
Ссылки из поста:– https://hooks.pro/media/2026/07/26/bot5207751351/v...
– https://t.me/MikeBlazerX
– https://t.me/tribute/app?startapp=sE4X
Источник новости https://t.me/mikeblazerx/6591...

