SEOFAQ Telegram, маркетинг и SEO Канал SEOFAQT в мессенджере Telegram

Все чаты​Патент Google Visual Citations раскрывает механику: совпадение...

 3  


​Патент Google Visual Citations раскрывает механику: совпадение по картинке перевешивает текст при выборе источника

Патент, поданный в 2023 году и опубликованный в апреле 2026-го, описывает флоу генерации ответа.

Алгоритм сначала выбирает источник по совпадению картинки, а уже потом подтягивает окружающий текст для формирования ответа.

Это лишь заявка, а не подтвержденная механика в проде.

Google регистрирует их тысячами, и многие никогда не выходят в прод в описанном виде.

Если рассматривать это как вектор развития, а не как факт, патент переворачивает все правила, на которых строилось image SEO.

Картинка решает, какая страница попадет в ответ, а текст рядом с этой картинкой решает, что именно скажет ответ.

Операционное следствие — это плейсмент.

Факт, нужный покупателю, должен висеть прямо под картинкой в виде подписи или тега, а не в трех скроллах ниже по странице.

Распознавание не гарантировано.

На одном из рекламных кадров Cartier модель компьютерного зрения выдала браслет и часы, но в упор не заметила кольцо.

То, что креативная команда пыталась донести, и то, что фиксирует алгоритм — это разные сущности.

И только вторая попадает в движок ответов.

Текст на картинке отваливается при измеримых условиях.

Пороги отказа, вытянутые из литературы Cognex и arXiv, а не из спецификаций Google, показывают: OCR ломается при высоте символов ниже ~30px, контрасте менее ~40 оттенков серого, на стилизованных шрифтах и бликах от отражающей упаковки.

Сжатие, заточенное исключительно под скорость загрузки, вычищает текст с упаковки, который модель должна была спарсить.

Большую часть слоя измерений берет на себя Google Cloud Vision API:

— Web Detection отдает fullMatchingImages, partialMatchingImages, visuallySimilarImages и pagesWithMatchingImages. Это проверка на уникальность: реально ли hero image принадлежит вам, или это около-дубль, который юзает половина ниши.

— OBJECT_LOCALIZATION возвращает названия найденных объектов, mid-идентификаторы, скоринг уверенности алгоритма (confidence) и координаты (bounding boxes). Это дает список объектов-соседей в кадре, чтобы контролировать совместную встречаемость по бренд-гайдлайнам. Сам по себе API контекст не оценивает.

— TEXT_DETECTION прогоняет OCR-слой, отвечающий за метрику читаемости.

— FACE_DETECTION отдает faceAnnotations и классификаторы эмоций от UNKNOWN до VERY_UNLIKELY, UNLIKELY, POSSIBLE, LIKELY и VERY_LIKELY (где VERY_LIKELY — это таргет). Отсечка по confidence: 0.90 и выше — железобетонно, 0.70-0.89 — сойдет для второстепенных кадров, все, что ниже 0.60 — это мусор.

— Масштабирование проверки идет через Screaming Frog плюс OpenAI Vision API и остается качественным. Связка флагит запросы, которые страница уже могла бы забрать, если бы ее текст подтверждал то, что нарисовано на фото.

За этими цифрами стоят два вопроса.

Первый: правильно ли машина прочитала то, что в кадре?

И второй: правильный ли объект туда вообще засунули на старте?

Первое — это слой денотации, который можно чекнуть на уровне объектов.

Второе — слой коннотации: проблема брифинга, которую не закроет ни один API.

https://searchengineland.com/images-new-job-ai-search-485840

@MikeBlazerX

📈 "Пушки" — в @MikeBlazerPRO

Ссылки из поста:
https://t.me/MikeBlazerX
https://t.me/tribute/app?startapp=sE4X

Источник новости https://t.me/mikeblazerx/6703...