SEOFAQ Telegram, маркетинг и SEO Канал SEOFAQT в мессенджере Telegram

Все чатыЭксперимент boatbuilder показал, что LLM, такие как ChatGPT и...

 192  


Эксперимент boatbuilder показал, что LLM, такие как ChatGPT и Perplexity, используют глобальный кэш, а это означает, что цитирование в ответе ИИ не гарантирует обращения к вашему серверу.

Это делает невозможным использование логов сервера как надежного способа измерения видимости в LLM.

Эксперимент, проведенный с использованием мидлвэра Next.js на Vercel для обхода пограничного кэширования (edge caching), показал, что LLM не всегда используют свой брендированный юзер-агент и иногда маскируются под обычные браузеры.

Глобальный кэш обновляется часто — в тесте наблюдался интервал около 20 минут — но не по фиксированному графику.

Наблюдаемая схема получения информации такова: Индекс → Проверка кэша → Если отсутствует, загрузить один раз → Отдавать из кэша до истечения срока его действия.

Мнения сеошников

— Несколько пользователей подтверждают, что LLM, такие как ChatGPT, Perplexity и Claude, будут отдавать устаревший контент страницы в течение нескольких часов или даже целого дня после обновления, что подтверждает гипотезу о кэшировании.

Один пользователь не смог принудительно обновить информацию, даже прямо указав модели, что ее данные устарели.

— Видимость структурированных данных зависит от метода доступа LLM.

Когда агент использует поисковый инструмент (например, web.search), он получает от поисковой системы предварительно проиндексированные JSON-LD, микроданные и RDFa.

Однако при использовании инструментов прямого доступа к странице (например, open_page, browse) JSON-LD в основном невидим, и доступными остаются только встроенные микроданные.

— Критическая ошибка реализации — это ссылка на внешние файлы JSON-LD через <link rel="alternate" ...>.

Это делает структурированные данные невидимыми для LLM, выполняющих прямые краулинговые обходы страницы в реальном времени, так как агент не перейдет по ссылке.

— Разные модели Gemini демонстрируют различное поведение при извлечении данных.

Приложение Gemini запрашивает контент страницы в реальном времени и появляется в логах.

Gemini через API заявляет, что не может получить доступ к страницам.

AI Mode (в поиске) может галлюцинировать доступ к странице, фактически не обходя ее.

— Для сайтов, использующих Cloudflare, один пользователь реализовал Cloudflare Worker, который добавляет заголовок Vary по юзер-агенту, чтобы успешно сбрасывать кэш специально для трафика от ИИ.

Отмечается, что даже при промахе кэша CDN, собственный кэширующий слой веб-сервера (например, от плагинов WordPress или платформ вроде Webflow) все еще может отдавать устаревший контент ботам ИИ.

— Стратегический фреймворк для понимания краулеров ИИ делит их на три типа по намерению:

1 Краулеры для обучающих датасетов: Контент используется для будущих релизов моделей.

Оптимизация под Schema/JSON-LD в основном влияет на этот тип, а выгоды реализуются только после обновления модели.

2 Краулеры для RAG / обоснования поиска: Контент извлекается из проиндексированной базы данных (часто это традиционная поисковая система, как Bing для ChatGPT) для мгновенных ответов.

Эффективность можно предсказать, анализируя ранжирование по подзапросам в базовой поисковой системе.

3 Агентные краулеры по запросу пользователя: Контент обходится в реальном времени для конкретного запроса пользователя.

— Стратегический ответ на повсеместное кэширование LLM — это смещение фокуса с отслеживания паттернов обхода на создание контента, который является единственным, исчерпывающим источником, наиболее вероятно кэшируемым и отдаваемым по релевантным запросам.

@MikeBlazerX

Ссылки из поста:
https://www.reddit.com/r/SEO_for_AI/comments/1n1ga...
https://t.me/MikeBlazerX

Источник новости https://t.me/mikeblazerx/5647...