SEOFAQ Telegram, маркетинг и SEO Канал SEOFAQT в мессенджере Telegram

Все чатыСтатистика сканирования в GSC раскрывает запросы Googlebot...

 25  


Статистика сканирования в GSC раскрывает запросы Googlebot, которые CDN поглощает до основного сервера

Выгрузка логов основного сервера за 40 дней для крупного e-commerce домена содержала 45 765 событий с юзер-агентом Googlebot — и 40 157 из них были запросами к /.env, /.ssh/id_ecdsa_sk.priv, /keystore.jks и подобным.

То есть около 88% оказались сканерами, подделывающими UA.

В сухом остатке — порядка 5 600 правдоподобно реальных обращений Googlebot за 30 дней.

Остальная часть выгрузки выглядела не лучше: 76 377 из 76 381 событий www отдавали 3xx на 80 порту без единого 200 — это отскок с HTTP на HTTPS, а не краулинг.

А набор intl_bots, охватывающий примерно две трети данных, вообще не содержал статус-кодов.

Согласно Джону Мюллеру: бери для работы меньшую подвыборку (поддомен, если есть), затем сравнивай запросы на краулинг в GSC с запросами от Google в логах и проверяй, совпадает ли хотя бы тренд.

Идеально не будет — Google использует много юзер-агентов, а сайт с тяжелым каталогом товаров или активной рекламой тоже генерирует массу таких обращений.

Статистика сканирования в GSC также показывает, тормозит ли Googlebot, отваливается ли по тайм-ауту или в целом ловит ошибки.

Десять лет полных логов для сайта такого размера — это территория петабайтов, при этом сам объем здесь не главное ограничение.

Если впереди стоит кеш, запросы обрабатываются на edge-серверах, и основной сервер их никогда не видит.

Поэтому логи не дадут ответа, сколько бы дней ни выгружали.

Вместо этого запрашивай предварительно отфильтрованные данные: короткий период, только трафик ботов, с фокусом на масштабируемые разделы сайта, такие как plp и pdp.

Фильтрация сырых логов по юзер-агенту выдает только потенциальных ботов — реального Googlebot подтверждает обратный поиск по IP.

Инсайты комьюнити

— Сначала загрузи 7 дней в Screaming Frog Log File Analyser, затем добавляй по одному логу в день и следи за паттерном; грузить всё сразу — слишком много информации для анализа. Перед импортом проверь заголовки сырого файла и подтверди, что есть что — в логах IIS поля c-ip и IP клиента WAF легко перепутать, а с Sucuri спереди именно поле IP WAF изолирует Googlebot и Bingbot. Сверяй это с данными краулинга GSC в настройках. Ведущие WAF и CDN по умолчанию не должны блокировать настоящих ботов вроде Googlebot.

— Обработка ботов может отличаться в зависимости от фронтенд-окружения, поэтому подтверди, логи какой именно среды тебе передали: в одном случае один фронтенд рапортовал, что каждый бот получает 429, тогда как остальные этого не делали. Некоторые переданные урлы были маршрутами, а не путями, поэтому в ТЗ на выгрузку нужно указывать пути и урлы явно. Отслеживание даже одного случая из GSC обратно в логи подтверждает правильное место и нужного бота; в том же кейсе многие боты, видимые в GSC, оказались не теми, кого ждали, а количество сканирований от самого Googlebot оказалось ниже, чем подразумевал график.

@MikeBlazerX

📈 "Пушки" — в @MikeBlazerPRO

Ссылки из поста:
– https://theseocommunity.slack.com/archives/C05HJDD...
– https://t.me/MikeBlazerX
– https://t.me/tribute/app?startapp=sE4X

Источник новости https://t.me/mikeblazerx/6726...