SEOFAQ Telegram, маркетинг и SEO Канал SEOFAQT в мессенджере Telegram

Все чаты​Управление ресурсами веб-страниц для эффективного краулинга и...

 172  


​Управление ресурсами веб-страниц для эффективного краулинга и рендеринга

Поисковые системы располагают ограниченным количеством ресурсов для просмотра и рендеринга веб-страниц.

Как владельцы веб-сайтов, мы обязаны обеспечить поисковым системам максимально быстрое обнаружение новых страниц, а также изменений на текущих страницах.

Эта задача становится еще более сложной для сайтов, которые могут содержать сотни миллионов страниц.

Проблема

Часть проблемы заключается в понимании того, что поисковые системы не должны обнаруживать или загружать.

Мы должны сосредоточиться на ресурсах, которые не изменяют содержание или структуру веб-страницы.

Например, Джакомо Зеккини выявил значительный объем запросов поисковых систем, направленных на внутреннюю аналитику и конечные точки отслеживания пользователей.

Эти запросы не вносят никакого вклада в содержание или структуру веб-страницы, а значит, не нужны поисковым системам.

Решение

Основной целью задачи Джакомо было повышение эффективности за счет перераспределения вычислительных ресурсов и времени для поисковых систем, чтобы они могли краулить и обнаруживать новые веб-страницы, устраняя ненужные запросы ботов.

Такой подход привел к значительному сокращению количества запросов на ресурсы и увеличению количества найденных HTML-страниц.

Например, он наблюдал 22-процентное увеличение количества дополнительных запросов HTML-страниц поисковиками.

Технические выводы

Джакомо обнаружил, что использование функции JavaScript для блокировки запросов к некэшируемым ресурсам является более настраиваемым и в 100-200 раз более быстрым по сравнению с правилами robots.txt.

Этот вывод был особенно полезен в сценариях, когда нужно было блокировать определенные ресурсы, не влияя на содержание или структуру веб-страницы.

Анализ логов сервера

Чтобы понять, какие запросы к ресурсам выполняются во время рендеринга, он опирался на журналы доступа к серверу.

Это позволило собрать подробные данные о запросах, отправленных во время рендеринга веб-страниц поисковой системой.

Затем Джакомо использовал эти данные для создания карты ресурсов, связывающей веб-страницы с подресурсами.

Подход с использованием Robots.Txt

После составления карты ресурсов веб-страниц Джакомо использовал robots.txt для ограничения доступа к URL-адресам, которые использовались исключительно для пользовательской аналитики и считались ненужными для поисковых систем.

Однако он обнаружил некоторые недостатки этого подхода, такие как жесткость правил robots.txt и задержка, связанная с оценкой URL на предмет потенциальной блокировки robots.txt во время краулинга страниц поисковыми системами.

Поиск новых подходов

Чтобы устранить эти ограничения, он изучил альтернативные методики, такие как реализация на стороне сервера и edge-воркеры.

Эти подходы обеспечивают большую гибкость и контроль над тем, какой контент передается поисковым системам, без изменения фактического содержания или структуры веб-страницы.

https://merj.com/blog/managing-webpages-resources-for-efficient-crawling-and-rendering

@MikeBlazerX

Ссылки из поста:
https://t.me/MikeBlazerX

Источник новости https://t.me/mikeblazerx/2676...