Управление ресурсами веб-страниц для эффективного краулинга и...
172
Управление ресурсами веб-страниц для эффективного краулинга и рендеринга
Поисковые системы располагают ограниченным количеством ресурсов для просмотра и рендеринга веб-страниц.
Как владельцы веб-сайтов, мы обязаны обеспечить поисковым системам максимально быстрое обнаружение новых страниц, а также изменений на текущих страницах.
Эта задача становится еще более сложной для сайтов, которые могут содержать сотни миллионов страниц.
Проблема
Часть проблемы заключается в понимании того, что поисковые системы не должны обнаруживать или загружать.
Мы должны сосредоточиться на ресурсах, которые не изменяют содержание или структуру веб-страницы.
Например, Джакомо Зеккини выявил значительный объем запросов поисковых систем, направленных на внутреннюю аналитику и конечные точки отслеживания пользователей.
Эти запросы не вносят никакого вклада в содержание или структуру веб-страницы, а значит, не нужны поисковым системам.
Решение
Основной целью задачи Джакомо было повышение эффективности за счет перераспределения вычислительных ресурсов и времени для поисковых систем, чтобы они могли краулить и обнаруживать новые веб-страницы, устраняя ненужные запросы ботов.
Такой подход привел к значительному сокращению количества запросов на ресурсы и увеличению количества найденных HTML-страниц.
Например, он наблюдал 22-процентное увеличение количества дополнительных запросов HTML-страниц поисковиками.
Технические выводы
Джакомо обнаружил, что использование функции JavaScript для блокировки запросов к некэшируемым ресурсам является более настраиваемым и в 100-200 раз более быстрым по сравнению с правилами robots.txt.
Этот вывод был особенно полезен в сценариях, когда нужно было блокировать определенные ресурсы, не влияя на содержание или структуру веб-страницы.
Анализ логов сервера
Чтобы понять, какие запросы к ресурсам выполняются во время рендеринга, он опирался на журналы доступа к серверу.
Это позволило собрать подробные данные о запросах, отправленных во время рендеринга веб-страниц поисковой системой.
Затем Джакомо использовал эти данные для создания карты ресурсов, связывающей веб-страницы с подресурсами.
Подход с использованием Robots.Txt
После составления карты ресурсов веб-страниц Джакомо использовал robots.txt для ограничения доступа к URL-адресам, которые использовались исключительно для пользовательской аналитики и считались ненужными для поисковых систем.
Однако он обнаружил некоторые недостатки этого подхода, такие как жесткость правил robots.txt и задержка, связанная с оценкой URL на предмет потенциальной блокировки robots.txt во время краулинга страниц поисковыми системами.
Поиск новых подходов
Чтобы устранить эти ограничения, он изучил альтернативные методики, такие как реализация на стороне сервера и edge-воркеры.
Эти подходы обеспечивают большую гибкость и контроль над тем, какой контент передается поисковым системам, без изменения фактического содержания или структуры веб-страницы.
https://merj.com/blog/managing-webpages-resources-for-efficient-crawling-and-rendering
@MikeBlazerX

– https://t.me/MikeBlazerX
Источник новости https://t.me/mikeblazerx/2676...

