Маскировка ссылок через JS не останавливает Google — бот...
16
Маскировка ссылок через JS не останавливает Google — бот парсит URL-строки напрямую из HTML и JSON
Удаление <a href> и вывод внутреннего URL только через span с атрибутом data-link или инлайн-объект JSON не прячет его от Google.
Поисковик парсит похожие на урлы строки везде, где их находит — в исходном HTML, в отрендеренном DOM или в JSON-блоках — и ставит их в очередь на краулинг.
Разница между span и классической ссылкой только в одном: URL не будет считаться внутренней ссылкой и не передаст ссылочный вес.
Но его все равно проиндексируют.
Официальная документация Google по ссылкам намекает на это, помечая нестандартные конструкции как "не рекомендуется (но Google все равно может попытаться это спарсить)".
Логи подтверждают это элементарно: закинь страницу с такой урлоподобной строкой, запроси индексацию и смотри, как бот стучится по этому адресу.
Попытка спрятать ссылку от краулера работает так же паршиво, как безопасность через запутывание кода.
Не отдавать URL Гуглу напрямую — нестабильный костыль, который никак не мешает третьим лицам сослаться на этот же актив извне.
Если задача реально отрезать ботов от этих страниц, единственные железобетонные рычаги — это robots.txt (для послушных краулеров) и правила фаервола или WAF, сносящие запросы от нежелательных юзер-агентов.
Инсайты комьюнити
— Кодировка Base64 для URL-строк — это слабая обфускация: Google умеет декодировать Base64 (один практик отмечает, что не ловил бота на дефолтной настройке, но полагаться на это опасно). Чтобы клиентский энкодинг выжил, завяжи кастомный JS-декодер с правилом в robots.txt, которое блочит от сканирования сам скрипт — так бот тупо не доберется до логики, которая собирает URL.
— Самый надежный вектор эксплуатирует механику Гугла: бот ставит цели URL в очередь, но никогда по ним не кликает. Сборка или расшифровка реального URL только внутри обработчика onclick означает, что доступный для краулинга DOM никогда не засветит парсящуюся URL-строку — и тогда блокировка через robots.txt вообще не нужна. Варианты внедрения: хешировать или шифровать урлы с клиентской расшифровкой через объект crypto (или микро-библиотеку), либо прогнать двустороннюю автозамену, меняющую / на символ, который никогда не встречается в урлах.
@MikeBlazerX
⚠️ Закрытый канал: @MikeBlazerPRO
Ссылки из поста:– https://theseocommunity.slack.com/archives/C05HJDD...
– https://developers.google.com/search/docs/crawling...
– https://t.me/MikeBlazerX
– https://t.me/tribute/app?startapp=sE4X
Источник новости https://t.me/mikeblazerx/6554...

