Query-параметр прокидывает мертвые пути в Screaming Frog и...
Query-параметр прокидывает мертвые пути в Screaming Frog и строит ранжированный маппинг 4xx → 200
Screaming Frog документирует маппинг редиректов только для живых страниц, но никогда для 4xx → 200.
Мертвые страницы не отдают контент, который могла бы прочитать модель эмбеддингов, на чем задокументированный флоу заканчивается — но контент им можно скормить.
Зашей битый путь в query-параметр живого, отвечающего URL, и семантическое сходство сопоставит эти пути с пулом живых страниц.
1. Собери битые урлы из краулов, GSC, Ahrefs, бэклинков и логов, плюс золотой пул живых страниц с кодом 200 из сайтмапа, краулинга или GSC.
2. В Sheets или Excel сконвертируй каждый мертвый урл в рабочий query-параметр — хватит обычного REGEXEXTRACT: /old-widget-guide/ → /?q=old-widget-guide. Рабочий параметр зависит от сайта, поэтому протестируй его перед запуском полного краулинга.
3. Подключи провайдера эмбеддингов (Gemini, OpenAI или Ollama) и установи таргет извлечения на "Address", а не контент.
4. Включи Semantic Similarity, отключи "Only Check Indexable Pages" и добавь правила фильтрации, чтобы урлы для маппинга сопоставлялись только с чистыми.
5. Запусти краулинг в режиме List, закинув все битые и живые урлы вместе, запусти Crawl Analysis, затем отфильтруй вкладку Content по паттерну ?q=.
Отсортируй по similarity score, сделай точечную проверку на точность, выгрузи маппинг и перенастрой эмбеддинги под свои задачи.
Дублирование исходных строк в выгрузке зависит от того, откуда запускается экспорт, а не от бага инструмента.
Bulk Export, в зависимости от отчета, выводит каждый исходный URL напротив всех подходящих таргетов выше порога — A > B (.95) лучшее совпадение, A > C (.94), A > D (.92) — тогда как экспорт из UI отдает только одно лучшее совпадение на исходный URL, A > B (.95).
Плюс ко всему, Embedding Filter Rules форсируют направление: исходные URL сопоставляются исключительно с целевыми, поэтому пары прилетают в формате A > B, C > D, E > F и никогда в обратном B > A.
Насыщенные, описательные пути URL — это базовый минимум.
Тонкие или параметризованные пути вроде /page?id=123 несут слишком мало сигнала для уверенного сопоставления, и это лишь одна из стартовых точек для прокачки маппинга, а не единственная.
@MikeBlazerX
📈 "Пушки" — в @MikeBlazerPRO

– https://www.linkedin.com/posts/tylergargula_did-yo...
– https://t.me/MikeBlazerX
– https://t.me/tribute/app?startapp=sE4X
Источник новости https://t.me/mikeblazerx/6675...
4 
